Back to blog

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

一、论文概述

项目内容
标题NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
作者Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic
机构NVIDIA
论文arXiv:2606.03159
代码未公开
发布2026年6月2日
领域计算机视觉 (cs.CV), 人工智能 (cs.AI), 机器人 (cs.RO)

注: 本文为极新论文(2026年6月2日),arXiv HTML 版本尚不可用,以下分析基于摘要内容。

二、核心思想

问题定义

随着自动驾驶能力的提升,长尾场景的安全评估成为关键瓶颈。在闭环仿真中,驾驶策略模型与环境主动交互,其动作动态更新仿真器状态并直接影响下一组生成的传感器观测。

现有方法的局限:

  • 重建式神经仿真器:虽然提供照片级真实感,但本质上受限于初始采集数据,难以泛化到高度动态或新颖场景
  • 传统仿真器:难以捕捉极端天气、不可预测的动态代理行为等复杂现象

解决方案概述

本文引入 OmniDreams,一个基础生成式世界模型,基于 Cosmos 扩散模型进行中期和后期训练,能够实时自回归生成动作条件视频。

核心设计:

  1. 基础模型:基于 NVIDIA Cosmos 扩散模型,利用其丰富的视觉先验
  2. 中期训练 (Mid-training):在 21k 小时驾驶场景数据上进行中期训练
  3. 后期训练 (Post-training):针对特定场景进行后期训练
  4. 自回归生成:基于过去帧、当前仿真器状态和即时驾驶动作,自回归生成照片级传感器数据
  5. 闭环部署:与 Alpamayo 1 策略模型和 AlpaSim 编排器集成,形成闭环系统

关键创新

创新点说明
生成式世界模型区别于重建式方法,能够生成训练数据中未见过的新颖场景
Cosmos 扩散模型基础利用 NVIDIA Cosmos 的强大视觉先验
21k 小时驾驶数据训练大规模中期/后期训练覆盖多样化驾驶场景
实时动作条件生成实时响应驾驶策略的动作输入
世界-动作模型 (WAM)从 OmniDreams 后期训练的策略模型,仅用 1/5 参数超越 Alpamayo 1.5

三、技术架构

系统架构

┌─────────────────────────────────────────────────────────┐
│                    闭环仿真系统                            │
│                                                         │
│  ┌──────────────┐     ┌──────────────┐     ┌──────────┐ │
│  │ Alpamayo 1   │────▶│   AlpaSim    │────▶│OmniDreams│ │
│  │ 策略模型      │     │   编排器      │     │ 世界模型  │ │
│  └──────────────┘     └──────────────┘     └──────────┘ │
│         ▲                                        │      │
│         │           动作 + 状态                    │      │
│         └────────────────────────────────────────┘      │
│                      传感器观测 (视频)                     │
└─────────────────────────────────────────────────────────┘

核心组件

组件说明角色
Cosmos 扩散模型NVIDIA 基础视觉生成模型提供丰富视觉先验
OmniDreams 世界模型中期/后期训练的生成式世界模型实时生成动作条件视频
Alpamayo 1驾驶策略模型发出驾驶动作
AlpaSim仿真编排器管理闭环仿真流程
WAM (World-Action Model)从 OmniDreams 后期训练的策略模型可直接作为驾驶策略

训练流程

阶段数据目标
Cosmos 预训练大规模视觉数据学习通用视觉先验
中期训练21k 小时驾驶场景适应自动驾驶领域
后期训练特定场景数据针对特定评估需求

生成条件

OmniDreams 自回归生成的条件包括:

  1. 过去帧:历史传感器观测
  2. 当前仿真器状态:场景中所有代理的状态
  3. 即时驾驶动作:策略模型输出的控制信号

四、核心能力

支持的场景类型

OmniDreams 能够合成传统仿真器难以捕捉的复杂现象:

  • 极端天气:暴雨、大雪、浓雾等
  • 不可预测的动态代理行为:行人突然穿越、车辆紧急变道等
  • 长尾场景:罕见但关键的安全场景

评估与训练双重用途

  1. 策略评估:作为闭环仿真环境,安全评估驾驶策略
  2. 策略训练:作为可交互的训练环境,支持在线强化学习
  3. 策略架构:WAM 可直接作为驾驶策略模型

五、实验结果

关键结果

指标Alpamayo 1.5 (VLA)WAM (OmniDreams)对比
参数量5x1xWAM 仅 1/5 参数
NuRec 数据集性能基线超越WAM 更优

关键发现:

  • 从 OmniDreams 后期训练的世界-动作模型 (WAM) 在 Physical AI Autonomous Vehicles NuRec 数据集上取得强劲性能
  • WAM 仅使用 Alpamayo 1.5 研究策略模型 1/5 的参数就超越了其性能
  • 这表明实时世界模型如 OmniDreams 也可作为策略架构的骨干

系统集成

OmniDreams 部署在完整闭环系统中:

  • Alpamayo 1:提供驾驶策略
  • AlpaSim:编排仿真流程
  • OmniDreams:作为高度响应的反应式环境

六、与现有方法对比

方法类型泛化能力实时性长尾场景
传统仿真器基于规则有限实时需手动设计
重建式神经仿真器基于数据受限于训练数据部分实时难以泛化
OmniDreams生成式强(Cosmos 先验)实时可合成

七、相关工作

方向代表工作与 OmniDreams 的关系
视觉基础模型CosmosOmniDreams 的基础模型
自动驾驶仿真CARLA, nuPlanOmniDreams 的替代方案
神经世界模型GAIA-1, DriveDreamerOmniDreams 的同类工作
闭环评估nuScenes, WaymoOmniDreams 的评估场景

八、总结

核心贡献

  1. OmniDreams 世界模型:基于 Cosmos 扩散模型的生成式世界模型,经 21k 小时驾驶数据训练
  2. 实时闭环仿真:与 Alpamayo 1 和 AlpaSim 集成,实现实时动作条件视频生成
  3. 长尾场景覆盖:能够合成极端天气和不可预测动态行为等复杂场景
  4. 世界-动作模型 (WAM):从 OmniDreams 后期训练的策略模型,仅 1/5 参数超越 VLA 基线
  5. 双重用途:同时支持策略评估和策略训练

技术影响

  • 为自动驾驶长尾场景评估提供了可扩展的生成式解决方案
  • 世界模型可作为策略架构的骨干,开辟了新的研究方向
  • Cosmos 扩散模型的视觉先验使生成质量大幅提升
  • 21k 小时训练数据确保了场景覆盖的多样性
  • NVIDIA 的端到端系统集成(世界模型 + 策略 + 编排器)为工业部署提供了参考

局限性

  • 代码未公开
  • 完整论文内容尚不可用(仅摘要)
  • WAM 结果为初步结果,需要更多验证
  • 21k 小时数据的多样性分布未详细说明
  • 与 Cosmos 基础模型的关系和差异未详细说明

九、参考资源

  • 论文: arXiv:2606.03159
  • 关键引用:
    • NVIDIA Cosmos (基础视觉生成模型)
    • Alpamayo 1/1.5 (驾驶策略模型)
    • AlpaSim (仿真编排器)
    • NuRec 数据集 (评估基准)

分析日期: 2026-06-05 注: 本文为极新论文,完整内容待 HTML 版本发布后更新