Back to blog

Cosmos 3: Omnimodal World Models for Physical AI

NVIDIA全模态世界模型,统一语言、图像、视频、音频和动作的理解与生成,为Physical AI提供通用骨干网络

Cosmos 3: Omnimodal World Models for Physical AI

一、论文概述

项目内容
标题Cosmos 3: Omnimodal World Models for Physical AI
作者NVIDIA
机构NVIDIA
论文NVIDIA Research
代码github.com/nvidia/cosmos
发布2026年
许可Linux Foundation OpenMDW-1.1 License
模型Cosmos3-Super, Cosmos3-Nano

二、核心思想

Cosmos 3是NVIDIA推出的全模态世界模型家族,旨在统一处理和生成语言、图像、视频、音频和动作序列。核心创新在于:

  1. 统一框架:将VLM、视频生成器、世界模拟器、世界-动作模型整合到单一网络架构中
  2. Mixture-of-Transformers (MoT):双塔架构,AR子序列用于推理,扩散子序列用于生成
  3. 统一动作表示:将异构具身控制映射到共享几何结构的紧凑动作向量
  4. Physical AI定位:为机器人、自动驾驶、智能基础设施提供通用骨干网络

问题定义

当前Physical AI面临的核心挑战:

  • 训练瓶颈:在真实世界中训练智能体缓慢、昂贵且危险
  • 架构碎片化:VLM(感知)、视频生成器(模拟)、VLA/WAM(动作)各自独立
  • 数据稀缺:高质量多模态训练数据难以获取

解决方案概述

Cosmos 3通过全模态统一架构解决上述问题:

  • 根据输入-输出配置无缝切换操作模式:VLM、文本到图像生成、视频生成、世界-动作模型
  • 通过共享表示和联合多任务监督实现可扩展学习
  • 支持合成数据生成、任务特定专业化、训练环境构建三种应用场景

三、技术架构

整体框架图

Cosmos 3架构概览

Cosmos 3作为Physical AI的通用骨干网络,统一建模语言、图像、视频、音频和动作的理解与生成,整合了多种模型类别:视觉语言模型、图像生成模型、音视频生成模型、策略/世界-动作模型、前向动力学模型、逆动力学模型。

编码器设计

视觉编码器(双编码器):

  • 理解编码器:ViT编码器,16×16 patch大小,两层MLP合并2×2 token,使用DeepStack聚合视觉特征
  • 生成编码器:Wan2.2-TI2V-5B的视频VAE编码器,时间压缩4×,空间压缩32×32(16×16空间压缩+2×2 patch合并)

音频编码器:

  • 采用Lee et al. (2025b)的音频VAE架构
  • 48kHz立体声,hop size 1920,25 tokens/秒

动作编码器:

  • 统一动作表示:ego poses(智能体主观测帧)、effector poses(执行器)、grasp states(抓取状态)
  • 使用6D旋转表示(Zhou et al., 2019)
  • 域感知输入/输出投影层,共享MoT骨干

核心公式

动作token化: z=Win(k)x+bin(k)\mathbf{z} = \mathbf{W}_{\text{in}}^{(k)} \mathbf{x} + \mathbf{b}_{\text{in}}^{(k)}

其中 z∈Rdmodel\mathbf{z} \in \mathbb{R}^{d_{\text{model}}} 是潜在动作token,k∈{1,…,K}k \in \{1, \ldots, K\} 是域标识符。

动作解码: x=Wout(k)z+bout(k)\mathbf{x} = \mathbf{W}_{\text{out}}^{(k)} \mathbf{z} + \mathbf{b}_{\text{out}}^{(k)}

Token排列:

  • AR子序列:语言token + ViT编码的视觉token,用于推理和理解
  • 扩散子序列:VAE编码的视觉token + 音频token + 动作token,用于生成

文本到图像序列: ST2I=[SAR,v~1]\mathbf{S}_{\mathrm{T2I}} = [\mathbf{S}_{\mathrm{AR}}, \tilde{v}_1]

其中 SAR≜[l1,…,ln,⟨EOS⟩,⟨BOG⟩]\mathbf{S}_{\mathrm{AR}} \triangleq [l_1, \ldots, l_n, \langle\mathrm{EOS}\rangle, \langle\mathrm{BOG}\rangle],v~1\tilde{v}_1 是噪声图像token。

文本到视频序列: ST2V+Audio=[SAR,v~1:N,s~]\mathbf{S}_{\mathrm{T2V+Audio}} = [\mathbf{S}_{\mathrm{AR}}, \tilde{v}_{1:N}, \tilde{s}]

图像到视频/视频到视频序列: SV2V=[SAR,v1:P,v~P+1:N]\mathbf{S}_{\mathrm{V2V}} = [\mathbf{S}_{\mathrm{AR}}, v_{1:P}, \tilde{v}_{P+1:N}]

视频转换序列: STransfer=[SAR,v1:Nctrl,v~1:N]\mathbf{S}_{\text{Transfer}} = [\mathbf{S}_{\mathrm{AR}}, v_{1:N}^{\mathrm{ctrl}}, \tilde{v}_{1:N}]

Mixture-of-Transformers (MoT) 架构

MoT架构详解

双塔层结构:

  • 每个Transformer解码器层包含两套参数:推理塔(AR子序列)和生成塔(扩散子序列)
  • 两个塔都从预训练VLM初始化,继承语言和视觉推理能力

双流联合注意力:

  • AR子序列注意力:因果自注意力,保持自回归属性 OAR=Attn⁡causal(QAR,KAR,VAR)\mathbf{O}_{\mathrm{AR}} = \operatorname{Attn}_{\text{causal}}(\mathbf{Q}_{\mathrm{AR}}, \mathbf{K}_{\mathrm{AR}}, \mathbf{V}_{\mathrm{AR}})

  • 扩散子序列注意力:全双向注意力,AR和DM token的联合作为key/value ODM=Attn⁡full(QDM,[KAR;KDM],[VAR;VDM])\mathbf{O}_{\mathrm{DM}} = \operatorname{Attn}_{\text{full}}(\mathbf{Q}_{\mathrm{DM}}, [\mathbf{K}_{\mathrm{AR}}; \mathbf{K}_{\mathrm{DM}}], [\mathbf{V}_{\mathrm{AR}}; \mathbf{V}_{\mathrm{DM}}])

关键特性:AR token永远不会基于DM token更新,保持条件路径的因果完整性。

多模态位置嵌入

3D MRoPE坐标分配

3D MRoPE设计:

  • 时间、高度、宽度三个分量
  • 语言token:t = h = w,退化为标准1D RoPE
  • 视觉token:t随时间帧索引,h和w平铺空间网格
  • 音频/动作token:仅时间坐标(h = w = 0)

FPS调制: δt=TPSbaseTPS\delta t = \frac{\mathrm{TPS}_{\text{base}}}{\mathrm{TPS}}

其中 TPSbase=6\mathrm{TPS}_{\text{base}} = 6(24 FPS / 4时间压缩比),对齐不同帧率的物理时间轴。

AR-DM时间间隔:在AR和扩散子序列之间插入15000的时间间隔,避免过饱和和棋盘伪影。

模型变体

变体总参数密集参数LLM层数隐藏维度注意力头KV头FFN维度
Cosmos3-Edge4B2B282,0481689,216
Cosmos3-Nano16B8B364,09632812,288
Cosmos3-Super64B32B645,12064825,600
  • Edge:从头训练的2B密集Transformer
  • Nano:基于Qwen3-VL 8B初始化
  • Super:基于Qwen3-VL 32B初始化

训练流程

训练流程

Reasoner训练:

  1. 预训练:22M样本,以图像-文本和文本为主(OCR 42.9%,2D Grounding 16.5%,Visual QA 11.3%)
  2. 监督微调:2.2M样本,转向Physical AI专业化(Video Reasoning 22.7%,Video QA 21.4%)

Generator训练:

  1. 预训练:大规模图像、视频、音频数据
  2. 中期训练:引入动作、控制条件转换、合成数据
  3. 后训练:文本到图像、图像到视频、机器人策略

数据基础设施

语义去重:

  • 使用Qwen3-VL-Embedding-8B和Perception Encoder计算联合嵌入
  • K-means聚类 + 余弦相似度(阈值0.95)去除近重复

AI Judge质量过滤:

  • 使用Gemma-4-31B-it作为视觉语言评判器
  • 三个质量维度:Faithfulness、Completeness、Correctness
  • 预训练阈值2(保留78%数据),SFT阈值5(保留46%数据)

四、核心创新

创新点说明理论/实验依据
全模态统一架构语言、图像、视频、音频、动作的统一处理单一框架整合VLM、视频生成器、世界模拟器、VLA
MoT双塔架构AR用于推理,扩散用于生成,联合注意力交互从预训练VLM初始化,继承语言和视觉推理能力
统一动作表示异构具身控制映射到共享几何结构支持自动驾驶、相机运动、机器人、自我中心运动
3D MRoPE + FPS调制对齐不同模态和帧率的物理时间轴消除帧率差异,统一位置编码
合成数据生成SDG数据集(PhyxSim、RobotSim、DriveSim等)增强Physical AI训练数据多样性

五、实验结果

基准测试

Table 1: 结果概览

能力指标Cosmos3-SuperCosmos3-Nano最佳基线
推理
通用综合73.769.6Gemini 3.1 Pro: 77.5
机器人综合57.855.1Gemini 3.1 Pro: 58.2
智能基础设施综合62.661.0Gemini 3.1 Pro: 58.6
自动驾驶综合79.376.0Gemini 3.1 Pro: 47.2
生成
文本到图像综合91.36*84.61Gemini 3 Pro Image: 90.85
文本到视频综合80.079.4Veo-3.1: 79.1
图像到视频综合82.882.7Veo-3.1: 82.6
音频综合7.317.34Veo-3.1: 7.45
前向动力学(机器人)综合26.0*25.5*Ctrl-World: 23.0
策略(机器人)综合-39.7*π₀.₅: 28.1

关键发现:

  • Cosmos 3在大多数能力上建立新SOTA,超越专业化开源基线
  • 文本到图像:Cosmos3-Super-Text2Image 91.36,超越Gemini 3 Pro Image (90.85)
  • 自动驾驶推理:Cosmos3-Super 79.3,大幅超越Gemini 3.1 Pro (47.2)
  • 机器人策略:Cosmos3-Nano-Policy 39.7,超越π₀.₅ (28.1)
  • 图像到视频:Cosmos3-Super 82.8,与Veo-3.1 (82.6)竞争

生成能力展示

文本到图像生成示例

Cosmos3-Super-Text2Image生成的图像具有物理合理性和照片级真实感,展现了精细的细节和多样化的场景。

六、相关工作

方向代表工作Cosmos 3优势
VLMQwen3-VL, InternVL3统一生成能力,无需额外模型
视频生成Veo-3.1, Wan2.2同时支持理解和生成
世界模型Ctrl-World更强的前向动力学预测
VLA/WAMπ₀.₅更高的策略成功率
全模态模型Gemini 3.1 Pro开源,支持动作模态

七、总结

核心贡献

  1. 提出全模态世界模型Cosmos 3,统一语言、图像、视频、音频和动作的理解与生成
  2. 设计MoT双塔架构,AR用于推理,扩散用于生成,通过联合注意力交互
  3. 引入统一动作表示,将异构具身控制映射到共享几何结构
  4. 在大多数能力上建立新SOTA,包括文本到图像(91.36)、自动驾驶推理(79.3)、机器人策略(39.7)
  5. 开源代码、模型检查点、合成数据集和评估基准

技术影响

  • 为Physical AI提供统一的训练设施,消除碎片化模型管道
  • 合成数据生成能力解决训练数据稀缺问题
  • 任务特定专业化能力支持多样化具身和任务
  • 长期可生成高质量复杂训练环境

局限性

  • 音频生成能力略弱于Veo-3.1(7.31 vs 7.45)
  • 通用推理能力略弱于Gemini 3.1 Pro(73.7 vs 77.5)
  • Cosmos3-Edge模型尚未发布
  • 大规模模型(64B参数)需要大量计算资源

八、参考资源