Back to blog

Qwen-VLA

统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成

一、论文概述

项目内容
标题Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
作者Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou 等 (40+ 作者)
机构Qwen Team (Alibaba)
论文arXiv:2605.30280
代码GitHub: QwenLM/Qwen-VLA
发布2026-05-28
许可未明确

二、核心思想

问题定义

具身智能通常通过针对单一任务(如操作或导航)的专用模型来研究,导致能力碎片化,跨任务、环境和机器人形态的泛化能力有限。不同具身任务在输出格式、控制频率、预测时间范围、动作维度和评估协议上存在显著差异,但它们共享一个共同的计算结构:智能体必须基于视觉观察、语言指令和形态特定约束来预测未来动作或轨迹。

解决方案概述

Qwen-VLA 是一个统一的具身基础模型,将 Qwen 的视觉-语言建模栈从感知、理解和推理扩展到连续动作和轨迹生成。核心创新包括:

  1. 统一动作-轨迹预测框架:将操作、导航和轨迹预测统一到共享的动作空间中
  2. 形态感知提示条件化:通过文本描述指定当前机器人形态和控制约定,无需为每个平台设计单独的输出头
  3. 渐进式训练策略:T2A预训练 → 持续预训练 → 监督微调 → 强化学习
  4. DiT动作解码器:基于流匹配的1.15B参数动作专家

三、技术架构

整体框架图

架构图

Qwen-VLA 的架构由两个核心组件构成:

  1. 视觉-语言骨干网络:基于 Qwen3.5-4B,采用早期视觉-语言融合设计,ViT产生的视觉token直接交错到文本token流中
  2. DiT动作专家:1.15B参数的单流DiT风格流匹配策略,将VLM隐藏状态与噪声动作块拼接后通过联合自注意力处理

核心公式

统一条件预测框架:

pθ(yt:t+H−1∣ot,x,e,z)p_{\theta}(y_{t:t+H-1} \mid o_t, x, e, z)

其中 oto_t 为视觉上下文,xx 为语言指令,ee 为形态描述,zz 为任务标识符,HH 为预测时间范围。

流匹配动作损失:

给定干净目标 Y0∈RH×K\mathbf{Y}_0 \in \mathbb{R}^{H \times K} 和噪声 Y1∼N(0,I)\mathbf{Y}_1 \sim \mathcal{N}(0, \mathbf{I}),线性插值为:

Yτ=(1−τ)Y0+τY1,τ∈[0,1]\mathbf{Y}_\tau = (1-\tau)\mathbf{Y}_0 + \tau\mathbf{Y}_1, \quad \tau \in [0,1]

每个活跃通道的均方误差:

ℓk=∑h=1HMh,k∥(vθ(Yτ,τ∣o1:t,x,e,z)−(Y1−Y0))h,k∥22∑h=1HMh,k\ell_k = \frac{\sum_{h=1}^{H} M_{h,k} \|(v_\theta(\mathbf{Y}_\tau, \tau \mid o_{1:t}, x, e, z) - (\mathbf{Y}_1 - \mathbf{Y}_0))_{h,k}\|_2^2}{\sum_{h=1}^{H} M_{h,k}}

动作损失(双层平均):

Lact=Eτ,Y0,Y1[1c∑k=0c−1ℓk]\mathcal{L}_{\mathrm{act}} = \mathbb{E}_{\tau, \mathbf{Y}_0, \mathbf{Y}_1} \left[\frac{1}{c} \sum_{k=0}^{c-1} \ell_k\right]

视觉-语言损失:

Lvl=−∑ilog⁡pθ(wi∣w<i,o1:t)\mathcal{L}_{\mathrm{vl}} = -\sum_{i} \log p_\theta(w_i \mid w_{<i}, o_{1:t})

联合目标:

L=λactLact+λvlLvl\mathcal{L} = \lambda_{\mathrm{act}} \mathcal{L}_{\mathrm{act}} + \lambda_{\mathrm{vl}} \mathcal{L}_{\mathrm{vl}}

强化学习目标(PPO):

Lactor(θ)=−Et[min⁡(rt(θ)A^t,clip(rt(θ),1−ϵ,1+ϵ)A^t)]\mathcal{L}^{\text{actor}}(\theta) = -\mathbb{E}_t \left[\min\left(r_t(\theta)\hat{A}_t, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t\right)\right]

其中 rt(θ)=πθ(at∣st)/πθold(at∣st)r_t(\theta) = \pi_\theta(a_t \mid s_t) / \pi_{\theta_{\text{old}}}(a_t \mid s_t) 为重要性比率,A^t\hat{A}_t 为GAE优势估计。

动作表示

统一张量接口: 每个训练样本贡献目标张量 Y∈RH×K\mathbf{Y} \in \mathbb{R}^{H \times K},其中 HH 为固定预测时间范围,KK 为所有控制模式共享的固定通道维度。

控制信号类型:

  • 操作信号:delta末端执行机位置 (Δx,Δy,Δz)(\Delta x, \Delta y, \Delta z)、旋转(欧拉角/四元数)、关节位置、夹爪开度、灵巧手关节角
  • 导航轨迹信号:每路点 (Δx,Δy,Δθ)(\Delta x, \Delta y, \Delta \theta),编码地面平面上的相对位移和航向变化

通道布局: 给定控制模式使用 c≤Kc \leq K 通道,放置在 YY 的前 cc 维,其余维度零填充。每通道二进制掩码 M∈{0,1}H×K\mathbf{M} \in \{0,1\}^{H \times K} 记录有效信号。

动作归一化: 每个数据集使用分位数统计进行归一化:

a~d=2⋅ad−q01kq99k−q01k−1\tilde{a}_d = 2 \cdot \frac{a_d - q_{01}^k}{q_{99}^k - q_{01}^k} - 1

训练流程

训练流程

Qwen-VLA 采用四阶段渐进式训练策略:

阶段名称描述关键特点
Stage IT2A (Text-to-Action)冻结VLM,仅训练DiT语言到动作的解压缩器,无视觉输入
Stage IICPT (Continued Pretraining)解冻两个模块异构混合数据,模拟+真实轨迹
Stage IIISFT (Supervised Fine-Tuning)两个并行分支多任务SFT + 真实机器人部署
Stage IVRL (Reinforcement Learning)PPO优化稀疏二元奖励,闭环任务成功

T2A阶段的核心洞察: 将动作学习视为”解压缩”问题。语言指令(如”拿起红色杯子”)加上形态提示用少量token紧凑编码任务意图,但对应的动作轨迹可能跨越数百个高维关节位置值。T2A教会解码器作为语言条件化的动作解压缩器。

四、核心创新

创新点说明理论/实验依据
统一动作-轨迹空间操作、导航、自我中心动作建模共享一个预测空间无需为每个形态设计单独输出头
形态感知提示条件化通过文本描述指定机器人平台、臂配置、控制约定切换形态只需更改文本提示
T2A预训练无视觉输入的语言条件化动作先验学习20%合成+80%真实数据最佳(71.09%)
渐进式训练策略压缩视角:动作先验压缩 → 视觉接地 → 任务专业化 → 成功驱动优化分离关注点,提高训练稳定性
流匹配动作解码器DiT风格,1.15B参数,16个DiT块低延迟实时控制,少量欧拉积分步骤
多模态联合训练操作轨迹、人类自我中心演示、合成数据、导航数据、VL数据74.2%操作 + 6%人类 + 7.5%导航 + 3.7%合成

五、预训练数据

数据组成

数据源比例说明
机器人操作轨迹74.2%桌面、移动、双臂、灵巧手控制
人类自我中心轨迹6.0%Ego4D, EPIC-KITCHENS, EgoDex, EgoVerse, Xperience
导航轨迹7.5%指令跟随(4.3%)、物体搜索(2.3%)、目标跟踪(1.0%)
合成模拟轨迹3.7%ROBOINF管线,359,848条成功轨迹
通用视觉-语言数据3.4%描述、VQA、OCR、指令跟随
空间接地(2D)2.5%边界框接地数据
自动驾驶VQA2.4%时序场景理解、环绕视图空间推理
细粒度动作描述0.2%48,000个视频-描述对

机器人形态

机器人臂数动作类型
WidowX单臂ΔEEF + G
Google Robot单臂ΔEEF + G
Franka Panda单/双臂ΔEEF + G; Abs Joint + G
Mobile ALOHA双臂ΔEEF + G; Abs Joint + G
AgiBot A2-D双臂Abs Joint + G; Abs Joint + DH
Real Human双臂ΔEEF (from MANO)

合成数据管线 (ROBOINF)

ROBOINF数据示例

  • 20个桌面场景 × 10个物体初始位姿配置 = 200个基础场景配置
  • 450个操作任务(短/长时间范围)
  • 每个任务300条成功轨迹,含环境和执行增强
  • 视觉随机化:~3K背景、~1K桌面纹理
  • 总计359,848条成功轨迹(含子任务段)

六、实验结果

操作基准测试

方法类型LIBERORoboCasa-GR1Simpler-WidowXRoboTwin-EasyRoboTwin-Hard
π₀专家94.4--65.958.4
StarVLA-OFT专家96.648.864.650.4-
GR00T N1.6专家97.249.963.247.6-
π₀.₅专家97.637.046.982.776.8
ABot-M0专家98.658.3-86.085.0
Qwen-VLA-Instruct通用97.956.773.786.187.2

关键发现: 单个通用模型在大多数基准上匹配或超越专门针对每个基准微调的专家模型。

真实世界结果(ALOHA双臂平台)

真实世界任务

域内性能(成功率%):

模型拾放桌面清理碗堆叠碗拾放毛巾折叠精细操作平均
GR00T N1.630.838.553.819.219.210.328.6
π₀.₅73.184.688.569.280.833.371.6
Qwen-VLA-aloha (无预训练)30.853.861.564.150.030.848.5
Qwen-VLA-aloha (有预训练)96.292.398.787.265.461.583.6

域外性能(成功率%):

模型颜色实例位置背景指令平均
GR00T N1.646.238.53.819.219.225.4
π₀.₅57.761.519.226.942.341.5
Qwen-VLA-aloha (有预训练)88.576.953.880.884.676.9

导航结果(VLN-CE)

方法R2R OS↑R2R SR↑RxR SR↑RxR SPL↑
NaVid49.241.945.738.2
Uni-NaVid53.347.048.740.9
NaVILA62.554.049.344.0
StreamVLN64.256.952.946.0
Qwen-VLA-Instruct69.057.559.647.8

域外泛化评估

OOD定性结果

SimplerEnv-OOD(仅在简单拾放上微调):

方法MoveAwayMoveRightPlaceNearPlaceRightPutFrontStackYellow平均
π₀.₅26.10.00.032.113.04.212.6
Qwen-VLA-Instruct43.833.339.647.94.222.932.0

DOMINO动态操作(零样本):

方法SR↑MS↑
OpenVLA-OFT (微调)9.124.1
StarVLA-OFT (微调)10.930.5
PUMA (微调)17.235.0
Qwen-VLA-Instruct (零样本)26.639.5

重要发现: Qwen-VLA 在零样本设置下超越了所有在动态操作数据上微调的方法,包括PUMA(+9.4pp SR, +4.5pp MS)。

七、消融实验

T2A预训练消融

消融-数据组成

消融维度最佳配置性能
数据组成20%合成 + 80%真实71.09%
序列预测模式全序列 > 块预测+4.94pp
视觉输入无图像 > 有图像+2.87pp
时间步分布Sigmoid-Normal(T2A) + Beta(SFT)71.09%
训练时长2,000步71.09%(40K步降至60.42%)

多模态联合训练消融

消融-VL联合训练

  • 混合VL数据在操作基准上带来明显收益
  • RoboCasa-GR1: VLA-Only 51% → VL+VLA 56% (+5pp)
  • RoboTwin-2.0: VLA-Only 82% → VL+VLA 86% (+4pp)

八、相关工作

方向代表工作Qwen-VLA的优势
通用VLAOpenVLA, π₀, π₀.₅统一动作空间,跨形态泛化
专用操作模型GR00T N1.6, ABot-M0通用模型匹配/超越专家
导航模型NaVid, StreamVLN, NaVILA联合训练保持导航性能
动态操作PUMA, LingBot-VA零样本超越微调方法

九、总结

核心贡献

  1. 统一具身基础模型:将操作、导航和自我中心动作建模统一到共享的动作-轨迹空间,基于Qwen3.5-4B骨干和1.15B DiT动作解码器
  2. 大规模联合预训练:构建涵盖操作轨迹、人类自我中心演示、合成模拟、导航和VL数据的异构预训练混合
  3. 形态感知提示条件化:通过文本描述统一多样机器人平台,无需为每个形态单独的策略
  4. 渐进式训练策略:T2A预训练 → CPT → SFT → RL,桥接离散VL token和连续动作轨迹

技术影响

  • 证明了异构具身决策问题可以在单一VLA模型中统一
  • 通用模型可以匹配或超越针对每个基准专门微调的专家模型
  • 大规模具身预训练提供了强大的域外泛化能力
  • T2A阶段的”压缩视角”为动作学习提供了新的理论框架

局限性

  • 论文未详细公开模型权重和完整训练代码
  • 合成数据管线(ROBOINF)的完整技术细节在单独的博客中
  • RL阶段仅在单一模拟环境(SimplerEnv)中训练,但展示了跨环境迁移
  • 未详细讨论计算资源需求和训练成本

十、参考资源