Back to blog

DIAL: Decoupling Intent and Action via Latent World Modeling

End-to-End VLA with Differentiable Latent Intent Bottleneck

DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA

一、论文概述

项目内容
标题DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
作者Yi Chen, Yuying Ge, Hui Zhou, Mingyu Ding, Yixiao Ge, Xihui Liu
机构XPeng Robotics (小鹏机器人)
论文arXiv:2603.29844
代码项目主页
发布2026-03-31 (v2: 2026-04-28)
许可CC BY 4.0

二、核心思想

问题定义

现有的端到端 Vision-Language-Action (VLA) 模型将预训练 VLM 主要用作多模态编码器,直接将视觉-语言特征映射到低级动作。这种范式存在三个核心问题:

  1. VLM 潜力未充分利用:VLM 被当作被动的特征编码器,其高级决策能力被忽视
  2. 训练不稳定:端到端训练容易导致模型崩溃,退化 VLM 的预训练知识
  3. 语义表示退化:直接映射会破坏 VLM 丰富的语义表示

解决方案概述

DIAL 提出通过可微分潜在意图瓶颈(differentiable latent intent bottleneck)桥接高级决策和低级运动执行:

  • System-2 (VLM):作为潜在世界模型,在 VLM 原生 ViT 特征空间中合成潜在视觉前瞻(latent visual foresight),显式编码意图
  • System-1 (策略):轻量级潜在逆动力学模型,将预测意图与当前观察解码为精确的机器人动作
  • 两阶段训练:解耦预热阶段 + 端到端联合优化,确保训练稳定性

三、技术架构

整体框架图

DIAL 双系统架构

VLA 架构对比

VLA 架构对比

架构类型代表方法问题
分层式LLM 文本规划 + 下游策略非可微间隙,部署延迟高
端到端直接特征→动作映射训练崩溃,知识退化
DIAL潜在意图瓶颈 + 逆动力学结构化解耦,梯度稳定

核心公式

潜在视觉前瞻生成 (System-2):

xt=MLPϕ(LLMψ(lt,ot,q1,…,qN))x_t = \text{MLP}_{\phi}(\text{LLM}_{\psi}(l_t, o_t, q_1, \ldots, q_N))

其中 ltl_t 为语言指令,oto_t 为当前视觉观察,q1,…,qNq_1, \ldots, q_N 为 N=64N=64 个可学习查询。

潜在逆动力学解码 (System-1):

at:t+H=DiTθ(SA(ot,q1s,…,qMs),xt)a_{t:t+H} = \text{DiT}_{\theta}(\text{SA}(o_t, q_1^s, \ldots, q_M^s), x_t)

其中 SA 为自注意力,q1s,…,qMsq_1^s, \ldots, q_M^s 为 System-1 的可学习查询,HH 为动作块大小。

模型组件

组件说明关键参数
VLM BackboneQwen2.5-VL-3BViT + LLM
System-2 MLP Head潜在意图合成输出 ViT 特征维度
System-1 DiT潜在逆动力学自注意力 + 流匹配
可学习查询System-2: N=64, System-1: M=128跨系统共享
视觉分辨率224×224统一输入
动作块大小H=16 (仿真), H=50 (真实)预测未来动作

两阶段训练

阶段一:解耦预热 (Decoupled Warmup)

  • System-2 学习预测潜在未来状态(使用 GT 未来作为监督)
  • System-1 在 GT 未来引导下学习运动控制
  • 两个系统独立优化,确保稳定初始化

阶段二:端到端联合优化

  • System-2 合成的预测前瞻作为 System-1 的输入
  • 动作感知梯度以受控方式细化 VLM backbone
  • 保持预训练知识的同时提升控制能力

四、核心创新

创新点说明理论/实验依据
潜在意图瓶颈通过可微分潜在空间桥接语义推理和运动控制避免分层式的非可微间隙
潜在世界建模在 VLM 原生 ViT 特征空间中合成视觉前瞻保持语义一致性,避免跨流形翻译
潜在逆动力学System-1 作为逆动力学模型解码意图→动作结构化瓶颈防止捷径学习
解耦预热训练两阶段训练确保稳定性和知识保持消除模型崩溃,10x 数据效率
跨具身学习利用异构人类演示学习物理接地的操作先验零样本泛化到未见物体和配置

五、代码实现分析

项目结构

  • 项目主页: https://xpeng-robotics.github.io/dial
  • VLM Backbone: Qwen2.5-VL-3B (冻结 ViT,微调 LLM)
  • System-1: 基于 DiT 的流匹配模型
  • 训练框架: PyTorch,两阶段训练流程

关键实现细节

  • ViT 编码器保持冻结以维持特征对齐
  • 可学习查询在两个系统间共享同一潜在空间
  • 人类演示数据通过手腕 EEF 姿态对齐到机器人状态空间
  • 动作预测使用流匹配(flow matching)而非扩散

六、实验结果

仿真基准测试 (RoboCasa GR1 Tabletop)

仿真全数据结果

全数据设置 (24,000 轨迹):

方法平均成功率Pick & PlaceArticulated
Diffusion Policy32.4%28.3%40.0%
UWM38.6%34.1%48.3%
FLARE55.0%51.7%61.7%
GR00T-N1.647.6%44.2%55.0%
DIAL70.2%68.9%74.3%

仿真少样本结果

少样本设置 (2,400 轨迹,10x 减少):

方法平均成功率
GR00T-Qwen2.5 (frozen)21.8%
GR00T-Qwen2.5 (-FT)30.6%
+ FLARE51.9%
+ SEER49.6%
+ SEER-EV47.2%
DIAL-DINO47.2%
DIAL58.3%

关键发现: DIAL 用 10x 更少的数据(58.3%)超过了 FLARE 用全数据训练的结果(55.0%)。

消融实验

架构设计消融:

  • 世界建模目标:+30% 成功率提升(21.8% → 50%+)
  • 结构化瓶颈:比松散耦合(SEER/FLARE)高 6-11%
  • 特征对齐:DINO 替换导致 11% 性能下降(58.3% → 47.2%)

人类数据影响:

人类数据影响

设置Pick & PlaceOOD 平均
仅机器人数据56.0%46.2%
+ 人类数据60.8%51.2%

真实世界实验

真实世界分布内结果

跨具身学习任务 (分布内):

方法Pick & PlacePouring平均
GR00T-Qwen2.550.0%50.0%50.0%
GR00T-Qwen2.5 + FLARE62.5%55.0%58.8%
GR00T-Qwen2.5 + SEER57.5%57.5%57.5%
DIAL (w/o human)75.0%70.0%72.5%
DIAL85.0%80.0%82.5%

解耦预热的重要性:

  • 无预热:分布内 57.5%,OOD 30.0%
  • 有预热:分布内 77.5%,OOD 58.3%

真实世界OOD结果

OOD 泛化结果:

方法组合泛化干扰物鲁棒实例迁移平均
GR00T-Qwen2.5 + FLARE60.0%40.0%40.0%46.7%
DIAL (w/o human)60.0%60.0%33.3%51.1%
DIAL80.0%80.0%60.0%73.3%

真实世界多阶段任务

多阶段协调任务:

方法Handover (分布内)Sweeping (分布内)Handover (新货架)Sweeping (新桌布)
GR00T-Qwen2.5 + FLARE50.0%30.0%0.0%0.0%
GR00T-Qwen2.5 + SEER50.0%30.0%0.0%0.0%
DIAL90.0%80.0%70.0%70.0%

潜在表示可视化

潜在表示可视化

PCA 可视化显示:

  • 预测前瞻与 GT 未来在任务相关区域高度对齐
  • 预测前瞻与当前观察在预期变化区域显著不同
  • 证明 System-2 主动预测有意义的状态转换,而非仅重建当前场景

七、相关工作

分层式 VLA

  • LLM/VLM 作为语义规划器生成文本子任务或代码
  • 视频扩散模型预测像素级目标图像
  • 问题:非可微接口阻碍基础模型获取动作感知动态

端到端 VLA

  • 早期方法:将动作作为离散文本 token
  • 双系统架构趋势:VLM (System-2) + 轻量级连续动作专家 (System-1)
  • 问题:端到端训练导致模型崩溃,VLM 被降级为被动编码器

世界建模

  • 视频预训练初始化策略
  • SEER:前瞻特征作为动作生成的显式条件
  • FLARE:查询 token 对齐中间特征与视觉前瞻
  • 问题:大多数方法将前瞻作为辅助任务或简单附加到长上下文序列

八、总结

核心贡献

  1. 提出 DIAL 框架,通过潜在意图瓶颈实现认知决策与运动执行的结构化解耦
  2. 设计潜在世界建模(System-2)+ 潜在逆动力学(System-1)的双系统架构
  3. 引入两阶段训练范式(解耦预热 + 端到端优化),确保训练稳定性
  4. 在 RoboCasa GR1 仿真基准上建立新 SOTA(70.2%),10x 数据效率
  5. 在真实世界人形机器人上验证鲁棒性和零样本泛化能力

技术影响

  • 潜在意图瓶颈作为通用接口,支持 VLM 和动作专家的独立迭代
  • 跨具身学习范式,利用人类演示提升机器人泛化能力
  • 为构建通用具身智能体提供可扩展的架构范式

局限性

  • System-1 使用较小的 DiT 骨干,复杂任务精度有限
  • ViT 编码器保持冻结,可能限制视觉表示学习
  • 未来方向:端到端微调 ViT、利用无动作人类视频预训练

九、参考资源

  • 论文: arXiv:2603.29844
  • 项目主页: https://xpeng-robotics.github.io/dial
  • 相关工作:
    • FLARE (2025) - 流匹配框架 + 未来潜在对齐
    • SEER (2025) - 前瞻特征作为动作生成条件
    • GR00T-N1.6 (2026) - 双系统 VLA 架构
    • π-VLA (2026) - KV 缓存的逐层 VLM 表示
    • EgoDex (2024) - 人类手部操作数据集