Back to blog

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

通过强化学习增强视觉-语言-动作框架,实现四足机器人的显式推理和连续控制

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

一、论文概述

项目内容
标题MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
作者Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang
论文https://arxiv.org/abs/2511.17889
发布2025-11-22
代码https://github.com/MobileVLA-R1/MobileVLA-R1
网站https://mobilevla-r1.github.io

二、核心思想

问题定义

四足机器人视觉-语言-动作(VLA)面临的核心挑战:

挑战说明
语义-动作鸿沟高层语义推理与低层电机控制难以桥接
推理不透明缺乏可解释的推理结构
泛化能力弱实际部署中稳定性和泛化性不足

解决方案概述

MobileVLA-R1 提出层级化推理-执行框架:

  1. Chain-of-Thought (CoT) 推理:生成结构化推理计划
  2. 两阶段训练:SFT对齐 + GRPO强化学习
  3. 连续控制:将推理转化为连续控制命令

MobileVLA-R1架构

MobileVLA-R1架构:端到端框架,集成自然语言指令与多模态感知,通过CoT推理生成结构化动作计划

三、技术架构

整体框架

多模态输入 (RGB + Depth + Point Cloud)
          ↓
    视觉编码器 (DepthAnything V2 + Point Transformer v3)
          ↓
    多模态融合 (Projection Module)
          ↓
    LLaMA3-8B语言骨干
          ↓
    CoT推理生成 (<think>...</think>)
          ↓
    动作解码器 (连续速度 + 离散动作)
          ↓
    四足机器人控制

核心公式

策略映射:

fθ:(Xrgb,Xdepth,Xpoint)×I→Af_\theta: (X^{\text{rgb}}, X^{\text{depth}}, X^{\text{point}}) \times I \rightarrow A

at=[Vx,Vy,ωyaw,α]a_t = [V_x, V_y, \omega_{yaw}, \alpha]

其中:

  • Vx,VyV_x, V_y:x/y轴平移速度
  • ωyaw\omega_{yaw}:偏航角速度
  • α\alpha:离散高层动作

GRPO目标函数:

LGRPO=E(x,i)∼D[1N∑j=1N(A^jlog⁡πθ(oj∣x,i)−β⋅KL(πθ∥πref))]\mathcal{L}_{\text{GRPO}} = \mathbb{E}_{(x,i) \sim \mathcal{D}} \left[ \frac{1}{N} \sum_{j=1}^{N} \left( \hat{A}_j \log \pi_\theta(o_j | x, i) - \beta \cdot \text{KL}(\pi_\theta \| \pi_{\text{ref}}) \right) \right]

其中 A^j\hat{A}_j 是归一化后的组内奖励。

模型组件

组件说明关键参数
RGB编码器视觉感知从NaVILA初始化
深度编码器DepthAnything V23D几何感知
点云编码器Point Transformer v33D点云处理
语言骨干LLaMA3-8BCoT推理生成
动作解码器连续+离散动作统一控制

训练流程

两阶段训练范式:

阶段方法数据目标
冷启动SFTMobileVLA-CoT (134K)格式对齐,初始化推理
强化学习GRPO在线采样推理一致性,控制稳定性

LoRA配置:

  • r=16r = 16, α=32\alpha = 32
  • 仅训练投影层和注意力层
  • 视觉编码器冻结

四、核心创新

创新点说明优势
CoT数据引擎使用Gemini生成多粒度推理标注高质量推理监督
层级化推理从高层推理到低层控制的显式映射可解释性强
GRPO强化学习组内相对奖励优化训练稳定,避免过更新
多模态融合RGB + Depth + Point Cloud3D感知增强
统一框架导航+控制任务统一处理通用性强

五、代码实现分析

数据集统计:

数据集导航控制CoT标注规模
R2R✓××50K
RxR✓××58
QUARD✓✓×262K
MobileVLA-CoT-Episode×✓✓18K
MobileVLA-CoT-Step×✓✓78K
MobileVLA-CoT-Nav✓×✓38K

CoT数据引擎流程:

  1. 输入:RGB-D观察 + 自然语言指令 + 状态-动作历史
  2. 模型:Gemini-2.5-Flash
  3. 输出:<think>...</think> 推理 + <answer>...</answer> 动作
  4. 验证:规则过滤 + 人工检查

六、实验结果

VLN-CE导航任务

R2R-CE Val-Unseen结果:

方法NE↓OS↑SR↑SPL↑
NaVILA5.2262.554.049.0
CorrectNav4.2467.565.162.3
MobileVLA-R14.0569.768.365.2

RxR-CE Val-Unseen结果:

方法NE↓SR↑SPL↑nDTW↑
NaVILA6.7749.344.058.8
CorrectNav4.0969.363.375.2
MobileVLA-R13.9271.566.876.1

关键发现:

  • MobileVLA-R1在VLN-CE任务上达到SOTA
  • 相比CorrectNav,SR提升2.2%(R2R-CE)和3.4%(RxR-CE)
  • 无需预训练路点预测器

QUARD四足控制任务

整体性能:

方法EasyMediumHard平均
CLIP0.440.350.000.25
VC-10.460.380.000.28
QUART0.660.490.220.44
MoRE0.820.620.410.60
MobileVLA-R10.920.750.510.73

详细任务结果:

任务难度MoREMobileVLA-R1提升
DistinguishEasy0.820.92+12.2%
Go toEasy0.800.89+11.3%
Go avoidMedium0.590.71+20.3%
Go throughMedium0.570.65+14.0%
CrawlHard0.490.58+18.4%
UnloadHard0.330.44+33.3%

关键发现:

  • MobileVLA-R1在所有6个任务上均超越现有方法
  • 平均提升21.7%,困难任务提升更大(Crawl +18.4%, Unload +33.3%)
  • 证明推理对齐的控制在复杂任务中更有效

消融实验

训练阶段影响:

配置SR (R2R-CE)SR (RxR-CE)QUARD
SFT only65.168.20.68
SFT + RL68.371.50.73

强化学习提升:

  • VLN任务:SR提升3-4%
  • QUARD任务:成功率提升7.4%

真实世界部署

硬件平台:

  • 机器人:Unitree Go2四足机器人
  • 计算:Jetson Orin Nano(车载PC)
  • 传感器:L2 LiDAR + Intel RealSense D435i RGB-D相机

部署流程:

  1. RGB-D和3D点云数据传输到MobileVLA-R1
  2. 多模态推理和动作生成
  3. 速度和运动命令回传车载PC
  4. 实时执行

关键发现:

  • 在杂乱和部分可观测条件下表现稳健
  • 支持实时控制(低延迟推理)
  • 无需额外仿真预训练

七、相关工作

视觉-语言导航

方法特点局限性
NaVILAVLN预训练无显式推理
CorrectNav纠错机制推理不透明
VLN-R1RL优化缺乏结构化推理

四足控制

方法特点局限性
QUART四足强化学习无语言理解
MoRE多模态表征推理不显式
VC-1视觉控制泛化能力弱

链式思维推理

  • DeepSeek-R1:RL增强推理
  • MobileVLA-R1创新:将CoT应用于具身控制

八、总结

核心贡献

  1. MobileVLA-R1框架:层级化推理-执行的VLA框架
  2. MobileVLA-CoT数据集:大规模多粒度CoT标注
  3. 两阶段训练:SFT对齐 + GRPO强化学习
  4. SOTA性能:VLN和四足控制任务均达到最优

技术影响

  • 可解释性:显式推理过程便于调试和优化
  • 泛化能力:跨任务、跨环境的稳健表现
  • 实时部署:支持车载实时控制
  • 通用框架:统一导航和控制任务

局限性

  1. 计算开销:多模态编码增加推理延迟
  2. 数据依赖:CoT数据生成需要大模型
  3. 硬件要求:需要LiDAR和深度相机
  4. 任务范围:主要验证于四足机器人,其他平台待探索

九、参考资源

论文

相关方法

  • NaVILA: 具身VLN预训练
  • CorrectNav: VLN纠错导航
  • QUART: 四足强化学习
  • MoRE: 多模态表征学习
  • DeepSeek-R1: RL增强推理