Back to blog

A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

从动作 tokenization 视角统一审视 VLA 模型的综述。提出 VLA 模块 + 动作 token 的统一框架,将现有 VLA 模型归为 8 种动作 token 类型(语言描述/代码/可供性/轨迹/目标状态/隐表示/原始动作/推理),逐一分析每种类型的优势、局限与未来方向,并提出分层架构趋势与从 VLA 模型到 VLA 智能体的演进路径。

A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

一、论文概述

项目内容
标题A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
作者Yifan Zhong, Fengshuo Bai, Shaofei Cai, Xiaowei Zhang, Yuanpei Chen, Yaodong Yang 等(北京大学等)
机构北京大学、鹏城实验室等
论文arXiv 2507.01925(v1)
代码无(综述论文)
发布2025-07-02
学科Robotics (cs.RO)
定位首个以动作 tokenization 为统一视角的 VLA 综述

统一框架总览

二、核心思想

问题定义

VLA 模型种类繁多(RT-1/2、OpenVLA、π₀、GR00T N1 等),各自采用不同的架构和训练策略,导致领域缺乏统一的认知框架来理解它们的共性与差异。研究者难以回答的核心问题是:不同 VLA 模型的本质区别是什么?各种设计选择之间的 trade-off 如何?

解决方案概述

本文提出一个统一框架:所有 VLA 模型都可以抽象为一系列 VLA 模块(最大可微子网络或非可微功能单元)的迭代处理链,每个模块的输出即为动作 token(action token)。动作 token 是 VLA 中语言 token 的泛化对应物——它将视觉和语言输入逐步编码为更具 grounding 和行动导向的信息,最终生成可执行的动作。

动作 token 可视化(同一任务的不同 token 形式)

VLA 模块定义为:VLA 模型中支持端到端梯度流动的最大可微子网络,或非可微功能单元(如运动规划器)。若多个神经网络组件相互连接且联合优化,则视为同一模块的一部分。

8 种动作 token 类型

通过统一框架分析,本文发现 VLA 模型的主要区别在于动作 token 的表述方式,可归纳为 8 种类型:

类型定义形式
(1) 语言描述描述预期动作序列的自然语言表达高层语言计划 → 低层语言动作
(2) 代码可执行代码片段或伪代码Python 程序、有限状态机
(3) 可供性捕捉任务相关交互属性的空间化表征关键点、边界框、分割掩码、可供性图
(4) 轨迹时空有序的状态序列末端执行器/物体运动轨迹
(5) 目标状态预测的未来观测单帧图像、点云、视频片段
(6) 隐表示专门预训练的隐向量序列从大规模数据集提取的动作相关隐变量
(7) 原始动作可直接由机器人执行的低层控制指令7-DoF 位姿、关节角度、速度
(8) 推理描述导致特定动作 token 的决策过程自然语言推理链(增强其他所有 token)

基础模型演进时间线

三、基础模型演进(§2)

VLA 的发展建立在 LFM/VFM/VLM 的持续进步之上,呈现 U 型曲线——VLA 的繁荣由基础模型和数据双轮驱动。

语言基础模型 (LFM)

  • Encoder: BERT(MLM + NSP)、T5(text-to-text)
  • Decoder-only: GPT 系列(next-token prediction → in-context learning → 175B 规模涌现能力)
  • Scaling Laws: 模型大小/数据量/算力与预训练损失的预测关系
  • 对齐: InstructGPT(SFT + RLHF)开启了人类偏好对齐时代
  • 开源: Llama/Gemma/Mistral(2B-70B)+ PEFT(LoRA)
  • MoE: Switch Transformer / Mixtral(激活子集专家,大容量低推理成本)
  • 线性注意力: Mamba(选择性状态空间,替代 Transformer 二次复杂度)
  • 推理增强: o1 / DeepSeek-R1(扩展测试时计算,GRPO 强化学习)

视觉基础模型 (VFM)

  • ViT: 图像作为视觉 token 序列,与文本联合处理
  • CLIP/SigLIP: 4 亿图文对的对比学习 → 零样本迁移
  • DINO: 自监督学习 → 细粒度下游任务(分割/深度估计)
  • SAM/SAM 2: 提示式图像/视频分割
  • Grounding DINO: 开放词汇检测与定位
  • 扩散模型: Stable Diffusion / Sora(流匹配 + 物理先验)
  • 世界模型: Genie/Genie 2(条件动作序列的未来视觉模拟)

视觉-语言模型 (VLM)

  • BLIP-2: Q-Former 连接器 + 两阶段训练(冻结 VFM + 冻结 LLM)
  • LLaVA: CLIP 视觉编码器 → MLP → Vicuna(视觉指令微调)
  • Qwen2.5-VL: 2D RoPE + M-RoPE 时空编码,动态分辨率视频理解
  • Prismatic: 单阶段训练 + 融合 DINOv2/SigLIP 视觉骨干
  • PaliGemma: SigLIP + Gemma → π₀ 系列 VLA 骨干
  • GPT-4o / Gemini 2.5 Pro: 领先闭源模型

四、8 种动作 token 类型详解

4.1 语言描述(§4)

进展与代表工作:

  • 早期: Language Planner、Socratic Models(LLM 分解子目标)、SayCan(LLM 计划 + VLM 可行性加权)
  • 反馈循环: Inner Monologue(成功检测/场景描述/人类反馈的多轮推理)、DoReMi(LLM 生成计划 + 执行约束)
  • VLM 直接规划: PaLM-E(视觉+语言+机器人状态统一编码)、EmbodiedGPT(轻量 VLM + EgoCOT 数据集)
  • 记忆与反思: BUMBLE、ReflectVLM
  • 分层架构: Hi Robot(PaliGemma 高层 VLM → π₀ 风格低层策略)、π₀.₅(单一模型统一:高层语义子任务 + 低层连续动作,web-scale 异构数据训练)
  • 语言动作(fine-grained): RT-H(VLM 预测”拉餐巾”→ 低层动作)、NaVILA(导航:生成”前进 75cm”)

优势:

  1. 与 LLM/VLM 无缝集成,开箱即用的零样本规划
  2. 丰富的共训练数据(网络语料转移世界知识)
  3. 长时序规划近乎必需
  4. 可解释性支持人类监督与干预

局限:

  • 表达能力不足(模糊、难以描述精细操作)
  • 大模型推理延迟高

4.2 代码(§5)

核心思路: 用可执行代码片段或伪代码替代离散信号/语言命令,天然支持条件/循环等控制结构,通过机器人 API 直接执行。

进展:

  • Code as Policies: Codex → Python 代码 → 调用机器人 API + NumPy 空间推理
  • ProgPrompt: 有限状态机框架(import 声明 + 自然语言注释 + 断言验证)
  • Instruct2Act: 多模态基础模型辅助精确目标分割 + 开放词汇分类
  • RoboCodeX: 思维树框架融合视觉/语言/物理线索
  • RoboScript: 统一代码生成管线

优势: 逻辑清晰、可利用丰富第三方库、透明可验证

局限: 过度依赖预定义 API 库、运行时脆弱(符号接地问题)、动态环境适应性差

4.3 可供性(§6)

可供性(Affordance)= 环境相对于智能体提供的「动作可能性」。4 种子类型:

子类型说明代表
关键点精确交互锚点ReKep(倒茶)
边界框实例级定位DexGraspVLA(杂 cluttered 场景精细抓取)
分割掩码细粒度轮廓/功能区ROCKET-1(开放世界决策)
可供性图密集、交互为中心的全场景ManiFoundation(可变形物体操作)

优势: 空间 grounding 强、与视觉感知天然对齐 局限: 3D 空间结构建模不足、缺乏时序演化建模、对视觉噪声(遮挡/运动伪影)敏感

4.4 轨迹(§7)

定义: 时空有序的空间状态序列,捕捉物体/末端执行器/场景的动态演化。

代表: RT-Trajectory(用板擦清洁桌子)

优势: 可从离线人类视频中训练、跨任务泛化 局限: 3D 表达能力有限、VLM 支持不足、语义 grounding 不充分

4.5 目标状态(§8)

定义: 预测的未来观测——图像、点云或视频片段,表示预期动作结果。

子类型:

  • 单帧图像: 静态目标状态
  • 多帧视频: 动态目标状态(VPP:移液管液体转移)

优势: 基础模型强力支持、通过 hindsight relabeling 和数据利用实现高可扩展性、任务特异性强 局限: 高质量一致的目标状态生成困难、推理延迟高

4.6 隐表示(§9)

定义: 专门预训练的隐向量序列,编码时间区间内的动作相关信息。

子类型:

  • 视觉基: 从图像对学隐动作(LAPA、UniVLA)
  • 动作基: 从动作序列学表征
  • 目标基: 从目标状态学表征

代表: GO-1(叠短裤)、OmniJARVIS(Minecraft 挖矿)

优势: 高数据可扩展性(利用无动作标签的人类视频和跨具身数据)、表达力强(紧凑结构、隐式语义、多模态融合) 局限: 不可解释;需改进粒度、全面性和任务中心对齐

隐表示方法统一可视化

4.7 原始动作(§10)

定义: 可直接由机器人执行的一个或多个低层控制指令。

六大技术方向:

  1. 视觉-语言特征融合: FiLM 条件、交叉注意力
  2. Transformer 通用模型: Gato、RT-1(TokenLearner + 非自回归解码)
  3. 自回归机器人 VLA: RT-2、OpenVLA(VLM 骨干 + 离散动作 token)
  4. 视频预训练 + 机器人数据微调: π₀(PaliGemma + flow matching,50Hz 并行输出)
  5. 扩散动作分块: Octo、Diffusion-VLA(DDPM/DDIM 去噪)
  6. 异构数据集 + 统一动作空间: OXE(22 台机器人 100 万 episode)、UniAct(Universal Action Space 离散码本)

优势: 最小人工知识、最小 token 标注、训练策略与 VLM 相似具备扩展潜力、高效微调 局限: 数据稀缺、采集困难、推理延迟高、跨具身泛化差

4.8 推理(§11)

定义: 自然语言表达,明确描述导致特定动作 token 的决策过程。

演进: 纯语言推理 → 基于动作 token 的推理(用动作 token 而非语言 token 构建推理链)

代表: DriveVLM(自动驾驶)、ECoT(自回归预测中间表征)

优势: 增强目标动作 token 的生成、解决复杂问题 局限: 高延迟;需开发灵活的推理范式(自适应测试时计算)

五、Table 1 汇总:8 种 token 类型一览

动作 token 类型优势局限代表性实证成果
语言计划LLM/VLM 原生支持、丰富共训练数据、长时序规划必需表达能力不足(模糊/难描述精细操作)、高延迟π₀.₅ 铺床、Hi Robot 做三明治
语言动作多任务数据共享—RT-H 拉餐巾
代码LLM 原生支持、逻辑清晰、丰富第三方库依赖预定义 API、运行时脆弱Instruct2Act 整理房间
关键点精确交互目标3D 结构建模不足、缺时序建模、对视觉噪声敏感ReKep 倒茶
边界框VLM 支持充分、实例级定位高效—DexGraspVLA 精细抓取
分割掩码细粒度轮廓/功能区 grounding—ROCKET-1 开放世界决策
可供性图密集、交互为中心、全场景—ManiFoundation 可变形物体操作
轨迹可从离线人类视频训练、跨任务泛化3D 表达有限、VLM 支持不足、语义 grounding 弱RT-Trajectory 清洁桌面
目标状态基础模型支持、hindsight relabeling 可扩展、任务特异性高质量生成困难、高延迟VPP 移液管转移液体
隐表示高数据可扩展性(利用人类视频/跨具身数据)、表达力强不可解释;需改进粒度/全面性/任务对齐GO-1 叠短裤、OmniJARVIS 挖矿
原始动作最小人工知识/标注、扩展潜力大、高效微调数据稀缺、采集困难、高延迟、跨具身泛化差π₀ 洗衣折叠、Real-Time Chunking 点火
推理增强目标 token 生成、解决复杂问题高延迟;需灵活推理范式DriveVLM 自动驾驶

六、可扩展数据来源(§12)

三层金字塔结构:

        ┌─────────────────────┐
        │  Top: 真实机器人数据  │  ← 最高保真度,直接物理监督
        │  OXE / DROID / RT-1  │
        ├─────────────────────┤
        │  Middle: 合成/仿真数据 │  ← 低成本可扩展,composition skills
        │  MimicGen / RoboCasa │
        ├─────────────────────┤
        │  Bottom: 网络数据/人类视频 │  ← 最大规模,世界知识
        │  Ego4D / EPIC-KITCHENS│
        └─────────────────────┘

Bottom: 网络数据与人类视频

  • 数据集: Ego4D(3000+ 小时,800+ 人,9 国 74 城)、EPIC-KITCHENS-100、Something-Something V2
  • 作用: 提取轨迹(Magma Set-of-Mark)、推断隐状态转换、生成隐动作
  • 弱监督: Frame-level captioning + temporal alignment 间接监督轨迹/目标 token

Middle: 合成与仿真数据

  • 合成数据集生成: MimicGen(空间变换 + 场景重组)、DexMimicGen(双臂运动学重定向)、RoboCasa(100K+ 轨迹)、GR00T N1(双臂装配)
  • 交互式仿真平台: robosuite、Habitat、Isaac Gym/Lab、AgiBot Digital World
  • 数据生成范式: 遥操作 / 算法求解器(运动规划器)/ 学习策略(RL)
  • 程序化内容生成: 随机化物体/纹理/光照
  • 挑战: sim-to-real gap

Top: 真实机器人数据

  • 多具身数据集: OXE(100 万 episode,22 台机器人)、RoboMIND(含 5K 失败轨迹 + 因果标注)、RH20T(多模态含力矩/音频)
  • 单具身/任务特定: RT-1(13 万轨迹,13 台 Google Robot)、DROID(13 机构统一 Franka Panda)、AgiBot World(100 万轨迹,Genie-1)
  • 长时序: BridgeData V2(6 万厨房任务演示)
  • 野外环境: HoNY(非结构化家庭环境)
  • 自动驾驶: nuScenes、Waymo Open Dataset-Motion
  • 主流范式: 大规模仿真/网络数据预训练 → 小规模高质量真实数据微调

七、VLA 发展趋势与未来方向(§13)

7.1 动作 token 与 VLA 架构趋势

核心观点: 未来 VLA 不是单一主导 token,而是战略性组合,推动分层架构:

┌─────────────────────────────────────────┐
│  顶层: 语言计划 + 代码                     │  ← 长时序规划 + 逻辑控制
│  (LLM/VLM 原生支持,不可替代)              │
├─────────────────────────────────────────┤
│  中层: 3D 可供性 + 轨迹流建模 + 目标视频预测  │  ← 精确可解释的运动表征
│  (世界模型支持视觉目标状态的生成)            │
├─────────────────────────────────────────┤
│  底层: 原始动作                            │  ← 端到端映射
│  (短期由中层 token 映射,长期直接 subtask→raw)│
└─────────────────────────────────────────┘
  • 语言动作和基于 API 的代码相对表达能力较弱,可被 3D 可供性/轨迹/目标视频替代
  • 隐表示潜力巨大但目前训练挑战大(粒度/全面性/任务对齐),短期偏好更显式的 token
  • 推理应贯穿整个 VLA 层次,从语言推理进化为基于动作 token 的推理(利用多模态反馈和自适应测试时计算)

7.2 从 VLA 模型到 VLA 智能体(§13.2)

  • 当前 VLA 缺乏历史机制(仅几帧或简单语言规划)
  • 需要结构化记忆、规划、反思组件
  • 架构应从线性链进化为双向/图拓扑(自适应调用模块和 token)
  • 多智能体系统与人类-智能体共存

7.3 从模仿学习到强化学习(§13.3)

  • IL 上限受演示者能力限制,人类演示常次优(疲劳/设备限制)
  • RL 可实现类人的试错和自主探索
  • 挑战:真实世界重置成本高、交互效率低、安全风险
  • 方向:上下文强化学习(in-context RL)、VLM 自动生成稠密奖励函数

7.4 从受限硬件到全灵巧与多模态(§13.4)

  • 当前多用简单夹爪,需向灵巧手演进
  • 整合音频、触觉等新模态

7.5 从能力中心到安全感知(§13.5)

  • 当前研究偏重能力,需加强安全与人类对齐

7.6 从数据稀缺到数据可扩展性(§13.6)

  • 模型、数据、硬件三者协同进化(triad of progress)
  • 当前受限于受限平台和稀缺数据,多数研究仍停留在简化实验室环境

八、与另一篇 VLA 综述的对比

维度本文(动作 tokenization 视角)之前的 VLA 综述 (2510.07077)
核心视角动作 token 的类型学与统一框架全栈(软件+硬件)综合审查
分类方式8 种动作 token 类型3 类架构(sensorimotor/world model/affordance)
独特贡献VLA 模块定义、Table 1 对比、分层组合趋势7 种 sensorimotor 变体、机器人平台/数据集详表
共同结论分层架构 + 多种 token 组合 + 推理贯穿分层架构 + 世界模型 + RL + 持续学习

九、总结

核心贡献

  1. 统一框架: 提出 VLA 模块 + 动作 token 概念,将所有 VLA 模型统一到同一分析框架下
  2. 8 型分类法: 首次系统性地将动作 token 分为 8 种类型,逐一分析动机/代表工作/优势/局限/未来方向
  3. Table 1 全景对比: 汇总每种 token 类型的优势、局限和实证成就
  4. 分层架构趋势: 论证未来 VLA 不是单一 token 主导,而是语言计划+可供性/轨迹/目标状态+原始动作的分层组合
  5. 数据三层金字塔: 从人类视频→仿真合成→真实机器人数据的可扩展数据策略
  6. 从模型到智能体: 呼吁引入记忆/规划/反思,从线性架构进化为图拓扑

技术影响

  • 为 VLA 研究提供了统一的认知语言(VLA 模块 + 动作 token)
  • 揭示了看似不同的 VLA 架构背后的共性
  • 为未来 VLA 系统设计提供了可操作的路线图

局限性

  • 部分 token 类型(尤其是隐表示)仍处于早期探索阶段
  • 真实世界 RL 训练的效率和安全挑战尚未解决
  • 硬件(灵巧手/多模态传感器)仍是瓶颈

十、参考资源