Back to blog

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

A single VLA with bidirectional speed control via Variable-Speed Trajectory Augmentation (VSTA) and explicit speed conditioning, enabling on-demand acceleration/deceleration without retraining

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

一、论文概述

项目内容
标题TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
作者Dong Jing*^1,2, Jingchen Nie*^2, Tianqi Zhang*^2, Jiaqi Liu^2, Huaxiu Yao^2, Zhiwu Lu^1†, Mingyu Ding^2†
机构^1 RUC (Renmin University of China), ^2 UNC (University of North Carolina at Chapel Hill)
论文arXiv:2606.06491
发布4 Jun 2026 (v1), revised 19 Jul 2026 (v2), 5,020 KB
许可CC BY 4.0
SubjectsRobotics (cs.RO); Artificial Intelligence (cs.AI)

二、核心思想

问题定义

机器人操作在低风险通过阶段需要快速执行,在高接触风险阶段需要慢速精确运动。然而现有的 Vision-Language-Action 模型(VLAs)仅从训练演示中继承单一固定速度。已有工作通过模型压缩、KV-cache 复用或强化学习来加速 VLAs,只是将策略从一个固定速度移到另一个固定速度,且减速几乎未被探索。

解决方案概述

TempoVLA 是一个单一 VLA 框架,其执行速度通过显式条件控制。核心洞察是:每个预测动作的幅度已经决定了机器人的移动速度——这为可控执行速度打开了直接通道。

TempoVLA 结合两个耦合组件:

  1. 数据端 — 变速轨迹增强 (Variable-Speed Trajectory Augmentation, VSTA):在线将任何演示重新定时到任意目标速度,通过合并连续动作来加速,或拆分动作来减速,同时保持运动语义不变。

  2. 模型端 — 速度条件机制:将标量速度 ss 作为显式条件输入策略,通过三种注入方案之一缩放预测动作幅度,底层控制器保持不变。

配合大型多模态模型 (VLM),TempoVLA 可实现动态速度调度——在低风险阶段加速通过,在高接触阶段减速以确保精度。

三、技术架构

整体框架图

TempoVLA Framework

┌─────────────────────────────────────────────────────────────────┐
│                      TempoVLA Architecture                       │
│                                                                  │
│  ┌─────────────────── VSTA (Data Side) ─────────────────────┐   │
│  │                                                          │   │
│  │  Original Demo:  [a_1] [a_2] [a_3] [a_4] [a_5] [a_6]    │   │
│  │                    │      │      │      │      │      │   │
│  │  s=0.5× (slow):  [a_1] [a_1'] [a_2] [a_2'] [a_3] [a_3'] │   │
│  │                  (split: q<p → more output frames)        │   │
│  │                                                          │   │
│  │  s=2.0× (fast):  [b_1] [b_2] [b_3]                      │   │
│  │                  (merge: q>p → fewer output frames)       │   │
│  │                                                          │   │
│  │  Key: s = q/p, accumulate Δ = Σ a_i, re-split into p     │   │
│  │  steps. Gripper copied discretely (never averaged).       │   │
│  └──────────────────────────────────────────────────────────┘   │
│                                                                  │
│  ┌─────────────────── Speed Conditioning (Model Side) ─────────┐ │
│  │                                                              │ │
│  │  Three injection schemes:                                    │ │
│  │                                                              │ │
│  │  ① Textual Prefix:                                          │ │
│  │     "Perform the task at ⟨s⟩x speed." + original instruction │ │
│  │                                                              │ │
│  │  ② Speed-Modulated RMSNorm:                                 │ │
│  │     adaRMSNorm(x; σ_ts + ϕ_mod(s)) = γ(σ_ts+ϕ_mod(s)) ⊙ x  │ │
│  │                                                              │ │
│  │  ③ Soft Prompt with Speed Anchors:                          │ │
│  │     P ∈ ℝ^{K×P×d_emb}, pick anchor k* = argmin_k|s-s_k|    │ │
│  │                                                              │ │
│  └──────────────────────────────────────────────────────────────┘ │
│                                                                  │
│  ┌─────────────────── VLM Scheduler (Optional) ────────────────┐ │
│  │  GPT-4o observes scene → dispatches per-chunk speeds        │ │
│  │  s_t → TempoVLA executes chunks at speed s_t                │ │
│  └──────────────────────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────────────┘

核心公式

问题形式化

VLA 策略 (Eq. 1):

θ⋆=arg⁡min⁡θE(ot,At)∼D[L(πθ(ot),At)](1)\theta^\star = \arg\min_\theta \mathbb{E}_{(o_t, A_t) \sim \mathcal{D}} [\mathcal{L}(\pi_\theta(o_t), A_t)] \tag{1}

其中 ot=(vt,ℓt,ρt)o_t = (v_t, \ell_t, \rho_t) 包含视觉输入、语言指令和可选本体感知状态,At=(at,…,at+H−1)A_t = (a_t, \ldots, a_{t+H-1}) 是 horizon HH 的动作块。

TempoVLA 目标: 产生速度可控的策略 πθ(ot,s)\pi_\theta(o_t, s),其中 s>1s > 1 加速,s<1s < 1 减速,s=1s = 1 恢复默认速度。

变速轨迹增强 (VSTA)

速度分解: 将目标速度写为既约分数 s=q/ps = q/p,其中 q,pq, p 为互质整数。qq 个源帧映射到 pp 个输出帧 (q>pq > p 加速,q<pq < p 减速)。

累积-拆分操作 (Section 3.2):

对每个 chunk 积累总运动:

Δ=∑i=1qai(2)\Delta = \sum_{i=1}^{q} a_i \tag{2}

然后将 Δ\Delta 拆分为 pp 个等幅步长(线性插值累积运动)。由构造可知,新的 pp 个动作之和恰好等于 Δ\Delta,因此 chunk 的积分运动被保留,仅改变 chunk 内的形状。

在线 Chunk-start 采样: 对每个 segment 采样偏移 r∼U{0,…,q−1}r \sim \mathcal{U}\{0, \ldots, q-1\},chunks 从 r,r+q,r+2q,…r, r+q, r+2q, \ldots 开始。每次演示采样时抽取新鲜偏移。

速度调制 RMSNorm

AdaRMSNorm (Eq. 2):

adaRMSNorm(x;σts+ϕmod(s))=γ(σts+ϕmod(s))⊙x∥x∥RMS(3)\text{adaRMSNorm}(x; \sigma_{ts} + \phi_{\text{mod}}(s)) = \gamma(\sigma_{ts} + \phi_{\text{mod}}(s)) \odot \frac{x}{\|x\|_{\text{RMS}}} \tag{3}

其中 ϕmod(s)∈Rdmod\phi_{\text{mod}}(s) \in \mathbb{R}^{d_{\text{mod}}} 是小型两层 MLP,将标量速度嵌入并加到 flow-matching timestep embedding 上。

软提示速度锚点

最近锚点选择:

k⋆=arg⁡min⁡k∣s−sk∣(4)k^\star = \arg\min_k |s - s_k| \tag{4}

其中 P∈RK×P×demb\mathbf{P} \in \mathbb{R}^{K \times P \times d_{\text{emb}}} 存储 KK 个训练速度锚点各 PP 个软提示 token。

运动模式分割 (Section 3.2)

每帧标记为四种运动模式之一:静止 (still)、平移 (translate)、旋转 (rotate)、平移+旋转 (translate-and-rotate)。当平移/旋转幅度超过小阈值时设置边界。进一步在运动方向反转时拆分(连续平移或旋转方向的余弦相似度低于 τdir\tau_{\text{dir}})。

动作表示要求

累积-拆分操作仅在动作相加等于组合时才有效。这在 R3\mathbb{R}^3 中的笛卡尔平移、关节速度和 so(3)\mathfrak{so}(3) 中的轴角向量旋转增量下成立。单位四元数、旋转矩阵或欧拉角等不满足加法封闭性的表示必须先映射到 so(3)\mathfrak{so}(3) 或在流形上插值(如 SLERP)。

模型组件

组件说明关键参数
Base Modelπ0.5\pi_{0.5} (flow-matching VLA based on PaliGemma)3B parameters
VSTA Segmentation按运动模式分割演示为 motion-consistent segments4 modes, τdir\tau_{\text{dir}} threshold
Chunk Transforms=q/ps=q/p 累积-拆分,保持总运动守恒q,pq, p coprime integers
Online Offset Samplingr∼U{0,…,q−1}r \sim \mathcal{U}\{0, \ldots, q-1\} 避免丢弃帧每次训练重新采样
Textual Prefix”Perform the task at ⟨s⟩\langle s \ranglex speed.”默认方案,无需架构修改
Speed Modulation2-layer MLP ϕmod(s)\phi_{\text{mod}}(s) → adaRMSNorm注入 action expert
Soft PromptKK anchors × PP tokens tensorK=8K=8, P=8P=8 in ablation
VLM SchedulerGPT-4o 每 2 个 action chunks 查询一次速度部署时可选

训练流程

TempoVLA 不需要额外数据收集:

  1. VSTA 在线增强: 在训练过程中,对每个采样的演示在线重定时到随机目标速度 ss
  2. 速度条件训练: 使用 VSTA 生成的多速度数据集 D~\tilde{\mathcal{D}} 训练速度条件策略 πθ(ot,s)\pi_\theta(o_t, s)
  3. 超参数: 30k 迭代,batch size 512,32× NVIDIA H20 GPUs
  4. 底层控制器不变: 训练和部署均不修改低层控制器

四、核心创新

创新点说明理论/实验依据
发现动作幅度即速度控制观察到已预测动作的幅度已决定机器人移动速度,为可控执行速度打开直接通道Section 3: 无需修改底层控制器即可实现双向速度控制
VSTA: 在线变速轨迹增强通过 s=q/ps=q/p 累积-拆分操作,将演示重定时到任意目标速度,保持运动语义不变;在线 chunk-start 采样避免丢弃帧Table 1: Motion Err. <4.8×10−8< 4.8 \times 10^{-8},可忽略不计
三种轻量级速度注入方案文本前缀(零架构修改)、RMSNorm 调制(注入 action expert)、软提示锚点(encoder 输入),三者性能基本持平Table 2: SR 差异 <0.3%< 0.3\%
VLM 动态速度调度与 GPT-4o 配合实现运行时自动速度调度,低风险加速、高接触减速Section 5.2: 96% 成功率,比最佳固定速度高 8 分

五、代码实现分析

实现细节

  • Base Model: π0.5\pi_{0.5} — 基于 PaliGemma 的 flow-matching VLA
  • 动作空间: LIBERO 上是 7-dim EEF 命令(平移 Δx,y,z\Delta x,y,z + 轴角旋转增量 + 夹爪信号);Franka 上是 8-dim(7-dim 关节速度 + 1-dim 夹爪)
  • 运动表示兼容性: 平移和旋转部分位于可线性组合的空间,VSTA 可直接应用;夹爪命令离散复制
  • 硬件: 32× NVIDIA H20 GPUs 训练,单 H100 评估

六、实验结果

仿真实验设置

  • Benchmark: LIBERO — 4 套任务(Spatial, Object, Goal, Long),每套 10 任务 × 500 演示
  • 动作: 7-dim EEF (平移 + 轴角旋转 + 夹爪)
  • 基线: 单速度 π0.5\pi_{0.5} 在 1×1\times

VSTA 可行性验证 (Table 1)

重定时演示回放成功率:

Target ssData RatioSucc. (#)SR (%)Motion Err.
0.50.566483.02.8×10−102.8 \times 10^{-10}
0.750.76+0.010.76^{+0.01}74392.94.4×10−94.4 \times 10^{-9}
1.01.078197.6—
1.251.20−0.051.20^{-0.05}73992.41.1×10−81.1 \times 10^{-8}
1.51.43−0.071.43^{-0.07}65381.62.2×10−82.2 \times 10^{-8}
2.01.90−0.101.90^{-0.10}54067.54.8×10−84.8 \times 10^{-8}

关键观察:Motion Error 始终 <5×10−8< 5 \times 10^{-8},远小于控制器容差。SR 接近 1× 时很高(0.75×: 92.9%, 1.25×: 92.4%),远离 1× 时单调下降。

速度注入方案消融 (Table 2)

三种方案在 LIBERO 上的对比:

SpeedText SR (%)Modulation SR (%)Soft Prompt-8 SR (%)
0.75×96.595.896.4
1.0×96.997.095.8
1.25×97.097.396.8
1.5×96.897.296.9
Avg.96.896.896.5

三种方案整体 SR 差异 <0.3%< 0.3\%,表明速度控制可注入 VLA 而几乎不依赖具体机制。Text 前缀因无需架构修改且 SR 最高被选为默认方案。

训练速度范围影响 (Table 3)

不同速度范围的训练效果:

Narrow Range {0.75, 1, 1.25, 1.5}×:

  • 1× SR: 96.9% ↑0.2 (vs baseline 96.7%)
  • Peak SR: 97.0% at 1.25× (比 1× 高 0.3)

Wide Sparse Range {0.5, 1, 1.5, 2}×:

  • 1× SR: 96.8% ↑0.1
  • Peak SR: 97.2% at 1.5×

Refined 7-Range {0.5, 0.75, 1, 1.25, 1.5, 1.75, 2}×:

  • 1× SR: 96.9% ↑0.2
  • Peak SR: 97.4% at 1.25× (最佳)
  • 在共享速度 {0.5, 1, 1.5, 2}× 上,细化粒度始终优于稀疏范围

关键发现:

  1. 峰值成功率高出 1×:所有速度条件策略的峰值出现在 1.25× 或 1.5×,归因于遥操作数据中的自然节奏冗余被 VSTA 压缩
  2. 更细粒度有益:在共享速度上,stride 从 0.5 细化到 0.25 始终提升 SR
  3. 极端速度扩展有益:包含 0.5× 和 2× 扩大了增强覆盖,提升中等速度表现

真实世界实验 (Section 5)

Franka 机械臂设置: 7-DoF arm + 1-DoF 并行夹爪,主相机 + 腕部相机,5 任务(4 个 pick-and-place + 1 个可变形物体任务)。

速度控制结果:

SpeedPick & Place Avg. SRDeformable Object SR
Baseline (1×)80.0%—
VSTA (1×)88.0% (+8)—
VSTA (1.25×)84.0%—
Realized ratio—0.63× (cmd 0.75×), 1.29× (cmd 1.25×), 1.48× (cmd 1.5×)

VSTA 将 1× 成功率从 80% 提升到 88%,与仿真中发现的隐式增强效应一致。

VLM 动态速度调度 (Section 5.2)

GPT-4o 调度器表现:

  • 平均成功率: 96% — 比最佳固定速度配置 (88% at 1×) 高 8 分
  • 平均实现加速比: 1.21× over 1× baseline
  • 速度分布: 大多数决策落在 1× 或 1.25×,1.5× 很少调度
  • GPT-4o 可靠地识别自由空间通过、精细对齐和接触阶段

失败模式分析 (Appendix D, Figure 4)

在高速度端,实现的加速逐渐饱和——策略的每步目标开始超出固定底层控制器的跟踪带宽。

七、相关工作

Vision-Language-Action Models

  • RT-2, OpenVLA, π0\pi_0, π0.5\pi_{0.5}, GR-3, CogACT, BAKU, Diffusion Policy, ACT, PaLM-E, RoboCat, UniVLA, etc.
  • 共同局限:执行速度从演示数据中静默继承

VLA Acceleration (Model-based)

  • TinyVLA, SmolVLA, EfficientVLA (模型压缩)
  • FAST tokenizer, OpenVLA-OFT (token/KV 压缩)
  • Real-Time Chunking, Flow policies with smooth boundaries (异步执行)
  • DemoSpeedup, SpeedAug, ESPADA, SAIL — 操纵演示 tempo 的近期工作,但均未暴露执行速度为显式的按需控制

VLA Acceleration (Model-free / Low-level)

  • CHOMP, Riemannian motion policies, cuRoBo (运动规划器)
  • Tune to learn: controller gains shaping policy execution

八、总结

核心贡献

  1. 提出 TempoVLA: 一个单一的 VLA 框架,通过 VSTA(数据端)和速度条件(模型端)实现双向速度控制,无需新数据收集
  2. 发现速度控制的简易性: 证明在正确重定时数据下,速度控制易于植入且几乎独立于注入机制,变量速度训练作为有效增强持续提升默认 1× 成功率
  3. 扩展到 VLM 驱动动态调度: 将执行速度转化为高层推理器的新控制通道

技术影响

TempoVLA 将执行速度从 VLAs 的隐式属性转变为显式控制通道。通过与 VLM 调度器配合,系统可以在低风险阶段自动加速、在高接触阶段自动减速,无需人工干预。

局限性

  1. 高速端饱和: 在速度范围高端,实现的加速逐渐饱和——策略每步目标超出固定底层控制器的跟踪带宽
  2. 动作表示要求: VSTA 的累积-拆分操作要求动作表示在线性可组合空间中(R3\mathbb{R}^3 平移、so(3)\mathfrak{so}(3) 旋转),单位四元数等需要额外变换
  3. 极端速度成功率下降: 2× 加速时回放成功率降至 67.5%,2× commanded 时模型仅实现 1.56×
  4. VLM 调度保守: GPT-4o 实际调度偏向安全端(主要 1×/1.25×),未充分利用加速潜力

九、参考资源