Back to blog

X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference

面向少步自回归世界模型推理的跨分块缓存加速

X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference

一、论文概述

项目内容
标题X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
作者AI Infra Team, XPeng Inc
论文arXiv:2604.20289
代码未公开
发布2026年4月
硬件阿里巴巴 T-Head 真武 810E PPU (96GB HBM2e, BF16)

二、核心思想

问题定义

自回归视频扩散模型是自动驾驶世界模拟器的理想选择,支持闭环评估和在线强化学习。然而,在交互式模拟中需要快速推理,而少步蒸馏(如 S=4 步)已接近极限。现有加速方法面临两个结构性问题:

  1. 跨步缓存方法的局限:现有训练无关缓存方法(如 DeepCache、FlowCache、SCOPE)依赖去噪步间的特征轨迹外推,基于局部平滑性假设。但在交互式模拟中,外部策略发出的动作流在 chunk 边界处天然不平滑(离散制动、转向、变道指令通过 adaLN-Zero 注入每个 DiT block),平滑性假设恰好在最需要缓存的地方失效。

  2. 少步蒸馏下跨步冗余消失:跨步缓存方法的冗余性随去噪步数 S 的减少而降低,少步蒸馏后这种冗余基本消失。

解决方案概述

本文观察到少步自回归世界模型在另一维度上存在强冗余:跨连续生成 chunk(而非跨去噪步)。在自动驾驶场景中,物理世界相对于生成率变化缓慢,相邻 chunk 在相同 (denoising step, block) 位置的 DiT block 输入高度相似。这种跨 chunk 冗余来自物理场景连续性,独立于去噪步数 S。

X-Cache 利用这种跨 chunk 冗余,通过以下机制加速推理:

  1. 跨 chunk 残差缓存:缓存前一 chunk 的 block 残差,跳过当前 chunk 中相似的 block
  2. 双指标门控:余弦相似度(全局方向)+ 最大 token 偏差(局部异常值)
  3. 自适应阈值:基于历史 EMA 动态调整跳过阈值
  4. 安全机制:去噪步 0 保护、KV 更新 chunk 保护、锚定 block、最大陈旧度

三、技术架构

整体框架图

X-Cache 架构

核心公式

AR 视频扩散推理循环

生成步 nn(第 nn 个 chunk),chunk 潜在从高斯噪声初始化,通过 SS 步去噪迭代精炼:

xt,b(n)=xt,b−1(n)+fb(xt,b−1(n);c)\mathbf{x}^{(n)}_{t,b} = \mathbf{x}^{(n)}_{t,b-1} + f_b(\mathbf{x}^{(n)}_{t,b-1}; \mathbf{c})

其中 xt,0(n)\mathbf{x}^{(n)}_{t,0} 为去噪步 tt block 0 的潜在,fb(⋅;c)f_b(\cdot; \mathbf{c}) 为第 bb 个 DiT block。

Block 残差:

rt,b(n)=fb(xt,b−1(n);c)=xt,b(n)−xt,b−1(n)\mathbf{r}^{(n)}_{t,b} = f_b(\mathbf{x}^{(n)}_{t,b-1}; \mathbf{c}) = \mathbf{x}^{(n)}_{t,b} - \mathbf{x}^{(n)}_{t,b-1}

跨 chunk 残差缓存

核心观察:相邻 chunk 在相同 (t,b)(t, b) 位置的 block 输入高度相似(来自物理场景连续性)。

缓存机制:

  • 缓存前一 chunk 的残差 rt,b(n−1)\mathbf{r}^{(n-1)}_{t,b}
  • 当判断当前 block 与缓存相似时,直接复用残差:xt,b(n)≈xt,b−1(n)+rt,b(n−1)\mathbf{x}^{(n)}_{t,b} \approx \mathbf{x}^{(n)}_{t,b-1} + \mathbf{r}^{(n-1)}_{t,b}
  • 跳过该 block 的计算

双指标门控

指纹提取:从 block 输入 xt,b−1(n)\mathbf{x}^{(n)}_{t,b-1}(形状 B×V×L×CB \times V \times L \times C)中,按 3D 时空网格的比例 kF:kH:kW≈Fg:Hg:Wgk_F : k_H : k_W \approx F_g : H_g : W_g 均匀采样 KK 个 token,得到紧凑指纹 ϕ(x)\phi(\mathbf{x})。

指标 1:余弦相似度(全局方向)

cos_sim=ϕ(xt,b−1(n))⋅ϕ(xt,b−1(n−1))∥ϕ(xt,b−1(n))∥⋅∥ϕ(xt,b−1(n−1))∥\text{cos\_sim} = \frac{\phi(\mathbf{x}^{(n)}_{t,b-1}) \cdot \phi(\mathbf{x}^{(n-1)}_{t,b-1})}{\|\phi(\mathbf{x}^{(n)}_{t,b-1})\| \cdot \|\phi(\mathbf{x}^{(n-1)}_{t,b-1})\|}

指标 2:最大 token 偏差(局部异常值)

max_dev=max⁡i∥ϕ(xt,b−1(n))i−ϕ(xt,b−1(n−1))i∥2\text{max\_dev} = \max_i \|\phi(\mathbf{x}^{(n)}_{t,b-1})_i - \phi(\mathbf{x}^{(n-1)}_{t,b-1})_i\|_2

跳过决策:两个指标同时满足条件时跳过 block。

自适应阈值

对每个 (t,b)(t, b) 位置维护余弦相似度的指数移动平均:

EMAt,b(n)=α⋅cos_simt,b(n)+(1−α)⋅EMAt,b(n−1)\text{EMA}^{(n)}_{t,b} = \alpha \cdot \text{cos\_sim}^{(n)}_{t,b} + (1-\alpha) \cdot \text{EMA}^{(n-1)}_{t,b}

自适应阈值:

τt,b(n)=max⁡(EMAt,b(n)−m,τfloor)\tau^{(n)}_{t,b} = \max(\text{EMA}^{(n)}_{t,b} - m, \tau_{\text{floor}})

  • 高跨 chunk 相似度的 block 累积高 EMA,阈值稳定在典型相似度下方,最大化跳过
  • 波动大的 block 保持保守
  • 质量下限 τfloor\tau_{\text{floor}} 提供绝对安全保证

安全机制

机制说明默认值
去噪步 0 保护t=0t=0 时强制全计算(输入由高级噪声主导,条件信号影响最大)Off (可选 strict τ0=0.999\tau_0=0.999)
锚定 block (FnF_n)前 FnF_n 个 block 在所有去噪步强制计算Fn=1F_n=1
KV 更新 chunk 保护使用去噪后干净潜在计算 KV 的 chunk 强制全计算On
最大陈旧度 (MM)连续跳过次数超过 MM 时强制重算Off

默认超参数

符号含义默认值
FnF_n前锚定 block 数1
BnB_n后锚定 block 数0
WW预热 chunk 数1
τfloor\tau_{\text{floor}}自适应阈值质量下限0.97
mmEMA 下方 margin0.02
α\alphaEMA 更新系数0.30
τdev\tau_{\text{dev}}最大 token 偏差阈值2.00

四、核心创新

创新点说明理论/实验依据
跨 chunk 冗余利用识别跨连续生成 chunk(而非跨去噪步)的 block 级冗余跨 chunk 余弦相似度热力图高度相似
物理场景连续性驱动冗余来自物理世界平滑变化,独立于去噪步数 S少步蒸馏 (S=4) 下仍有效
双指标门控余弦相似度 + 最大 token 偏差,捕获全局和局部变化消融实验验证
自适应阈值基于 EMA 的动态阈值,自动适配不同 block 的相似度模式保守/激进自适应
安全机制体系步 0 保护 + KV 更新保护 + 锚定 block + 最大陈旧度KV 更新保护为硬性要求
2.6-2.7× 加速71% block 跳过率,PSNR >53dB,SSIM >0.999跨场景一致性验证

五、实验结果

主要结果

场景相机PSNR↑SSIM↑LPIPS↓跳过率DiT 耗时 (s)加速比
城市街道 (n=7)F-C53.830.99883.6e-471.4%1.3922.65×
7-cam51.370.99903.3e-4
高速公路 (n=3)F-C54.870.99892.6e-471.6%1.3652.66×
7-cam54.670.99911.9e-4
U 转弯 (n=3)F-C54.600.99874.3e-471.3%1.3642.70×
7-cam52.040.99903.1e-4

关键发现:

  • 71% block 跳过率,DiT 耗时从 ~3.68s 降至 ~1.37s
  • PSNR >51dB,SSIM >0.999,LPIPS <5e-4,质量损失不可感知
  • 跨场景(城市、高速、U 转弯)一致性好

消融实验

配置PSNR↑SSIM↑LPIPS↓跳过率DiT (s)加速比
Baseline (无缓存)––––3.6371.00×
Default (step-0 off, τfloor\tau_{\text{floor}}=0.97)53.3840.99902.0e-471.3%1.4062.59×
+ Step-0 保护53.3890.99902.0e-453.5%1.9751.84×
- KV 更新保护21.4610.80671.77e-162.8%1.6702.18×
- 前锚定 (FnF_n=0) †53.6220.99912.0e-455.4%1.9021.91×
τfloor\tau_{\text{floor}} ∈ {0.90,…,0.96} †53.37-53.400.99902.0e-453.5%1.96-1.981.84×

关键发现:

  • KV 更新保护是硬性要求:移除后 PSNR 从 53→21 dB,质量灾难性退化
  • Step-0 保护降低跳过率(71%→54%),但质量提升不明显(53.384→53.389)
  • 前锚定 block 移除后跳过率降低,质量略提升
  • 质量下限 τfloor\tau_{\text{floor}} 在 0.90-0.96 范围内影响不大

六、跨 chunk 余弦相似度分析

跨 chunk 余弦相似度热力图

跨 chunk 余弦相似度由 DiT block 位置(而非场景内容)驱动:

  • 早期 block(接近输入)相似度最高
  • 后期 block(接近输出)相似度逐渐降低
  • 跨场景(城市、高速、U 转弯)模式一致

每 block 跳过率

每 block 跳过率

Block 0(前锚定)始终不跳过,后续 block 跳过率逐渐增加。

七、定性对比

基线 vs X-Cache 定性对比

X-Cache 在高速公路、城市街道、U 转弯三个场景下生成质量与基线无可见差异。

每帧 PSNR 对比

X-Cache 的每帧 PSNR 稳定在 53 dB 附近,与基线一致。

八、相关工作

方向代表工作与 X-Cache 的关系
跨步缓存DeepCache, SeqCache, FORAX-Cache 利用跨 chunk 冗余(非跨步)
AR 视频缓存FlowCache, SCOPEX-Cache 针对交互式模拟的动作不平滑问题
DiT 加速Token pruning, QuantizationX-Cache 为正交加速手段
自驾驶世界模型X-World, GAIA-1, DriveDreamerX-Cache 的应用场景

九、总结

核心贡献

  1. 识别跨 chunk 冗余:少步 AR 世界模型在跨连续生成 chunk 的 block 级存在强冗余,来自物理场景连续性
  2. X-Cache 框架:跨 chunk 残差缓存 + 双指标门控 + 自适应阈值 + 安全机制
  3. 2.6-2.7× 加速:71% block 跳过率,PSNR >53dB,SSIM >0.999,质量损失不可感知
  4. 安全机制设计:KV 更新保护为硬性要求,步 0 保护和锚定 block 为可选增强
  5. 生产级验证:在小鹏 X-World 自驾世界模型上验证,跨场景一致性好

技术影响

  • 为自回归世界模型的交互式模拟提供了关键推理加速
  • 跨 chunk 冗余利用思想可推广到其他自回归生成任务
  • 双指标门控和自适应阈值为缓存决策提供了鲁棒的判断机制
  • 安全机制体系为生产部署提供了质量保证

局限性

  • 仅在 22 秒内部数据上验证,未测试更长时间范围
  • 未覆盖夜间、恶劣天气、激进驾驶等分布外场景
  • 超参数在单个验证 clip 上调优,可能需要针对不同场景调整
  • 代码未公开
  • 仅在阿里真武 810E PPU 上验证,未测试 GPU 平台

十、参考资源

  • 论文: arXiv:2604.20289
  • 关键引用:
    • X-World (小鹏自驾世界模型)
    • DeepCache, FlowCache, SCOPE (跨步缓存方法)
    • DiT (Diffusion Transformer)---

分析日期: 2026-06-05