X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
面向少步自回归世界模型推理的跨分块缓存加速
X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference |
| 作者 | AI Infra Team, XPeng Inc |
| 论文 | arXiv:2604.20289 |
| 代码 | 未公开 |
| 发布 | 2026年4月 |
| 硬件 | 阿里巴巴 T-Head 真武 810E PPU (96GB HBM2e, BF16) |
二、核心思想
问题定义
自回归视频扩散模型是自动驾驶世界模拟器的理想选择,支持闭环评估和在线强化学习。然而,在交互式模拟中需要快速推理,而少步蒸馏(如 S=4 步)已接近极限。现有加速方法面临两个结构性问题:
-
跨步缓存方法的局限:现有训练无关缓存方法(如 DeepCache、FlowCache、SCOPE)依赖去噪步间的特征轨迹外推,基于局部平滑性假设。但在交互式模拟中,外部策略发出的动作流在 chunk 边界处天然不平滑(离散制动、转向、变道指令通过 adaLN-Zero 注入每个 DiT block),平滑性假设恰好在最需要缓存的地方失效。
-
少步蒸馏下跨步冗余消失:跨步缓存方法的冗余性随去噪步数 S 的减少而降低,少步蒸馏后这种冗余基本消失。
解决方案概述
本文观察到少步自回归世界模型在另一维度上存在强冗余:跨连续生成 chunk(而非跨去噪步)。在自动驾驶场景中,物理世界相对于生成率变化缓慢,相邻 chunk 在相同 (denoising step, block) 位置的 DiT block 输入高度相似。这种跨 chunk 冗余来自物理场景连续性,独立于去噪步数 S。
X-Cache 利用这种跨 chunk 冗余,通过以下机制加速推理:
- 跨 chunk 残差缓存:缓存前一 chunk 的 block 残差,跳过当前 chunk 中相似的 block
- 双指标门控:余弦相似度(全局方向)+ 最大 token 偏差(局部异常值)
- 自适应阈值:基于历史 EMA 动态调整跳过阈值
- 安全机制:去噪步 0 保护、KV 更新 chunk 保护、锚定 block、最大陈旧度
三、技术架构
整体框架图

核心公式
AR 视频扩散推理循环
生成步 (第 个 chunk),chunk 潜在从高斯噪声初始化,通过 步去噪迭代精炼:
其中 为去噪步 block 0 的潜在, 为第 个 DiT block。
Block 残差:
跨 chunk 残差缓存
核心观察:相邻 chunk 在相同 位置的 block 输入高度相似(来自物理场景连续性)。
缓存机制:
- 缓存前一 chunk 的残差
- 当判断当前 block 与缓存相似时,直接复用残差:
- 跳过该 block 的计算
双指标门控
指纹提取:从 block 输入 (形状 )中,按 3D 时空网格的比例 均匀采样 个 token,得到紧凑指纹 。
指标 1:余弦相似度(全局方向)
指标 2:最大 token 偏差(局部异常值)
跳过决策:两个指标同时满足条件时跳过 block。
自适应阈值
对每个 位置维护余弦相似度的指数移动平均:
自适应阈值:
- 高跨 chunk 相似度的 block 累积高 EMA,阈值稳定在典型相似度下方,最大化跳过
- 波动大的 block 保持保守
- 质量下限 提供绝对安全保证
安全机制
| 机制 | 说明 | 默认值 |
|---|---|---|
| 去噪步 0 保护 | 时强制全计算(输入由高级噪声主导,条件信号影响最大) | Off (可选 strict ) |
| 锚定 block () | 前 个 block 在所有去噪步强制计算 | |
| KV 更新 chunk 保护 | 使用去噪后干净潜在计算 KV 的 chunk 强制全计算 | On |
| 最大陈旧度 () | 连续跳过次数超过 时强制重算 | Off |
默认超参数
| 符号 | 含义 | 默认值 |
|---|---|---|
| 前锚定 block 数 | 1 | |
| 后锚定 block 数 | 0 | |
| 预热 chunk 数 | 1 | |
| 自适应阈值质量下限 | 0.97 | |
| EMA 下方 margin | 0.02 | |
| EMA 更新系数 | 0.30 | |
| 最大 token 偏差阈值 | 2.00 |
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| 跨 chunk 冗余利用 | 识别跨连续生成 chunk(而非跨去噪步)的 block 级冗余 | 跨 chunk 余弦相似度热力图高度相似 |
| 物理场景连续性驱动 | 冗余来自物理世界平滑变化,独立于去噪步数 S | 少步蒸馏 (S=4) 下仍有效 |
| 双指标门控 | 余弦相似度 + 最大 token 偏差,捕获全局和局部变化 | 消融实验验证 |
| 自适应阈值 | 基于 EMA 的动态阈值,自动适配不同 block 的相似度模式 | 保守/激进自适应 |
| 安全机制体系 | 步 0 保护 + KV 更新保护 + 锚定 block + 最大陈旧度 | KV 更新保护为硬性要求 |
| 2.6-2.7× 加速 | 71% block 跳过率,PSNR >53dB,SSIM >0.999 | 跨场景一致性验证 |
五、实验结果
主要结果
| 场景 | 相机 | PSNR↑ | SSIM↑ | LPIPS↓ | 跳过率 | DiT 耗时 (s) | 加速比 |
|---|---|---|---|---|---|---|---|
| 城市街道 (n=7) | F-C | 53.83 | 0.9988 | 3.6e-4 | 71.4% | 1.392 | 2.65× |
| 7-cam | 51.37 | 0.9990 | 3.3e-4 | ||||
| 高速公路 (n=3) | F-C | 54.87 | 0.9989 | 2.6e-4 | 71.6% | 1.365 | 2.66× |
| 7-cam | 54.67 | 0.9991 | 1.9e-4 | ||||
| U 转弯 (n=3) | F-C | 54.60 | 0.9987 | 4.3e-4 | 71.3% | 1.364 | 2.70× |
| 7-cam | 52.04 | 0.9990 | 3.1e-4 |
关键发现:
- 71% block 跳过率,DiT 耗时从 ~3.68s 降至 ~1.37s
- PSNR >51dB,SSIM >0.999,LPIPS <5e-4,质量损失不可感知
- 跨场景(城市、高速、U 转弯)一致性好
消融实验
| 配置 | PSNR↑ | SSIM↑ | LPIPS↓ | 跳过率 | DiT (s) | 加速比 |
|---|---|---|---|---|---|---|
| Baseline (无缓存) | – | – | – | – | 3.637 | 1.00× |
| Default (step-0 off, =0.97) | 53.384 | 0.9990 | 2.0e-4 | 71.3% | 1.406 | 2.59× |
| + Step-0 保护 | 53.389 | 0.9990 | 2.0e-4 | 53.5% | 1.975 | 1.84× |
| - KV 更新保护 | 21.461 | 0.8067 | 1.77e-1 | 62.8% | 1.670 | 2.18× |
| - 前锚定 (=0) † | 53.622 | 0.9991 | 2.0e-4 | 55.4% | 1.902 | 1.91× |
| ∈ {0.90,…,0.96} † | 53.37-53.40 | 0.9990 | 2.0e-4 | 53.5% | 1.96-1.98 | 1.84× |
关键发现:
- KV 更新保护是硬性要求:移除后 PSNR 从 53→21 dB,质量灾难性退化
- Step-0 保护降低跳过率(71%→54%),但质量提升不明显(53.384→53.389)
- 前锚定 block 移除后跳过率降低,质量略提升
- 质量下限 在 0.90-0.96 范围内影响不大
六、跨 chunk 余弦相似度分析

跨 chunk 余弦相似度由 DiT block 位置(而非场景内容)驱动:
- 早期 block(接近输入)相似度最高
- 后期 block(接近输出)相似度逐渐降低
- 跨场景(城市、高速、U 转弯)模式一致
每 block 跳过率

Block 0(前锚定)始终不跳过,后续 block 跳过率逐渐增加。
七、定性对比

X-Cache 在高速公路、城市街道、U 转弯三个场景下生成质量与基线无可见差异。

X-Cache 的每帧 PSNR 稳定在 53 dB 附近,与基线一致。
八、相关工作
| 方向 | 代表工作 | 与 X-Cache 的关系 |
|---|---|---|
| 跨步缓存 | DeepCache, SeqCache, FORA | X-Cache 利用跨 chunk 冗余(非跨步) |
| AR 视频缓存 | FlowCache, SCOPE | X-Cache 针对交互式模拟的动作不平滑问题 |
| DiT 加速 | Token pruning, Quantization | X-Cache 为正交加速手段 |
| 自驾驶世界模型 | X-World, GAIA-1, DriveDreamer | X-Cache 的应用场景 |
九、总结
核心贡献
- 识别跨 chunk 冗余:少步 AR 世界模型在跨连续生成 chunk 的 block 级存在强冗余,来自物理场景连续性
- X-Cache 框架:跨 chunk 残差缓存 + 双指标门控 + 自适应阈值 + 安全机制
- 2.6-2.7× 加速:71% block 跳过率,PSNR >53dB,SSIM >0.999,质量损失不可感知
- 安全机制设计:KV 更新保护为硬性要求,步 0 保护和锚定 block 为可选增强
- 生产级验证:在小鹏 X-World 自驾世界模型上验证,跨场景一致性好
技术影响
- 为自回归世界模型的交互式模拟提供了关键推理加速
- 跨 chunk 冗余利用思想可推广到其他自回归生成任务
- 双指标门控和自适应阈值为缓存决策提供了鲁棒的判断机制
- 安全机制体系为生产部署提供了质量保证
局限性
- 仅在 22 秒内部数据上验证,未测试更长时间范围
- 未覆盖夜间、恶劣天气、激进驾驶等分布外场景
- 超参数在单个验证 clip 上调优,可能需要针对不同场景调整
- 代码未公开
- 仅在阿里真武 810E PPU 上验证,未测试 GPU 平台
十、参考资源
- 论文: arXiv:2604.20289
- 关键引用:
- X-World (小鹏自驾世界模型)
- DeepCache, FlowCache, SCOPE (跨步缓存方法)
- DiT (Diffusion Transformer)---
分析日期: 2026-06-05