MixCache: Adaptive Hybrid Caching for Video Diffusion Model Acceleration
自适应混合缓存策略加速视频扩散模型推理
MixCache: Adaptive Hybrid Caching for Video Diffusion Model Acceleration
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | Adaptive Hybrid Caching for Efficient Text-to-Video Diffusion Model Acceleration |
| 作者 | Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Jiangsu Du |
| 机构 | Sun Yat-sen University, Alibaba Group, National University of Singapore |
| 论文 | arXiv:2508.12691 |
| 发布 | 2025年8月18日 |
| 主题 | cs.GR, cs.CV |
二、核心思想
问题定义
视频 DiT 模型的多步迭代去噪过程导致高计算成本和推理延迟。现有缓存方法仅在单一粒度(step/cfg/block)上利用冗余,难以灵活平衡生成质量和推理速度。
解决方案概述
MixCache 是一个无需训练的自适应混合缓存框架:
- 三层次冗余分析: 识别 step 级、cfg 级、block 级冗余
- 上下文感知缓存触发: 根据 step 级冗余动态决定何时启用缓存
- 自适应混合缓存决策: 根据相似度和精度影响动态选择最优缓存粒度
- N 缩放策略: 自动调整缓存间隔平衡质量和效率
核心性能
| 指标 | Wan 14B | HunyuanVideo |
|---|---|---|
| 加速比 | 1.94× | 1.97× |
| VBench 变化 | -0.15 | - |
| 训练需求 | 无需训练 | 无需训练 |
三、技术架构
整体框架图

Figure 4: MixCache 框架。包含上下文感知缓存触发策略和自适应混合缓存决策策略。
核心公式
扩散模型前向过程
噪声估计网络 (DiT 架构)
反向去噪过程
Classifier-Free Guidance (CFG)
三层次冗余度量 (相对 L1 距离)
Step 级冗余:
CFG 级冗余:
Block 级冗余:
缓存决策指标 (P 值)
其中 是相似度, 是精度影响值。选择 P 值最小的缓存方法。
N 缩放策略 (准确率优先)
模型组件
| 组件 | 说明 | 关键参数 |
|---|---|---|
| Step 级缓存 | 复用前一时间步输出 | |
| CFG 级缓存 | 复用条件输出估计无条件输出 | |
| Block 级缓存 | 复用前一时间步的 block 输出 | Input for block |
| 缓存触发器 | 根据 决定何时启用缓存 | 阈值 |
| N 缩放器 | 动态调整缓存间隔 | , |
| 决策器 | 选择最优缓存粒度 | P 值最小化 |
训练流程
- 离线 Profiling: 运行 100 个 prompt,记录每个时间步的 ,确定 , , , ,
- Warm-up 阶段: 初始扩散阶段执行完整计算,直到
- Cache 启用阶段: 根据 N 缩放策略确定缓存间隔,使用自适应混合缓存决策选择粒度
- 惩罚策略: 防止在同一缓存间隔内使用相同缓存粒度
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| 三层次冗余分析 | 系统分析 step/cfg/block 级冗余 | Figure 2 冗余可视化 |
| 上下文感知缓存触发 | 根据 动态决定何时启用缓存 | Warm-up 阶段保护早期扩散 |
| 自适应混合缓存决策 | 根据相似度×精度影响选择最优粒度 | P 值最小化策略 |
| N 缩放策略 | 自动调整缓存间隔 | 监控机制 |
| 惩罚策略 | 防止缓存粒度局部最优 | 交替禁用机制 |
五、实验结果
主要结果 (Wan 14B, 832×480, 5s, 81帧)
| 方法 | VBench↑ | LPIPS↓ | PSNR↑ | SSIM↑ | 延迟 | 加速比 |
|---|---|---|---|---|---|---|
| 原始 | 84.05 | - | - | - | 900s | - |
| TeaCache₀.₁ | 84.01 | 0.147 | 22.17 | 0.786 | 849s | 1.06× |
| TeaCache₀.₁₄ | 83.95 | 0.244 | 18.60 | 0.688 | 612s | 1.47× |
| FasterCache | 83.40 | 0.140 | 23.26 | 0.796 | 633s | 1.42× |
| BlockDance₄ | 83.48 | 0.129 | 24.01 | 0.811 | 679s | 1.29× |
| PAB₁₀₀,₈₀₀⁸ | 83.00 | 0.166 | 22.29 | 0.772 | 717s | 1.25× |
| MixCache_acc | 83.97 | 0.124 | 23.45 | 0.814 | 528s | 1.70× |
| MixCache_effi | 83.90 | 0.132 | 22.94 | 0.802 | 463s | 1.94× |
冗余分析

Figure 2: Wan 14B 480p 和 HunyuanVideo 540p 的三层次冗余。冗余在扩散过程中呈现强动态性。
关键发现:
- 初始扩散阶段冗余低,不适合缓存
- CFG 级冗余始终最强
- 不同 block 的冗余在不同阶段表现不同
缓存粒度影响分析

Figure 5: (a) 扰动与原始输出的距离作为影响指标。(b) 不同扩散阶段不同级别干扰的可视化和定量指标。
关键发现:
- CFG 级干扰影响最大,超出其他级别一个数量级
- Block 级影响具有时间依赖性
- Step 级和 CFG 级影响相对稳定
消融实验 (Wan 14B 480p)
| 配置 | VBench↑ | LPIPS↓ | PSNR↑ | SSIM↑ | 加速比 |
|---|---|---|---|---|---|
| w/o N scaling | 83.82 | 0.138 | 22.65 | 0.798 | 1.88× |
| w/o penalty | 83.85 | 0.135 | 22.82 | 0.805 | 1.90× |
| step only | 83.75 | 0.145 | 22.35 | 0.792 | 1.85× |
| cfg only | 83.60 | 0.158 | 21.85 | 0.778 | 1.82× |
| block only | 83.70 | 0.142 | 22.55 | 0.795 | 1.80× |
| MixCache (full) | 83.97 | 0.124 | 23.45 | 0.814 | 1.70× |
质量-延迟权衡

Figure 11: Wan 14B 480p 不同超参数配置下的质量-延迟权衡。
缓存分布可视化

Figure 9: 两个 prompt 的三级缓存分布。不同 prompt 在不同时间步选择不同缓存粒度。
不同分辨率和 GPU 扩展

Figure 12: MixCache 在不同视频分辨率和 GPU 配置下的加速效率。
六、与现有方法对比
| 方面 | TeaCache | FasterCache | BlockDance | PAB | MixCache |
|---|---|---|---|---|---|
| 缓存粒度 | Step | CFG | Block | Block | 混合 |
| 自适应性 | 部分 | 无 | 无 | 无 | 完全自适应 |
| 触发策略 | 输入差异 | 固定 | 固定 | 固定 | 上下文感知 |
| 决策策略 | 阈值 | 固定 | 固定 | 固定 | P 值最小化 |
| 训练需求 | 无需 | 无需 | 无需 | 无需 | 无需 |
| Wan 加速 | 1.47× | 1.42× | 1.29× | 1.25× | 1.94× |
| 质量损失 | 中等 | 较大 | 较小 | 较大 | 极小 |
七、相关工作
| 相关工作 | 与本文关系 |
|---|---|
| TeaCache | Step 级缓存基线 |
| FasterCache | CFG 级缓存基线 |
| BlockDance | Block 级缓存基线 |
| PAB | Block 级缓存基线 |
| FORA | Block 级缓存参考 |
| Δ-DiT | Block 级缓存参考 |
| L2C | 可学习层选择参考 |
八、总结
核心贡献
- 三层次冗余分析: 系统分析 step/cfg/block 级冗余的动态特性
- 上下文感知缓存触发: 根据 动态决定何时启用缓存
- 自适应混合缓存决策: 根据相似度×精度影响选择最优缓存粒度
- MixCache 框架: 无需训练的自适应混合缓存框架
- 1.94× 加速: 在 Wan 14B 上实现 1.94× 加速,质量损失极小
技术影响
- 视频生成加速: 为大规模视频 DiT 模型提供高效推理方案
- 混合缓存策略: 首次将多粒度缓存策略统一到一个框架
- 自适应决策: 根据实时冗余动态调整缓存策略
- 工业应用: 在 Wan 14B、HunyuanVideo 等工业级模型上验证
局限性
- 需要离线 Profiling 阶段
- 未探索 token 级缓存
- 超参数需要针对不同模型调整
- 未与蒸馏方法结合
九、参考资源
- 论文: arXiv:2508.12691
- 主题: cs.GR, cs.CV
- 页数: 约 20 页
十、关键公式速查
| 公式 | 说明 |
|---|---|
| Step 级冗余 | |
| CFG 级冗余 | |
| Block 级冗余 | |
| 缓存决策指标 | |
| CFG 公式 |
十一、关键图片索引
| 图片 | 说明 | 文件名 |
|---|---|---|
| Figure 1 | MixCache 跨模型可视化 | x1.png |
| Figure 2 | 三层次冗余分析 | x2.png |
| Figure 3 | 不同缓存策略相似度对比 | x3.png |
| Figure 4 | MixCache 框架 | x4.png |
| Figure 5 | 精度影响分析 | x5.png, x6.png |
| Figure 6 | 距离张量统计 | x6.png |
| Figure 7 | 视觉质量对比 | x7.png |
| Figure 8 | 消融实验可视化 | x8.png |
| Figure 9 | 缓存分布可视化 | x9.png |
| Figure 10 | 延迟分解 | x10.png |
| Figure 11 | 质量-延迟权衡 | x11.png |
| Figure 12 | 多 GPU 扩展效率 | x12.png |
| Figure 13 | 附加结果 | x13.png |