Back to blog

MixCache: Adaptive Hybrid Caching for Video Diffusion Model Acceleration

自适应混合缓存策略加速视频扩散模型推理

MixCache: Adaptive Hybrid Caching for Video Diffusion Model Acceleration

一、论文概述

项目内容
标题Adaptive Hybrid Caching for Efficient Text-to-Video Diffusion Model Acceleration
作者Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Jiangsu Du
机构Sun Yat-sen University, Alibaba Group, National University of Singapore
论文arXiv:2508.12691
发布2025年8月18日
主题cs.GR, cs.CV

二、核心思想

问题定义

视频 DiT 模型的多步迭代去噪过程导致高计算成本和推理延迟。现有缓存方法仅在单一粒度(step/cfg/block)上利用冗余,难以灵活平衡生成质量和推理速度。

解决方案概述

MixCache 是一个无需训练的自适应混合缓存框架:

  • 三层次冗余分析: 识别 step 级、cfg 级、block 级冗余
  • 上下文感知缓存触发: 根据 step 级冗余动态决定何时启用缓存
  • 自适应混合缓存决策: 根据相似度和精度影响动态选择最优缓存粒度
  • N 缩放策略: 自动调整缓存间隔平衡质量和效率

核心性能

指标Wan 14BHunyuanVideo
加速比1.94×1.97×
VBench 变化-0.15-
训练需求无需训练无需训练

三、技术架构

整体框架图

MixCache 框架

Figure 4: MixCache 框架。包含上下文感知缓存触发策略和自适应混合缓存决策策略。

核心公式

扩散模型前向过程

xt=δtxt−1+1−δtϵt,t=1,2,...,Tx_{t}=\sqrt{\delta_{t}}x_{t-1}+\sqrt{1-\delta_{t}}\epsilon_{t},\quad t=1,2,...,T

噪声估计网络 (DiT 架构)

ϵθ(xt)=fL−1∘fL−2∘⋯∘f0(xt)\epsilon_{\theta}(x_{t})=f_{L-1}\circ f_{L-2}\circ\cdots\circ f_{0}(x_{t})

反向去噪过程

xt−1=Φ(xt,t,ϵθ(xt)),t=T,T−1,...,1x_{t-1}=\Phi(x_{t},t,\epsilon_{\theta}(x_{t})),\quad t=T,T-1,...,1

Classifier-Free Guidance (CFG)

ϵ~θ(xt,t,c)=(1+g)⋅ϵθ(xt,t,c)−g⋅ϵθ(xt,t,ϕ)\tilde{\epsilon}_{\theta}(x_{t},t,c)=(1+g)\cdot\epsilon_{\theta}(x_{t},t,c)-g\cdot\epsilon_{\theta}(x_{t},t,\phi)

三层次冗余度量 (相对 L1 距离)

Step 级冗余: Dtstep=∣∣Otstep−Ot−1step∣∣1∣∣Ot−1step∣∣1D^{step}_{t}=\frac{||O^{step}_{t}-O^{step}_{t-1}||_{1}}{||O^{step}_{t-1}||_{1}}

CFG 级冗余: Dtcfg=∣∣Otuncond−Otcond∣∣1∣∣Otcond∣∣1D^{cfg}_{t}=\frac{||O^{uncond}_{t}-O^{cond}_{t}||_{1}}{||O^{cond}_{t}||_{1}}

Block 级冗余: Dtblocki=∣∣Otblocki−Ot−1blocki∣∣1∣∣Ot−1blocki∣∣1,i∈[0,L)D^{block_{i}}_{t}=\frac{||O^{block_{i}}_{t}-O^{block_{i}}_{t-1}||_{1}}{||O^{block_{i}}_{t-1}||_{1}},\quad i\in[0,L)

缓存决策指标 (P 值)

Ptψ=Dtψ⋅Itψ,ψ∈{step,cfg,blocki}P_{t}^{\psi}=D^{\psi}_{t}\cdot I^{\psi}_{t},\quad\psi\in\{step,cfg,block_{i}\}

其中 DtψD^{\psi}_{t} 是相似度,ItψI^{\psi}_{t} 是精度影响值。选择 P 值最小的缓存方法。

N 缩放策略 (准确率优先)

Nacc={4if Dtfull<δ13if δ1≤Dtfull<δ22if Dtfull≥δ2N_{\text{acc}}=\begin{cases}4 & \text{if } D^{full}_{t}<\delta_{1}\\3 & \text{if } \delta_{1}\leq D^{full}_{t}<\delta_{2}\\2 & \text{if } D^{full}_{t}\geq\delta_{2}\end{cases}

模型组件

组件说明关键参数
Step 级缓存复用前一时间步输出Ot←Ot−1O_t \leftarrow O_{t-1}
CFG 级缓存复用条件输出估计无条件输出Otuncond←Otcond+ΔcfgO^{uncond}_t \leftarrow O^{cond}_t + \Delta_{cfg}
Block 级缓存复用前一时间步的 block 输出Input for block i+1i+1 ←Ot−1blocki\leftarrow O^{block_i}_{t-1}
缓存触发器根据 DtstepD^{step}_t 决定何时启用缓存阈值 θ\theta
N 缩放器动态调整缓存间隔δ1\delta_1, δ2\delta_2
决策器选择最优缓存粒度P 值最小化

训练流程

  1. 离线 Profiling: 运行 100 个 prompt,记录每个时间步的 DstepD^{step},确定 θ\theta, δ1\delta_1, δ2\delta_2, μ^\hat{\mu}, σ^\hat{\sigma}
  2. Warm-up 阶段: 初始扩散阶段执行完整计算,直到 Dtstep<θD^{step}_t < \theta
  3. Cache 启用阶段: 根据 N 缩放策略确定缓存间隔,使用自适应混合缓存决策选择粒度
  4. 惩罚策略: 防止在同一缓存间隔内使用相同缓存粒度

四、核心创新

创新点说明理论/实验依据
三层次冗余分析系统分析 step/cfg/block 级冗余Figure 2 冗余可视化
上下文感知缓存触发根据 DtstepD^{step}_t 动态决定何时启用缓存Warm-up 阶段保护早期扩散
自适应混合缓存决策根据相似度×精度影响选择最优粒度P 值最小化策略
N 缩放策略自动调整缓存间隔DfullD^{full} 监控机制
惩罚策略防止缓存粒度局部最优交替禁用机制

五、实验结果

主要结果 (Wan 14B, 832×480, 5s, 81帧)

方法VBench↑LPIPS↓PSNR↑SSIM↑延迟加速比
原始84.05---900s-
TeaCache₀.₁84.010.14722.170.786849s1.06×
TeaCache₀.₁₄83.950.24418.600.688612s1.47×
FasterCache83.400.14023.260.796633s1.42×
BlockDance₄83.480.12924.010.811679s1.29×
PAB₁₀₀,₈₀₀⁸83.000.16622.290.772717s1.25×
MixCache_acc83.970.12423.450.814528s1.70×
MixCache_effi83.900.13222.940.802463s1.94×

冗余分析

三层次冗余

Figure 2: Wan 14B 480p 和 HunyuanVideo 540p 的三层次冗余。冗余在扩散过程中呈现强动态性。

关键发现:

  • 初始扩散阶段冗余低,不适合缓存
  • CFG 级冗余始终最强
  • 不同 block 的冗余在不同阶段表现不同

缓存粒度影响分析

精度影响

Figure 5: (a) 扰动与原始输出的距离作为影响指标。(b) 不同扩散阶段不同级别干扰的可视化和定量指标。

关键发现:

  • CFG 级干扰影响最大,超出其他级别一个数量级
  • Block 级影响具有时间依赖性
  • Step 级和 CFG 级影响相对稳定

消融实验 (Wan 14B 480p)

配置VBench↑LPIPS↓PSNR↑SSIM↑加速比
w/o N scaling83.820.13822.650.7981.88×
w/o penalty83.850.13522.820.8051.90×
step only83.750.14522.350.7921.85×
cfg only83.600.15821.850.7781.82×
block only83.700.14222.550.7951.80×
MixCache (full)83.970.12423.450.8141.70×

质量-延迟权衡

质量延迟权衡

Figure 11: Wan 14B 480p 不同超参数配置下的质量-延迟权衡。

缓存分布可视化

缓存分布

Figure 9: 两个 prompt 的三级缓存分布。不同 prompt 在不同时间步选择不同缓存粒度。

不同分辨率和 GPU 扩展

多 GPU 扩展

Figure 12: MixCache 在不同视频分辨率和 GPU 配置下的加速效率。

六、与现有方法对比

方面TeaCacheFasterCacheBlockDancePABMixCache
缓存粒度StepCFGBlockBlock混合
自适应性部分无无无完全自适应
触发策略输入差异固定固定固定上下文感知
决策策略阈值固定固定固定P 值最小化
训练需求无需无需无需无需无需
Wan 加速1.47×1.42×1.29×1.25×1.94×
质量损失中等较大较小较大极小

七、相关工作

相关工作与本文关系
TeaCacheStep 级缓存基线
FasterCacheCFG 级缓存基线
BlockDanceBlock 级缓存基线
PABBlock 级缓存基线
FORABlock 级缓存参考
Δ-DiTBlock 级缓存参考
L2C可学习层选择参考

八、总结

核心贡献

  1. 三层次冗余分析: 系统分析 step/cfg/block 级冗余的动态特性
  2. 上下文感知缓存触发: 根据 DtstepD^{step}_t 动态决定何时启用缓存
  3. 自适应混合缓存决策: 根据相似度×精度影响选择最优缓存粒度
  4. MixCache 框架: 无需训练的自适应混合缓存框架
  5. 1.94× 加速: 在 Wan 14B 上实现 1.94× 加速,质量损失极小

技术影响

  • 视频生成加速: 为大规模视频 DiT 模型提供高效推理方案
  • 混合缓存策略: 首次将多粒度缓存策略统一到一个框架
  • 自适应决策: 根据实时冗余动态调整缓存策略
  • 工业应用: 在 Wan 14B、HunyuanVideo 等工业级模型上验证

局限性

  • 需要离线 Profiling 阶段
  • 未探索 token 级缓存
  • 超参数需要针对不同模型调整
  • 未与蒸馏方法结合

九、参考资源

十、关键公式速查

公式说明
Dtstep=∥∥Otstep−Ot−1step∥∥1∥∥Ot−1step∥∥1D^{step}_{t}=\frac{\|\|O^{step}_{t}-O^{step}_{t-1}\|\|_{1}}{\|\|O^{step}_{t-1}\|\|_{1}}Step 级冗余
Dtcfg=∥∥Otuncond−Otcond∥∥1∥∥Otcond∥∥1D^{cfg}_{t}=\frac{\|\|O^{uncond}_{t}-O^{cond}_{t}\|\|_{1}}{\|\|O^{cond}_{t}\|\|_{1}}CFG 级冗余
Dtblocki=∥∥Otblocki−Ot−1blocki∥∥1∥∥Ot−1blocki∥∥1D^{block_{i}}_{t}=\frac{\|\|O^{block_{i}}_{t}-O^{block_{i}}_{t-1}\|\|_{1}}{\|\|O^{block_{i}}_{t-1}\|\|_{1}}Block 级冗余
Ptψ=Dtψ⋅ItψP_{t}^{\psi}=D^{\psi}_{t}\cdot I^{\psi}_{t}缓存决策指标
ϵ~θ=(1+g)⋅ϵθ(xt,t,c)−g⋅ϵθ(xt,t,ϕ)\tilde{\epsilon}_{\theta}=(1+g)\cdot\epsilon_{\theta}(x_{t},t,c)-g\cdot\epsilon_{\theta}(x_{t},t,\phi)CFG 公式

十一、关键图片索引

图片说明文件名
Figure 1MixCache 跨模型可视化x1.png
Figure 2三层次冗余分析x2.png
Figure 3不同缓存策略相似度对比x3.png
Figure 4MixCache 框架x4.png
Figure 5精度影响分析x5.png, x6.png
Figure 6距离张量统计x6.png
Figure 7视觉质量对比x7.png
Figure 8消融实验可视化x8.png
Figure 9缓存分布可视化x9.png
Figure 10延迟分解x10.png
Figure 11质量-延迟权衡x11.png
Figure 12多 GPU 扩展效率x12.png
Figure 13附加结果x13.png