Back to blog

FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality

无需训练的视频扩散模型加速策略,通过动态特征复用和 CFG-Cache 实现 1.67x 加速同时保持高质量生成

FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality

论文信息: arXiv:2410.19355 [cs.CV] 12 Mar 2025

作者: Zhengyao Lv, Chenyang Si, Junhao Song, Zhenyu Yang, Yu Qiao, Ziwei Liu, Kwan-Yee K. Wong

机构: The University of Hong Kong, S-Lab NTU, Shanghai AI Lab

代码: https://github.com/Vchitect/FasterCache

许可: arXiv.org perpetual non-exclusive license


一、论文概述

1.1 研究背景

扩散变换器(DiT)在图像和视频生成中取得了显著成功。然而,迭代去噪、无分类器引导(CFG)和 Transformer 注意力机制导致推理计算成本高昂,特别是视频生成通常需要 2-5 分钟来合成 6 秒 480P 视频,限制了其实际应用。

核心挑战:

挑战说明
计算成本高视频扩散模型推理需要大量计算资源
推理延迟长6 秒 480P 视频需要 2-5 分钟合成
特征复用局限现有缓存方法直接复用相邻步特征导致质量下降
CFG 冗余条件和非条件输出在同时间步高度相似,存在冗余

1.2 核心贡献

贡献说明
动态特征复用策略保留特征区分性和时间连续性,避免直接复用导致的质量下降
CFG-Cache优化条件和非条件输出的复用,进一步提升推理速度
无需训练方法无需额外训练成本,可直接应用于现有模型
显著加速在 Vchitect-2.0 上实现 1.67x 加速,同时保持高质量

二、核心思想

2.1 问题定义

现有缓存加速方法存在两个关键问题:

问题 1:直接复用相邻步特征导致质量下降

  • 虽然同一注意力模块的特征在相邻步之间高度相似
  • 但存在细微而可察觉的差异
  • 直接复用会导致视频细节丢失

问题 2:CFG 计算冗余

  • CFG 需要计算条件和非条件输出,几乎使推理时间翻倍
  • 同时间步的条件和非条件输出高度相似
  • 相邻步的非条件输出相似度较低

2.2 解决方案概述

FasterCache 通过两个核心策略解决上述问题:

  1. 动态特征复用策略:计算相邻缓存特征的差异作为偏差,动态调整特征复用
  2. CFG-Cache:缓存条件和非条件输出之间的高频和低频偏差,优化 CFG 计算

三、技术架构

3.1 动态特征复用策略

动态特征复用 图 13:动态特征复用的设计选择和与 Vanilla Feature Reuse 的比较。

核心公式:

对于中间时间步 t−1t-1 的特征计算:

Ft−1=Fcachet+(Fcachet−Fcachet+2)∗w(t)\bm{F}_{t-1} = \bm{F}_{cache}^{t} + (\bm{F}_{cache}^{t} - \bm{F}_{cache}^{t+2}) * w(t)

其中:

  • Fcachet\bm{F}_{cache}^{t}:时间步 tt 的缓存特征
  • Fcachet+2\bm{F}_{cache}^{t+2}:时间步 t+2t+2 的缓存特征
  • w(t)w(t):权重函数,从 0 线性增加到 1

关键特性:

  • 每隔 2 步计算一次完整注意力输出
  • 利用相邻缓存特征的差异作为偏差
  • 动态捕捉时间步间的演变细节

3.2 CFG-Cache

CFG-Cache 概览 图 8:CFG-Cache 概览。通过缓存条件和非条件输出之间的高频和低频偏差来加速非条件输出的计算。

核心思想:

  • 缓存条件和非条件输出之间的高频和低频偏差
  • 在后续时间步中利用这些偏差快速计算非条件输出
  • 避免完整的非条件前向传播

CFG 公式:

ϵ~θ(xt,c)=(1+g)ϵθ(xt,c)−gϵθ(zt,∅)\tilde{\bm{\epsilon}}_{\theta}(\bm{x}_{t}, \bm{c}) = (1+g) \bm{\epsilon}_{\theta}(\bm{x}_{t}, \bm{c}) - g \bm{\epsilon}_{\theta}(\bm{z}_{t}, \emptyset)

其中 gg 是引导尺度。

3.3 CFG 冗余分析

CFG 冗余 图 6:(a) 同时间步和跨时间步的条件和非条件输出之间的 MSE。(b) 直接复用前时间步的非条件输出会导致显著的视觉质量下降。

关键发现:

  • 采样中后期,同时间步的条件和非条件输出相似度极高
  • 跨时间步的非条件输出相似度较低
  • 直接复用前时间步的非条件输出会导致误差累积

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
动态特征复用利用相邻缓存特征差异作为偏差特征 MSE 分析和视觉质量对比
CFG-Cache缓存条件/非条件输出的高频/低频偏差CFG 冗余分析和消融实验
无需训练方法无需额外训练成本直接应用于多个视频扩散模型
通用性适用于多种视频扩散模型架构在 Open-Sora、Latte、CogVideoX 等模型上验证

4.2 技术细节

特征相似性分析:

特征 MSE 比较 图 4:当前和前一扩散步骤之间注意力特征的均方误差(MSE)比较。较小的值表示较高的相似性。

质量退化分析:

质量退化 图 5:Vanilla Feature Reuse 导致的视觉质量退化(左)和相邻时间步之间的特征差异(右)。


五、代码实现分析

5.1 项目结构

组件说明
FasterCache 核心动态特征复用和 CFG-Cache 实现
模型适配支持 Open-Sora、Latte、CogVideoX 等模型
评估工具VBench、LPIPS、PSNR、SSIM 指标计算

5.2 实现细节

  • 注意力计算:每 2 步进行一次完整空间和时间注意力推理
  • 权重函数:w(t)w(t) 从 0 线性增加到 1
  • CFG 复用:从总采样步数的 1/3 开始,每 5 步进行一次完整推理
  • 超参数:α1=α2=0.2\alpha_1 = \alpha_2 = 0.2(默认值)

六、实验结果

6.1 主要结果

视觉质量比较 图 9:不同方法的视觉质量比较。差异在红框中突出显示。

Open-Sora 1.2 (192 frames, 480P):

方法MACs (P)加速比延迟 (s)VBenchLPIPSSSIMPSNR
原始模型6.301×192.0778.79%---
Δ-DiT (Nc=14, N=2)5.511.14×168.6977.43%0.28340.740317.77
Δ-DiT (Nc=28, N=2)4.721.34×143.1476.60%0.33210.709216.24
PAB5.331.23×156.7378.15%0.10410.882126.43
FasterCache4.131.62×118.4478.46%0.08350.893227.03

Vchitect-2.0 (40 frames, 480P):

方法MACs (P)加速比延迟 (s)VBenchLPIPSSSIMPSNR
原始模型14.571×260.3280.80%---
Δ-DiT (Nc=6, N=3)13.001.11×233.5979.98%0.41530.583714.26
Δ-DiT (Nc=12, N=3)11.791.24×209.7879.50%0.45340.551913.68
PAB12.201.26×206.2379.56%0.04890.880627.38
FasterCache8.671.67×156.1380.84%0.02820.922431.45

6.2 消融实验

消融实验 MSE 图 10:消融研究中的特征 MSE 曲线和视觉结果比较。

效率消融:

变体MACs (P)延迟 (s)Δ 延迟 (s)
原始模型1.5441.28-
+ Vanilla FR1.3333.25-8.03
+ Vanilla FR + CFG1.3333.50-7.78
+ Dynamic FR1.1631.32-9.96
+ Dynamic FR + CFG-Cache1.0126.12-15.16

关键发现:

  1. 动态特征复用策略和 CFG-Cache 独立贡献显著的推理成本降低
  2. 与 Vanilla Feature Reuse 相比,动态特征复用策略对效率的影响可忽略不计

6.3 可扩展性和泛化性

分辨率缩放 图 11:方法在不同视频分辨率和长度下的加速效率。

关键发现:

  • 方法在不同视频分辨率和长度下保持稳定的加速效率
  • 可泛化到多种视频扩散模型架构

七、相关工作

7.1 视频扩散模型

方法类型特点
Open-SoraDiT 架构开源视频生成模型
LatteDiT 架构视频扩散模型
CogVideoXDiT 架构视频生成模型
Vchitect-2.0DiT 架构视频生成模型

7.2 加速方法

方法类型特点
PAB金字塔注意力复用层级注意力缓存
Δ-DiT残差缓存Transformer 特征复用
FasterCache动态特征复用 + CFG-Cache无需训练,高质量加速

八、总结

8.1 核心贡献

  1. 动态特征复用策略:通过计算相邻缓存特征差异作为偏差,保留特征区分性和时间连续性
  2. CFG-Cache:缓存条件和非条件输出之间的高频和低频偏差,优化 CFG 计算
  3. 无需训练:方法无需额外训练成本,可直接应用于现有模型
  4. 显著加速:在多个视频扩散模型上实现 1.54×-1.67× 加速
  5. 高质量保持:在加速的同时保持与原始模型相当的视觉质量

8.2 技术影响

  • 实时视频生成:使视频扩散模型更接近实时应用
  • 资源效率:减少视频生成所需的计算资源
  • 即插即用:方法可直接应用于现有视频扩散模型
  • 研究方向:为缓存加速方法提供了新的研究思路

8.3 局限性

  • 超参数敏感:需要调整权重函数和缓存策略的超参数
  • 模型依赖:不同模型可能需要不同的超参数设置
  • 质量权衡:在极高加速比下仍可能存在质量损失

九、参考资源

9.1 论文链接

9.2 关键图表

图表说明路径
图 1方法比较figure-1-comparison.png
图 4特征 MSE 比较figure-4-mse-comparison.png
图 5质量退化分析figure-5-quality-degradation.png
图 6CFG 冗余分析figure-6-cfg-redundancy.png
图 8CFG-Cache 概览figure-8-cfg-cache-overview.png
图 9视觉质量比较figure-9-visual-comparison.png
图 10消融实验 MSEfigure-10-ablation-mse.png
图 11分辨率缩放figure-11-resolution-scaling.png
图 13动态特征复用figure-13-dynamic-feature-reuse.png

9.3 相关论文

论文作者年份关系
PABZhao et al.2024金字塔注意力缓存方法
Δ-DiTChen et al.2024残差缓存方法
Open-SoraZheng et al.2024视频扩散模型
LatteMa et al.2024视频扩散模型

9.4 关键技术术语

术语英文说明
扩散变换器Diffusion Transformer (DiT)基于 Transformer 的扩散模型骨干
无分类器引导Classifier-Free Guidance (CFG)增强生成质量的技术
动态特征复用Dynamic Feature Reuse保留特征区分性的复用策略
CFG-CacheCFG-Cache优化 CFG 计算的缓存策略
视频扩散模型Video Diffusion Model用于视频生成的扩散模型
特征缓存Feature Cache存储中间特征以加速推理

分析完成时间:2026年6月23日 分析工具:Claude Code + paper-analyzer skill