Back to blog

Sparse-vDiT: Sparse Attention Acceleration for Video Diffusion Transformers

利用稀疏注意力模式加速视频扩散 Transformer 推理

Sparse-vDiT: Sparse Attention Acceleration for Video Diffusion Transformers

一、论文概述

项目内容
标题Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers
作者Pengtao Chen, Xianfang Zeng, Maosen Zhao, Peng Ye, Mingzhu Shen, Wei Cheng, Gang Yu, Tao Chen
机构Fudan University, StepFun, CUHK, Imperial College London
论文arXiv:2506.03065
代码GitHub
发布2025年6月3日
许可CC BY 4.0

二、核心思想

问题定义

视频扩散 Transformer (vDiT) 的 3D 全注意力机制导致二次复杂度,在长序列设置下成为推理瓶颈。例如,HunyuanVideo 生成 5 秒 720p 视频需要约 50 分钟,其中注意力模块占比 81%。

解决方案概述

Sparse-vDiT 是一个稀疏加速框架,通过以下策略加速 vDiT:

  • 注意力头跳过: 3-6% 的注意力头可以跳过而不影响质量
  • 三种稀疏模式: 对角线、多对角线、垂直条纹模式
  • 离线搜索算法: 基于硬件感知的代价模型为每个层和头选择最优稀疏策略
  • 头融合: 将相同注意力策略的头融合以提高效率

核心性能

模型FLOP 减少实际加速PSNR
CogVideoX1.52.09×1.76×24.13
HunyuanVideo2.38×1.85×27.09
Wan2.11.67×1.58×22.59

三、技术架构

整体框架图

Sparse-vDiT 框架

Figure 5: Sparse-vDiT 概览。预定义五种注意力模式 M0:4M_{0:4},通过离线稀疏扩散搜索算法为每个层和头选择最优模式,然后融合相同模式的头以提高效率。

核心公式

全注意力机制

Attention(Qh,Kh,Vh)=softmax(QhKhT/d)Vh∈RB×N×dAttention(\bm{Q}_{h},\bm{K}_{h},\bm{V}_{h})=softmax(\bm{Q}_{h}\bm{K}_{h}^{T}/\sqrt{d})\bm{V}_{h}\in\mathbb{R}^{B\times N\times d}

离线搜索损失函数

Li=MSE(Oi−O0)+λ×(1−Si)L_{i}=MSE(\bm{O}_{i}-\bm{O}_{0})+\lambda\times(1-S_{i})

其中:

  • O0\bm{O}_0: 全注意力输出
  • Oi\bm{O}_i: 第 ii 种稀疏模式输出
  • SiS_i: 第 ii 种模式的稀疏度
  • λ\lambda: 质量-效率平衡因子

注意力模式选择

Attention(Q,K,V,M)={M0(Q,K,V), if⋂i=1,...,4(Li>ϵ)Margmini{Li}(Q,K,V), otherwiseAttention(\bm{Q},\bm{K},\bm{V},\bm{M})=\begin{cases}M_{0}(\bm{Q},\bm{K},\bm{V})&\text{, if}\bigcap\limits_{i=1,...,4}(L_{i}>\epsilon)\\M_{argmin_{i}\{L_{i}\}}(\bm{Q},\bm{K},\bm{V})&\text{, otherwise}\end{cases}

其中 ϵ\epsilon 控制推理时的整体稀疏度。

四种注意力模式

模式说明稀疏度适用场景
M0M_0 Full全注意力,值均匀分布0无法稀疏化的头
M1M_1 Skip跳过注意力,输出置零1冗余头
M2M_2 Diagonal对角线模式,大值在主对角线预定义帧内自交互
M3M_3 Multi-Diagonal多对角线模式,多条均匀间隔对角线预定义跨帧一致性
M4M_4 Vertical-Stripe垂直条纹模式,全局 token预定义全局 token 交互

注意力图结构

注意力图可视化

Figure 2: vDiT 注意力图的四个交互区域。主导的 V-V 区域包含帧内对角线块和跨帧非对角线块。

稀疏模式可视化

稀疏模式

Figure 3: vDiT 中四种循环注意力模式的可视化。

注意力模式不变性

t-SNE 可视化

Figure 4: VBench 子集上注意力模式的 t-SNE 可视化。不同层用不同颜色表示。不同 prompt 的模式呈现聚类,说明模式与输入内容无关。

模型组件

组件说明关键参数
稀疏核针对三种稀疏模式的高效实现Triton/CUDA
离线搜索器为每个层和头选择最优模式λ\lambda, ϵ\epsilon
头融合器融合相同模式的头层内融合
跳过策略跳过冗余头,输出置零3-6% 跳过率

搜索算法

Algorithm 1: Offline Sparse Diffusion Search

  1. 输入: vDiT 模型,小样本集
  2. 对每个时间步和每个层:
    • 通过 M0M_0 到 M4M_4 获取隐藏状态 O0\bm{O}_0 到 O4\bm{O}_4
    • 计算 MSE(Oi−O0)MSE(\bm{O}_i - \bm{O}_0)
    • 计算损失 Li=MSE+λ×(1−Si)L_i = MSE + \lambda \times (1-S_i)
    • 如果所有 Li>ϵL_i > \epsilon,保留全注意力
    • 否则选择 argmin(Li)argmin(L_i) 的模式
  3. 输出: 每个层和头的固定稀疏模式配置

四、核心创新

创新点说明理论/实验依据
注意力冗余分析发现 3-6% 头可跳过,三种稀疏模式Table 1 跳过实验
模式不变性稀疏模式与输入无关,仅与位置相关Figure 4 t-SNE 聚类
离线搜索仅需小样本即可确定最优配置离线 Profiling
头融合相同模式的头融合提高效率层内融合优化
三种稀疏核针对对角线/多对角线/垂直条纹的高效实现Triton/CUDA 实现

五、实验结果

主要结果 (CogVideoX1.5)

方法FLOPS (PFLOPS)↓延迟↓加速↑SSIM↑PSNR↑LPIPS↓
原始147.87901s1.00×---
MInference84.89634s1.42×0.6114.630.37
WinAttn (Spatial)72.34531s1.69×0.6419.070.32
WinAttn (Temporal)72.34537s1.67×0.6919.640.28
PAB105.88630s1.43×0.7220.930.23
SVG74.57550s1.64×0.7521.920.22
Sparse-vDiT70.69511s1.76×0.8224.130.14

主要结果 (HunyuanVideo)

方法FLOPS (PFLOPS)↓延迟↓加速↑SSIM↑PSNR↑LPIPS↓
原始612.373166s1.00×---
MInference293.872042s1.55×0.6419.230.43
WinAttn (Spatial)258.841755s1.80×0.5617.810.56
WinAttn (Temporal)258.841764s1.79×0.8023.760.22
SVG259.791802s1.75×0.8626.830.14
Sparse-vDiT257.091715s1.85×0.8727.090.12

主要结果 (Wan2.1)

方法FLOPS (PFLOPS)↓延迟↓加速↑SSIM↑PSNR↑LPIPS↓
原始660.491935s1.00×---
MInference469.791453s1.33×0.6215.490.36
WinAttn (Spatial)401.211265s1.53×0.6819.140.25
WinAttn (Temporal)---0.7320.29-
Sparse-vDiT--1.58×0.8022.59-

注意力头跳过实验 (Table 1)

CogVideoX1.5:

跳过比例PSNR↑SSIM↑LPIPS↓
1%36.620.960.01
3%33.310.950.02
6%30.020.920.04
10%26.870.850.09

HunyuanVideo:

跳过比例PSNR↑SSIM↑LPIPS↓
1%31.840.950.02
3%28.940.910.06
6%24.210.810.12
10%17.980.720.22

消融实验 (Table 3)

超参数 λ\lambda 和 ϵ\epsilon 的影响:

λ\lambdaϵ\epsilonPSNR↑SSIM↑LPIPS↓加速↑
0.010.124.130.820.141.76×
0.0050.123.850.810.151.78×
0.010.0524.520.830.131.72×
0.010.1523.650.800.161.80×

视觉质量对比

视觉对比

Figure 6: Sparse-vDiT 与基线方法的视觉对比。绿框为真值,黄框突出模糊和平滑度差异,白框突出细节差异,红框强调轮廓对比。

延迟分解

延迟分析

Figure 1: vDiT 架构及其两种变体 (CogVideoX1.5 和 HunyuanVideo) 的推理延迟分析。在长序列设置下,注意力模块延迟占主导地位。

六、与现有方法对比

方面MInferenceWinAttnSVGPABSparse-vDiT
方法类型稀疏注意力窗口注意力稀疏注意力缓存稀疏注意力+头跳过
模式类型动态固定窗口在线搜索固定离线搜索
头跳过无无无无有
头融合无无无无有
CogVideoX 加速1.42×1.69×1.64×1.43×1.76×
HunyuanVideo 加速1.55×1.80×1.75×-1.85×
质量损失大中等较小较小极小

七、相关工作

相关工作与本文关系
SVG最近的 vDiT 稀疏加速方法,Sparse-vDiT 超越
MInferenceLLM 稀疏注意力迁移,效果有限
WinAttn窗口注意力基线
PAB缓存方法基线
DiTFastAttnDiT 注意力加速参考
CogVideoX, HunyuanVideo, Wan2.1目标 vDiT 模型

八、总结

核心贡献

  1. 注意力冗余分析: 发现 vDiT 中 3-6% 头可跳过,三种循环稀疏模式
  2. 模式不变性: 稀疏模式与输入无关,仅与注意力位置相关
  3. Sparse-vDiT 框架: 离线搜索+稀疏核+头融合的完整加速方案
  4. SOTA 性能: 在 CogVideoX1.5、HunyuanVideo、Wan2.1 上均达到最佳加速效果

技术影响

  • 视频生成加速: 为 vDiT 提供系统性的稀疏加速方案
  • 离线优化: 仅需小样本即可确定最优配置,运行时无额外开销
  • 头融合: 利用固定模式实现层内融合,进一步提高效率
  • 通用性: 适用于多种 vDiT 架构 (CogVideoX, HunyuanVideo, Wan)

局限性

  • 仅在三个模型上验证
  • 稀疏核需要 Triton/CUDA 实现
  • 未与蒸馏或量化方法结合
  • 超参数 λ\lambda 和 ϵ\epsilon 需要调整

九、参考资源

十、关键公式速查

公式说明
Attention(Qh,Kh,Vh)=softmax(QhKhT/d)VhAttention(\bm{Q}_{h},\bm{K}_{h},\bm{V}_{h})=softmax(\bm{Q}_{h}\bm{K}_{h}^{T}/\sqrt{d})\bm{V}_{h}全注意力
Li=MSE(Oi−O0)+λ×(1−Si)L_{i}=MSE(\bm{O}_{i}-\bm{O}_{0})+\lambda\times(1-S_{i})离线搜索损失
Attention(Q,K,V,M)=Margmini{Li}(Q,K,V)Attention(\bm{Q},\bm{K},\bm{V},\bm{M})=M_{argmin_{i}\{L_{i}\}}(\bm{Q},\bm{K},\bm{V})模式选择

十一、关键图片索引

图片说明文件名
Figure 1vDiT 架构和延迟分析x1.png
Figure 2注意力图四个交互区域x2.png
Figure 3四种循环注意力模式x3.png
Figure 4t-SNE 模式聚类可视化x4.png
Figure 5Sparse-vDiT 框架概览x5.png
Figure 6视觉质量对比x6.png
Figure 7更多视觉对比结果x7.png
Figure 8更多视觉对比结果x8.png
Figure 9更多视觉对比结果x9.png
Figure 10帧间一致性对比x10.png
Figure 11帧间一致性对比x11.png