MOD-DiT: Mixture of Distributions for Dynamic Sparse Attention in Video Diffusion Transformers
训练自由、无采样的动态稀疏注意力框架,通过线性近似模型预测三种核心注意力模式(块对角、平行对角、垂直)的强度演化,在 HunyuanVideo 上实现 2.05× 加速,在 Wan2.1 上实现 1.75× 加速。
2 posts tagged with "Video Diffusion Transformers"
训练自由、无采样的动态稀疏注意力框架,通过线性近似模型预测三种核心注意力模式(块对角、平行对角、垂直)的强度演化,在 HunyuanVideo 上实现 2.05× 加速,在 Wan2.1 上实现 1.75× 加速。
Kaleido 通过挖掘视频潜在空间通道级时空相关性,提出通道级复用算法与可重构 PE 阵列加速器,最高 6.6× 加速、18.4× 能耗节省,PSNR 提升 >17 dB