Back to blog

From Slow Bidirectional to Fast Autoregressive Video Diffusion Models (CausVid)

首个与双向扩散模型质量匹敌的自回归视频生成方法,通过非对称蒸馏将50步双向DiT蒸馏为4步因果生成器,实现9.4 FPS流式生成

From Slow Bidirectional to Fast Autoregressive Video Diffusion Models (CausVid)

一、论文概述

项目内容
标题From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
简称CausVid
作者Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Frédo Durand, Eli Shechtman, Xun Huang
机构MIT, Adobe Research
论文https://arxiv.org/abs/2412.07772
代码https://github.com/tianweiy/CausVid
项目页https://causvid.github.io/
会议CVPR 2025
发布2024-12-10 (v1), 最新 v4 (2025-09-23)
许可CC BY 4.0

二、核心思想

问题定义

当前视频扩散模型使用双向注意力,生成单帧需要处理整个序列(包括未来帧),导致:

问题说明
高延迟生成128帧需要219秒
无法流式必须等待全部帧完成才能观看
计算量大复杂度与帧数平方成正比
不支持交互无法响应实时用户输入

解决方案概述

CausVid 是首个与双向扩散模型质量匹敌的自回归视频生成方法。核心创新:

  • 因果自回归架构:将预训练双向DiT适配为自回归Transformer,支持帧级流式生成
  • 视频DMD蒸馏:将Distribution Matching Distillation扩展到视频,50步→4步
  • 非对称蒸馏策略:用双向教师监督因果学生,显著减少误差累积
  • SOTA性能:VBench-Long总分84.27,单GPU 9.4 FPS流式生成

Figure 1: 双向vs因果生成对比 - 219s vs 1.3s延迟

三、技术架构

整体框架

Figure 5: 自回归扩散Transformer架构

CausVid采用自回归扩散Transformer架构,在3D VAE压缩的潜在空间中生成视频帧。关键设计:

  • 块级因果注意力:当前帧只关注当前和之前帧,不关注未来
  • 块内双向注意力:每个chunk内部保持双向注意力以捕获局部时间依赖
  • KV缓存:支持高效推理,避免重复计算

注意力掩码

Mi,j={1,if ⌊jk⌋≤⌊ik⌋,0,otherwise.(5)M_{i,j} = \left\{ \begin{array}{ll} 1, & \text{if } \left\lfloor \frac{j}{k} \right\rfloor \leq \left\lfloor \frac{i}{k} \right\rfloor, \\ 0, & \text{otherwise.} \end{array} \right. \tag{5}

其中 ii 和 jj 是帧索引,kk 是chunk大小,⌊⋅⌋\lfloor \cdot \rfloor 是向下取整函数。

核心公式

扩散模型训练目标:

L(θ)=Et,x0,ϵ∥ϵθ(xt,t)−ϵ∥22(2)\mathcal{L}(\theta) = \mathbb{E}_{t, x_0, \epsilon} \| \epsilon_\theta(x_t, t) - \epsilon \|_2^2 \tag{2}

Score函数:

sθ(xt,t)=∇xtlog⁡p(xt)=−ϵθ(xt,t)σt(3)s_\theta(x_t, t) = \nabla_{x_t} \log p(x_t) = - \frac{\epsilon_\theta(x_t, t)}{\sigma_t} \tag{3}

DMD蒸馏损失:

∇ϕLDMD≈−Et(∫(sdata(Ψ(Gϕ(ϵ),t),t)−sgen,ξ(Ψ(Gϕ(ϵ),t),t))dGϕ(ϵ)dϕdϵ)(4)\nabla_\phi \mathcal{L}_{\text{DMD}} \approx - \mathbb{E}_t \left( \int (s_{\text{data}}(\Psi(G_\phi(\epsilon), t), t) - s_{\text{gen}, \xi}(\Psi(G_\phi(\epsilon), t), t)) \frac{dG_\phi(\epsilon)}{d\phi} d\epsilon \right) \tag{4}

学生初始化损失:

Linit=Ex,ti∥Gϕ({xtii}i=1N,{ti}i=1N)−{x0i}i=1N∥2(6)\mathcal{L}_{\text{init}} = \mathbb{E}_{x, t^i} \| G_\phi(\{x_{t^i}^i\}_{i=1}^N, \{t^i\}_{i=1}^N) - \{x_0^i\}_{i=1}^N \|^2 \tag{6}

非对称蒸馏策略

Figure 6: 非对称蒸馏架构

核心创新:用双向教师监督因果学生

教师(双向注意力)→ 学生(因果注意力)

优势:

  • 教师可以看到完整序列,提供更准确的监督
  • 学生学习因果依赖,支持流式推理
  • DMD的分布级匹配允许架构差异
  • 显著减少自回归误差累积

学生初始化

基于教师ODE轨迹初始化:

  1. 从标准高斯分布采样噪声输入 {xTi}i=1L\{x_T^i\}_{i=1}^L
  2. 使用预训练双向教师模拟ODE轨迹 {xti}i=1L\{x_t^i\}_{i=1}^L
  3. 选择与学生生成器匹配的t值子集
  4. 用回归损失训练学生模型

KV缓存推理

推理时生成视频帧序列,使用KV缓存避免重复计算:

  • 每个chunk生成后,计算KV对并追加到缓存
  • 后续chunk可以直接使用缓存的KV对
  • 块级因果注意力在推理时不再需要,可使用快速双向注意力实现

四、核心创新

创新点说明优势
因果自回归架构块级因果注意力 + 块内双向注意力流式生成 + 局部一致性
视频DMD蒸馏将DMD从图像扩展到视频50步→4步,160×延迟降低
非对称蒸馏双向教师 → 因果学生减少误差累积,质量接近教师
ODE轨迹初始化基于教师ODE解初始化学生稳定训练,提高最终质量
KV缓存推理高效自回归推理9.4 FPS流式生成

五、训练流程

训练策略

阶段 1:ODE轨迹初始化(3000迭代)
  - 生成1000个ODE解对
  - AdamW优化器,学习率 5×10⁻⁶

阶段 2:非对称DMD蒸馏(6000迭代)
  - 双向教师 → 因果学生
  - AdamW优化器,学习率 2×10⁻⁶
  - 引导尺度 3.5
  - DMD2双时间尺度更新规则,比率5

训练数据

项目值
分辨率352×640
帧率12 FPS
视频时长10秒
训练数据混合图像和视频数据集
视频数量~400K单镜头视频
训练硬件64 H100 GPU
训练时间~2天

模型规格

规格教师模型学生模型
架构双向DiT因果DiT
注意力全局双向块级因果
去噪步数50步4步
推理时间步-[999, 748, 502, 247]
VAE3D VAE (16帧→5潜在帧)同教师
基础模型CogVideoX风格同教师

六、实验结果

VBench短视频评估

方法时长时间质量↑帧质量↑文本对齐↑
CogVideoX-5B6s89.959.829.1
OpenSORA8s88.452.028.4
Pyramid Flow10s89.655.927.1
MovieGen10s91.561.128.8
CausVid10s94.764.430.1

CausVid在所有三个关键指标上均达到最优。

VBench长视频评估(~30s)

方法时间质量↑帧质量↑文本对齐↑
Gen-L-Video86.752.328.7
FreeNoise86.254.828.7
StreamingT2V89.246.127.2
FIFO-Diffusion93.157.929.9
Pyramid Flow89.048.324.4
CausVid94.963.428.9

推理速度对比

Figure 7: 用户偏好研究

方法延迟(s)↓吞吐量(FPS)↑
CogVideoX-5B208.60.6
Pyramid Flow6.72.5
双向教师219.20.6
CausVid1.39.4

CausVid实现160×延迟降低和16×吞吐量提升。

用户偏好研究

模型对比CausVid胜率
vs 双向教师51.7%
vs PyramidFlow87.4%
vs CogVideoX69.0%
vs MovieGen60.9%

VBench-Long排行榜

Figure 10: VBench雷达图对比

方法总分质量分语义分
Vchitect82.2483.5477.06
Jimeng81.9783.2976.69
CogVideoX81.6182.7577.04
Vidu81.8983.8574.04
Kling81.8583.3975.68
CogVideoX1.5-5B82.1782.7879.76
Gen-382.3284.1175.17
CausVid84.2785.6578.75

CausVid以84.27总分排名第一,在动态程度(92.69)、物体类别(92.99)、人类动作(99.80)等维度显著领先。

消融实验

模型时间质量帧质量文本对齐
双向(多步)94.662.729.6
因果(多步)92.460.128.5
无ODE初始化 + 双向教师93.460.629.4
ODE初始化 + 无教师92.948.125.3
ODE初始化 + 因果教师91.961.728.2
完整CausVid94.764.430.1

关键发现:

  • 因果教师导致误差累积传递给学生
  • 双向教师显著优于因果教师
  • ODE初始化进一步提升性能

质量随时间变化

Figure 8: 30秒视频质量变化

时间(s)CausVid因果教师Causal Teacher (蒸馏)StreamingT2VFIFOPyramid Flow
00.690.670.690.520.610.65
100.690.580.590.490.610.55
200.690.530.550.450.610.48
300.680.470.470.470.610.42

CausVid在30秒内保持稳定质量(0.68-0.69),而因果教师和PyramidFlow显著退化。

图像到视频评估

方法时间质量↑帧质量↑文本对齐↑
CogVideoX-5B87.064.928.9
Pyramid Flow88.460.327.6
CausVid92.065.028.9

CausVid零样本支持图像到视频生成,无需额外训练。

超长视频生成

Figure 9: 14分钟视频示例

模型成功生成14分钟视频,虽有轻微过曝但整体质量保持良好。

七、应用场景

Figure 2: 多样化任务支持

文本到视频

  • 标准文本到视频生成
  • 支持长视频(滑动窗口)

图像到视频

  • 零样本支持(无需额外训练)
  • 第一帧作为条件输入

流式视频到视频翻译

方法时间质量帧质量文本对齐
StreamV2V92.559.326.9
CausVid93.261.727.7

动态提示

  • 用户可随时输入新prompt
  • 支持扩展叙事和情节变化

游戏引擎增强

  • 为简单游戏引擎输出添加真实纹理和光照
  • 实时响应用户输入

八、相关工作

自回归视频生成

  • Diffusion Forcing:支持自回归采样的扩散模型
  • FIFO-Diffusion:先进先出扩散模型
  • StreamingT2V:流式文本到视频生成

长视频生成

  • Gen-L-Video:长视频生成
  • FreeNoise:自由噪声长视频
  • Pyramid Flow:金字塔流匹配

扩散蒸馏

  • DMD:Distribution Matching Distillation
  • DMD2:多步DMD扩展
  • Consistency Distillation:一致性蒸馏
  • Progressive Distillation:渐进式蒸馏

CausVid的差异化

  • 首个质量匹敌双向的自回归方法:之前方法均显著落后
  • 非对称蒸馏:独特地用双向教师训练因果学生
  • 流式生成:9.4 FPS,支持交互式应用
  • 多任务支持:T2V、I2V、V2V、动态提示

九、总结

核心贡献

  1. 因果自回归架构:设计块级因果注意力的DiT,支持帧级流式生成,首次实现与双向模型质量匹敌
  2. 视频DMD蒸馏:将DMD从图像扩展到视频,50步→4步,160×延迟降低
  3. 非对称蒸馏策略:用双向教师监督因果学生,有效减少误差累积
  4. ODE轨迹初始化:稳定训练过程,提高最终质量
  5. SOTA性能:VBench-Long总分84.27排名第一,9.4 FPS流式生成

技术影响

  • 视频生成新范式:证明自回归方法可以匹敌双向扩散模型
  • 实时视频生成:为交互式应用(游戏、机器人、流式编辑)提供基础
  • 蒸馏技术突破:非对称蒸馏策略可推广到其他架构差异场景
  • 长视频生成:支持10分钟以上视频,质量退化可控

局限性

  1. 超长视频退化:生成极长视频时仍观察到质量下降
  2. VAE延迟瓶颈:当前VAE需要5个潜在帧才能输出像素,限制了延迟进一步降低
  3. 输出多样性降低:DMD基于反向KL,导致输出多样性下降
  4. 帧率限制:当前实现约10 FPS,需工程优化(编译、量化、并行化)才能实现实时
  5. 训练成本:64 H100 GPU训练2天,对资源要求较高

十、参考资源

论文

相关论文

  • DMD: Distribution Matching Distillation (CVPR 2024)
  • DMD2: 多步DMD扩展
  • CogVideoX: 视频生成模型(教师模型基础)
  • Diffusion Forcing: 自回归扩散模型
  • VBench: 视频生成评估基准
  • FlexAttention: 高效注意力计算