Back to blog

Latte: Latent Diffusion Transformer for Video Generation

首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。

Latte:面向视频生成的潜空间扩散 Transformer

一、论文概述

项目内容
标题Latte: Latent Diffusion Transformer for Video Generation
作者Xin Ma, Yaohui Wang, Xinyuan Chen, Gengyu Jia, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, Yu Qiao
机构Monash University(莫纳什大学)、Shanghai AI Laboratory(上海人工智能实验室)、南京邮电大学、NTU S-Lab
论文https://arxiv.org/abs/2401.03048
项目主页https://maxin-cn.github.io/latte_project/
代码https://github.com/Vchitect/Latte
发布2024-01(TMLR 收录)
领域视频生成、扩散模型、Diffusion Transformer

一句话概括

Latte 是首个系统性研究「用 Transformer 作为骨干」的潜空间视频扩散模型。它先用预训练 VAE 把视频逐帧压到潜空间、抽取时空 token,再用一系列 Transformer block 建模视频分布。由于视频 token 数量巨大,作者从解耦时空维度的角度设计了 4 种高效变体;并通过严谨的消融确定了一套「最佳实践」(patch embedding 方式、变体选择、时间步/类别信息注入、时间位置编码、学习策略)。在 FaceForensics、SkyTimelapse、UCF101、Taichi-HD 四个标准视频生成基准上全面取得 SOTA,还成功扩展到文生视频(T2V)。Latte 是后来 Sora 类 DiT 视频模型的重要先驱工作之一。


二、核心思想

问题定义

扩散模型在图像生成上非常成功,但高质量视频生成仍极具挑战:视频具有复杂、高维的时空信息(高分辨率帧 + 时序)。此前视频扩散普遍以 U-Net(CNN) 为骨干,而 DiT / U-ViT 已证明在图像生成中 U-Net 的归纳偏置并非必需、Transformer 骨干反而性能更好。由此提出核心问题:

基于 Transformer 的潜空间扩散模型能否提升真实视频的生成质量?

关键难点在于:视频抽取的 token 数量 nf×nh×nwn_f \times n_h \times n_w 非常庞大,若直接用标准 Transformer 做全时空注意力,计算量无法承受,必须高效地解耦时空维度。

解决方案概述

  1. Latte 架构:VAE 逐帧编码 → 抽取时空 token → Transformer 骨干建模 → 线性解码器预测噪声与协方差。用 Lsimple+Lvlb\mathcal{L}_{simple}+\mathcal{L}_{vlb} 联合训练。
  2. 4 种时空解耦变体:从「Transformer block 分解」与「多头注意力分解」两个角度设计,探索时空模块解耦程度对视频生成的影响。
  3. 最佳实践:通过消融确定 5 个设计维度的最优选择,使 Latte 生成时序连贯的高保真视频。

三、技术架构

3.1 潜空间扩散模型基础(LDM)

LDM 在潜空间而非像素空间做扩散,用预训练 VAE 编码器 E\mathcal{E} 把样本 xx 压成潜码 z=E(x)z=\mathcal{E}(x)。

扩散过程(逐步加高斯噪声):

zt=αˉt z+1−αˉt ϵ,ϵ∼N(0,1)z_t = \sqrt{\bar\alpha_t}\, z + \sqrt{1-\bar\alpha_t}\,\epsilon, \quad \epsilon\sim\mathcal{N}(0,1)

去噪过程(学习逆扩散预测 zt−1z_{t-1}):pθ(zt−1∣zt)=N(μθ(zt),Σθ(zt))p_\theta(z_{t-1}|z_t)=\mathcal{N}(\mu_\theta(z_t), \Sigma_\theta(z_t)),其变分下界为:

Lθ=−log⁡p(z0∣z1)+∑tDKL(q(zt−1∣zt,z0) ∥ pθ(zt−1∣zt))\mathcal{L}_\theta = -\log p(z_0|z_1) + \sum_t D_{KL}\big(q(z_{t-1}|z_t,z_0)\,\|\,p_\theta(z_{t-1}|z_t)\big)

简单训练目标(预测噪声):

Lsimple=Ez∼p(z), ϵ∼N(0,1), t[∥ϵ−ϵθ(zt,t)∥22]\mathcal{L}_{simple}=\mathbb{E}_{z\sim p(z),\,\epsilon\sim\mathcal{N}(0,1),\,t}\left[\big\|\epsilon-\epsilon_\theta(z_t,t)\big\|_2^2\right]

为学习协方差 Σθ\Sigma_\theta,还需优化完整 DKLD_{KL} 项,即 Lvlb\mathcal{L}_{vlb};Σθ\Sigma_\theta 同样由 ϵθ\epsilon_\theta 实现。

3.2 Latte 架构与四种模型变体

Latte 架构与四种变体

给定潜空间视频片段 VL∈RF×H×W×CV_L\in\mathbb{R}^{F\times H\times W\times C},先转成 token 序列 z^∈Rnf×nh×nw×d\hat z\in\mathbb{R}^{n_f\times n_h\times n_w\times d},加时空位置编码 pp 得 z=z^+pz=\hat z + p。核心是两种 reshape:

  • 空间输入 zs∈Rnf×s×dz_s\in\mathbb{R}^{n_f\times s\times d}(s=nh×nws=n_h\times n_w,每个时间索引的 token 数)
  • 时间输入 zt∈Rs×nf×dz_t\in\mathbb{R}^{s\times n_f\times d}
变体解耦方式说明FLOPs(G)
Variant 1(最佳)Block 级 · 交错融合空间 Transformer block 与时间 Transformer block 交替堆叠,逐层交错捕获时空信息5572.69
Variant 2Block 级 · 后融合前半段全部做空间 block、后半段全部做时间 block(late fusion)5572.69
Variant 3注意力级 · 串行单个 block 内先做空间自注意力、再做时间自注意力(源自 TimeSformer)6153.15
Variant 4注意力级 · 并行把多头注意力一半头做空间、一半头做时间,两路结果 reshape 后相加1545.15
  • 参数量:Variant 1/2 均为 673.68M,Variant 3 为 676.33M,Variant 4 为 676.44M(Variant 4 FLOPs 仅约其他的 1/4)。
  • 骨干后接标准线性解码器 + reshape,输出预测噪声与协方差,形状与 VLV_L 相同。

3.3 架构设计的最佳实践

3.3.1 潜空间视频片段 Patch Embedding

视频片段 patch embedding

  • Uniform frame patch embedding(均匀帧):对每帧独立套用 ViT 的 2D patch,nf=Fn_f=F。
  • Compression frame patch embedding(压缩帧):把 ViT patch 扩到 3D,沿时间维以步长 ss 抽 tube,nf=F/sn_f=F/s,天然融入时空信息;解码时需额外接 3D 转置卷积做时间上采样。

消融结论:Uniform 显著优于 Compression(与视频理解模型 ViViT 结论相反)——推测压缩帧会丢失时空信号,使骨干难以学到视频分布。

3.3.2 时间步/类别信息注入

两种方式:

  • All tokens:把时间步/类别 cc 当作额外 token 拼到输入。
  • S-AdaLN(可扩展自适应层归一化):由 cc 线性回归出 γc,βc\gamma_c,\beta_c,AdaLN(h,c)=γc LayerNorm(h)+βcAdaLN(h,c)=\gamma_c\,\text{LayerNorm}(h)+\beta_c;并回归 αc\alpha_c 作用于残差连接前:RCs(h,c)=αch+AdaLN(h,c)RCs(h,c)=\alpha_c h + AdaLN(h,c)。

消融结论:S-AdaLN 明显优于 all tokens 且收敛更快——all tokens 只在输入层引入 cc,难以有效传播;S-AdaLN 在每个 block 自适应注入。

3.3.3 时间位置编码

  • 绝对位置编码:正余弦函数(Transformer 原版)。
  • 相对位置编码:RoPE(旋转位置编码)。

消融结论:绝对位置编码略优。由于 Latte 不需生成变时长/多分辨率视频(RoPE 的强项),最终选用绝对位置编码。

3.3.4 学习策略

时间掩码策略

(1) 用预训练模型初始化:从 ImageNet 上预训练的 DiT 初始化 Latte。处理参数不兼容:

  • 位置编码:把 DiT 的 p∈Rnh×nw×dp\in\mathbb{R}^{n_h\times n_w\times d} 沿时间复制 nfn_f 份成 p∈Rnf×nh×nw×dp\in\mathbb{R}^{n_f\times n_h\times n_w\times d}。
  • 标签嵌入:视频数据集类别数与 ImageNet(1000) 不符,直接丢弃 DiT 的标签嵌入并零初始化。

消融结论(Fig.5d):ImageNet 预训练早期收敛快,但后期性能停滞、远差于随机初始化。原因:ImageNet 与 FaceForensics 数据分布差异大,小数据集上域差距超过迁移收益。但对大规模、通用任务(如 T2V),预训练收益更显著。

(2) 图像-视频联合训练:在视频片段末尾追加同数据集随机采样的独立帧。为保证生成连续视频,提出时间掩码矩阵 M∈R(f+i)×(f+i)M\in\mathbb{R}^{(f+i)\times(f+i)}:

  • Only Video:仅视频内容 token 参与时间模块建模(图像只优化空间模块)→ 效果次优。
  • Temporal Mask(本文):让图像也优化时间模块,同时保持视频连续性。

UCF101 zero-shot:Only Video 的 FVD/FID 为 705.72 / 75.98;Temporal Mask 为 589.86 / 63.36,明显更优。

训练细节

项目配置
优化器AdamW,恒定学习率 1×10−41\times10^{-4}
数据增强仅水平翻转
EMA衰减率 0.9999,结果取 EMA 模型
VAE来自 Stable Diffusion 1.4 的预训练 VAE
硬件8× NVIDIA A100 (80G)
训练片段16 帧,分辨率 256×256,采样间隔 3

模型规模(follow ViT/DiT 配置):

模型层数 N维度 D头数 H参数
Latte-S12384632.48M
Latte-B1276812129.54M
Latte-L24102416456.81M
Latte-XL28115216673.68M

四、核心创新

创新点说明依据
首个系统化的视频 DiT 研究系统分析不同 Transformer 骨干与最佳实践对视频生成的影响,此前 VDT/GenTron/W.A.L.T 未做此分析§3.2/§3.3 全面消融
4 种时空解耦变体 + 深度分析从 block 级与注意力级两个角度设计,并首次解释「解耦程度」如何影响视频生成、为何 Variant 1 最优Fig.6/8 帧间余弦相似度分析
S-AdaLN在 AdaLN 基础上额外回归 αc\alpha_c 作用于残差前,逐 block 自适应注入时间步/类别优于 all tokens 且收敛更快
Temporal Mask 联合训练让追加图像帧也能优化时间模块,兼顾多样性与时序连贯FVD 705→589、FID 76→63
T2V 扩展用 PixArt-α 权重初始化空间 block,在 Vimeo25M 训练VBench 与 SOTA T2V 可比

为何 Variant 1 最佳(关键分析)

  • 过多连续空间注意力会破坏时序连贯(Variant 2):Fig.6 显示随空间注意力堆叠,帧间余弦相似度均值持续下降、方差增大,出现「倒置关系」(第 1 帧与第 2 帧相似度反而低于第 1 帧与第 5 帧),说明时空信息未有效解耦。
  • 并行结构直接融合会破坏时序(Variant 4):Fig.8 显示空间注意力与时间注意力输出的帧间相似度分布差异极大、互相似度极低,直接相加严重扰乱时序。
  • Variant 3 耦合度过高:空间注意力特征只经 LayerNorm 就送入时间注意力,归一化不足以适配。
  • Variant 1 交错融合恰到好处:完整 Transformer block(含 MHA+LN+MLP)比只用 MHA(Variant 3)更能建模时序 → 性能最佳。

五、实验结果

数据集:FaceForensics、SkyTimelapse、UCF101、Taichi-HD(16 帧、256×256)。 指标:FVD(主)、FID、IS(仅 UCF101)。

5.1 主结果:FVD(越低越好,Table 3)

方法FaceForensicsSkyTimelapseUCF101Taichi-HD
StyleGAN-V47.4179.521431.0-
PVDM355.9255.41343.6540.2
LVDM-95.20372.099.0
VDT--225.7-
W.A.L.T--258.1-
Latte34.0059.82477.97159.60
Latte+IMG27.0842.67202.2397.09

图像-视频联合训练(+IMG)带来大幅提升,全面刷新 SOTA。

5.2 帧质量:IS↑ / FID↓(Table 5)

方法IS (UCF101)↑FID (FaceForensics)↓
PVDM60.5529.76
Latte68.535.02
Latte+IMG73.313.87

5.3 消融实验(FaceForensics,FVD)

设计选择消融

维度对比结论
Patch embeddingUniform vs CompressionUniform 更优
信息注入S-AdaLN vs All tokensS-AdaLN 显著更优、收敛更快
时间位置编码绝对 vs RoPE绝对略优
ImageNet 预训练有 vs 随机早期快、后期停滞(小数据集不划算)
采样间隔不同 rate长期趋同,选间隔 3
模型变体V1–V4Variant 1 最佳

模型规模缩放

模型规模(Fig.7):XL > L > B > S,增大模型规模显著提升性能(与图像生成 DiT 结论一致)。

最佳实践总结:Variant 1 + Uniform patch embedding + S-AdaLN + 绝对位置编码 + 图像-视频联合训练。

5.4 文生视频扩展(VBench,Table 4)

用 PixArt-α(512×512)权重初始化空间 block,在 Vimeo25M 训练。与 ModelScope、VideoCrafter、CogVideo、HiGen、OpenSoraPlan 对比,Latte 在多个 VBench 维度(如 Human Action 85.31%、Multiple Object 34.53%、Overall Consistency 27.33%)取得可比甚至领先的成绩。


六、相关工作

  • 视频生成三条路线:GAN 类(易 mode collapse)、自回归类(质量好但算力高)、扩散类(近年主流)。
  • 并发/相关的 Transformer 视频扩散:VDT、GenTron、W.A.L.T(架构类似 Latte 的 Variant 3)、Open-Sora Plan、HunyuanVideo、Pyramidal Flow、Cosmos 等。Latte 的差异在于系统性分析不同 Transformer 骨干与最佳实践(详见附录 A.3)。
  • DiT / U-ViT:证明 U-Net 归纳偏置对 LDM 非必需,是 Latte 采用纯 Transformer 骨干的直接动机。

七、总结

核心贡献

  1. Latte 架构:首个以视频 Transformer 为骨干的潜空间扩散模型,含 4 种高效时空解耦变体及其设计洞见。
  2. 最佳实践:系统消融确定 patch embedding、变体、信息注入、位置编码、学习策略五维度的最优选择。
  3. SOTA 性能:四个标准视频基准全面领先,T2V 扩展与当前 SOTA 可比。

技术影响

  • 为「把 Transformer 骨干引入视频(及其他模态)扩散模型」提供了系统性参考,是 Sora 类 DiT 视频生成模型的重要先驱。
  • Variant 1(交错时空注意力)成为后续众多视频 DiT 的常见范式。

局限性

  • 训练片段固定 16 帧、256×256,未探索长视频/高分辨率/变时长生成(也是选绝对位置编码而非 RoPE 的原因)。
  • ImageNet 预训练在专用小数据集上收益有限(域差距问题)。
  • Variant 4 虽 FLOPs 最低(约 1/4)但性能最差,效率-质量权衡上尚无理想解。

八、参考资源


附录:论文图表索引

图文件说明
Figure 2architecture-variants.pngLatte 架构与四种时空解耦变体
Figure 3patch-embedding.pngUniform vs Compression patch embedding
Figure 4temporal-mask.pngTemporal Mask 联合训练策略
Figure 5aablation-patch-embedding.png消融:patch embedding
Figure 5bablation-timestep-injection.png消融:时间步/类别注入
Figure 5cablation-temporal-pe.png消融:时间位置编码
Figure 5dablation-imagenet-pretrain.png消融:ImageNet 预训练
Figure 5eablation-sampling-interval.png消融:视频采样间隔
Figure 5fablation-model-variants.png消融:四种模型变体
Figure 7model-size-scaling.png不同规模 Latte 性能缩放