Back to blog

MagicVideo: Efficient Video Generation With Latent Diffusion Models

字节跳动提出的首个基于潜空间扩散模型(LDM)的高效文生视频框架。通过在低维潜空间建模视频分布、复用文生图模型的 2D 卷积权重、引入帧级轻量 adaptor 与有向时序注意力,MagicVideo 在单卡上生成 256×256 视频,FLOPs 较 VDM 减少约 64×。

MagicVideo:基于潜空间扩散模型的高效视频生成

一、论文概述

项目内容
标题MagicVideo: Efficient Video Generation With Latent Diffusion Models
作者Daquan Zhou*, Weimin Wang*, Hanshu Yan*, Weiwei Lv, Yizhe Zhu, Jiashi Feng
机构ByteDance Inc.(字节跳动)
论文arXiv:2211.11018
发布2022-11-20
领域计算机视觉(cs.CV)、文生视频、扩散模型
项目主页MagicVideo Demo

一句话概括

MagicVideo 是首个基于潜空间扩散模型(Latent Diffusion Model, LDM)的文生视频框架。它不在 RGB 像素空间训练视频模型,而是先用 VAE 把视频压缩到低维潜空间再做扩散,从而把单帧生成计算量降低约 64×;同时提出帧级轻量 adaptor(复用文生图模型的 2D 卷积权重)与有向时序注意力(directed temporal attention)来适配图像 U-Net 到视频,并用 VideoVAE 解码器消除逐帧解码带来的像素抖动(dithering)。最终可在单卡 GPU 上生成 256×256 视频,并超分至 1024×1024。

历史地位:这是 2022 年末视频扩散浪潮中与 Imagen Video、Make-A-Video 同期的工作,但率先将 LDM 思想引入视频生成,为后续 latent video diffusion(如 Video LDM、AnimateDiff、SVD 等)奠定了「潜空间 + 复用图像先验」的范式基础。


二、核心思想

问题定义

用扩散模型做视频生成面临三大难题:

  1. 数据稀缺(Data scarcity):带精确文本描述的视频远少于图文对;且视频含大量与文本无关的冗余片段。
  2. 复杂时序动态(Complex temporal dynamics):视频跨帧内容多样、动态复杂,比静态图像分布建模难得多。
  3. 高计算成本(High computation cost):一段流畅视频可能上百帧,直接生成整段视频消耗巨大。现有级联式(cascaded)像素空间视频扩散模型(如 VDM)生成 16 帧 64×64 视频需 6–10 秒、75GB 显存/迭代。

核心问题:如何在数据、计算双重受限下,高效训练出高质量、时序一致的文生视频模型?

解决方案概述

MagicVideo 的思路可概括为「潜空间建模 + 复用图像先验 + 轻量时序适配」:

  1. 潜空间建模:用预训练 VAE 把视频帧映射到 8× 下采样的低维潜空间,扩散在潜空间进行,单帧计算量约降 64×。
  2. 复用文生图先验:用「2D 卷积 + adaptor」替代 3D/(2+1)D 卷积,使 2D 卷积可直接用预训练 LDM(Stable Diffusion)权重初始化,即使少量视频数据也能学会生成。
  3. 有向时序注意力:用因果掩码(下三角)的自注意力建模视频运动的方向性,优于双向注意力。
  4. VideoVAE 解码器:在解码器加时序注意力层,消除逐帧解码的像素抖动。
  5. 两阶段生成流水线:关键帧生成 → 帧插值 → VideoVAE 解码回 RGB → 超分至 1024×1024。

三、技术架构

整体框架图

MagicVideo 整体框架

Figure 2:MagicVideo 整体框架。(a) 训练/推理数据流:训练时从 [0,T][0,T] 随机采样时间步 tt,对输入视频帧做扩散加噪,U-Net decoder 学习重建;推理时随机采样高斯噪声,重复去噪 TT 次,去噪后的潜向量 z\bm{z} 送入 VAE decoder 转回 RGB。(b) 时空注意力(ST-Attn)模块结构。(c) ST-Attn 中使用的有向注意力(directed attention)。

推理流程:

文本 prompt ──CLIP──> 文本嵌入 τ(y)
                            │ (cross-attn 条件)
随机噪声 ──> [3D U-Net 去噪 ×T] ──> 关键帧潜向量 (16 帧)
                            │
                     [帧插值网络] ──> 加密帧序列 (每对相邻帧插 3 帧)
                            │
                   [VideoVAE decoder] ──> 256×256 RGB 视频
                            │
                  [扩散超分 SR 模型] ──> 1024×1024 高清视频

符号约定(Notation)

  • xt=[xt1,...,xtF]\bm{x}_t = [\bm{x}_t^1, ..., \bm{x}_t^F]:时间步 tt 加噪的视频帧序列,xti\bm{x}_t^i 为第 ii 帧。
  • E(⋅),D(⋅)\mathcal{E}(\cdot), \mathcal{D}(\cdot):VideoVAE 编码器/解码器;逐帧映射 zt=[E(xt1),...,E(xtF)]\bm{z}_t = [\mathcal{E}(\bm{x}_t^1), ..., \mathcal{E}(\bm{x}_t^F)]。
  • τ(y)\tau(\bm{y}):CLIP 编码的文本 prompt 嵌入。
  • ϵθ(zt,t,τ(y))\epsilon_\theta(\bm{z}_t, t, \tau(\bm{y})):潜空间扩散模型的去噪器。

核心公式

1. 视频分布 Adaptor(Video Distribution Adaptor)

将 “2D+1D” 卷积进一步简化为 “2D + adaptor”。对 FF 帧共享同一 2D 卷积提取空间特征后,逐帧调整均值与方差:

\bm{z}^i_t = S^i \cdot \text{Conv2d}(\bm{z}^i_t) + B^i \tag{1}

其中 S,B∈RF×CS, B \in \mathbb{R}^{F \times C} 是两组可学习参数(仅少量标量)。灵感来自「同一视频片段内各帧语义相似」——帧间微小差异不必用专门的 1D 卷积建模,用一小组参数即可捕捉。这既省算力,又让模型能复用图像 2D 卷积权重。

2. 空间 + 时序双注意力(并行)

在 U-Net 下采样块(空间分辨率降 4×/8×/16×)后,并行做空间与时序注意力,输出相加:

\bm{z}_t = \text{S-Attn}(\bm{z}_{t-1}) + \text{T-Attn}(\bm{z}_{t-1}) \tag{2}

空间注意力(含文本 cross-attention):

\text{S-Attn} = \text{Cross-Attn}(\text{LN}(\text{MHSA}(\text{LN}(\bm{z}_{t-1}))), \tau(\bm{y})) \tag{3}

3. 有向时序注意力(Directed Temporal Attention)★核心创新

将 zt∈RF×C×H×W\bm{z}_t \in \mathbb{R}^{F \times C \times H \times W} reshape 为 HW×#Heads×F×C#HeadsHW \times \#Heads \times F \times \frac{C}{\#Heads},把每帧每像素当作 token,对相同空间位置跨帧做注意力:

A_t = \text{Softmax}(Q_t K_t^\top / \sqrt{d}) \odot M \tag{4}

其中 MM 是下三角掩码:Mp,q=0M_{p,q}=0 if p>qp>q else 11。即当前帧 token 只受之前帧影响、不受未来帧影响,符合视频运动的方向性。这优于现有工作(VDM、Make-A-Video)普遍使用的双向时序注意力。

4. 训练目标与 FPS 嵌入

训练时先从每段视频随机采长度 LsL_s 的连续片段并读取 FPS,再从中均匀采 16 帧。用 ν=16Ls⋅FPS\nu = \frac{16}{L_s} \cdot \text{FPS} 表征运动速度(LsL_s 越长场景变化越快),并编码为嵌入:

\text{emb}_\nu = \text{Linear}(\text{SiLU}(\text{Linear}(\text{Sin}(\nu)))) \tag{5}

embν∈RC\text{emb}_\nu \in \mathbb{R}^C 加到视频帧特征上。

逐帧重建损失:

\mathcal{L}(\bm{z}_0) = \mathbb{E}_t \sum_{i=0}^{F} \|\bm{z}_0^i - \epsilon_\theta(\bm{z}_t^i, t, \bm{y})\|_2^2 \tag{6}

模型组件

组件说明关键设计
3D U-Net 去噪器关键帧生成核心;用预训练 LDM 权重初始化 2D 卷积2D Conv + adaptor 替代 3D/(2+1)D
Video Distribution Adaptor逐帧调整特征均值/方差,捕捉帧间微差仅 S,B∈RF×CS,B \in \mathbb{R}^{F\times C} 少量参数
ST-Attn(空间+有向时序注意力)空间注意力保内容多样性,时序注意力保跨帧一致性并行相加;时序含因果掩码
帧插值网络相邻关键帧间插 3 帧提升时间分辨率潜空间训练,条件为相邻两帧 CLIP 嵌入+潜码拼接;用关键帧模型初始化
VideoVAE decoder消除逐帧解码的像素抖动解码器加 2 层有向时序注意力
超分 SR 模型256×256 → 1024×1024RGB 空间扩散 SR,仅用图像数据训练 + 噪声条件增强

训练流程(两阶段)

  1. 无监督预训练:文本-视频对稀缺,故用 CLIP 视觉编码器提取的视频帧嵌入作为文本条件的代理(proxy)进行预训练(借鉴 Make-A-Video)。数据:HD-VILA-100M 与 Webvid-10M 的 10M 子集。
  2. 有监督微调:在自采 7M 视频-文本对上微调。两阶段用相同目标(Eqn.6)。
    • 初始化:用 Laion-5B 预训练的 LDM 权重初始化 3D U-Net。

四、核心创新

创新点说明理论/实验依据
首个 LDM 文生视频框架在低维潜空间做视频扩散,单帧计算量降约 64×FLOPs 较 VDM 减少 ~64×
2D+adaptor 替代 3D 卷积复用文生图 2D 卷积权重,少量视频数据即可训练消融显示 adaptor 既省算力又提升质量
有向时序注意力因果下三角掩码建模运动方向性消融显示可大幅降低 FVD
VideoVAE 解码器解码器加时序注意力消除像素抖动Fig.3 定性对比 vs 传统 VAE
无监督预训练策略CLIP 视觉嵌入代理文本条件FVD 进一步降低约 60
FPS 运动速度嵌入显式编码运动快慢作为条件Eqn.5

五、实验结果

数据集与设置

  • 初始化:Laion-5B 预训练 LDM 权重。
  • 无监督预训练:HD-VILA-100M + Webvid-10M 的 10M 子集。
  • 有监督微调:自采 7M 视频-文本对。
  • 评估:在 UCF-101、MSR-VTT 测试集上**零样本(zero-shot)**评估 FID/FVD。

基准测试

Table 1 — MSR-VTT 视频生成评估:

方法Zero-ShotFID ↓FVD ↓
NÜWANo47.7-
CogVideoYes49.01294
MagicVideo (ours)Yes36.5998

Table 2 — UCF-101 视频生成评估:

方法Zero-ShotFID ↓FVD ↓
MoCoGAN-HDNo-700
CogVideo (Chinese)Yes185751
CogVideo (English)Yes179702
MagicVideo (ours)Yes145655

MagicVideo 在两个基准上 FID/FVD 均优于 CogVideo。

Table 3 — 人工评估(DrawBench,200 prompts,vs CogVideo):

数值为 MagicVideo 结果优于或等于 CogVideo 的样本百分比。

RealismFaithfulnessSmoothnessTime cost (mins/16帧)
68%86%96%0.3 vs 21

MagicVideo 各维度显著优于 CogVideo,且生成 16 帧仅需 0.3 分钟 vs CogVideo 21 分钟(约 70× 加速)。

定性对比

与 SOTA 方法定性对比

Figure 5:与 VDM、CogVideo、Make-A-Video 对比。输入 “Busy freeway at night” 时,CogVideo/VDM 只生成模糊的运动流抽象场景,而 MagicVideo 能生成带车灯的清晰高速公路车辆,甚至呈现近大远小的透视关系。

消融实验

各组件对 FVD 的影响

Figure 7:各组件对性能(FVD)的影响。在 Webvid-10M 测试集 1000 段视频(每段 16 帧)上评估:

  • 有向注意力(directed attention):大幅降低 FVD。
  • Adaptor:既省计算又提升生成质量。
  • 无监督预训练:FVD 进一步降低约 60。

空间 vs 时序注意力可视化

空间注意力效果 时序注意力效果

Figure 4:分别可视化两个分支特征。空间注意力帮助生成多样化的帧内容;时序注意力保证跨帧一致性。两者结合兼顾内容多样性与一致性。

VideoVAE 消除抖动

VideoVAE 消除像素抖动

Figure 3:(a) VideoVAE 解码相比传统逐帧 VAE 能有效减少像素抖动伪影;(b) VideoVAE 解码器架构(低维潜特征 + 2 层有向时序注意力)。作者发现抖动与潜特征空间维度相关:维度越高抖动越少,但计算成本升高——VideoVAE 用时序注意力在保持低维的同时消除抖动。

应用扩展

MagicVideo 应用

Figure 6:基于 MagicVideo 的三类应用(绿框为源图/视频帧):(a) 视频变体(video variation);(b) 视频编辑——给定行驶巴士视频,用 “candies falling onto the ground” 文本编辑;(c) 图生视频——给定单张图像生成相关短视频。


六、相关工作

方法空间关键差异
VDM [Ho et al.]RGB 像素3D U-Net,级联超分;计算成本极高(75GB/迭代)
Imagen VideoRGB 像素基础文生视频 + 3 个时空超分模块
Make-A-Video(并发工作)RGB 像素先文生图嵌入 → 低分辨率视频 → 超分;双向时序注意力
CogVideo自回归 Transformer大规模预训练,条件于文本+前帧;速度慢
LDM (Stable Diffusion)潜空间(图像)MagicVideo 的基础,扩展到视频
MagicVideo(本文)潜空间(视频)首个 LDM 视频框架;2D+adaptor 复用图像先验;有向时序注意力

关键区别:Imagen Video 与 Make-A-Video 都在 RGB 空间建模视频分布;MagicVideo 在低维潜空间建模,效率显著更高。


七、总结

核心贡献

  1. 提出首个基于潜空间扩散模型的文生视频框架 MagicVideo,单帧计算量较像素空间 VDM 降约 64×,可在单卡生成 256×256 视频。
  2. 提出 2D 卷积 + 轻量 adaptor 设计,复用预训练文生图模型权重,缓解视频数据稀缺问题。
  3. 提出有向时序注意力(因果掩码),更好建模视频运动方向性。
  4. 提出 VideoVAE 解码器,消除逐帧解码的像素抖动伪影。
  5. 在 MSR-VTT/UCF-101 零样本 FID/FVD 及人工评估上均超越 CogVideo,且速度快约 70×。

技术影响

  • 奠定 latent video diffusion 范式:证明「潜空间扩散 + 复用图像先验」在视频生成上高效可行,直接启发后续 Video LDM、AnimateDiff、Stable Video Diffusion 等一系列 latent video diffusion 工作。
  • 参数高效适配:adaptor + 2D 卷积复用的思路对「图像模型→视频模型」的低成本迁移具有普适价值。
  • 有向注意力:为视频时序建模引入方向性归纳偏置。

局限性

  • 关键帧仅 16 帧,需插值 + 超分级联,长视频生成仍受限。
  • 超分 SR 仅用图像数据训练(缺高分辨率视频数据),时序一致性依赖前级。
  • 依赖 Stable Diffusion 预训练权重,可能继承 LAION 数据集的伦理问题。
  • 生成视频可能被用于恶意编辑(deepfake),需配合检测技术。

八、参考资源

  • 论文:arXiv:2211.11018
  • PDF:arXiv PDF
  • HTML(ar5iv):ar5iv 渲染版
  • 项目主页:https://magicvideo.github.io/
  • 基础工作:LDM/Stable Diffusion (2112.10752)、VDM (2204.03458)、Make-A-Video (2209.14792)、Imagen Video (2210.02303)
  • 引用:Zhou, D., Wang, W., Yan, H., Lv, W., Zhu, Y., & Feng, J. (2022). MagicVideo: Efficient Video Generation With Latent Diffusion Models. arXiv:2211.11018.

附录:论文图表索引

图文件说明
Figure 2architecture-overview.pngMagicVideo 整体框架(数据流 + ST-Attn + 有向注意力)
Figure 3videovae.pngVideoVAE 消除像素抖动 + 解码器架构
Figure 4 (a)attention-effects-spatial.png空间注意力效果(内容多样性)
Figure 4 (b)attention-effects-temporal.png时序注意力效果(跨帧一致性)
Figure 5qualitative-comparison.png与 VDM/CogVideo/Make-A-Video 定性对比
Figure 6applications.png三类应用(视频变体/编辑/图生视频)
Figure 7ablation-fvd.png各组件对 FVD 的消融影响