Improved Video VAE for Latent Video Diffusion Model
ByteDance/Tongyi Lab's IV-VAE introduces Keyframe-based Temporal Compression and Group Causal Convolution to achieve SOTA video reconstruction with balanced inter-frame performance
Improved Video VAE for Latent Video Diffusion Model (IV-VAE)
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | Improved Video VAE for Latent Video Diffusion Model |
| 作者 | Pingyu Wu, Kai Zhu*, Yu Liu, Liming Zhao, Wei Zhai*, Yang Cao, Zheng-Jun Zha |
| 机构 | 中国科学技术大学, 通义实验室 (ByteDance) |
| 论文 | https://arxiv.org/abs/2411.06449 |
| 项目页 | https://wpy1999.github.io/IV-VAE/ |
| 发布 | arXiv:2411.06449v1 [cs.CV], Nov 10, 2024 |
二、核心思想
问题定义
视频变分自编码器(Video VAE)在潜空间视频扩散模型(如 SVD, Open-Sora, Latte)中扮演关键角色,负责将高维像素数据压缩到低维潜空间。现有方法普遍采用以下三个步骤:
- 基于 UNet 网络结构,继承 SD 图像 VAE 架构
- 使用 3D 因果卷积实现时空压缩
- 以预训练的 2D 图像 VAE(同维度)作为初始化
本文通过两个关键发现揭示了这些方法的缺陷:
发现 1:以同维度预训练图像 VAE 初始化会抑制后续时序压缩能力的提升。随着潜在通道数 增加,图像 VAE 带来的空间压缩收益递减。使用低维度 的图像先验初始化反而收敛更好更快。
发现 2:因果卷积导致帧间信息交互不均衡——同一压缩组内,前面的帧无法与后续帧交互,最后一帧能获得整组信息,导致帧间性能不平衡和闪烁伪影。
解决方案概述
提出 IV-VAE(Improved Video VAE),包含两大核心创新:
- Keyframe-based Temporal Compression (KTC):双分支架构,2D 分支继承低维图像先验负责关键帧空间压缩,3D 分支通过组因果卷积进行时序压缩
- Group Causal Convolution (GCConv):将输入帧按压缩率分组,组内使用标准卷积保证帧间等价交互,组间使用因果逻辑填充保持因果性
三、技术架构
整体框架
IV-VAE 基本单元 (KTC Unit):
输入特征 F (C_in channels)
├─ 2D Branch ─→ Conv2D (C_out/2 channels) ─→ RMSNorm ─┐
│ ├── Concat ─→ 输出
└─ 3D Branch ─→ GCConv3D (C_out/2 channels) ─→ RMSNorm ─┘
初始化策略:
2D Branch: 预训练图像 VAE 权重 (latent dim = Z/2)
3D Branch: 中心初始化 (center initialization) 膨胀 2D → 3D
GCConv 时间填充方案 (tc=4):
Frame Group 1: [pad][F1][F2][F3][F4] → zero pad
Frame Group 2: [pad][F5][F6][F7][F8] → zero pad
Frame Group 3: [pad][F9][F10][F11][F12] → zero pad
其中 pad = 前一组的最后一个帧特征
核心公式
1. Group Causal Convolution
对于时间压缩率 (本文 ),每 帧分为一组。第一帧单独成组。
帧组内:使用标准卷积(双向交互) 帧组间:因果逻辑填充
2. Keyframe-based Temporal Compression (KTC)
双分支特征融合:
初始化阶段:
- 2D 分支权重:预训练图像 VAE ( 通道)
- 3D 分支权重:中心初始化膨胀(Carreira & Zisserman, 2017)
初始即具备 时序压缩能力,可独立处理帧组内不同帧。
3. Temporal Motion Perception Enhancement (TMPE)
并行空洞卷积 (PAC),借鉴 DeepLabV3+ ASPP:
其中 为不同的空洞率(atrous rate)。
注意力模块从 2 个扩展到 7 个,全部在完整时空压缩后实施。
4. 信息保留度度量
其中 为原始视频, 为重建视频, 为样本数。
5. 训练损失
模型组件
| 组件 | 说明 | 关键参数 |
|---|---|---|
| KTC Unit | 双分支基本单元,2D+3D 卷积 | 2D: ch, 3D: ch |
| GCConv3D | 组因果卷积,组内标准卷积+组间因果填充 | 压缩率 |
| PAC (并行空洞卷积) | TMPE 模块的最后层,扩张感受野 | 多空洞率并行 |
| RMSNorm | 替代 GroupNorm,保证时间因果性 | — |
| Attention (7 个) | 全时空压缩后的全局注意力 | 压缩帧上操作 |
| 3D Discriminator | GAN 训练的多尺度判别器 | Stage 3 加入 |
训练流程
四阶段训练:
| 阶段 | 数据 | 分辨率 | 迭代次数 | 损失函数 | GPU |
|---|---|---|---|---|---|
| 1. 图像 VAE | ImageNet 图像 | 256×256 | 200K | KL + MAE + LPIPS | 4×A800 |
| 2. 视频 VAE (低分辨率) | 17帧视频 | 256×256 | 500K | KL + MAE + LPIPS | — |
| 3. 视频 VAE (中分辨率) | 17帧视频 | 512×512 | 200K | + GAN Loss | — |
| 4. 多分辨率微调 | 多变帧数/分辨率 | 480P–1080P | 100K | + 加权 GAN Loss | — |
基础通道数:IV-VAE 设为 64(2D 和 3D 各 64),基线 Causal VAE 为 96。
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| KTC 双分支架构 | 用 低维图像先验初始化,剩余通道用于时序压缩 | Fig.1(a): 先验收敛优于 先验 |
| GCConv 组因果卷积 | 组内标准卷积保证帧间等价,组间因果填充保持因果性 | Fig.1(b): 消除帧间 SSIM 波动,减少闪烁 |
| TMPE 时序运动感知增强 | 并行空洞卷积 + 扩展注意力模块到 7 个 | Table 2: 分辨率越高优势越明显 |
| Cache 推理机制 | 利用因果性保存最后 帧特征用于下一 clip 填充 | Table 7: 等效单步推理,内存和时间均优于 Overlap |
| MotionHD 数据集 | 从 OpenVid-0.4M 选取 2000 个 1080P 视频,覆盖多种运动速度 | 填补高分辨率 + 多变运动基准的空白 |
五、代码实现分析
架构基础:基于 SD 图像 VAE 的 UNet 结构
关键实现细节:
- 所有 GroupNorm 替换为 RMSNorm(保证时间因果性)
- 空间上采样期间缩小通道数(而非在后继残差块),480P 重建显存降低 29%
- 注意力模块数量从 2 扩展到 7,均在完整时空压缩后实施
- 第一帧独立处理(单独帧组)
- 每层下采样/上采样时,帧组内帧数同步增减
六、实验结果
基准测试
Table 1: Kinetics-600 和 ActivityNet 重建对比
| 方法 | 参数量 | 压缩率 | Chn | K600 FVD↓ | K600 PSNR↑ | K600 SSIM↑ | K600 LPIPS↓ | ANet FVD↓ | ANet PSNR↑ |
|---|---|---|---|---|---|---|---|---|---|
| SVD VAE | 97M | 1×8×8 | 4 | 6.26 | 35.26 | 0.9363 | 0.03675 | 5.47 | 37.07 |
| OD-VAE | 239M | 4×8×8 | 4 | 10.69 | 33.88 | 0.9242 | 0.05485 | 8.10 | 36.95 |
| IV-VAE | 107M | 4×8×8 | 4 | 8.01 | 34.29 | 0.9281 | 0.05209 | 6.08 | 38.47 |
| IV-VAE | 107M | 4×8×8 | 8 | 3.94 | 36.66 | 0.9520 | 0.03599 | 3.50 | 39.61 |
| IV-VAE | 108M | 4×8×8 | 16 | 2.97 | 39.02 | 0.9685 | 0.02280 | 2.01 | 42.61 |
IV-VAE 在所有通道数设置下均取得最佳 FVD 和 LPIPS 指标,参数量仅为 CogX-VAE 的一半。
Table 2: MotionHD 多分辨率对比
| 方法 | Chn | 480P FVD↓ | 720P FVD↓ | 1080P FVD↓ | 1080P PSNR↑ |
|---|---|---|---|---|---|
| CogX-VAE | 16 | 3.50 | 3.66 | 2.26 | 38.68 |
| IV-VAE (Z=16, dim=64) | 16 | 2.58 | 2.78 | 2.18 | 40.33 |
| IV-VAE (Z=16, dim=96) | 16 | 2.18 | 2.34 | 1.95 | 41.02 |
分辨率越高,IV-VAE 优势越明显(1080P PSNR 比 CogX-VAE 高 1.65dB)。
视频生成质量
Table 3: Latte 扩散模型生成 FVD
| 方法 | Kinetics-400 FVD↓ | SkyTimelapse FVD↓ |
|---|---|---|
| CV-VAE | 552.4 | 128.0 |
| OS-VAE | 617.6 | 141.3 |
| OD-VAE | 548.7 | 140.0 |
| IV-VAE | 541.6 | 118.6 |
SkyTimelapse 上 IV-VAE 比 CV-VAE 降低 9.4 FVD。
消融实验
Table 4: 各组件消融
| 设置 | GCConv | KTC | TMPE | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|---|---|---|
| (A) Baseline | ✗ | ✗ | ✗ | 31.29 | 0.9042 | 0.05233 |
| (B) +GCConv | ✓ | ✗ | ✗ | 31.64 | 0.9082 | 0.05028 |
| (C) +KTC | ✗ | ✓ | ✗ | 31.86 | 0.9116 | 0.04865 |
| (D) +GCConv+KTC | ✓ | ✓ | ✗ | 32.12 | 0.9145 | 0.04744 |
| (E) Full | ✓ | ✓ | ✓ | 32.24 | 0.9158 | 0.04725 |
Cache vs Overlap 推理机制
Table 7: 长视频推理效率 (49帧 1024×1024)
| 方法 | 切片策略 | 显存 | 时间 |
|---|---|---|---|
| 单步 | 49帧×1 | 76.3G | 12.7s |
| Overlap | 5帧×12 | 14.3G | 14.7s |
| Cache | 1帧+4帧×12 | 14.1G | 13.0s |
Cache 机制等效于单步推理结果,同时显存和时间均优于 Overlap。
七、相关工作
| 工作 | 关系 |
|---|---|
| SVD-VAE (Blattmann et al., 2023) | 冻结 2D 编码器 + 重训 3D 解码器,无法有效时序压缩 |
| Open-Sora VAE (hpcaitech, 2024) | 3D 因果卷积,同维度图像 VAE 初始化 |
| OD-VAE (Chen et al., 2024a) | Omni-dimensional 视频压缩,尾部初始化膨胀 |
| CogVideoX VAE (Yang et al., 2024) | 多 GPU 并行因果视频 VAE |
| CV-VAE (Zhao et al., 2024) | 潜在空间正则化防止分布偏移 |
| MagVITv2 (Yu et al., 2023b) | 3D 因果 VAE + 离散 token,启发 IV-VAE 因果设计 |
| DC-AE (Chen et al., 2025) | 深度压缩图像 VAE,FSVideo 的起点 |
八、总结
核心贡献
- 两个关键发现:同维度图像 VAE 初始化抑制时序压缩;因果卷积导致帧间性能不平衡
- KTC 架构:双分支(2D+3D)解耦关键帧空间压缩与时序运动压缩,加速收敛
- GCConv:组内标准卷积 + 组间因果填充,平衡帧间性能同时保持因果性
- TMPE:并行空洞卷积 + 扩展注意力,增强高分辨率时序运动感知
- MotionHD 数据集:首个覆盖多种运动速度的 1080P 视频重建基准
- Cache 推理机制:等效单步推理的长视频分段编码策略
技术影响
- IV-VAE 为 latent video diffusion models 提供了更高效的视频压缩方案,在更少参数下实现 SOTA 重建质量
- GCConv 解决了因果卷积的帧间不均衡问题,可应用于任何基于因果卷积的视频 VAE
- KTC 初始化策略启发了后续工作(如 FSVideo 采用类似的双分支思路)
局限性
- 架构仍基于 UNet:未探索 DiT 或 Mamba 等新架构,UNet 缺乏全局感受野
- 空间下采样受限于压缩比:空间下采样数与空间压缩率对齐,进一步限制感受野
- 仅评估到 1080P:更高视频分辨率的编码策略仍有探索空间
九、参考资源
- arXiv: https://arxiv.org/abs/2411.06449
- Project Page: https://wpy1999.github.io/IV-VAE/
- SVD: Blattmann et al., “Stable Video Diffusion”, 2023
- MagVITv2: Yu et al., “Language Model Beats Diffusion – Tokenizer is Key to Visual Generation”, 2023
- OD-VAE: Chen et al., “Omni-dimensional Video Compressor”, 2024
- DC-AE: Chen et al., “Deep Compression Autoencoder for Image Generation”, 2025
- FSVideo: Huang et al., “Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space”, 2026