Back to blog

Improved Video VAE for Latent Video Diffusion Model

ByteDance/Tongyi Lab's IV-VAE introduces Keyframe-based Temporal Compression and Group Causal Convolution to achieve SOTA video reconstruction with balanced inter-frame performance

Improved Video VAE for Latent Video Diffusion Model (IV-VAE)

一、论文概述

项目内容
标题Improved Video VAE for Latent Video Diffusion Model
作者Pingyu Wu, Kai Zhu*, Yu Liu, Liming Zhao, Wei Zhai*, Yang Cao, Zheng-Jun Zha
机构中国科学技术大学, 通义实验室 (ByteDance)
论文https://arxiv.org/abs/2411.06449
项目页https://wpy1999.github.io/IV-VAE/
发布arXiv:2411.06449v1 [cs.CV], Nov 10, 2024

二、核心思想

问题定义

视频变分自编码器(Video VAE)在潜空间视频扩散模型(如 SVD, Open-Sora, Latte)中扮演关键角色,负责将高维像素数据压缩到低维潜空间。现有方法普遍采用以下三个步骤:

  1. 基于 UNet 网络结构,继承 SD 图像 VAE 架构
  2. 使用 3D 因果卷积实现时空压缩
  3. 以预训练的 2D 图像 VAE(同维度)作为初始化

本文通过两个关键发现揭示了这些方法的缺陷:

发现 1:以同维度预训练图像 VAE 初始化会抑制后续时序压缩能力的提升。随着潜在通道数 ZZ 增加,图像 VAE 带来的空间压缩收益递减。使用低维度 Z/2Z/2 的图像先验初始化反而收敛更好更快。

发现 2:因果卷积导致帧间信息交互不均衡——同一压缩组内,前面的帧无法与后续帧交互,最后一帧能获得整组信息,导致帧间性能不平衡和闪烁伪影。

解决方案概述

提出 IV-VAE(Improved Video VAE),包含两大核心创新:

  1. Keyframe-based Temporal Compression (KTC):双分支架构,2D 分支继承低维图像先验负责关键帧空间压缩,3D 分支通过组因果卷积进行时序压缩
  2. Group Causal Convolution (GCConv):将输入帧按压缩率分组,组内使用标准卷积保证帧间等价交互,组间使用因果逻辑填充保持因果性

三、技术架构

整体框架

IV-VAE 基本单元 (KTC Unit):

输入特征 F (C_in channels)
  ├─ 2D Branch ─→ Conv2D (C_out/2 channels) ─→ RMSNorm ─┐
  │                                                       ├── Concat ─→ 输出
  └─ 3D Branch ─→ GCConv3D (C_out/2 channels) ─→ RMSNorm ─┘

初始化策略:
  2D Branch: 预训练图像 VAE 权重 (latent dim = Z/2)
  3D Branch: 中心初始化 (center initialization) 膨胀 2D → 3D
GCConv 时间填充方案 (tc=4):

Frame Group 1: [pad][F1][F2][F3][F4] → zero pad
Frame Group 2:          [pad][F5][F6][F7][F8] → zero pad
Frame Group 3:                  [pad][F9][F10][F11][F12] → zero pad

其中 pad = 前一组的最后一个帧特征

核心公式

1. Group Causal Convolution

对于时间压缩率 tct_c(本文 tc=4t_c=4),每 tct_c 帧分为一组。第一帧单独成组。

帧组内:使用标准卷积(双向交互) 帧组间:因果逻辑填充

pad=last frame of previous group,after each group: zero pad\text{pad} = \text{last frame of previous group}, \quad \text{after each group: zero pad}

2. Keyframe-based Temporal Compression (KTC)

双分支特征融合:

Fout=Concat(RMSNorm(Conv2D(F)),RMSNorm(GCConv3D(F)))F_{\text{out}} = \text{Concat}(\text{RMSNorm}(\text{Conv2D}(F)), \text{RMSNorm}(\text{GCConv3D}(F)))

初始化阶段:

  • 2D 分支权重:预训练图像 VAE (Z/2Z/2 通道)
  • 3D 分支权重:中心初始化膨胀(Carreira & Zisserman, 2017)

初始即具备 2×2\times 时序压缩能力,可独立处理帧组内不同帧。

3. Temporal Motion Perception Enhancement (TMPE)

并行空洞卷积 (PAC),借鉴 DeepLabV3+ ASPP:

Fatrous=Conv1×1(Concat(Fr1,Fr2,Fr3))F_{\text{atrous}} = \text{Conv}_{1\times1}\left(\text{Concat}(F_{r_1}, F_{r_2}, F_{r_3})\right)

其中 rir_i 为不同的空洞率(atrous rate)。

注意力模块从 2 个扩展到 7 个,全部在完整时空压缩后实施。

4. 信息保留度度量

Info Preservation=1−∑i=1m∥xi−xi′∥∑i=1m∥xi∥\text{Info Preservation} = 1 - \frac{\sum_{i=1}^{m} \|x_i - x'_i\|}{\sum_{i=1}^{m} \|x_i\|}

其中 xix_i 为原始视频,xi′x'_i 为重建视频,mm 为样本数。

5. 训练损失

Ltotal=LKL+LMAE+LLPIPS+λ⋅LGAN\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{KL}} + \mathcal{L}_{\text{MAE}} + \mathcal{L}_{\text{LPIPS}} + \lambda \cdot \mathcal{L}_{\text{GAN}}

模型组件

组件说明关键参数
KTC Unit双分支基本单元,2D+3D 卷积2D: Z/2Z/2 ch, 3D: Z/2Z/2 ch
GCConv3D组因果卷积,组内标准卷积+组间因果填充压缩率 tc=4t_c=4
PAC (并行空洞卷积)TMPE 模块的最后层,扩张感受野多空洞率并行
RMSNorm替代 GroupNorm,保证时间因果性—
Attention (7 个)全时空压缩后的全局注意力压缩帧上操作
3D DiscriminatorGAN 训练的多尺度判别器Stage 3 加入

训练流程

四阶段训练:

阶段数据分辨率迭代次数损失函数GPU
1. 图像 VAEImageNet 图像256×256200KKL + MAE + LPIPS4×A800
2. 视频 VAE (低分辨率)17帧视频256×256500KKL + MAE + LPIPS—
3. 视频 VAE (中分辨率)17帧视频512×512200K+ GAN Loss—
4. 多分辨率微调多变帧数/分辨率480P–1080P100K+ 加权 GAN Loss—

基础通道数:IV-VAE 设为 64(2D 和 3D 各 64),基线 Causal VAE 为 96。

四、核心创新

创新点说明理论/实验依据
KTC 双分支架构用 Z/2Z/2 低维图像先验初始化,剩余通道用于时序压缩Fig.1(a): Z/2Z/2 先验收敛优于 ZZ 先验
GCConv 组因果卷积组内标准卷积保证帧间等价,组间因果填充保持因果性Fig.1(b): 消除帧间 SSIM 波动,减少闪烁
TMPE 时序运动感知增强并行空洞卷积 + 扩展注意力模块到 7 个Table 2: 分辨率越高优势越明显
Cache 推理机制利用因果性保存最后 PtP_t 帧特征用于下一 clip 填充Table 7: 等效单步推理,内存和时间均优于 Overlap
MotionHD 数据集从 OpenVid-0.4M 选取 2000 个 1080P 视频,覆盖多种运动速度填补高分辨率 + 多变运动基准的空白

五、代码实现分析

架构基础:基于 SD 图像 VAE 的 UNet 结构

关键实现细节:

  • 所有 GroupNorm 替换为 RMSNorm(保证时间因果性)
  • 空间上采样期间缩小通道数(而非在后继残差块),480P 重建显存降低 29%
  • 注意力模块数量从 2 扩展到 7,均在完整时空压缩后实施
  • 第一帧独立处理(单独帧组)
  • 每层下采样/上采样时,帧组内帧数同步增减

六、实验结果

基准测试

Table 1: Kinetics-600 和 ActivityNet 重建对比

方法参数量压缩率ChnK600 FVD↓K600 PSNR↑K600 SSIM↑K600 LPIPS↓ANet FVD↓ANet PSNR↑
SVD VAE97M1×8×846.2635.260.93630.036755.4737.07
OD-VAE239M4×8×8410.6933.880.92420.054858.1036.95
IV-VAE107M4×8×848.0134.290.92810.052096.0838.47
IV-VAE107M4×8×883.9436.660.95200.035993.5039.61
IV-VAE108M4×8×8162.9739.020.96850.022802.0142.61

IV-VAE 在所有通道数设置下均取得最佳 FVD 和 LPIPS 指标,参数量仅为 CogX-VAE 的一半。

Table 2: MotionHD 多分辨率对比

方法Chn480P FVD↓720P FVD↓1080P FVD↓1080P PSNR↑
CogX-VAE163.503.662.2638.68
IV-VAE (Z=16, dim=64)162.582.782.1840.33
IV-VAE (Z=16, dim=96)162.182.341.9541.02

分辨率越高,IV-VAE 优势越明显(1080P PSNR 比 CogX-VAE 高 1.65dB)。

视频生成质量

Table 3: Latte 扩散模型生成 FVD

方法Kinetics-400 FVD↓SkyTimelapse FVD↓
CV-VAE552.4128.0
OS-VAE617.6141.3
OD-VAE548.7140.0
IV-VAE541.6118.6

SkyTimelapse 上 IV-VAE 比 CV-VAE 降低 9.4 FVD。

消融实验

Table 4: 各组件消融

设置GCConvKTCTMPEPSNR↑SSIM↑LPIPS↓
(A) Baseline✗✗✗31.290.90420.05233
(B) +GCConv✓✗✗31.640.90820.05028
(C) +KTC✗✓✗31.860.91160.04865
(D) +GCConv+KTC✓✓✗32.120.91450.04744
(E) Full✓✓✓32.240.91580.04725

Cache vs Overlap 推理机制

Table 7: 长视频推理效率 (49帧 1024×1024)

方法切片策略显存时间
单步49帧×176.3G12.7s
Overlap5帧×1214.3G14.7s
Cache1帧+4帧×1214.1G13.0s

Cache 机制等效于单步推理结果,同时显存和时间均优于 Overlap。

七、相关工作

工作关系
SVD-VAE (Blattmann et al., 2023)冻结 2D 编码器 + 重训 3D 解码器,无法有效时序压缩
Open-Sora VAE (hpcaitech, 2024)3D 因果卷积,同维度图像 VAE 初始化
OD-VAE (Chen et al., 2024a)Omni-dimensional 视频压缩,尾部初始化膨胀
CogVideoX VAE (Yang et al., 2024)多 GPU 并行因果视频 VAE
CV-VAE (Zhao et al., 2024)潜在空间正则化防止分布偏移
MagVITv2 (Yu et al., 2023b)3D 因果 VAE + 离散 token,启发 IV-VAE 因果设计
DC-AE (Chen et al., 2025)深度压缩图像 VAE,FSVideo 的起点

八、总结

核心贡献

  1. 两个关键发现:同维度图像 VAE 初始化抑制时序压缩;因果卷积导致帧间性能不平衡
  2. KTC 架构:双分支(2D+3D)解耦关键帧空间压缩与时序运动压缩,加速收敛
  3. GCConv:组内标准卷积 + 组间因果填充,平衡帧间性能同时保持因果性
  4. TMPE:并行空洞卷积 + 扩展注意力,增强高分辨率时序运动感知
  5. MotionHD 数据集:首个覆盖多种运动速度的 1080P 视频重建基准
  6. Cache 推理机制:等效单步推理的长视频分段编码策略

技术影响

  • IV-VAE 为 latent video diffusion models 提供了更高效的视频压缩方案,在更少参数下实现 SOTA 重建质量
  • GCConv 解决了因果卷积的帧间不均衡问题,可应用于任何基于因果卷积的视频 VAE
  • KTC 初始化策略启发了后续工作(如 FSVideo 采用类似的双分支思路)

局限性

  1. 架构仍基于 UNet:未探索 DiT 或 Mamba 等新架构,UNet 缺乏全局感受野
  2. 空间下采样受限于压缩比:空间下采样数与空间压缩率对齐,进一步限制感受野
  3. 仅评估到 1080P:更高视频分辨率的编码策略仍有探索空间

九、参考资源

  • arXiv: https://arxiv.org/abs/2411.06449
  • Project Page: https://wpy1999.github.io/IV-VAE/
  • SVD: Blattmann et al., “Stable Video Diffusion”, 2023
  • MagVITv2: Yu et al., “Language Model Beats Diffusion – Tokenizer is Key to Visual Generation”, 2023
  • OD-VAE: Chen et al., “Omni-dimensional Video Compressor”, 2024
  • DC-AE: Chen et al., “Deep Compression Autoencoder for Image Generation”, 2025
  • FSVideo: Huang et al., “Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space”, 2026