Back to blog

Movie Gen: 媒体基础模型全家桶

Meta 的 Movie Gen 媒体基础模型全家桶:30B 文生视频 + 13B 视频音频生成,Flow Matching + LLaMa3 风格 Transformer,支持 1080p HD 视频、同步音频、个性化与指令式视频编辑,多任务达到 SOTA。

Movie Gen: A Cast of Media Foundation Models

一、论文概述

项目内容
标题Movie Gen: A Cast of Media Foundation Models
机构Meta AI
论文https://arxiv.org/abs/2410.13720 (v2, 2025-02-26)
发布2024-10-17(v1),2025-02-26(v2)
分类cs.CV (Computer Vision and Pattern Recognition)
规模Movie Gen Video 30B / Movie Gen Audio 13B

摘要

Movie Gen 是一套基础模型全家桶(cast of foundation models),可生成高质量 1080p HD 视频(多种宽高比)+ 同步音频,并支持精确的指令式视频编辑、基于用户图像的个性化视频生成。模型在多个任务上刷新 SOTA:文生视频合成、视频个性化、视频编辑、视频到音频生成、文本到音频生成。

  • Movie Gen Video:最大 30B 参数 Transformer,最大上下文 73K 视频 token,对应 16fps 下 16 秒视频
  • Movie Gen Audio:13B 参数,视频/文本到音频生成,48kHz 电影级音效与音乐,支持数分钟长音频

论文公开了两个基准(Movie Gen Video Bench、Movie Gen Audio Bench)及架构、训练、推理、实验设置的详尽细节。

二、核心思想

核心理念:简单化 + 规模化

发现:用 Flow Matching 训练一个简单的、基于 Transformer 的模型,扩展训练数据、算力和模型参数,即可得到高质量的视频/音频生成模型。

设计哲学是刻意保持简单,所有组件(训练目标、骨干架构、TAE 时空压缩)都尽量简单并与 LLM(尤其是 LLaMa3)相似,从而能用类似 LLM 的技术自信地扩展模型规模与训练效率。经验上,该架构与专门设计的模块性能相当或更优,且训练更稳定。

五大能力

Movie Gen 能力概览

  1. 文生视频/图(单一联合模型,图像视为单帧视频)
  2. 视频个性化(PT2V,条件于人物图像 + 文本)
  3. 指令式精确视频编辑(Movie Gen Edit,无需监督编辑数据)
  4. 视频到音频生成(同步音效/音乐)
  5. 文本到音频生成

三、技术架构:Movie Gen Video (30B)

3.1 时序自编码器 (TAE)

TAE 变长编解码

  • 基于 VAE,将像素空间视频 V\mathbf{V}(T′×3×H′×W′T'\times 3 \times H' \times W')压缩到时空压缩潜空间,压缩比 8×8×8
  • 架构:沿用图像自编码器(Rombach et al. 2022)并”膨胀”——每个 2D 空间卷积后加 1D 时序卷积,每个空间注意力后加 1D 时序注意力;时序下采样用 stride=2 卷积,上采样用最近邻插值+卷积
  • Outlier Penalty Loss (OPL):标准目标会产生 “spot” 伪影(潜码某些空间位置范数过高,即 “latent dots”,属捷径学习)。不改架构,而是加惩罚项让潜值不偏离均值太远:

LOPL=1N∑max⁡(0,∣X∣−r⋅σ)\mathcal{L}_{\text{OPL}} = \frac{1}{N}\sum \max(0, |\mathbf{X}| - r \cdot \sigma)

其中 rr(默认 3)为标准差倍数阈值,加到 VAE 常规损失(重建+判别器+感知)上即可消除 dot 伪影。

分块推理

  • 时序分块推理 (Temporal Tiling):高分辨率长视频(如 1024×1024、256 帧)直接编解码内存不可行,故沿时间维度分块编解码后拼接。

3.2 训练目标:Flow Matching

采用 Flow Matching 框架,通过迭代将先验分布(高斯)样本变为目标数据分布样本。构造 Xt\mathbf{X}_t 用简单线性插值(最优传输路径):

Xt=tX1+(1−(1−σmin⁡)t)X0,σmin⁡=10−5\mathbf{X}_t = t\mathbf{X}_1 + (1 - (1-\sigma_{\min})t)\mathbf{X}_0, \quad \sigma_{\min}=10^{-5}

真值速度 Vt=dXtdt\mathbf{V}_t = \dfrac{d\mathbf{X}_t}{dt},模型预测速度 u(Xt,P,t)u(\mathbf{X}_t, \mathbf{P}, t),训练最小化 MSE:

L=E[∥Vt−u(Xt,P,t)∥2]\mathcal{L} = \mathbb{E}\left[\| \mathbf{V}_t - u(\mathbf{X}_t, \mathbf{P}, t) \|^2\right]

  • tt 从 logit-normal 分布采样(底层高斯零均值单位标准差)
  • 零终端 SNR:t=0t=0 时 SNR 为零,训练时模型接收纯高斯噪声并学习预测其速度
  • 推理:先采 X0∼N(0,1)\mathbf{X}_0 \sim \mathcal{N}(0,1),用 ODE solver 计算 X1\mathbf{X}_1

3.3 骨干架构(LLaMa3 风格)

Transformer 骨干与并行

  • 潜码 T×C×H×WT\times C\times H\times W 先经 3D 卷积 patchify 再展平为 1D 序列
  • 因子化可学习位置嵌入,支持任意尺寸/宽高比/时长
  • 骨干紧随 LLaMa3 Transformer block:RMSNorm + SwiGLU,对视频生成做三处修改:
    1. 在 self-attention 与 FFN 之间加 cross-attention 融入文本条件 P\mathbf{P}
    2. 加 adaptive layer norm 融入时间步 tt(沿用 DiT)
    3. 全双向注意力(非因果)

3.4 富文本嵌入

用三个互补文本编码器拼接构成 P\mathbf{P}:

  • UL2(语义级)
  • ByT5(字符级,用于视觉文本生成)
  • Long-prompt MetaCLIP

FPS 条件控制:在输入 prompt 前追加采样 FPS 值(如 “FPS-16”)控制生成视频长度;预训练用原始 FPS(≥16),微调用固定 16/24 FPS。

3.5 空间上采样器 (Spatial Upsampler)

空间上采样器

  • 独立 7B 模型,将 768px 视频转为全 HD (1080p),降低高分辨率生成的总计算成本(基础模型处理更少 token)
  • 形式化为视频到视频生成任务:低分辨率视频先双线性插值到目标分辨率 → VAE 编码 → 逐帧 VAE 解码
  • 从 1024px 文生图模型初始化
  • MultiDiffusion:滑窗上采样边界不一致问题用免训练优化解决

3.6 模型缩放与训练效率

  • 基础设施:最多 6,144 张 H100(700W TDP,80GB HBM3),Meta Grand Teton 平台;服务器内 8 GPU NVSwitch 互联,跨服务器 400Gbps RoCE RDMA
  • 上下文长度:768px 训练达 ~73K token(768×768、256 帧,经 TAE 8×8×8 + patchify 2×2 压缩)
  • 3D 并行:FSDP + 张量并行(TP) + 序列并行(SP) + 上下文并行(CP)
  • 与 LLM 对比:Movie Gen 用全双向注意力(无因果掩码),CP 的扩展特性因 Q 与 K,V 行为分离而不同于用 GQA 的 LLaMa3

3.7 预训练与微调

训练配方

  • 预训练数据:𝒪(100)M 视频 + 𝒪(1)B 图像

数据清洗流水线

  • 训练流程:先文生图预训练 → 联合文生图/文生视频预训练(渐进提高分辨率 256px→768px)
  • linear-quadratic t-schedule:加速推理的时间步调度

linear-quadratic 调度

  • 微调:在高质量视频集上微调(表 7 显示微调净胜率 +34.65% Overall Quality)
  • 推理:prompt 重写 + 提高推理效率

四、视频个性化 (Personalized Movie Gen Video, PT2V)

个性化架构

  • 条件于文本 + 人物图像生成保持身份的个性化视频
  • 用含人物的视频子集,自动构造 (图像, 文本)→视频 训练对
  • 后训练策略:预训练 + 监督微调

表 15:身份保持消融 —— 可训练视觉编码器显著优于冻结:

方法Identity_best↑Identity_worst↑Face Consistency↑
Frozen Vision Encoder73.93%66.67%83.50%
Trainable Vision Encoder90.10%87.22%99.69%
Cross-Paired Training71.79%66.36%97.53%

五、指令式精确视频编辑 (Movie Gen Edit)

视频编辑扩展

难点:大规模监督视频编辑数据难获取。创新:无需监督编辑数据的训练方法,三阶段:

  1. Stage I:单帧视频编辑(从图像编辑能力迁移)
  2. Stage II:多帧视频编辑(在合成多帧编辑对上训练)
  3. Stage III:Backtranslation(反向翻译)——训练模型对干净输入视频去噪,从而在多帧高质量输出视频上训练

结果:TGVE+ 基准上人类标注者 >74% 时间更偏好 Movie Gen Edit(相比先前 SOTA)。

六、联合音效与音乐生成 (Movie Gen Audio, 13B)

音频扩展

音频模型

  • 13B DiT,视频/文本到音频,生成 48kHz 电影级音效与音乐,与视频同步
  • Flow Matching 训练
  • 预训练 𝒪(1)M 小时音频
  • 音频扩展 (audio extension):通过扩展技术为数分钟长视频生成连贯长音频(用户提供如 58s 视频,音频分段生成后拼接,采用 triangle window 加权融合而非均匀加权)

七、实验结果

文生视频 SOTA(表 6:Movie Gen Video 净胜率 vs 先前工作)

指标vs Runway Gen3vs LumaLabsvs OpenAI Soravs Kling1.5
Overall Quality+35.02+60.58+8.23+3.87
Consistency+33.1+42.14+8.22+13.5
Motion Naturalness+19.27+29.33+4.43+0.52
Motion Completeness-1.72+23.59+8.86-10.04
Text-alignment+10.45+12.23+17.72-1.99
Realness+48.49+61.83+11.62+37.09
Aesthetics+38.55+48.19+6.45+26.88

(正值表示 Movie Gen 胜率更高;在 Overall Quality 上全面领先所有对比系统。)

关键消融

  • 微调(表 7):Overall Quality 净胜率 +34.65%,验证高质量微调的重要性
  • 验证损失与人类评估相关(图 15):损失曲线可作为人类质量评估的代理
  • 视频编辑:TGVE+ 上 >74% 偏好率

八、总结

核心贡献

  1. Movie Gen 全家桶:30B 文生视频 + 13B 视频音频,覆盖 5 大媒体生成任务,均达 SOTA
  2. 简单化设计:Flow Matching + LLaMa3 风格 Transformer,便于规模化与稳定训练
  3. TAE + OPL:时空 8×8×8 压缩,Outlier Penalty Loss 消除 spot 伪影
  4. 无监督数据的视频编辑:三阶段 + backtranslation,>74% 偏好率
  5. 长音频生成:48kHz 同步音频 + 音频扩展技术
  6. 公开基准:Movie Gen Video Bench + Movie Gen Audio Bench

技术影响

  • 证明”简单 Transformer + Flow Matching + 规模化”是媒体生成的强范式,与 LLM 训练技术栈对齐
  • 空间上采样器解耦策略大幅降低高分辨率生成成本
  • 为后续工作(如 LinGen 沿用其 TAE 与 linear-quadratic schedule)奠定基础

局限性

  • 30B + 73K 上下文训练需高达 6,144 张 H100,成本极高
  • 全双向注意力二次复杂度昂贵(LinGen 等后续工作针对此改进)
  • Motion Completeness 部分场景弱于 Kling1.5

九、参考资源

  • arXiv: https://arxiv.org/abs/2410.13720
  • 基准: Movie Gen Video Bench、Movie Gen Audio Bench
  • 关键技术: Flow Matching、LLaMa3 架构、UL2/ByT5/MetaCLIP 文本编码器

图表索引

图号描述文件名
Figure 2Movie Gen Video 训练配方figure-2-training-recipe.png
Figure 3联合图像视频生成流水线概览figure-3-generation-pipeline.png
Figure 4TAE 变长视频编解码figure-4-tae-encoding.png
Figure 7空间上采样器概览figure-7-spatial-upsampler.png
Figure 8Transformer 骨干与模型并行figure-8-transformer-parallelism.png
Figure 9预训练数据清洗流水线figure-9-data-curation.png
Figure 10linear-quadratic t-schedulefigure-10-linear-quadratic-schedule.png
Figure 21个性化 (PT2V) 架构与推理figure-21-personalization-arch.png
Figure 25扩展为视频编辑figure-25-video-editing.png
Figure 28Movie Gen Audio 扩展figure-28-audio-extension.png
Figure 29Movie Gen Audio 模型figure-29-audio-model.png

分析日期: 2026-07-07 分析师: AI Paper Analyzer