Back to blog

Waver: 面向逼真视频生成的统一基础模型

字节跳动 Waver 团队的统一图像/视频生成基础模型:基于 Rectified Flow Transformer,用 Hybrid Stream DiT(Dual Stream 前 16 层对齐模态 + Single Stream 后 40 层提效)在单一网络内统一 T2V/I2V/T2I,原生生成 720p 5–10 秒视频再经 Cascade Refiner 级联超分到 1080p(提速 40%)。配套 MLLM 视频质量模型的数据清洗流水线、REPA 表征对齐、mode 时间步采样、192p 运动预训练、视频 APG、模型平均等训练/推理配方,在 Artificial Analysis T2V/I2V 榜单双双第三,复杂运动场景显著领先。

Waver: 面向逼真视频生成的统一基础模型

一、论文概述

项目内容
标题Waver: Wave Your Way to Lifelike Video Generation
作者Bytedance Waver Team(Yifu Zhang, Hao Yang, Yuqi Zhang, Yifei Hu, Fengda Zhu, Chuang Lin, Xiaofeng Mei, Yi Jiang, Bingyue Peng, Zehuan Yuan 等)
机构字节跳动(ByteDance)
论文arXiv:2508.15761(v2, 2025-08-26)
代码/主页https://github.com/FoundationVision/Waver
主题统一图像/视频生成、Rectified Flow Transformer、DiT、级联超分

一句话总结:Waver 用一套 12B 的 Rectified Flow Transformer 在单一网络内统一 T2V/I2V/T2I,靠 Hybrid Stream DiT 加速收敛、Cascade Refiner 两阶段生成 1080p,并以工业级数据清洗与训练配方在复杂运动视频上取得 SOTA,Artificial Analysis 榜单 T2V/I2V 双双第三。

二、核心思想

问题定义

当前视频生成社区面临四大挑战:(1) 生成视频质量仍不理想,缺乏美感与真实感,尤其在体操、篮球等复杂运动场景表现差;(2) 公开技术报告很少讨论 1080p 高分辨率生成的技术细节,架构设计的动机也常常语焉不详;(3) 多数模型用两个独立模型分别实现 T2V 和 I2V,训练资源开销大;(4) 数据处理流水线与训练流程信息有限,难以完整复现。

解决方案概述

Waver 基于 Rectified Flow Transformer,由两大模块构成:

  1. Task-Unified DiT:用灵活的输入条件机制把 T2I/T2V/I2V 统一进单一网络(仅需改变输入通道维度),生成原生 720p、时长 5–10 秒的视频;采用 Hybrid Stream 架构在模态对齐与参数效率间取得平衡并加速收敛。
  2. Cascade Refiner:把第一阶段的 480p/720p 视频作为输入,通过 flow matching 以更少推理步超分到 1080p,相比直接生成 1080p 提速 40%。

配套贡献:完整的数据清洗流水线(含人工标注训练的 MLLM 视频质量模型)+ 详尽的训练/推理配方(语义表征、美学、运动、真实感的优化与权衡)。累计训练超 2 亿视频片段。

三、技术架构

3.1 整体框架

Fig 3. Task-Unified DiT 架构

  • VAE:采用 Wan2.1-VAE 做高效视频潜变量压缩。
  • 双文本编码器:flan-t5-xxl + Qwen2.5-32B-Instruct。得益于 Qwen 的强能力,双编码器显著提升 T2I 的 prompt following(Fig 4)。
  • 主干:Rectified Flow Transformer,“Dual Stream + Single Stream”融合视频与文本模态。
  • Refiner:同为 Rectified Flow Transformer,作为超分模块,把 480p/720p 升到 1080p。

3.2 Task-Unified DiT

统一输入表示(Unified Input Formulation):把三部分沿通道维拼接——主噪声潜变量 VV、条件帧张量 II(已知条件帧的 VAE 潜变量,其余帧填黑图潜变量)、二值条件掩码 MaskMask(1=条件帧,0=待生成帧)。这一表示极为灵活:既能在训练时混合并调节各任务比例,也能直接扩展到视频插帧等新任务。

Hybrid Stream 结构:

Fig 5. Hybrid / Dual / Single Stream 的 loss 对比,Hybrid 收敛最快

  • Dual Stream block:视频与文本模态用独立参数,仅在 self-attention 时合并——利于模态共适应对齐,但参数效率低(T2V 时视频 token 极多,文本参数被闲置)。
  • Single Stream block:模态共享同一套参数,效率最高,但因视频/文本统计分布差异导致收敛慢。
  • 混合策略:前 M 层 用 Dual Stream 对齐模态,后 N 层 切换为 Single Stream 提效。收敛比任一纯方案都快。

关键参数(Table 1):

Model SizeMNInput DimOutput DimNum HeadsHead Dim
12B1640361624128

Hybrid Position Embedding:融合相对与绝对位置信号——

  • 3D RoPE:提供时间/高/宽三维相对位置,相比 ViT 正弦编码有更强的时长/分辨率外推能力,减少变形失真;
  • factorized 可学习位置编码:独立编码每一维再求和,提供绝对位置锚点,加速收敛。

3.3 Cascade Refiner

Fig 6. Cascade Refiner 两阶段流水线

两阶段思路:先生成低分辨率视频,再由专用 refiner 超分到 1080p(受强先验条件约束,可加速 1080p 生成)。

  • Window Attention:把 token 划分到 Wh×Ww×WtW_h \times W_w \times W_t 局部窗口内计算注意力;交替使用空间窗(2×2×1)与时间窗(1×1×2)实现跨窗通信。观察到 DiT 注意力在最浅与最深层最密集,故对首尾各 8 层用 full attention、中间层用 window attention。
  • 像素 + 潜变量退化(Pixel & Latent Degradation):从高清源合成低质视频。像素退化:1080p→360p→1080p;潜变量退化:向 VAE 潜空间注入高斯噪声弥合域差:

xn=(1−wd)⋅x+wd⋅n,wd∼[0.85,0.95]\mathbf{x}_n = (1 - w_d)\cdot\mathbf{x} + w_d\cdot\mathbf{n}, \quad w_d \sim [0.85, 0.95]

  • Refiner 训练/推理:模型输入为退化潜变量与干净潜变量的线性插值,训练目标为预测从退化到干净的差量:

xinput=w⋅xn+(1−w)⋅x0,xtarget=x0−xn,w∼[0,1]\mathbf{x}_{\text{input}} = w\cdot\mathbf{x}_n + (1-w)\cdot\mathbf{x}_0, \quad \mathbf{x}_{\text{target}} = \mathbf{x}_0 - \mathbf{x}_n, \quad w \sim [0,1]

Refiner 不仅超分,还能修正生成伪影;当 wdw_d 取大值时甚至能做视频编辑(如把视频里的女性变成男性,Fig 7)。

3.4 核心公式:表征对齐(Representation Alignment)

借鉴 REPA / VA-VAE,用 Qwen2.5-VL 抽取视频高层语义特征 f\mathbf{f},与 DiT 第 16 层的中间特征 h\mathbf{h} 对齐(仅在 480p 阶段施加,避免拖慢 192p 快速迭代、规避 720p 特征存储开销)。将 h\mathbf{h} 空间下采样 2×、时间下采样 4×,再用轻量 MLP gϕg_\phi 投影通道,最大化余弦相似度:

Lalign=−Ex[1N∑i=1Nhg,i⋅fi∥hg,i∥ ∥fi∥]\mathcal{L}_{\text{align}} = -\mathbb{E}_{\mathbf{x}}\left[\frac{1}{N}\sum_{i=1}^{N}\frac{\mathbf{h}_{g,i}\cdot\mathbf{f}_i}{\|\mathbf{h}_{g,i}\|\,\|\mathbf{f}_i\|}\right]

最终训练目标(λ=0.5\lambda = 0.5):

Ltrain=Lfm+λ Lalign\mathcal{L}_{\text{train}} = \mathcal{L}_{\text{fm}} + \lambda\,\mathcal{L}_{\text{align}}

四、训练数据流水线

Fig 8. 数据处理流水线:多源采集 → 预处理 → 质量过滤 → 打字幕 → 语义均衡

4.1 数据预处理

  • 多源采集:对复杂球类运动、复杂运动场景做定向补充采集,缓解数据集偏差。
  • 视频切分:先用 PySceneDetect 做场景检测,再用 DINOv2 相邻帧余弦相似度细分镜头;保留 2–10 秒片段,对超 10 秒者采样内部相似度最低的段(捕捉显著运动/高光时刻)。
  • 片段质量打分:基础属性(FPS/分辨率/码率)+ 静态视觉(美学模型 + OCR 文字占比 + 水印检测)+ 动态质量(RAFT 光流,前景/背景分离后主要基于前景光流度量运动幅度)。

4.2 质量模型(MLLM-based)

质量打分有局限(慢动作运动分不准、美学分某些区间不可靠、OCR 漏检小水印)。因此对 100 万+高分片段人工标注,标注高质量样本与 13 个低质维度(Fig 9a),用于对 VideoLLaMA3 做 SFT。在 480p 训练阶段用它过滤数据;验证集上”预测为高质量”样本的准确率为 78%。

4.3 字幕模型

基于 Qwen2.5-VL,联合训练 caption 与 sub-action 描述任务;以 Tarsier2 caption 作为输入生成更细粒度字幕。为每个子动作标注起止时间戳以增强动作时序理解。DPO 阶段用 DPOP loss 抑制幻觉、稳定长文本输出。

4.4 语义均衡

用 Qwen2.5-32B 对字幕做多级动作分类(12 个一级、100 个二级、6000+ 三级动作标签),对占比过低的类别(如稀缺的体育类,Fig 9b)通过过采样 + 合成样本补齐。

4.5 分层数据过滤漏斗

Fig 10. 分层数据过滤漏斗,逐级收紧质量标准

各训练阶段逐级收严:

  • 192p 预训练:尽量保留多样性,仅去除过多叠字与近静态视频,重运动一致性/语义对齐/时序连贯。
  • 480p 预训练:引入美学打分、更严叠字/运动阈值、8 维质量模型。
  • 720p 预训练:质量模型扩到 12 维(新增主体截断、过曝、暗/模糊、图像动画)。
  • 720p CT:新增清晰度、色彩平衡;强制数据源与语义类别均衡。
  • 720p SFT:引入合成数据(高美学 + 超现实),仅保留 2K/4K 真实片段,复杂运动人工精选并详细标注。
  • 1080p Refinement:只留 720p CT 数据 + 最高质量 2K/4K 数据。

五、训练 / 推理配方

5.1 多阶段训练(Table 2)

TaskStageResolutionData volume (video/image)EpochsLRSigma shift
T2IPretrain256p170M241e-41.0
T2IPretrain512p100M36e-52.0
T2IPretrain1024p60M13e-53.0
T2V/T2IPretrain192p 12fps185M/40M21e-41.5
T2V/T2IPretrain192p 16fps185M/40M1.51e-41.5
T2V+I2V/T2IPretrain480p 16fps41M/40M35e-52.5
T2V+I2V/T2IPretrain720p 24fps22M/15M13e-53.0
T2V+I2V/T2ICT720p 24fps4M/15M21e-53.0
T2V+I2V/T2ISFT720p 24fps0.1M/15M25e-63.0
(T+V)2V/T2IRefine1080p 24fps3M/3M11e-54.5
(T+V)2V/T2ISFT1080p 24fps0.2M/3M15e-64.5

先训 T2I(256p→1024p,学文图对应与指令跟随);再从 192p 起联合训 T2V + T2I;480p 起以 20% 概率 训 I2V(控制是否加首帧条件)。遵循 SD3:分辨率越高、flow matching 的 sigma shift 越大。

5.2 运动优化(Motion Optimization)

  • 低分辨率视频训练:在 192p(12fps→16fps)学运动,把运动学习与视觉质量/语义部分解耦。相比从 T2I 直接跳到 480p,加入 192p 中间步能让 480p 收敛更快、运动幅度更大(Fig 12)。
  • 噪声调度(mode 采样):遵循 SD3,中间时间步最难学,故用中间概率高、两端低的 PDF。

πln⁡(t;m,s)=1s2π1t(1−t)exp⁡ ⁣(−(logit(t)−m)22s2)\pi_{\ln}(t;m,s) = \frac{1}{s\sqrt{2\pi}}\frac{1}{t(1-t)}\exp\!\left(-\frac{(\text{logit}(t)-m)^2}{2s^2}\right)

fmode(u;s)=1−u−s⋅ ⁣(cos⁡2 ⁣(π2u)−1+u)f_{\text{mode}}(u;s) = 1 - u - s\cdot\!\left(\cos^2\!\left(\frac{\pi}{2}u\right) - 1 + u\right)

Fig 14. 时间步采样 PDF:T2I 用宽 logit-normal,T2V/I2V 用尖峰 mode 分布以生成更大运动

mode 采样让运动幅度更大(Fig 13)。最终 T2I 用 Lognorm(0.5,1),T2V/I2V 用 Mode(1.29)。

  • T2V & I2V 联合训练:I2V 因强首帧条件易”运动不足”。以 20% 概率引入首帧条件做联合训练,防止首帧主导,使 I2V 与 T2V 运动幅度相当(Fig 15)。
  • 弱运动数据过滤:用前景运动分过滤静态/过度运动视频;再用质量模型过滤慢动作与图像动画视频。

5.3 美学优化(合成数据增强)

利用统一多任务模型 + 高质量图像 + I2V 能力,合成强调美学(构图/光影/色彩)的视频;经至少 2 名标注员一致通过的严格人工审核(N=8381,主要失败原因为畸变,Fig 18a)。高美学微调后视觉质量 SBS 胜率从 32.9% 升到 39.5%(+7%),运动质量保持不变(Fig 18b/19)。需平衡合成与真实数据比例,防止过拟合合成风格。

5.4 模型平衡(Model Balancing)

视频生成常有”运动大↔清晰度低""真实感↔伪影”等权衡。三招应对:

  • Prompt tagging:按数据源/质量给数据打标签(anime/game/CG/real/synthetic + 清晰度/运动速度),训练时前/后缀入 caption,推理时把不良质量描述放进 negative prompt。
  • Video APG:把 APG 扩展到视频,将 CFG 更新项分解为平行 + 正交分量并下调平行分量,减伪影不过饱和;从 [C,H,W] 维归一化优于 [C,T,H,W],最佳超参 CFG=8、norm threshold=27(Fig 21)。
  • 模型平均(Model averaging):合并 7–10 个不同数据/阶段/采样概率的模型,运动质量 +5%、视觉 +2%、指令 +1%(Fig 22)。

5.5 Prompt Rewriting

不训练专用改写模型,直接用 GPT-4.1,按训练字幕分布补充相机/外观/背景/动作细节;对 5 秒与 10 秒设计两套 system prompt。

六、基础设施

Fig 24. Ulysses 序列并行、Selective Activation Checkpointing、Activation Offloading 示意

  • FSDP 混合分片:inner shard 64 或 128,平衡显存与通信开销。
  • torch.compile:把 transformer 层编译成 fullgraph,让 inductor 自动融合 CUDA 算子。
  • Ulysses 序列并行:720p/1080p、8–10 秒视频序列可达数十万 token,沿序列维切分到并行组,缓解显存压力。
  • Bucket Dataloader + Sequence Packing:用 SPFHP 按 token 长度打包短视频,按计算量分桶,保证同批 token 长度一致。
  • Selective Activation Checkpointing (SAC):低重算成本算子(逐元素加乘)重算,昂贵算子(attention/GEMM)尽量留存。
  • Activation Offloading:前向激活拷贝到 CPU,反向前几步预取回 GPU,用独立 CUDA 流与主计算重叠,开销可忽略。

MFU(Table 3):192p 0.32 / 480p 0.36 / 720p 0.39 / 1080p 0.40。

七、实验结果

7.1 Artificial Analysis Arena

Fig 25. Artificial Analysis T2V/I2V 官方排名,Waver 双双第三

基于大量用户对比的 Elo 排名,Waver 在 T2V 与 I2V 双榜均排第三(数据截至 2025-07-22/08-05)。

7.2 人工评估

Fig 1. Waver 对 Veo3/Kling2.0/Wan2.1 的人评 GSB 胜率(左 Waver-bench,右 Hermes 运动集)

两个自建基准:

  • Waver-Bench 1.0:304 个通用样本(体育、日常、超现实等)。
  • Hermes Motion Testset:96 个 prompt,聚焦 32 类体育运动(网球、篮球、体操等)复杂运动。

评估维度分三类:运动质量(Action/Interaction/Distortion)、视觉质量(Image Quality/Color/Clarity/Realism/Aesthetics)、prompt following(Subject/描述/动作准确性/动作幅度/相机运动)。

Fig 28. Waver-bench(a) 与 Hermes(b) 上与竞品的 SBS 人评结果 Fig 28b. Hermes Motion Testset 评估

  • Waver-bench 1.0:全面优于 Wan2.1 14B;对 Kling2.0 视觉/指令更好、运动略优;对 Veo3 视觉更高、运动略优,仅 prompt following 略弱。
  • Hermes 运动集:在运动质量与 prompt following 上大幅领先所有 baseline,凸显复杂动态运动生成能力。

八、讨论:稀疏注意力与 VAE 经验

8.1 DiT 稀疏性

Fig 29. 注意力图揭示三大特性:跨头异质、层间稀疏动态、时间步稀疏演化

self-attention 复杂度 O(N2)O(N^2),生成 5 秒 1080p 时注意力占总计算 90%+。作者观察到三大规律:(1) 跨注意力头异质(空间局部/时间局部/全局/固定列);(2) 层间稀疏呈”密-疏-密”;(3) 随去噪时间步稀疏度递增。据此指出两条方向:时空滑窗注意力、以及为视频重设计的 NSA(Native Sparse Attention) 自适应稀疏注意力。

8.2 VAE 经验(虽用 Wan2.1-VAE,仍给出优化洞见)

LVAE=λ1L1+λ2LLPIPS+λ3LGAN+λ4LKL\mathcal{L}_{VAE} = \lambda_1\mathcal{L}_1 + \lambda_2\mathcal{L}_{LPIPS} + \lambda_3\mathcal{L}_{GAN} + \lambda_4\mathcal{L}_{KL}

  • KL 权重敏感:过低(Wan VAE)导致颗粒纹理/模式坍塌;过高(CogVideoX VAE)扭曲背景。KL=0 时潜空间平滑规整,KL 增大则潜表示向 N(0,I)\mathcal{N}(0,I) 坍缩、变噪,扩散训练更难(Fig 30/31)。
  • LPIPS 权重:过高在高运动细节区引入网格状伪影,故设为 0.1(Fig 32)。
  • 未来方向:更高压缩率、与音频/文本融合的多模态统一潜空间。

九、核心创新与贡献

创新点说明依据
Task-Unified DiT三段式输入(噪声潜变量 + 条件帧 + 掩码)在单一网络统一 T2I/T2V/I2V,仅改通道维省去双模型开销,支持任务混合
Hybrid Stream 架构前 16 层 Dual Stream 对齐模态 + 后 40 层 Single Stream 提效Fig 5 收敛快于纯方案
Cascade Refiner两阶段生成 + 像素/潜变量退化训练,超分并修伪影比直生 1080p 提速 40%
表征对齐Qwen2.5-VL 语义特征对齐 DiT 第 16 层(仅 480p 阶段)Fig 11 语义结构更清晰
运动优化组合拳192p 运动预训练 + mode 采样 + T2V/I2V 联合 + 弱运动过滤复杂运动 SOTA
工业级数据流水线MLLM 质量模型 + 细粒度字幕 + 多级动作均衡 + 分层漏斗2 亿+片段,可复现配方

十、局限性

  • 高运动场景下人体细节(手、腿)易畸变;
  • 生成视频有时缺乏丰富视觉细节,表现力受限;
  • 未来拟用强化学习(RL)缓解畸变、增强细节。

十一、参考资源