Back to blog

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

通过跨模态上下文学习改进联合音视频生成

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

一、论文概述

项目内容
标题Improving Joint Audio-Video Generation with Cross-Modal Context Learning
作者Bingqi Ma, Linlong Lang, Ming Zhang, Dailan He, Xingtong Ge, Yi Zhang, Guanglu Song, Yu Liu
论文arXiv:2603.18600
代码未公开
发布2026年3月

二、核心思想

问题定义

联合音视频生成(Joint Audio-Video Generation)旨在同时生成时间一致的音频和视频内容。当前主流方法采用双流 Transformer 架构(Dual-Stream Transformer),通过跨模态注意力模块在音频和视频流之间交换信息。然而,现有设计存在三个关键问题:

  1. 门控机制 (Gating Mechanism) 破坏优化稳定性:二值门控在不同优化目标间切换时,在参数空间中引入分段目标结构,导致梯度方向不稳定,损害收敛过程。

  2. 跨模态注意力的背景偏差:现有双向跨模态注意力模块中,背景区域的 token 也会被强制参与跨模态交互,引入噪声并降低对齐质量。

  3. 训练-推理不一致:传统分类器自由引导 (CFG) 在跨模态条件下存在条件冲突问题,特别是视频流对音频流的过强条件引导。

解决方案概述

本文提出 Cross-Modal Context Learning (CCL) 范式,在保留双流 Transformer 架构的基础上,引入以下关键模块:

  1. TARP (Temporally Aligned RoPE and Partitioning):时间对齐的位置编码和分区机制
  2. CCA (Cross-Modal Context Attention):包含可学习上下文令牌 (LCT) 和动态上下文路由 (DCR)
  3. UCG (Unconditional Context Guidance):利用 LCT 作为自然无条件表示的引导策略

三、技术架构

整体框架图

CCL 流水线架构

CCL 继承传统双流 Transformer 架构,视频帧通过 3D VAE 压缩到潜在空间,原始音频先转换为 Mel 频谱图再通过音频 VAE 压缩。音频和视频流共享相同层数和整体架构,但音频分支使用更少通道以提高参数效率。

核心公式

门控机制的问题

传统双流 Transformer 块的公式:

X′=FFN(Self-Attn(X,T)+g⋅Cross-Attn(X,Y))\mathbf{X}' = \text{FFN}(\text{Self-Attn}(\mathbf{X}, \mathbf{T}) + g \cdot \text{Cross-Attn}(\mathbf{X}, \mathbf{Y}))

其中 X\mathbf{X} 为当前模态的潜在表示,T\mathbf{T} 为文本条件,Y\mathbf{Y} 为另一模态的潜在表示,g∈{0,1}g \in \{0, 1\} 为二值门控。

问题:门控状态切换导致参数空间中的分段目标结构,梯度方向不稳定。

TARP: 时间对齐 RoPE 和分区

RoPE 缩放:由于音频 token 数 tat_a 与视频 token 数 tvt_v 不匹配,对音频的 RoPE 索引进行缩放:

qˉa,kˉa=RoPE(qa,ka;scale=tv/ta)\bar{\mathbf{q}}_a, \bar{\mathbf{k}}_a = \text{RoPE}(\mathbf{q}_a, \mathbf{k}_a; \text{scale} = t_v / t_a)

分区机制:每个模态仅需关注另一模态当前时间步附近的局部邻域。设 c=⌊ta/tv⌋c = \lfloor t_a / t_v \rfloor 为每个视频帧对应的音频 token 数,第 ii 个视频帧的窗口中心为:

mi=⌊c/2+c⋅i⌋,窗口大小=3cm_i = \lfloor c/2 + c \cdot i \rfloor, \quad \text{窗口大小} = 3c

CCA: 跨模态上下文注意力

可学习上下文令牌 (LCT):

  • 音频到视频 CCA:La∈Rna×dv\mathbf{L}_a \in \mathbb{R}^{n_a \times d_v}
  • 视频到音频 CCA:Lv∈Rnv×da\mathbf{L}_v \in \mathbb{R}^{n_v \times d_a}

LCT 提供来自另一模态的稳定上下文信息,作为背景信息的锚点。LCT 不使用 RoPE(因为其时间不敏感特性)。

动态上下文路由 (DCR):根据任务类型动态调整跨模态交互的强度和方向。

跨注意力计算:

CCA(Q,[Kmodal;Kl],[Vmodal;Vl])\text{CCA}(\mathbf{Q}, [\mathbf{K}_{\text{modal}}; \mathbf{K}_l], [\mathbf{V}_{\text{modal}}; \mathbf{V}_l])

由于 na,nvn_a, n_v 远小于潜在 token 数,额外计算开销可忽略。

UCG: 无条件上下文引导

LCT 在训练后成为自然的无条件表示。两种推理形式:

两步推理(标准 UCG):

v^θ(xt,t)=vθ(xt,t∣uctext,Lm)+sm(vθ(xt,t∣ctext,cm)−vθ(xt,t∣uctext,Lm))\hat{v}_\theta(x_t, t) = v_\theta(x_t, t \mid uc_{\text{text}}, \mathcal{L}^m) + s_m \left( v_\theta(x_t, t \mid c_{\text{text}}, c_m) - v_\theta(x_t, t \mid uc_{\text{text}}, \mathcal{L}^m) \right)

三步推理(解耦文本和跨模态引导强度):

v^θ(xt,t)=vθ(xt,t∣uctext,Lm)+stext(vθ(xt,t∣ctext,Lm)−vθ(xt,t∣uctext,Lm))+sm(vθ(xt,t∣uctext,cm)−vθ(xt,t∣uctext,Lm))\hat{v}_\theta(x_t, t) = v_\theta(x_t, t \mid uc_{\text{text}}, \mathcal{L}^m) + s_{\text{text}} \left( v_\theta(x_t, t \mid c_{\text{text}}, \mathcal{L}^m) - v_\theta(x_t, t \mid uc_{\text{text}}, \mathcal{L}^m) \right) + s_m \left( v_\theta(x_t, t \mid uc_{\text{text}}, c_m) - v_\theta(x_t, t \mid uc_{\text{text}}, \mathcal{L}^m) \right)

多任务训练

L={Laud+Lvid,text/image-to-video, text-to-audio, or joint AV0⋅Laud+Lvid,audio-to-videoLaud+0⋅Lvid,video-to-audio\mathcal{L} = \begin{cases} \mathcal{L}_{\text{aud}} + \mathcal{L}_{\text{vid}}, & \text{text/image-to-video, text-to-audio, or joint AV} \\ 0 \cdot \mathcal{L}_{\text{aud}} + \mathcal{L}_{\text{vid}}, & \text{audio-to-video} \\ \mathcal{L}_{\text{aud}} + 0 \cdot \mathcal{L}_{\text{vid}}, & \text{video-to-audio} \end{cases}

在 audio-to-video 和 video-to-audio 训练中,断开参考流的梯度以防止过优化。

模型组件

组件说明关键参数
视频流 (Wan2.1-14B)视频扩散 Transformer14B 参数
音频流音频扩散 Transformer(与视频同架构但更少通道)参数效率优化
3D VAE视频帧压缩到潜在空间—
音频 VAEMel 频谱图压缩到 1D 潜在表示—
TARP时间对齐 RoPE + 分区机制缩放因子 tv/tat_v/t_a,窗口大小 3c3c
LCT可学习上下文令牌na=8n_a = 8, nv=8n_v = 8
DCR动态上下文路由任务自适应

训练流程

阶段学习率步数批大小
音频扩散模型预训练1×10−41 \times 10^{-4}160,0003,200
联合音视频训练跨模态: 1×10−41 \times 10^{-4}, 其他: 1×10−51 \times 10^{-5}12,000320
消融实验—6,000128

数据集:百万级音视频对,包括 OpenHumanVid 和内部采集(访谈、短剧、电影),以及学术音频数据集(WavCaps, VGGSound)。

四、核心创新

创新点说明理论/实验依据
门控机制问题识别首次系统分析门控机制导致的分段目标结构和梯度不稳定训练损失曲线对比:CCL 收敛更快更稳定
TARP时间对齐 RoPE + 分区机制,解决音视频 token 数不匹配消融实验:WER 4.67% → 4.81% (与 LCT/DCR 组合)
LCT (可学习上下文令牌)提供稳定的跨模态上下文锚点,区分前景/背景注意力可视化:背景 token 更强地关注 LCT
DCR (动态上下文路由)根据任务类型动态调整跨模态交互消融实验验证各模块贡献
UCG (无条件上下文引导)利用 LCT 作为自然无条件表示,消除训练-推理不一致两种推理形式(2步/3步)灵活选择
多任务训练统一支持 text/image-to-video, text-to-audio, joint AV, audio-to-video, video-to-audio梯度断开防止参考流过优化

五、实验结果

与现有方法对比(测试集)

方法数据量CU↑PQ↑WER↓Sync-C↑ (easy)Sync-D↓ (easy)Sync-C↑ (hard)Sync-D↓ (hard)DeSync↓ (easy)IB↑ (easy)DeSync↓ (hard)IB↑ (hard)
Ovi30.7M5.886.1417.51%8.477.325.968.571.110.201.180.21
LTX-2–5.125.3511.04%7.677.905.478.931.180.191.200.21
MOVA50M6.347.248.09%7.797.705.388.871.150.201.220.19
CCL4M5.716.424.62%8.457.486.128.251.110.231.190.22

关键发现:

  • CCL 仅用 4M 数据(Ovi 的 1/8,MOVA 的 1/12)就大幅超越现有方法
  • WER 从 8.09% 降至 4.62%,相对降低 43%
  • 唇形同步指标 (Sync-C) 在 easy 和 hard 子集上均最优
  • 音视频对齐指标 (DeSync, IB) 表现优异

消融实验

TARPLCT/DCRUCGSyncCFGWER↓Sync-C↑Sync-D↓DeSync↓IB↑
4.52%4.5310.811.200.20
✓4.67%5.0510.171.200.20
✓✓4.81%5.629.121.180.21
✓✓✓4.63%6.148.091.160.22
✓✓✓✓5.59%5.858.461.180.20

关键发现:

  • 每个模块都对性能有贡献
  • TARP + LCT/DCR 组合显著提升 Sync-C(4.53 → 5.62)
  • 完整 CCL 达到最佳 WER (4.63%) 和 Sync-D (8.09%)
  • 传统 SyncCFG 反而降低 WER 性能(5.59%),验证 UCG 的优越性

训练动态可视化

训练损失对比:门控机制 vs CCL

CCL 展现出更快、更稳定的训练损失下降,表明其促进更高效的优化。

注意力图可视化

CCL 注意力图可视化

背景 token 在音频和视频模态中都更强烈地关注 LCT,表明 CCL 鼓励模型捕获模态特定的背景模式,形成更清晰的前景/背景分离。

六、能力展示

CCL 能力展示:多语言语音、环境声、音乐、背景语音、故事板等

CCL 支持多种生成能力:

  • 多语言人声生成
  • 环境声合成
  • 音乐生成
  • 背景语音生成
  • 故事板风格内容生成

七、相关工作

方向代表工作与 CCL 的关系
视频生成模型Wan2.1, Sora2, Kling 3.0, Seedance 2.0CCL 的视频流基于 Wan2.1-14B
联合音视频生成Ovi, LTX-2, MOVACCL 在数据效率和性能上超越
双流 Transformer先前跨模态注意力方法CCL 识别并解决门控机制问题
分类器自由引导传统 CFG, Multi-Modal CFGCCL 提出 UCG 作为更优替代

八、总结

核心贡献

  1. 系统性问题分析:识别双流 Transformer 中门控机制、跨模态注意力偏差、训练-推理不一致三大问题
  2. TARP:时间对齐 RoPE 和分区机制,解决音视频 token 数不匹配和时间对齐问题
  3. CCA 模块:可学习上下文令牌 (LCT) 提供稳定锚点,动态上下文路由 (DCR) 实现任务自适应
  4. UCG:利用 LCT 作为自然无条件表示,提供 2 步和 3 步两种推理形式
  5. 数据效率:仅用 4M 数据即大幅超越使用 30-50M 数据的现有方法
  6. 多任务统一:支持 5 种生成任务(text/image-to-video, text-to-audio, joint AV, audio-to-video, video-to-audio)

技术影响

  • 为联合音视频生成提供了新的范式,从门控机制转向上下文学习
  • LCT 作为无条件表示的思想可推广到其他多模态生成任务
  • 数据效率的提升降低了联合音视频生成的门槛
  • 多任务训练框架为统一多模态生成系统提供了参考

局限性

  • 代码未公开
  • 论文未详细报告各项能力的具体评估指标
  • 音频质量 (CU, PQ) 指标略低于 MOVA(数据量更大)
  • 未与最新商业系统(Veo3, Sora2 等)进行直接对比

九、参考资源

  • 论文: arXiv:2603.18600
  • 关键引用:
    • Wan2.1 (视频扩散模型骨干)
    • Ovi, LTX-2, MOVA (联合音视频生成基线)
    • WavCaps, VGGSound (音频数据集)
    • OpenHumanVid (音视频数据集)

分析日期: 2026-06-05