Back to blog

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

基于预训练视频扩散 Transformer 的全音频条件说话人像生成与编辑统一框架,支持无限长度生成和多模态控制

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

一、论文概述

项目内容
标题SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
作者Zhengcong Fei, Hao Jiang, Di Qiu, Baoxuan Gu, Youqiang Zhang, Jiahua Wang, Jialin Bai, Debang Li, Mingyuan Fan, Guibin Chen, Yahui Zhou
机构Skywork AI
论文https://arxiv.org/abs/2506.00830
代码https://github.com/SkyworkAI/SkyReels-Audio
发布2025-06-01
许可未明确标注

二、核心思想

问题定义

音频驱动的说话人像生成(Talking Portrait Generation)面临三大核心挑战:

  1. 多模态控制不足:现有方法难以同时利用文本、图像、视频和音频等多种条件进行统一控制
  2. 长视频生成困难:现有框架在生成长视频时存在误差累积、视觉质量下降和时间不一致问题
  3. 音频-视觉对齐不精确:唇部同步精度、身份一致性和面部动态真实性难以同时保证

解决方案概述

SkyReels-Audio 是一个统一的全音频条件说话人像框架,基于预训练的视频扩散 Transformer(SkyReels-V2),实现:

  • 无限长度生成与编辑:通过双向潜在融合(BLF)策略实现无缝长视频生成
  • 多模态控制:支持文本、图像、视频和音频的灵活组合输入
  • 混合课程学习:渐进式对齐音频与面部运动,实现细粒度多模态控制
  • 音频引导 CFG:推理时增强音频同步的条件引导机制

Figure 1: SkyReels-Audio 多模态控制能力展示

三、技术架构

整体框架

Figure 2: SkyReels-Audio 框架概览

基于 SkyReels-V2 视频扩散 Transformer,通过以下组件实现音频驱动:

核心组件:

  1. 3D VAE:因果 3D VAE 联合压缩时间轴和空间轴,提取潜在视觉特征
  2. UMT5 文本编码器:生成语义嵌入,通过交叉注意力注入扩散网络
  3. Whisper 音频编码器:提取音频特征,通过 1D RoPE 位置编码和交叉注意力融合到视频 DiT 中
  4. 二进制时间掩码:区分静态图像和动态视频输入,编码模态特定信息

音频条件注入机制:

  • Whisper 特征提取器:重采样和特征编码
  • Whisper 编码器:获取离散 token 嵌入
  • 1D RoPE:增强音频 token 的距离感知关系
  • 解耦交叉注意力:音频 token 注入到视频 DiT 的解耦交叉注意力块末尾

核心公式

Flow Matching 训练目标:

L_{mse} = \mathbb{E}_{z_0, z_1, t \sim [0,1]} \left[ \left\| v_t - u_\theta(z_t, t, T_s, I_s, V_s, A) \right\|_2^2 \right] \tag{1}

其中 uθu_\theta 是可训练去噪网络,z1z_1 和 z0z_0 分别是训练样本和高斯噪声的潜在嵌入,vt=dzt/dt=z1−z0v_t = dz_t/dt = z_1 - z_0 是回归目标。

多模态条件:

  • TsT_s:文本提示
  • IsI_s:静态肖像图像
  • VsV_s:参考视频片段
  • AA:驱动音频序列

训练时随机丢弃任一条件以促进鲁棒泛化。

联合损失函数(混合学习策略):

L_{joint} = w_1 * V_m^{downsample} * L_{mse} + w_2 * (1 - V_m^{downsample}) * L_{msk} \tag{2}

其中 VmV_m 是掩码序列,用于区分图像动画和视频编辑任务。

面部掩码损失:

Lface={Lmse,if p≥pmaskMlip⊙LmseotherwiseL_{face} = \begin{cases} L_{mse}, & \text{if } p \geq p_{mask} \\ \mathcal{M}_{lip} \odot L_{mse} & \text{otherwise} \end{cases}

Mlip\mathcal{M}_{lip} 通过 DWPose 提取面部关键点掩码,经三线性插值转换到潜在空间。概率门控机制平衡唇部同步精度和全局视觉保真度。

音频引导条件采样(Audio CFG):

\hat{u}_\theta^{cfg} = (1 + \omega_{audio}) u_\theta(\mathbf{z}_t, t, T_s, I_s, V_s, A) - \omega_{audio} u_\theta(\mathbf{z}_t, t, T_s, I_s, V_s, \emptyset) + (1 + \omega_{text}) u_\theta(\mathbf{z}_t, t, T_s, I_s, V_s, \emptyset) - \omega_{text} u_\theta(\mathbf{z}_t, t, \emptyset, \emptyset, \emptyset, \emptyset) \tag{3}

ωaudio\omega_{audio} 和 ωtext\omega_{text} 分别是音频和文本的 CFG 权重,采用时间依赖调度动态平衡条件影响。

混合推理策略(视频编辑时):

u_\theta^t = \begin{cases} u_\theta(\mathbf{z}_t, t, T_s, V_s^V, V_M^V, A), & \text{if } t \leq N \\ u_\theta(\mathbf{z}_t, t, T_s, V_s^I, V_M^I, A), & \text{otherwise} \end{cases} \tag{4}

前 N 步使用完整视频输入保持结构一致性,后续切换到图像输入(首帧)细化唇部同步细节。

双向潜在融合(BLF)

Figure 3: BLF 策略示意

BLF 是免训练的无限视频推理策略,通过重叠滑动窗口双向加权融合相邻窗口的潜在表示:

三个关键阶段:

  1. 音频重采样:确保与视频帧时间对齐,初始化对应时长的噪声向量
  2. 加权融合:在同一去噪步内,通过线性插值权重融合重叠区域的潜在表示
  3. 双向传播:将融合后的潜在表示重新插入两个参与窗口,确保平滑过渡

Algorithm 1:BLF 完整伪代码描述了滑动窗口去噪过程,包括重叠长度 oo、融合权重 wi=(i−1)/(o−1)w_i = (i-1)/(o-1) 等细节。

优势:

  • 免训练(tuning-free)
  • 相比无重叠方法:显著减少图像跳跃
  • 相比单向融合:更好的时间连续性
  • 相比运动帧方法:减少误差累积

混合学习策略

通过掩码区分两种任务:

图像动画任务:

  • 输入:参考图像 + 空帧序列
  • 掩码:Vm=(Mˉones,Mzeros,...,Mzeros)V_m = (\bar{M}_{ones}, M_{zeros}, ..., M_{zeros})
  • 特点:控制信号有限(文本+图像+音频),模型更容易学习音频驱动合成

视频编辑任务:

  • 输入:视频首帧(参考)+ 后续帧(DWPose 检测面部关键点,生成下脸边界框掩码)
  • 掩码:Vm=(Mones,Mmouth,...,Mmouth)V_m = (M_{ones}, M_{mouth}, ..., M_{mouth})
  • 特点:额外视频控制引入唇部运动与周围区域的依赖,削弱音频控制影响

模型加速

技术说明效果
TeaCache通过潜在表示重用消除冗余去噪步显著减少推理时间
USP统一序列并行,支持多 GPU 推理线性加速
CPU 卸载TeaCache 计算转移到 CPU减少 VRAM 消耗

两者可同时激活,80 帧视频生成可在 1 分钟内完成(8×A800 GPU,50 步推理)。

数据流水线

Figure 4: 数据处理流水线

数据规模:原始 10K 小时 → 过滤后 1K 小时

数据来源:OpenHumanVid、Panda-6M、Hallo3 等公开数据集 + 自采数据

多阶段过滤:

  1. 图像内容:OCR、去重、合成数据过滤、马赛克/黑屏/静态屏幕过滤
  2. 视频质量:帧率、分辨率、帧数过滤
  3. 人像质量:人物数量、头身比过滤
  4. 音频质量:音频存在性、语言过滤
  5. 音视频同步:同步置信度分数、说话人数量过滤

辅助工具:

  • SkyCaptioner-V1:生成描述性标注
  • YOLO-World + InsightFace:人体和面部检测
  • DWPose:提取姿态特征,计算头身比
  • Whisper:识别语音语言
  • 同步置信度分数:评估音视频同步

质量控制:每个阶段引入人工标注,确保坏案例率低于 5%。

四、核心创新

创新点说明优势
全音频条件框架统一处理图像动画和视频编辑多模态灵活组合控制
双向潜在融合(BLF)免训练的滑动窗口双向融合无限长度生成,平滑过渡
混合课程学习渐进式对齐音频与面部运动精细唇部同步
音频引导 CFG推理时增强音频同步的条件引导提升音视频一致性
面部掩码损失概率门控平衡局部精度和全局保真度选择性强调唇部区域
1D RoPE 音频位置编码增强音频 token 的距离感知改善跨模态对应关系
混合推理策略前 N 步视频输入 + 后续图像输入结构一致性 + 唇部精度

五、代码实现分析

项目结构

SkyReels-Audio/
├── README.md
├── requirements.txt
├── models/                    # 模型权重
├── configs/                   # 配置文件
├── inference/                 # 推理脚本
└── training/                  # 训练代码

训练配置

参数值
优化器AdamW
学习率1e-5(恒定)
训练数据~1K 小时(内部数据)
GPU80× NVIDIA
推理步数50
Audio CFG4.5
条件丢弃率0.15(文本/图像/音频各 15%)

训练阶段

  1. 阶段一:仅音频数据训练,建立音频-视觉模态基础对齐
  2. 阶段二:图像+视频联合训练,提升运动一致性和时间连贯性

六、实验结果

HDTF 数据集定量比较

方法FID ↓FVD ↓Sync-C ↑Sync-D ↓IQA ↑ASE ↑
Hallo340.12408.125.7510.124.032.65
FantacyTalking39.53381.225.3611.683.502.38
SkyReels-Audio38.32364.716.069.124.602.92

SkyReels-Audio 在所有指标上均优于开源基线。

Lip Sync 定量比较

方法FID ↓FVD ↓Sync-C ↑IQA ↑AV Consist. ↑Visual Quality ↑
LatenSync40.23390.258.483.631.191.00
SkyReels-Audio39.75377.238.493.621.381.32

用户研究:20 名参与者评估,SkyReels-Audio 在音视频一致性和视觉质量上均优于基线。

内部数据集定量比较

方法Sync-C ↑Sync-D ↓IQA ↑ASE ↑
Hallo35.539.334.132.80
MagicInfinite6.228.434.563.00
OmniHuman-17.507.474.663.19
FantacyTalking3.6710.974.262.80
SkyReels-Audio6.758.324.422.91

SkyReels-Audio 与闭源模型 OmniHuman-1 具有可比性。

消融实验

Audio CFG 影响:

CFG 值Sync-C ↑Sync-D ↓IQA ↑ASE ↑
15.789.654.583.02
36.308.784.452.91
4.5(默认)6.758.324.422.91

随 CFG 增大,音视频一致性提升,但视觉质量略有下降。

Audio RoPE 影响:

配置Sync-C ↑Sync-D ↓IQA ↑ASE ↑
w/o Audio RoPE5.589.754.352.82
w/ Audio RoPE6.758.324.422.91

位置编码显著提升音频-视觉对齐。

推理加速效果:

配置1 GPU2 GPU4 GPU8 GPU
w/o TeaCache23.62 min17.90 min7.80 min4.29 min
w/ TeaCache (α=0.3)8.96 min7.18 min1.88 min0.97 min

TeaCache + USP 组合实现约 24 倍加速(23.62 → 0.97 分钟)。

定性比较

Figure 5: 与其他音频驱动方法的定性比较

Figure 6: 与 SoTA 唇部同步方法的定性比较

Figure 7: 不同潜在融合方法的比较

Figure 8: 更多生成结果

七、相关工作

扩散模型唇部同步

  • LatenSync:使用 SyncNet 损失辅助唇部同步
  • EMO:音频驱动唇部同步 + 稀疏视觉线索驱动头部动态
  • V-Express:音频驱动 + 视觉线索的协同控制
  • Hallo3:端到端扩散框架,音频驱动肖像动画

扩散模型肖像动画

  • Echomimic / MegActor-Sigma:联合建模视觉和听觉信号
  • OmniHuman-1:基于 DiT 的高质量肖像动画
  • CogVideoX / HunyuanVideo:3D 全注意力机制的视频生成

SkyReels-Audio 的差异化

  • 统一框架:同时支持图像动画和视频编辑
  • 无限长度生成:BLF 策略实现免训练的长视频生成
  • 音频引导 CFG:推理时增强音频同步
  • 混合课程学习:渐进式多模态对齐

八、总结

核心贡献

  1. 全音频条件框架:基于预训练视频扩散 Transformer 的统一肖像生成和编辑系统
  2. 双向潜在融合(BLF):免训练的无限视频推理策略,实现时间连续性
  3. 混合学习范式:结合图像和视频控制的多模态条件,面部区域加权损失
  4. 高质量数据流水线:精心策划的音视频文本三元组数据集

技术影响

  • 数字人应用:为虚拟通信、数字故事、沉浸式教育提供基础技术
  • 长视频生成:BLF 策略可推广到其他视频生成任务
  • 多模态控制:统一框架展示了多条件灵活组合的可能性
  • 推理加速:TeaCache + USP 组合提供高效推理方案

局限性

  1. 开源缺失:GitHub 仓库尚未公开,代码和模型暂不可用
  2. 训练数据依赖:需要 1K 小时高质量音视频三元组数据
  3. 计算资源:训练需要 80×GPU,推理需要多 GPU 加速
  4. 颜色漂移:长视频推理中观察到图像颜色变暗现象(通过数据质量和后处理缓解)
  5. 面部多样性:主要针对正面人脸,侧面和极端角度可能效果有限
  6. 评估基准:内部基准尚未公开,与闭源模型比较有限

九、参考资源

论文

相关工作

  • SkyReels-V2: 预训练视频扩散 Transformer 骨干
  • SkyCaptioner-V1: 视频标注模型
  • Whisper: 音频特征提取和编码
  • DWPose: 面部关键点检测
  • TeaCache: 推理加速技术
  • USP: 统一序列并行

数据集

  • OpenHumanVid, Panda-6M, Hallo3 等公开数据集
  • 自采数据(未公开)