Back to blog

SkyReels V1-V4 系列论文总结

昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引

SkyReels V1-V4 系列论文总结

一、系列概述

项目内容
机构Skywork AI(昆仑万维)
核心模型SkyReels V1–V4
专项模型A1、A2、Audio、Text
数据基础SkyScript-100M
时间跨度2024 年 8 月 — 2026 年 2 月

SkyReels 是 Skywork AI 推出的一系列开源视频生成模型,已发展出 V1–V4 四代核心模型,以及 A1/A2/Audio 三个专项模型和 Text 文字编辑模型。该系列覆盖文本到视频、图像到视频、视频编辑、音频驱动、角色动画、多元素合成等多个方向,是目前开源视频生成领域最完整的模型系列之一。

二、SkyScript-100M — 数据基础

项目内容
论文arXiv:2408.09333
发布2024 年 8 月

SkyScript-100M 是 SkyReels 系列的 数据基础,为后续所有模型的训练提供了高质量数据支撑。

核心内容:

  • 收集 6,660 部热门短剧,每部平均 100 集,总计约 80,000 集
  • 总时长约 2,000 小时,数据量 10TB
  • 通过关键帧提取和标注获得约 10,000,000 个拍摄脚本
  • 基于自研短剧生成模型 SkyReels 进行 100 次脚本还原
  • 最终生成 10 亿对剧本-拍摄脚本 数据对

意义:为视频生成提供了包含场景、镜头语言等丰富信息的高质量标注数据,推动了文本到视频生成的范式转变。

三、SkyReels-V1 — 以人为中心的视频基础模型

项目内容
发布2025 年 2 月
模型I2V · T2V
代码github.com/SkyworkAI/SkyReels-V1
基座HunyuanVideo

核心定位

SkyReels V1 是 首个也是最先进的开源以人为中心的视频基础模型,基于 HunyuanVideo 微调,在千万级高质量影视片段上训练。

三大优势

特性说明
开源领先T2V 模型在开源模型中达到 SOTA,可比肩 Kling、Hailuo 等闭源模型
高级面部动画捕捉 33 种面部表情,超过 400 种自然运动组合,精准反映人类情感
电影级光影美学基于好莱坞级影视数据训练,每帧在构图、演员定位、镜头角度上均具电影品质

技术特点

1. 自研数据清洗与标注流水线:

  • 表情分类:将面部表情分为 33 种类型
  • 角色空间感知:利用 3D 人体重建技术理解多人空间关系
  • 动作识别:构建 400+ 动作语义单元
  • 场景理解:跨模态关联分析服装、场景、情节

2. 多阶段 I2V 预训练:

  • Stage 1:模型域迁移预训练(影视内容适应)
  • Stage 2:图像到视频模型预训练

支持任务

  • Text-to-Video (T2V):文本生成视频
  • Image-to-Video (I2V):图像生成视频

四、SkyReels-A1 — 表情肖像动画

项目内容
论文arXiv:2502.10841
发布2025 年 2 月
模型Skywork/SkyReels-A1

核心定位

基于视频扩散 Transformer 的 肖像图像动画框架,解决现有方法中的身份失真、背景不稳定和面部动态不真实等问题。

技术特点

模块功能
表情感知条件模块基于表情引导的 landmark 输入实现无缝视频合成
面部图像-文本对齐模块加强面部属性与运动轨迹的融合,强化身份保持
多阶段训练范式逐步细化表情与运动的关联,确保稳定的身份再现

应用场景

虚拟头像、远程通信、数字媒体生成

五、SkyReels-A2 — 多元素视频合成

项目内容
论文arXiv:2504.02436
发布2025 年 4 月
代码github.com/SkyworkAI/SkyReels-A2

核心定位

可控视频生成框架,能够将任意视觉元素(角色、物体、背景)根据文本提示组装成合成视频,同时保持每个元素与参考图像的严格一致性。该任务被称为 Elements-to-Video (E2V)。

技术特点

组件说明
数据流水线构建 prompt-reference-video 三元组用于模型训练
图文联合嵌入模型将多元素表示注入生成过程,平衡元素一致性与全局协调性
推理优化优化速度和输出稳定性
A2 Bench精心策划的系统评估基准

核心价值

  • 首个开源商业级 E2V 模型
  • 性能优于先进闭源商业模型
  • 推动戏剧创作、虚拟电商等创意应用

六、SkyReels-V2 — 无限长度电影生成模型

项目内容
论文arXiv:2504.13074
发布2025 年 4 月
代码github.com/SkyworkAI/SkyReels-V2

核心定位

无限长度电影生成模型,协同多模态大语言模型(MLLM)、多阶段预训练、强化学习和 Diffusion Forcing 框架。

解决的关键问题

问题V1 的局限V2 的解决方案
运动动态为提升视觉质量牺牲运动动态Motion-specific RL 训练
视频时长限制在 5–10 秒Diffusion Forcing 框架实现无限长度
镜头感知通用 MLLM 无法理解电影语法SkyCaptioner-V1 统一视频描述器

技术架构

1. SkyCaptioner-V1 — 统一视频描述器:

  • 结合 MLLM 的通用描述和子专家模型的详细镜头语言
  • 辅以人工标注,高效标注视频数据

2. 四阶段后训练增强:

  • Stage 1:概念平衡的监督微调(SFT)提升基线质量
  • Stage 2:运动特定强化学习(RL)训练,使用人工标注和合成失真数据
  • Stage 3:非递减噪声调度的 Diffusion Forcing 框架,实现高效长视频合成
  • Stage 4:高质量 SFT 精炼视觉保真度

核心创新

  • Diffusion Forcing:非递减噪声调度,实现理论上无限长度的视频生成
  • SkyCaptioner-V1:统一的视频描述模型,融合通用理解和镜头语言
  • 运动 RL:针对运动伪影的强化学习训练

七、SkyReels-Audio — 音频驱动说话肖像

项目内容
论文arXiv:2506.00830
发布2025 年 6 月

核心定位

基于预训练视频扩散 Transformer 的 统一说话肖像视频合成框架,支持无限长度生成和编辑,通过多模态输入实现多样化可控调节。

技术特点

技术说明
混合课程学习渐进式对齐音频与面部运动
面部 mask 损失增强局部面部连贯性
音频引导 classifier-free guidance实现细粒度多模态控制
滑动窗口去噪融合时间片段间的潜在表示
专用数据流水线构建音频-视频-文本同步三元组

核心能力

  • 唇形同步精度高
  • 身份一致性保持
  • 复杂条件下逼真的面部动态

八、SkyReels-V3 — 多模态上下文条件视频生成

项目内容
论文arXiv:2601.17323
发布2026 年 1 月

核心定位

基于统一多模态上下文学习框架的 条件视频生成模型,在单一架构内支持三种核心生成范式。

三大生成范式

范式说明
参考图像→视频高保真视频生成,保持强主体身份、时间连贯性和叙事一致性
视频→视频扩展时空一致性建模,支持单镜头无缝续拍和多镜头智能切换
音频引导视频生成分钟级音频条件视频生成,训练首尾帧插入模式

技术创新

1. 参考图像→视频:

  • 跨帧配对、图像编辑、语义重写的数据处理流水线
  • 图像-视频混合策略 + 多分辨率联合优化
  • 有效缓解复制粘贴伪影

2. 视频扩展:

  • 时空一致性建模 + 大规模视频理解
  • 专业电影级镜头切换模式

3. 说话头像:

  • 首尾帧插入模式训练
  • 关键帧推理范式重构
  • 音视频同步优化

评估结果

在视觉质量、指令遵循和特定方面指标上达到 SOTA 或接近 SOTA,接近领先闭源系统。

九、SkyReels-Text — 字体可控海报文字编辑

项目内容
论文arXiv:2511.13285
发布2025 年 11 月
会议CVPR 2026

核心定位

字体可控的精确海报文字编辑框架,支持同时编辑多个文字区域,每个区域可使用不同的排版风格。

核心特点

  • 无需字体标签或测试时微调
  • 用户只需提供裁剪的字形补丁即可指定字体
  • 保持非编辑区域的视觉外观
  • 在文本保真度和视觉真实感上达到 SOTA

十、SkyReels-V4 — 多模态视频-音频统一生成模型

项目内容
论文arXiv:2602.21818
发布2026 年 2 月

核心定位

统一多模态视频基础模型,同时支持视频-音频联合生成、修复(inpainting)和编辑。

架构设计

双流多模态扩散 Transformer (MMDiT):

  • 视频分支:合成视频
  • 音频分支:生成时间对齐的音频
  • 共享文本编码器:基于多模态大语言模型(MLLM)

多模态输入支持

输入类型说明
文本文本描述和指令
图像参考图像
视频片段视频条件输入
掩码区域指定
音频参考音频条件引导

统一任务接口

通过通道拼接公式,统一以下任务:

  • 图像到视频
  • 视频扩展
  • 视频编辑
  • 视觉参考修复和编辑

生成能力

参数规格
分辨率最高 1080p
帧率32 FPS
时长最长 15 秒

效率策略

  • 低分辨率全序列 + 高分辨率关键帧联合生成
  • 专用超分辨率和帧插值模型

历史意义

据论文所知,SkyReels V4 是首个同时支持多模态输入、视频-音频联合生成,以及统一生成/修复/编辑处理的视频基础模型,在电影级分辨率和时长下保持强大的效率和质量。

十一、技术演进总结

SkyScript-100M (2024.08) — 数据基础
    │
    ├── SkyReels-V1 (2025.02) — 以人为中心的视频基础模型
    │   ├── 基于 HunyuanVideo 微调
    │   ├── 33 种面部表情,400+ 运动组合
    │   └── T2V + I2V
    │
    ├── SkyReels-A1 (2025.02) — 肖像动画
    │   └── 表情感知 + 身份保持
    │
    ├── SkyReels-A2 (2025.04) — 多元素视频合成
    │   └── E2V (Elements-to-Video)
    │
    ├── SkyReels-V2 (2025.04) — 无限长度电影生成
    │   ├── SkyCaptioner-V1 统一描述器
    │   ├── Diffusion Forcing 无限长度
    │   └── Motion RL 运动优化
    │
    ├── SkyReels-Audio (2025.06) — 音频驱动说话肖像
    │   └── 无限长度 + 多模态控制
    │
    ├── SkyReels-Text (2025.11) — 字体可控文字编辑
    │   └── CVPR 2026 接收
    │
    ├── SkyReels-V3 (2026.01) — 多模态上下文条件生成
    │   ├── 参考图像→视频
    │   ├── 视频→视频扩展
    │   └── 音频引导视频生成
    │
    └── SkyReels-V4 (2026.02) — 多模态统一生成模型
        ├── 双流 MMDiT 架构
        ├── 视频-音频联合生成
        ├── 统一生成/修复/编辑
        └── 1080p, 32FPS, 15s

十二、核心论文列表

模型论文发布时间arXiv
SkyScript-100MSkyScript-100M: 1B Pairs of Scripts and Shooting Scripts2024.082408.09333
SkyReels-V1Human-Centric Video Foundation Model2025.02HuggingFace
SkyReels-A1Expressive Portrait Animation in Video DiT2025.022502.10841
SkyReels-A2Compose Anything in Video DiT2025.042504.02436
SkyReels-V2Infinite-length Film Generative Model2025.042504.13074
SkyReels-AudioOmni Audio-Conditioned Talking Portraits2025.062506.00830
SkyReels-TextFine-Grained Font-Controllable Text Editing (CVPR 2026)2025.112511.13285
SkyReels-V3Multi-modal In-Context Video Generation2026.012601.17323
SkyReels-V4Multi-modal Video-Audio Generation, Inpainting and Editing2026.022602.21818

十三、相关加速研究

SkyReels 模型也催生了多项推理加速研究:

论文方法加速比arXiv
FlowCache流缓存压缩机制SkyReels-V2: 6.7×2602.10825
MotionCache运动感知缓存SkyReels-V2: 6.28×2605.01725
SCOPE选择性计算与预测外推SkyReels-V2: 4.73×2604.02979
SANA-Video块线性扩散 Transformer对比 SkyReels-V2-1.3B2509.24695

十四、总结

SkyReels 系列从 数据基础(SkyScript)到 基础模型(V1),再到 能力扩展(A1/A2/Audio)和 架构升级(V2→V3→V4),构建了一个完整的视频生成生态系统。其核心特点:

  1. 全开源:所有模型和代码均开源,推动社区发展
  2. 技术迭代快:从 2024.08 到 2026.02,不到两年完成四代核心模型迭代
  3. 能力全面:覆盖 T2V、I2V、视频编辑、音频驱动、肖像动画、多元素合成等
  4. 工程导向:注重实际应用场景(电影制作、虚拟电商、数字媒体)
  5. 效率优化:V4 引入联合生成策略,在电影级分辨率下保持可行的计算成本

SkyReels V4 作为最新一代模型,首次实现了视频-音频联合生成、统一生成/修复/编辑、多模态输入的完整统一,代表了开源视频基础模型的一个重要里程碑。

分析日期: 2026-06-16