SkyReels V1-V4 系列论文总结
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
SkyReels V1-V4 系列论文总结
一、系列概述
| 项目 | 内容 |
|---|---|
| 机构 | Skywork AI(昆仑万维) |
| 核心模型 | SkyReels V1–V4 |
| 专项模型 | A1、A2、Audio、Text |
| 数据基础 | SkyScript-100M |
| 时间跨度 | 2024 年 8 月 — 2026 年 2 月 |
SkyReels 是 Skywork AI 推出的一系列开源视频生成模型,已发展出 V1–V4 四代核心模型,以及 A1/A2/Audio 三个专项模型和 Text 文字编辑模型。该系列覆盖文本到视频、图像到视频、视频编辑、音频驱动、角色动画、多元素合成等多个方向,是目前开源视频生成领域最完整的模型系列之一。
二、SkyScript-100M — 数据基础
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2408.09333 |
| 发布 | 2024 年 8 月 |
SkyScript-100M 是 SkyReels 系列的 数据基础,为后续所有模型的训练提供了高质量数据支撑。
核心内容:
- 收集 6,660 部热门短剧,每部平均 100 集,总计约 80,000 集
- 总时长约 2,000 小时,数据量 10TB
- 通过关键帧提取和标注获得约 10,000,000 个拍摄脚本
- 基于自研短剧生成模型 SkyReels 进行 100 次脚本还原
- 最终生成 10 亿对剧本-拍摄脚本 数据对
意义:为视频生成提供了包含场景、镜头语言等丰富信息的高质量标注数据,推动了文本到视频生成的范式转变。
三、SkyReels-V1 — 以人为中心的视频基础模型
| 项目 | 内容 |
|---|---|
| 发布 | 2025 年 2 月 |
| 模型 | I2V · T2V |
| 代码 | github.com/SkyworkAI/SkyReels-V1 |
| 基座 | HunyuanVideo |
核心定位
SkyReels V1 是 首个也是最先进的开源以人为中心的视频基础模型,基于 HunyuanVideo 微调,在千万级高质量影视片段上训练。
三大优势
| 特性 | 说明 |
|---|---|
| 开源领先 | T2V 模型在开源模型中达到 SOTA,可比肩 Kling、Hailuo 等闭源模型 |
| 高级面部动画 | 捕捉 33 种面部表情,超过 400 种自然运动组合,精准反映人类情感 |
| 电影级光影美学 | 基于好莱坞级影视数据训练,每帧在构图、演员定位、镜头角度上均具电影品质 |
技术特点
1. 自研数据清洗与标注流水线:
- 表情分类:将面部表情分为 33 种类型
- 角色空间感知:利用 3D 人体重建技术理解多人空间关系
- 动作识别:构建 400+ 动作语义单元
- 场景理解:跨模态关联分析服装、场景、情节
2. 多阶段 I2V 预训练:
- Stage 1:模型域迁移预训练(影视内容适应)
- Stage 2:图像到视频模型预训练
支持任务
- Text-to-Video (T2V):文本生成视频
- Image-to-Video (I2V):图像生成视频
四、SkyReels-A1 — 表情肖像动画
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2502.10841 |
| 发布 | 2025 年 2 月 |
| 模型 | Skywork/SkyReels-A1 |
核心定位
基于视频扩散 Transformer 的 肖像图像动画框架,解决现有方法中的身份失真、背景不稳定和面部动态不真实等问题。
技术特点
| 模块 | 功能 |
|---|---|
| 表情感知条件模块 | 基于表情引导的 landmark 输入实现无缝视频合成 |
| 面部图像-文本对齐模块 | 加强面部属性与运动轨迹的融合,强化身份保持 |
| 多阶段训练范式 | 逐步细化表情与运动的关联,确保稳定的身份再现 |
应用场景
虚拟头像、远程通信、数字媒体生成
五、SkyReels-A2 — 多元素视频合成
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2504.02436 |
| 发布 | 2025 年 4 月 |
| 代码 | github.com/SkyworkAI/SkyReels-A2 |
核心定位
可控视频生成框架,能够将任意视觉元素(角色、物体、背景)根据文本提示组装成合成视频,同时保持每个元素与参考图像的严格一致性。该任务被称为 Elements-to-Video (E2V)。
技术特点
| 组件 | 说明 |
|---|---|
| 数据流水线 | 构建 prompt-reference-video 三元组用于模型训练 |
| 图文联合嵌入模型 | 将多元素表示注入生成过程,平衡元素一致性与全局协调性 |
| 推理优化 | 优化速度和输出稳定性 |
| A2 Bench | 精心策划的系统评估基准 |
核心价值
- 首个开源商业级 E2V 模型
- 性能优于先进闭源商业模型
- 推动戏剧创作、虚拟电商等创意应用
六、SkyReels-V2 — 无限长度电影生成模型
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2504.13074 |
| 发布 | 2025 年 4 月 |
| 代码 | github.com/SkyworkAI/SkyReels-V2 |
核心定位
无限长度电影生成模型,协同多模态大语言模型(MLLM)、多阶段预训练、强化学习和 Diffusion Forcing 框架。
解决的关键问题
| 问题 | V1 的局限 | V2 的解决方案 |
|---|---|---|
| 运动动态 | 为提升视觉质量牺牲运动动态 | Motion-specific RL 训练 |
| 视频时长 | 限制在 5–10 秒 | Diffusion Forcing 框架实现无限长度 |
| 镜头感知 | 通用 MLLM 无法理解电影语法 | SkyCaptioner-V1 统一视频描述器 |
技术架构
1. SkyCaptioner-V1 — 统一视频描述器:
- 结合 MLLM 的通用描述和子专家模型的详细镜头语言
- 辅以人工标注,高效标注视频数据
2. 四阶段后训练增强:
- Stage 1:概念平衡的监督微调(SFT)提升基线质量
- Stage 2:运动特定强化学习(RL)训练,使用人工标注和合成失真数据
- Stage 3:非递减噪声调度的 Diffusion Forcing 框架,实现高效长视频合成
- Stage 4:高质量 SFT 精炼视觉保真度
核心创新
- Diffusion Forcing:非递减噪声调度,实现理论上无限长度的视频生成
- SkyCaptioner-V1:统一的视频描述模型,融合通用理解和镜头语言
- 运动 RL:针对运动伪影的强化学习训练
七、SkyReels-Audio — 音频驱动说话肖像
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2506.00830 |
| 发布 | 2025 年 6 月 |
核心定位
基于预训练视频扩散 Transformer 的 统一说话肖像视频合成框架,支持无限长度生成和编辑,通过多模态输入实现多样化可控调节。
技术特点
| 技术 | 说明 |
|---|---|
| 混合课程学习 | 渐进式对齐音频与面部运动 |
| 面部 mask 损失 | 增强局部面部连贯性 |
| 音频引导 classifier-free guidance | 实现细粒度多模态控制 |
| 滑动窗口去噪 | 融合时间片段间的潜在表示 |
| 专用数据流水线 | 构建音频-视频-文本同步三元组 |
核心能力
- 唇形同步精度高
- 身份一致性保持
- 复杂条件下逼真的面部动态
八、SkyReels-V3 — 多模态上下文条件视频生成
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2601.17323 |
| 发布 | 2026 年 1 月 |
核心定位
基于统一多模态上下文学习框架的 条件视频生成模型,在单一架构内支持三种核心生成范式。
三大生成范式
| 范式 | 说明 |
|---|---|
| 参考图像→视频 | 高保真视频生成,保持强主体身份、时间连贯性和叙事一致性 |
| 视频→视频扩展 | 时空一致性建模,支持单镜头无缝续拍和多镜头智能切换 |
| 音频引导视频生成 | 分钟级音频条件视频生成,训练首尾帧插入模式 |
技术创新
1. 参考图像→视频:
- 跨帧配对、图像编辑、语义重写的数据处理流水线
- 图像-视频混合策略 + 多分辨率联合优化
- 有效缓解复制粘贴伪影
2. 视频扩展:
- 时空一致性建模 + 大规模视频理解
- 专业电影级镜头切换模式
3. 说话头像:
- 首尾帧插入模式训练
- 关键帧推理范式重构
- 音视频同步优化
评估结果
在视觉质量、指令遵循和特定方面指标上达到 SOTA 或接近 SOTA,接近领先闭源系统。
九、SkyReels-Text — 字体可控海报文字编辑
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2511.13285 |
| 发布 | 2025 年 11 月 |
| 会议 | CVPR 2026 |
核心定位
字体可控的精确海报文字编辑框架,支持同时编辑多个文字区域,每个区域可使用不同的排版风格。
核心特点
- 无需字体标签或测试时微调
- 用户只需提供裁剪的字形补丁即可指定字体
- 保持非编辑区域的视觉外观
- 在文本保真度和视觉真实感上达到 SOTA
十、SkyReels-V4 — 多模态视频-音频统一生成模型
| 项目 | 内容 |
|---|---|
| 论文 | arXiv:2602.21818 |
| 发布 | 2026 年 2 月 |
核心定位
统一多模态视频基础模型,同时支持视频-音频联合生成、修复(inpainting)和编辑。
架构设计
双流多模态扩散 Transformer (MMDiT):
- 视频分支:合成视频
- 音频分支:生成时间对齐的音频
- 共享文本编码器:基于多模态大语言模型(MLLM)
多模态输入支持
| 输入类型 | 说明 |
|---|---|
| 文本 | 文本描述和指令 |
| 图像 | 参考图像 |
| 视频片段 | 视频条件输入 |
| 掩码 | 区域指定 |
| 音频参考 | 音频条件引导 |
统一任务接口
通过通道拼接公式,统一以下任务:
- 图像到视频
- 视频扩展
- 视频编辑
- 视觉参考修复和编辑
生成能力
| 参数 | 规格 |
|---|---|
| 分辨率 | 最高 1080p |
| 帧率 | 32 FPS |
| 时长 | 最长 15 秒 |
效率策略
- 低分辨率全序列 + 高分辨率关键帧联合生成
- 专用超分辨率和帧插值模型
历史意义
据论文所知,SkyReels V4 是首个同时支持多模态输入、视频-音频联合生成,以及统一生成/修复/编辑处理的视频基础模型,在电影级分辨率和时长下保持强大的效率和质量。
十一、技术演进总结
SkyScript-100M (2024.08) — 数据基础
│
├── SkyReels-V1 (2025.02) — 以人为中心的视频基础模型
│ ├── 基于 HunyuanVideo 微调
│ ├── 33 种面部表情,400+ 运动组合
│ └── T2V + I2V
│
├── SkyReels-A1 (2025.02) — 肖像动画
│ └── 表情感知 + 身份保持
│
├── SkyReels-A2 (2025.04) — 多元素视频合成
│ └── E2V (Elements-to-Video)
│
├── SkyReels-V2 (2025.04) — 无限长度电影生成
│ ├── SkyCaptioner-V1 统一描述器
│ ├── Diffusion Forcing 无限长度
│ └── Motion RL 运动优化
│
├── SkyReels-Audio (2025.06) — 音频驱动说话肖像
│ └── 无限长度 + 多模态控制
│
├── SkyReels-Text (2025.11) — 字体可控文字编辑
│ └── CVPR 2026 接收
│
├── SkyReels-V3 (2026.01) — 多模态上下文条件生成
│ ├── 参考图像→视频
│ ├── 视频→视频扩展
│ └── 音频引导视频生成
│
└── SkyReels-V4 (2026.02) — 多模态统一生成模型
├── 双流 MMDiT 架构
├── 视频-音频联合生成
├── 统一生成/修复/编辑
└── 1080p, 32FPS, 15s
十二、核心论文列表
| 模型 | 论文 | 发布时间 | arXiv |
|---|---|---|---|
| SkyScript-100M | SkyScript-100M: 1B Pairs of Scripts and Shooting Scripts | 2024.08 | 2408.09333 |
| SkyReels-V1 | Human-Centric Video Foundation Model | 2025.02 | HuggingFace |
| SkyReels-A1 | Expressive Portrait Animation in Video DiT | 2025.02 | 2502.10841 |
| SkyReels-A2 | Compose Anything in Video DiT | 2025.04 | 2504.02436 |
| SkyReels-V2 | Infinite-length Film Generative Model | 2025.04 | 2504.13074 |
| SkyReels-Audio | Omni Audio-Conditioned Talking Portraits | 2025.06 | 2506.00830 |
| SkyReels-Text | Fine-Grained Font-Controllable Text Editing (CVPR 2026) | 2025.11 | 2511.13285 |
| SkyReels-V3 | Multi-modal In-Context Video Generation | 2026.01 | 2601.17323 |
| SkyReels-V4 | Multi-modal Video-Audio Generation, Inpainting and Editing | 2026.02 | 2602.21818 |
十三、相关加速研究
SkyReels 模型也催生了多项推理加速研究:
| 论文 | 方法 | 加速比 | arXiv |
|---|---|---|---|
| FlowCache | 流缓存压缩机制 | SkyReels-V2: 6.7× | 2602.10825 |
| MotionCache | 运动感知缓存 | SkyReels-V2: 6.28× | 2605.01725 |
| SCOPE | 选择性计算与预测外推 | SkyReels-V2: 4.73× | 2604.02979 |
| SANA-Video | 块线性扩散 Transformer | 对比 SkyReels-V2-1.3B | 2509.24695 |
十四、总结
SkyReels 系列从 数据基础(SkyScript)到 基础模型(V1),再到 能力扩展(A1/A2/Audio)和 架构升级(V2→V3→V4),构建了一个完整的视频生成生态系统。其核心特点:
- 全开源:所有模型和代码均开源,推动社区发展
- 技术迭代快:从 2024.08 到 2026.02,不到两年完成四代核心模型迭代
- 能力全面:覆盖 T2V、I2V、视频编辑、音频驱动、肖像动画、多元素合成等
- 工程导向:注重实际应用场景(电影制作、虚拟电商、数字媒体)
- 效率优化:V4 引入联合生成策略,在电影级分辨率下保持可行的计算成本
SkyReels V4 作为最新一代模型,首次实现了视频-音频联合生成、统一生成/修复/编辑、多模态输入的完整统一,代表了开源视频基础模型的一个重要里程碑。
分析日期: 2026-06-16