Back to blog

SkyScript-100M: 1,000,000,000 Pairs of Scripts and Shooting Scripts for Short Drama

首个十亿级短剧剧本-拍摄脚本对数据集,重新定义拍摄脚本格式以支持 AI 短剧生成,涵盖高光检测、世界布局理解和隐式角色关系挖掘

SkyScript-100M: 1,000,000,000 Pairs of Scripts and Shooting Scripts for Short Drama

一、论文概述

项目内容
标题SkyScript-100M: 1,000,000,000 Pairs of Scripts and Shooting Scripts for Short Drama
作者Jing Tang, Quanlu Jia, Yuqiang Xie†, Zeyu Gong†, Xiang Wen, Jiayi Zhang, Yalong Guo, Guibin Chen, Jiangping Yang
机构SkyWork AI, 华中科技大学, 浙江大学
论文https://arxiv.org/abs/2408.09333
发布2024-08-18 (v2: 2024-08-28)

二、核心思想

问题定义

短剧(Short Drama)产业爆发式增长(ReelShort、ShortsTV、ShortMax),但传统制作流程存在根本性瓶颈:

  1. 流程低效:故事生成 → 剧本创作 → 角色设计 → 拍摄脚本,每步需人工调整
  2. 格式不适配:现有拍摄脚本格式(场景描述、机位、运动参数)难以被视频生成模型直接理解
  3. 关键信息缺失:缺少戏剧高光标注、角色配对兼容性(“嗑 CP”)等 AI 制作所需信息
  4. 3D 布局缺失:角色和关键物体的空间位置信息缺失,导致生成视频中角色/物体抖动

解决方案概述

SkyScript-100M 是首个十亿级短剧数据集,核心创新在于:

  • 重新定义拍摄脚本格式:包含 3D 位置、情感连续变化、高光分数等丰富标注
  • MLLM 驱动的关键信息预提取:使用 InternVL2-Llama3-76B 进行角色/物体/场景标注
  • SkyReels 脚本恢复:基于自研大短剧生成模型,从拍摄脚本反向生成 1B 对脚本
  • 新范式对齐:将视频生成模型与短剧世界对齐,保持角色/物体/世界观一致性

Figure 1: SkyScript-100M 概览

三、数据集构建

数据规模

指标数值
短剧集数6,660 部
总集数~80,000 集
总时长~2,000 小时
总数据量10 TB
关键帧提取~10,000,000 拍摄脚本
脚本-拍摄脚本对1,000,000,000 对

与现有数据集对比

数据集标注方式视频数片段数时长(h)分辨率领域
MSR-VTTManual7.2K10K40240Popen
LSMDCManual200118K1581080Pmovie
HowTo100MASR1.2M136M134.5K240Pinstruct
HD-VILA-100MASR3.3M103M371.5K720Popen
InternVidGenerated7.1M234M760.3K720Popen
SkyScript-100MManual6.6K100M2K720Pdrama

关键差异:SkyScript-100M 是唯一针对短剧领域的超大规模数据集,且采用人工标注(而非 ASR/Alt-text 迁移)。

重新定义的拍摄脚本格式

传统拍摄脚本仅包含基础参数(场景、机位、运动),SkyScript-100M 扩展为:

字段说明示例
SCENE场景编号与环境SCENE 1 EXT. PARK - DAY
SHOT镜头类型WIDE SHOT
CAMERA POSITION机位描述Stationary, capturing the entire park
FOCUS焦点主体A couple, EMMA and JACK
ACTION动作描述They walk leisurely, talking
Highlight Score高光分数 (VAD)4.0
3D Location3D 坐标Emma: (0,165,0), Jack: (60,180,0)
Camera Detail-Time镜头时长4 seconds
Camera Detail-Shot Size景别WIDE SHOT
Camera Detail-Camera Angle机位角度Eye Level
Camera Detail-Main Subject主要主体(Emma, Jack)
Event Number/Event事件编号与描述001: Emma and Jack walking

角色情感标注(VAD 模型)

基于 Plutchik 情感理论,使用三维连续情感模型:

  • Valence (V):情感正负性(快乐程度)
  • Arousal (A):唤醒度(激动程度)
  • Dominance (D):支配感(控制程度)

配合 Temperament(气质) 和 Facial Attractiveness(面部吸引力) 指标,支持角色配对兼容性计算。

构建流程

Figure 3: 完整构建流程样本

  1. 视频采集:从互联网收集 6,660 部热门短剧
  2. MLLM 预提取:使用 InternVL2-Llama3-76B(32×A800 80G 推理)进行关键信息预标注
  3. 人工精标:专业编剧团队进行关键帧标注和拍摄脚本生成
  4. 脚本恢复:使用 SkyReels 模型对 10M 拍摄脚本进行 100 次脚本恢复,生成 1B 对

Figure 4: 像素化面部图像保护隐私

四、新短剧生成范式

传统 vs 新范式

Figure 5: 传统拍摄脚本格式 vs 新范式格式

传统流程:故事生成 → 剧本生成 → 角色设计 → 拍摄脚本生成(各步骤割裂)

新范式:拍摄脚本包含尽可能多的世界信息,使视频生成模型在生成过程中保持与短剧世界一致的记忆(角色、物体、世界观概念)。

生成效果评估

Figure 6: 新短剧视频生成范式效果

基于新范式的 SkyReels 在以下维度评估:

评估维度GPT-4oQwen2Yi-LargeGPT-3.5SkyReels
Theme Expression----最优
Character Development----最优
Dialogue Quality----最优
Emotional Impact----最优
Pacing and Rhythm----最优
Conflict Resolution----最优
Plot Coherence----最优
Narrative Structure----最优

Figure 7: 大型脚本模型质量评估

五、广泛应用

5.1 视频高光检测

Figure 8: 连续视频高光标注

  • 基于 VAD 情感模型计算连续高光分数
  • 支持回归式高光检测方法(非离散单帧标注)
  • 解决短剧高光检测难题:弹幕少、点赞粒度为整集

5.2 世界布局理解

Figure 9: 世界布局理解

通过多视图几何理论实现 3D-2D 位置转换:

\begin{pmatrix} u \\ v \\ 1 \end{pmatrix} = \begin{pmatrix} t_1 & t_2 & t_3 & t_4 \\ t_5 & t_6 & t_7 & t_8 \\ t_9 & t_{10} & t_{11} & t_{12} \end{pmatrix} \begin{pmatrix} x \\ y \\ z \\ 1 \end{pmatrix} \tag{1}

  • 基于 3D 位置和逻辑链的一致性约束
  • 解决异常遮挡问题(Figure 10)

Figure 10: 3D 短剧中的异常遮挡

5.3 隐式角色关系挖掘

Figure 11: 隐式角色关系挖掘

  • 从显式三元组扩展为时变隐式关系
  • 结合多模态和单模态 LLM 进行关系挖掘
  • 基于角色位置和连续情感标注实现高精度识别

5.4 反事实脚本生成

Figure 12: 反事实脚本生成

基于 SkyScript-100M 的结构化数据,支持:

  • “如果角色 A 做了不同选择会怎样?”
  • 探索替代剧情走向
  • 辅助编剧进行创意探索

六、核心创新总结

创新点说明影响
十亿级数据集首个 1B 对短剧脚本-拍摄脚本数据集填补短剧领域数据空白
新拍摄脚本格式包含 3D 位置、VAD 情感、高光分数支持 AI 短剧全自动生成
MLLM 预提取InternVL2 进行关键信息预标注降低人工标注成本
新生成范式拍摄脚本包含完整世界信息视频生成模型与短剧世界对齐
多维度应用高光检测、布局理解、关系挖掘、反事实生成推动短剧 AI 制作全链路

七、技术影响

对短剧 AI 制作的指导

  • 数据为王:10TB 级数据集证明大规模领域数据的关键价值
  • 格式即接口:重新定义拍摄脚本格式使其成为 AI 可理解的”世界描述”
  • 全链路覆盖:从脚本生成到视频制作的完整数据支撑

局限性

  1. 隐私问题:虽使用像素化处理面部,但角色识别仍存在伦理风险
  2. 版权风险:从互联网收集短剧视频,版权归属不明确
  3. 标注一致性:6,660 部短剧的标注风格一致性难以完全保证
  4. 模型依赖:依赖 SkyReels 进行脚本恢复,泛化性有待验证
  5. 评估局限:新范式评估主要依赖 LLM 打分,缺少人工评估

八、参考资源

论文

相关工作

  • SkyReels: 自研大短剧生成模型(论文中提及)
  • InternVL2: 多模态关键信息预提取
  • Plutchik 情感理论: VAD 情感模型基础

数据集对比

  • MSR-VTT, LSMDC, HowTo100M, HD-VILA-100M, InternVid 等