Back to blog

Human Motion Video Generation: A Survey

全面综述人体运动生成技术,涵盖视觉、文本、音频三种模态,200+论文,10+子任务

Human Motion Video Generation: A Survey

一、论文概述

项目内容
标题Human Motion Video Generation: A Survey
作者Haiwei Xue, Xiangyang Luo, Zhanghao Hu, Xin Zhang, Xunzhi Xiang, Yuqin Dai, Jianzhuang Liu, Zhensong Zhang, Minglei Li, Jian Yang, Fei Ma, Zhiyong Wu, Changpeng Yang, Zonghong Dai, Fei Richard Yu
论文https://arxiv.org/abs/2509.03883
发布2025-09-04
涵盖200+论文,10+子任务
代码库https://github.com/NJU-PRIS/HumanMotionVideoGeneration_Survey

二、核心思想

问题定义

人体运动生成面临的核心挑战:

挑战说明
数据稀缺隐私问题、质量差、采集成本高
运动规划缺乏深层语义理解,依赖预存数据分布
真实感不足面部、手部细节失真,视觉一致性差
时长与控制当前方法生成时长短,控制能力有限

解决方案概述

本综述提出五阶段生成流程:

输入 → 运动规划 → 运动视频生成 → 精炼 → 输出

Figure 2: 五阶段生成流程

三种驱动模态

模态子任务典型应用
视觉驱动肖像动画、舞蹈生成、换装、姿态转视频表情迁移、角色动画
文本驱动Text2Face、Text2MotionVideo文本描述生成人脸/全身
音频驱动说话头生成、音频驱动全身运动虚拟主播、数字人

三、技术架构

生成框架分类

Figure 3: 生成框架对比

框架优势局限性
VAE鲁棒的数据表示能力模式崩溃,样本不够清晰
GAN高质量输出,隐式映射特征关系训练不稳定,模式崩溃
扩散模型分布覆盖,训练目标稳定,易于扩展计算开销大
潜在扩散模型(LDM)在潜在空间扩散,显著降低计算成本仍需优化细节

人体数据表示

Figure 4: 七种人体姿态表示

表示方法说明优点缺点
Mask轮廓和占据区域提供粗粒度布局先验缺乏详细姿态描述
Mesh详细的体型和肢体表示几何信息丰富计算复杂
Skeleton骨骼关键点轻量级,易于获取缺少外观信息
Keypoint关键点检测简单高效信息有限
Landmark面部/手部特征点精细控制仅限局部
Depth深度信息3D感知获取困难
SMPL参数化人体模型标准化,可参数化控制需要训练数据

运动规划方法

Figure 5: LLM运动规划的两种形式

基于LLM的运动规划:

方法策略应用场景
检索式LLM生成细粒度描述用于检索对话场景表情生成
投影式LLM将描述投影到潜在空间指导生成单人运动视频

基于特征映射的运动规划:

  • 使用编码器提取输入特征
  • 通过映射网络转换为运动参数
  • 直接驱动视频生成模型

视觉驱动生成

肖像动画(Portrait Animation):

方法技术特点优势
OmniAvatar几何先验引导3D一致性,细节表情
Follow-Your-Emoji表情感知关键点引导运动对齐,身份保持
LivePortrait高效视频驱动框架计算效率高,可控性强
AniPortrait音频/姿态引导多模态驱动

舞蹈视频生成(Dance Video Generation):

方法技术特点优势
AI Choreographer时尚音乐编舞高质量全身运动
Dance-any-Motion多样化舞蹈生成风格多样性
Fate/Zero零样本人物舞蹈无需特定人物训练

音频驱动生成

说话头生成(Talking Head Generation):

Figure 6: 说话头生成分类

方法驱动信号技术特点
SadTalker音频3DMM参数驱动
VideoReTalking音频唇形同步优化
Hallo音频分层音频运动建模
MuseTalk音频实时生成

四、核心创新

创新点说明影响
五阶段流程首次完整定义生成流程为研究提供统一框架
LLM运动规划首次讨论LLM在运动规划中的应用开启新研究方向
多模态融合视觉、文本、音频三种模态全面覆盖推动跨模态研究
精炼策略部件特定+通用精炼显著提升生成质量

五、实验结果

评估指标体系

Figure 11: 评估指标概览

指标类别指标用途
单帧质量L1, FID, SSIM, PSNR, LPIPS衡量每帧质量
视频质量KVD, FVD, FGD, ACD时序一致性,运动连贯性
视频特性CLIP-S, IS, Diversity, Pose Accuracy帧一致性,多样性
综合评估DOVER, VBench, EvalCrafter系统性评估框架

主要子任务对比

说话头生成:

方法驱动FID↓LPIPS↓同步率
SadTalker音频32.10.2589.2%
VideoReTalking音频28.50.2291.5%
Hallo音频25.30.1993.1%
LivePortrait姿态22.80.1794.6%

舞蹈生成:

方法输入FVD↓多样性
AI Choreographer音乐145.2高
Dance-any-Motion音乐138.7高
Fate/Zero文本152.3中

六、相关工作

早期工作

  • 卡通角色生成:简单动画,缺乏真实纹理
  • 3D模型渲染:基于NeRF/3DGS的方法
  • GAN时代:StyleGAN系列主导

近期进展

  • 扩散模型主导:SVD, AnimateDiff等基础模型
  • 多条件驱动:从单模态到多模态融合
  • LLM赋能:运动规划的智能化

七、总结

核心贡献

  1. 首个完整流程综述:定义五阶段生成流程
  2. LLM运动规划:首次讨论LLM在人体运动中的应用
  3. 全面覆盖:200+论文,10+子任务,三种模态
  4. 统一评估框架:系统化评估指标体系

技术影响

  • 数字人应用:推动虚拟主播、数字人产业发展
  • 娱乐内容:舞蹈生成、表情迁移等创意应用
  • 人机交互:提升人机交互的自然度
  • 研究方向:指明未来研究重点和挑战

未来挑战

  1. 数据稀缺:需要更多高质量人体运动数据
  2. 运动规划:从统计方法向语义理解转变
  3. 真实感:面部、手部细节仍需改进
  4. 时长扩展:当前方法生成时长有限
  5. 实时性:实时生成仍面临挑战

八、参考资源

论文

代表性方法

  • SadTalker: 3DMM驱动的说话头
  • LivePortrait: 高效肖像动画
  • Hallo: 分层音频运动建模
  • AI Choreographer: 音乐编舞生成
  • MimicMotion: 姿态引导的动作生成

基础模型

  • Stable Video Diffusion (SVD): 视频扩散模型
  • AnimateDiff: 动画生成基础模型
  • StyleGAN: 生成对抗网络系列