Back to blog

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

通过潜在轨迹引导实现运动可控的视频生成

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

一、论文概述

项目内容
标题Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
作者Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang
机构Tongyi Lab (Alibaba), Tsinghua University, HKU, CUHK
论文arXiv:2512.08765
代码GitHub - ali-vilab/Wan-Move
发布2025年12月9日
主题cs.CV

二、核心思想

问题定义

运动控制是视频生成的核心,但现有方法存在两个关键限制:

  1. 表示粒度粗糙: 边界框和分割掩码无法控制局部运动;光流需要额外模型估计,累积误差;点轨迹缺乏空间上下文
  2. 集成方式复杂: 现有方法引入额外运动编码器和融合模块(如 ControlNet),信号在处理过程中退化,且难以大规模微调

核心观察

I2V 生成旨在动画第一帧,运动轨迹指定物体在后续帧的位置。由于 VAE 的平移等变性,轨迹位置的潜在特征应与第一帧高度相似。

解决方案概述

Wan-Move 提出简单可扩展的运动控制框架:

  • 潜在轨迹引导: 将点轨迹从像素空间映射到潜在空间
  • 潜在特征复制: 沿轨迹复制第一帧特征到后续帧
  • 无额外模块: 直接编辑图像条件特征,无需运动编码器
  • 可扩展微调: 基于 Wan-I2V-14B,轻松大规模微调

核心性能

指标数值
视频质量832×480p, 5 秒
MoveBench FID12.2 (vs Tora 22.5, MagicMotion 17.5)
MoveBench EPE2.6 (vs Tora 3.3, MagicMotion 3.2)
人类评估与 Kling 1.5 Pro 竞争性表现
推理开销仅增加 3 秒 (vs ControlNet +225 秒)

三、技术架构

整体框架

Wan-Move 框架

Figure 2: (a) 为注入运动引导,将点轨迹从视频转移到潜在空间,然后沿每条潜在轨迹将第一帧特征复制到后续零填充帧。(b) Wan-Move 基于现有 I2V 生成模型训练,通过高效的潜在特征复制步骤更新条件特征。

核心公式

条件特征构建

I2V 模型通过连接潜在噪声 xtx_t 和第一帧条件特征 zimagez_{\text{image}} 沿通道维度:

z_{\text{image}} = \mathcal{E}(\text{concat}[\mathbf{I}, \mathbf{0}_{T \times H \times W \times 3}]) \in \mathbb{R}^{(1+Tf_t) \times \frac{H}{f_s} \times \frac{W}{f_s} \times C} \tag{1}

潜在轨迹映射

将像素空间轨迹 p∈R(1+T)×2\mathbf{p} \in \mathbb{R}^{(1+T) \times 2} 映射到潜在空间:

\tilde{\mathbf{p}}[n] = \begin{cases} \frac{\mathbf{p}[n]}{f_s} & \text{if } n = 0 \\ \frac{\sum_{i=(n-1) \cdot f_t + 1}^{n \cdot f_t} \mathbf{p}[i]}{f_t \cdot f_s} & 1 \leq n \leq \frac{T}{f_t} \end{cases} \tag{2}

第一帧轨迹位置通过空间映射获得,后续帧对每 ftf_t 帧取平均。

潜在特征复制

提取第一帧在初始轨迹点 p~[0]\tilde{\mathbf{p}}[0] 的潜在特征,沿轨迹复制到后续帧:

z_{\text{image}}[n, \tilde{\mathbf{p}}[n, 0], \tilde{\mathbf{p}}[n, 1], :] = z_{\text{image}}[0, \tilde{\mathbf{p}}[0, 0], \tilde{\mathbf{p}}[0, 1], :] \tag{3}

for n=1,…,Tftn = 1, \ldots, \frac{T}{f_t}

关键: 利用潜在特征的平移等变性,无需额外运动编码器。

训练损失

基于 Flow Matching 的向量场预测:

\mathcal{L}_{\text{FM}}(\theta) = \mathbb{E}_{t, x_t, c}[\|v_\theta(x_t, t, c) - v_t(x_t)\|_2] \tag{4}

其中 cc 是生成条件的联合。

推理引导

\tilde{v}_\theta(x_t, t, z_{\text{image}}, z_{\text{global}}, z_{\text{text}}) = v_{\text{uncond}} + w(v_{\text{cond}} - v_{\text{uncond}}) \tag{5}

引导尺度 w=5.0w = 5.0。

训练数据

  • 数据规模: 200 万高质量 720p 视频
  • 来源: Panda70M, Pixabay, Pexels, YouTube
  • 两阶段过滤:
    1. 专家评分模型评估视觉质量
    2. SigLIP 特征余弦相似度过滤时间一致性
  • 轨迹提取: CoTracker 跟踪 32×32 稠密网格点
  • 训练采样: 5% 概率无轨迹 (k=0k=0),95% 概率 kk 均匀采样 1-200

MoveBench 基准

MoveBench 构建流程

Figure 3: MoveBench 构建流程,获取高质量样本和丰富标注。

特性MoveBenchMagicBenchDAVIS
视频数量101860090
时长5 秒短短
内容类别54有限有限
标注类型点轨迹 + 掩码自动标签稀疏标注
标注质量人工 + SAM自动人工

标注流程: 人工点击 → SAM 生成初始掩码 → 负点修正 → 精确标注

四、核心创新

创新点说明理论/实验依据
潜在轨迹引导像素轨迹映射到潜在空间,利用平移等变性EPE 2.6 vs 像素复制 3.7
潜在特征复制复制第一帧特征到轨迹位置,保留丰富上下文PSNR 17.8 vs 随机嵌入 16.1
无额外模块直接编辑条件特征,无需运动编码器推理仅增加 3 秒 (vs ControlNet +225 秒)
可扩展微调基于 Wan-I2V-14B,轻松大规模训练200 万视频训练
MoveBench综合基准:1018 视频,54 类,精确标注人工 + SAM 混合标注

五、实验结果

测试配置

配置值
基础模型Wan-I2V-14B
训练数据200 万视频
分辨率832×480p
时长5 秒
引导尺度5.0
评估指标FID↓, FVD↓, PSNR↑, SSIM↑, EPE↓

单物体运动控制 (MoveBench)

方法FID↓FVD↓PSNR↑SSIM↑EPE↓
ImageConductor34.5424.013.40.4915.6
LeviTor18.198.815.60.543.4
Tora22.5100.415.70.553.3
MagicMotion17.596.714.90.563.2
Wan-Move12.283.517.80.642.6

关键发现:

  • FID 12.2 vs Tora 22.5 (46% 改善)
  • EPE 2.6 vs Tora 3.3 (21% 改善)
  • PSNR 17.8 vs 最佳基线 15.7 (13% 改善)

DAVIS 数据集

方法FID↓FVD↓PSNR↑SSIM↑EPE↓
ImageConductor54.2513.611.60.4714.8
LeviTor22.0115.413.30.513.7
Tora25.9129.213.70.493.5
MagicMotion24.2113.412.80.533.5
Wan-Move14.794.316.50.612.5

多物体运动控制

方法FID↓FVD↓PSNR↑SSIM↑EPE↓
ImageConductor77.5764.513.90.519.8
Tora53.2350.014.50.543.5
Wan-Move28.8226.316.70.622.2

人类评估 (2AFC)

对比方法运动准确率运动质量视觉质量
vs LeviTor98.2%98.0%98.8%
vs Tora96.2%93.8%98.4%
vs MagicMotion89.4%96.4%98.2%
vs Kling 1.5 Pro47.8%53.4%50.2%

关键发现: 与商业模型 Kling 1.5 Pro 竞争性表现,运动质量略优。

消融实验

运动引导策略

策略FID↓FVD↓PSNR↑SSIM↑EPE↓
像素复制17.391.015.30.563.7
随机轨迹嵌入15.489.216.10.592.7
潜在特征复制12.283.517.80.642.6

关键发现: 潜在特征复制利用第一帧丰富上下文,显著优于其他策略。

条件融合策略

策略FID↓FVD↓EPE↓延迟 (秒)
ControlNet12.484.62.5987 (+225)
连接 (Ours)12.283.52.6765 (+3)

关键发现: 简单连接性能媲美 ControlNet,但推理仅增加 3 秒 (vs +225 秒)。

训练轨迹数量

数量FID↓FVD↓PSNR↑SSIM↑EPE↓
N=1012.886.617.60.623.3
N=10012.984.717.70.652.7
N=20012.283.517.80.642.6
N=50013.383.917.60.633.0

推理轨迹数量

数量FID↓FVD↓PSNR↑SSIM↑EPE↓
N=0 (无轨迹)12.887.917.90.6412.4
N=112.283.517.80.642.6
N=1610.678.318.20.672.2
N=5127.751.020.30.751.5
N=10246.245.221.90.791.1

关键发现: 更多轨迹 → 更好性能。无轨迹时保持 I2V 质量 (EPE 12.4 因无引导)。

骨干和数据规模

方法骨干数据规模FID↓EPE↓
MagicMotionCogVideoX-5B23K17.53.2
Wan-Move-Cog-23KCogVideoX-5B23K16.02.8
ToraCogVideoX-5B630K22.53.3
Wan-Move-Cog-630KCogVideoX-5B630K14.12.8
Wan-MoveWan2.1-I2V-14B2000K12.22.6

大运动和分布外场景

子集方法FID↓FVD↓EPE↓
LargeTora29.1126.34.3
MagicMotion24.6119.34.1
Wan-Move14.586.63.0
OODTora28.9120.24.0
MagicMotion23.5115.73.9
Wan-Move13.586.02.8

关键发现: 挑战性场景下差距进一步扩大,Wan-Move 鲁棒性强。

六、应用示例

应用展示

Figure 1: Wan-Move 支持多样化运动控制应用(832×480p, 5 秒):

应用说明
物体控制单/多点轨迹控制物体运动
相机控制拖拽背景元素或基于相机位姿轨迹
原语控制旋转虚拟球体生成投影 2D 轨迹
运动迁移从一个视频提取轨迹应用到另一个图像
3D 旋转基于深度估计位置,应用旋转后投影到 2D

七、与现有方法对比

方面ImageConductorLeviTor/Tora/MagicMotionWan-Move
运动表示像素级轨迹控制信号 (各异)潜在轨迹
编码方式直接像素注入ControlNet/adaLN无额外模块
上下文单像素,无上下文有限第一帧丰富特征
推理开销低+225 秒 (ControlNet)+3 秒
可扩展性差中等好
EPE15.63.2-3.42.6

八、相关工作

相关工作与本文关系
Motion Prompting最相关,使用点轨迹但像素空间随机嵌入 + ControlNet
Tora轻量 adaLN 集成,EPE 3.3
MagicMotion稀疏掩码/边界框引导,ControlNet
LeviTor控制信号 + ControlNet
Kling 1.5 Pro商业 Motion Brush,Wan-Move 与之竞争

九、总结

核心贡献

  1. 潜在轨迹引导: 将点轨迹映射到潜在空间,利用平移等变性注入运动信息
  2. 无额外模块: 直接编辑条件特征,无需运动编码器或 ControlNet
  3. 可扩展微调: 基于 Wan-I2V-14B,200 万视频训练
  4. MoveBench: 1018 视频,54 类,人工 + SAM 精确标注
  5. 商业级质量: 与 Kling 1.5 Pro 竞争性表现

技术影响

  • 简单有效: 无需复杂架构修改,仅编辑条件特征
  • 可扩展性: 轻松大规模微调,训练数据越多越好
  • 运动控制新范式: 潜在空间操作替代像素空间编码
  • 开源: 代码、模型、基准全部开源

局限性

  • 长时间遮挡可能导致运动控制丢失
  • 点轨迹依赖 CoTracker,遮挡时不可靠
  • 生成 5 秒视频,更长视频需扩展
  • 双用途风险:可控视频生成可能被滥用

十、参考资源