Back to blog

MotionStream: Real-Time Video Generation with Interactive Motion Controls

实时交互式运动控制视频生成

MotionStream: Real-Time Video Generation with Interactive Motion Controls

一、论文概述

项目内容
标题MotionStream: Real-Time Video Generation with Interactive Motion Controls
作者Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, Xun Huang
论文arXiv:2511.01266
代码未公开
发布2025年11月3日(v5: 2026年3月5日)

二、核心思想

问题定义

运动控制的视频合成目标是让用户能够直观地引导数字角色、物体和摄像机的运动。然而,现有方法存在根本性限制:

  • 延迟过高:生成 5 秒视频需要 12 分钟(如 Motion Prompting),用户被困在”渲染-等待”循环中
  • 非因果处理:双向注意力要求所有未来控制信号预先提供,无法支持实时交互
  • 无法流式生成:整个序列并行处理,用户在完成前无法看到任何部分结果

解决方案概述

本文提出 MotionStream,专为交互式创作体验设计的实时流式视频生成框架:

  1. 运动控制教师模型:使用轻量级正弦位置编码 + 通道拼接进行轨迹条件化,避免 ControlNet 的计算开销
  2. 因果蒸馏:通过 Self Forcing + DMD 将双向教师蒸馏为因果学生模型
  3. 注意力汇聚 + 滑动窗口因果注意力:解决长视频外推时的质量退化和漂移问题
  4. 自滚动训练:用自生成输出替代 GT 进行训练,正确模拟推理时的外推

关键创新

创新点说明效果
轻量级轨迹编码正弦 PE + 可学习 track head,通道拼接比 RGB-VAE 快 42×,质量更好
联合文本-运动引导文本提供自然动态,运动提供轨迹对齐兼顾轨迹精度和自然运动
注意力汇聚机制缓存初始帧 KV 作为全局锚点长视频外推质量显著提升
自滚动 + KV 缓存滚动训练时模拟推理时的外推行为解决有限长度→无限长度的域差距
Tiny VAE轻量级解码器,LPIPS + 对抗训练解码速度提升 10×+

三、技术架构

整体框架图

MotionStream 架构和训练流程

核心公式

运动控制教师模型

轨迹表示:每个 2D 轨迹分配唯一的 d 维嵌入向量 ee,通过随机采样的 ID 号经正弦位置编码得到:

e=SinusoidalPE(random_id)e = \text{SinusoidalPE}(\text{random\_id})

轻量级轨迹头:执行 4× 时间压缩后接 3×3 卷积,直接与视频 latent 通道拼接:

track_embedding=Conv3x3(TemporalCompress4x(track_input))\text{track\_embedding} = \text{Conv3x3}(\text{TemporalCompress4x}(\text{track\_input}))

联合引导:

guidance=α⋅text_guidance+β⋅motion_guidance\text{guidance} = \alpha \cdot \text{text\_guidance} + \beta \cdot \text{motion\_guidance}

  • 纯运动引导:轨迹精度最高,但运动过于刚性(如纯 2D 平移)
  • 纯文本引导:自然动态,但轨迹对齐差
  • 联合引导:兼顾两者优势

因果蒸馏

滑动窗口注意力:

xtj−1i=Attn(qi,k[sink]+[i−W:i],v[sink]+[i−W:i])x^i_{t_{j-1}} = \text{Attn}(q^i, k^{[\text{sink}]+[i-W:i]}, v^{[\text{sink}]+[i-W:i]})

其中 [sink][\text{sink}] 是注意力汇聚的初始帧,WW 是局部窗口大小。

自滚动 (Self Rollout):在训练时自回归生成视频块,用自生成输出替代 GT:

x^chunkk=Gθ(xt1:Tchunkk,t1:T,KVcache)\hat{x}^{chunk_k} = G_\theta(x^{chunk_k}_{t_{1:T}}, t_{1:T}, \text{KV}_{\text{cache}})

DMD 蒸馏损失:

∇θLDMD≈−Et∫(sdata(Ψ(Gθ(ϵ),t),t)−sgen(Ψ(Gθ(ϵ),t),t))dGθ(ϵ)dθdϵ\nabla_\theta \mathcal{L}_{DMD} \approx -\mathbb{E}_t \int \big(s_{\text{data}}(\Psi(G_\theta(\epsilon), t), t) - s_{\text{gen}}(\Psi(G_\theta(\epsilon), t), t)\big) \frac{d G_\theta(\epsilon)}{d\theta} d\epsilon

注意力机制可视化

注意力概率图可视化

  • 双向注意力:所有 token 互相注意
  • 全因果注意力:只注意过去 token
  • 因果滑动窗口 + 注意力汇聚:注意初始帧(汇聚)+ 最近窗口

四、核心能力

实时交互式运动控制

  • 画轨迹:用户绘制 2D 轨迹,实时控制物体运动
  • 相机控制:通过轨迹实现相机运动控制
  • 运动迁移:从参考视频迁移运动到新场景
  • 拖拽交互:实时拖拽物体,视频即时响应

性能指标

配置分辨率FPS延迟
Wan 2.1 (1.3B)480P16.70.69s
Wan 2.2 (5B)720P10.41.1s
Wan 2.1 + Tiny VAE480P29.50.39s
Wan 2.2 + Tiny VAE720P23.90.49s

支持的应用

多样化下游应用

  • 长视频运动迁移(离线/在线控制)
  • 新视角合成(相机控制)
  • 交互式拖拽演示
  • 物体运动引导

五、实验结果

运动迁移(重建质量)

方法BackboneFPSDAVIS PSNR ↑DAVIS SSIM ↑DAVIS LPIPS ↓DAVIS EPE ↓Sora PSNR ↑Sora SSIM ↑Sora LPIPS ↓Sora EPE ↓
Image ConductorAnimateDiff (256P)2.9811.300.2140.66491.6410.290.1920.64431.22
Go-With-The-FlowCogVideoX-5B (480P)0.6015.620.3920.49041.9914.590.4100.42510.27
Diffusion-As-ShaderCogVideoX-5B (480P)0.2915.800.3720.48340.2314.510.3820.43718.76
ATIWan 2.1-14B (480P)0.2315.330.3740.47317.4116.040.5020.3666.12
Ours Teacher (1.3B)Wan 2.1-1.3B (480P)0.7916.610.4770.4275.3517.820.5860.3332.71
Ours Causal (1.3B)Wan 2.1-1.3B (480P)16.716.200.4470.4437.8016.670.5310.3604.21
Ours Teacher (5B)Wan 2.2-5B (720P)0.7416.100.4660.4277.8617.180.5710.3313.16
Ours Causal (5B)Wan 2.2-5B (720P)10.416.300.4560.43811.1816.620.5450.3434.30

关键发现:

  • 1.3B 教师模型在 DAVIS 和 Sora 上均超越所有基线(包括使用 14B 参数的 ATI)
  • 因果蒸馏版本保持高质量的同时实现 16.7 FPS(比 ATI 快 72×)
  • Sora EPE: ATI 6.12 → Ours Teacher 2.71(降低 56%)

新视角合成(相机控制)

方法分辨率FPSLLFF PSNR ↑LLFF SSIM ↑LLFF LPIPS ↓
DepthSplat576P1.4013.90.280.30
ViewCrafter576P0.2614.00.300.30
SEVA576P0.2014.10.300.29
Ours Teacher (1.3B)480P0.7916.00.420.21
Ours Causal (1.3B)480P16.715.70.380.23
Ours Teacher (5B)720P0.7414.00.400.22
Ours Causal (5B)720P10.415.00.390.23

关键发现:

  • 因果版本在 LLFF 上以 16.7 FPS 达到 15.7 PSNR,超越所有专用 3D 方法
  • 比 ViewCrafter 快 64×,比 SEVA 快 83×,且质量更高

轨迹表示对比

方法时间 (ms)DAVIS PSNRSora PSNRDAVIS LPIPSSora LPIPS
RGB-VAE105316.03 / 16.990.433 / 0.5440.463 / 0.3638.57 / 3.96
PE-Head24.816.29 / 17.150.452 / 0.5590.456 / 0.3596.54 / 3.13

PE-Head 比 RGB-VAE 快 42×(24.8ms vs 1053ms),且质量更好。

消融实验

配置LPIPS ↓EPE ↓延迟 (s)吞吐量 (FPS)
Ours base (c3s1w1)0.46425.340.7016.92
+ Remove sink (c3s0w1)0.50126.640.6817.43
+ Chunk Size 1 (c1s1w1)0.59776.210.3013.26
Sliding window0.48028.090.8014.96

消融发现:

  • 注意力汇聚:移除后 LPIPS 从 0.464 升至 0.501,EPE 从 25.34 升至 26.64
  • Chunk Size:大小为 1 时质量严重下降(EPE 76.21),但延迟最低
  • 滑动窗口:比基础配置略差,延迟波动更大

注意力汇聚和窗口大小的影响

注意力汇聚和窗口大小消融

意外发现:最小配置(单 chunk 汇聚 + 单 chunk 窗口)达到最佳性能。额外的汇聚只提供边际改进,可能引入冗余上下文。

延迟-吞吐量分析

速度-质量权衡

小 chunk 导致低吞吐量,大 chunk 引入过高延迟。Chunk size = 3 是最优配置。

六、实现细节

配置值
基础模型Wan 2.1 (1.3B), Wan 2.2 (5B)
训练数据OpenVid-1M + 合成数据 (70K/30K samples)
分辨率480P (832×480), 720P (1280×704)
去噪步数4 步
Chunk Size3 latent frames
注意力汇聚1 chunk
局部窗口1 chunk
教师模型训练Rectified Flow Matching
学生蒸馏Self Forcing + DMD
Tiny VAE9.84M 参数(vs Full VAE 73.3M)

Tiny VAE

模型解码器参数压缩率解码时间 (s)PSNRSSIM
Full VAE (Wan 2.1)73.3M8×8×41.6731.430.934
Tiny VAE (社区版)9.84M8×8×40.1228.850.899
Tiny VAE (本文)9.84M8×8×40.1229.270.904
Full VAE (Wan 2.2)555M16×16×41.7531.870.938
Tiny VAE (Wan 2.2)56.7M16×16×40.2328.430.883

Tiny VAE 解码速度提升 14×(1.67s → 0.12s),质量损失很小。

七、与现有方法对比

方法类型FPS延迟运动控制流式长视频
Motion Prompting双向扩散<0.0112min2D 轨迹××
Image Conductor双向扩散2.98-运动迁移××
ATI双向扩散0.23-运动迁移××
Go-With-The-Flow双向扩散0.60-运动迁移××
Self Forcing因果蒸馏15.380.78s文本✓有限
Rolling Forcing因果蒸馏15.790.76s文本✓有限
MotionStream因果蒸馏29.50.39s2D轨迹+相机✓无限

独特优势:

  • 唯一支持实时运动控制的流式视频生成方法
  • 29 FPS(带 Tiny VAE),比 Motion Prompting 快 2000×+
  • 支持无限长度流式生成
  • 同时支持轨迹控制和相机控制

八、相关工作

方向代表工作与 MotionStream 的关系
运动控制视频Motion Prompting, ATI, Image Conductor教师模型的基线
AR 视频扩散Self Forcing, CausVid, Rolling Forcing因果蒸馏的基线
相机控制CameraCtrl, SEVA, ViewCrafter相机控制任务的基线
交互式世界模型GameNGen, Oasis同类实时交互系统
流式生成StreamingT2V, InfinityStream同类流式方法

九、总结

核心贡献

  1. 实时交互式运动控制:首个支持实时 2D 轨迹/相机控制的流式视频生成方法
  2. 轻量级轨迹编码:正弦 PE + 可学习 track head,比 ControlNet 更高效
  3. 联合文本-运动引导:兼顾轨迹精度和自然运动
  4. 注意力汇聚 + 自滚动:解决长视频外推的域差距和误差累积问题
  5. Tiny VAE:解码速度提升 14×,使实时流式成为可能
  6. 29 FPS 实时生成:单 GPU,支持无限长度流式

技术影响

  • 比 Motion Prompting 快 2000×+,首次实现实时运动控制交互
  • 1.3B 模型超越 14B 模型(ATI)在运动迁移任务上的表现
  • 在相机控制任务上以 16.7 FPS 超越专用 3D 方法(DepthSplat, ViewCrafter)
  • 注意力汇聚机制在视频扩散模型中的成功应用
  • Tiny VAE 为流式生成提供了关键的速度优化

局限性

  • 代码未公开
  • 轨迹控制需要预先估计深度(用于相机控制)
  • 某些复杂意图(如”把猫从盒子里拿出来”)难以通过轨迹表达
  • Tiny VAE 有一定质量损失(PSNR 31.43 → 29.27)

十、参考资源

  • 论文: arXiv:2511.01266
  • 关键引用:
    • Wan 2.1/2.2 (Wang et al., 2025a) — 基础视频扩散模型
    • Self Forcing (Huang et al., 2025b) — 因果蒸馏基线
    • Motion Prompting (Geng et al., 2025) — 运动控制基线
    • CausVid (Yin et al., 2025) — 因果适应初始化
    • DMD (Yin et al., 2024b) — 分布匹配蒸馏
    • StreamingLLM (Xiao et al., 2023) — 注意力汇聚机制

分析日期: 2026-06-05