Back to blog

Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

实时自回归长视频扩散生成技术

Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

一、论文概述

项目内容
标题Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
作者Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, Shijian Lu
论文arXiv:2509.25161
代码未公开
发布2025年9月29日

二、核心思想

问题定义

流式视频生成是交互式世界模型和神经游戏引擎的基础组件,目标是生成高质量、低延迟、时间一致的长视频流。然而,现有方法存在严重的误差累积 (error accumulation) 问题,显著降低了长视频流的生成质量。

现有方法的局限:

  • CausVid / Self Forcing:逐帧去噪的严格因果方式,单帧误差会传播到后续所有帧
  • SkyReels-V2 (Diffusion Forcing):通过破坏历史帧来缓解误差累积,但效果有限
  • MAGI-1:大规模模型(4.5B参数),但延迟极高(282秒),无法实时

解决方案概述

本文设计 Rolling Forcing,一种新型视频生成技术,通过三个关键设计实现实时流式长视频生成,同时最小化误差累积:

  1. 滚动扩散窗口 (Rolling Diffusion Window):联合去噪多帧,帧间噪声等级渐进增加,放松严格因果性
  2. 注意力汇聚机制 (Attention Sink):缓存初始帧的 KV 状态作为全局上下文锚点
  3. 高效训练算法:在扩展的去噪窗口上实现少步蒸馏

关键创新

创新点说明理论/实验依据
滚动扩散窗口联合去噪多帧,帧间噪声渐进增加相邻帧互相精炼,抑制误差传播
注意力汇聚缓存初始帧 KV 作为全局锚点增强长程全局一致性
非重叠窗口训练避免暴露偏差,支持扩展窗口缓解自生成历史的条件偏差
混合训练策略DMD + Self Forcing 双目标提升运动自然度和一致性

三、技术架构

整体框架图

Rolling Forcing 去噪过程

核心公式

自回归视频扩散模型基础

给定视频帧序列 x1:N=(x1,x2,…,xN)x^{1:N} = (x^1, x^2, \dots, x^N),联合分布通过链式法则分解:

p(x1:N)=∏i=1Np(xi∣x<i)p(x^{1:N}) = \prod_{i=1}^{N} p(x^i \mid x^{<i})

每个条件分布通过去噪扩散建模:p(xi∣x<i)p(x^i \mid x^{<i})。

滚动扩散窗口

Self Forcing 的逐帧去噪:在每个去噪步骤 tjt_j 和帧索引 ii,模型仅去噪单帧:

xtj−1i=Ψ(Gθ(xtji,tj,x0<i),tj−1)x^{i}_{t_{j-1}} = \Psi\big(G_\theta(x^{i}_{t_j}, t_j, x^{<i}_0), t_{j-1}\big)

Rolling Forcing 的窗口去噪:扩展为多帧滚动窗口,窗口长度 Lwin=TL_{\text{win}} = T:

pθ(xt0:T−1i:i+T−1∣xt1:Ti:i+T−1,x0<i)=Ψ(Gθ(xt1:Ti:i+T−1,t1:T,x0<i),t0:T−1)p_\theta(x^{i:i+T-1}_{t_{0:T-1}} \mid x^{i:i+T-1}_{t_{1:T}}, x_0^{<i}) = \Psi\big(G_\theta(x^{i:i+T-1}_{t_{1:T}}, t_{1:T}, x_0^{<i}), t_{0:T-1}\big)

其中 xt1:Ti:i+T−1x^{i:i+T-1}_{t_{1:T}} 是窗口内的噪声帧,噪声等级从 t1t_1 到 tTt_T 渐进增加。

DMD 损失

标准 DMD 损失(逐帧):

x^01:N={x^0i=Gθ(xtji,tj,x0<i)∣i=1,2,…,N}\hat{x}_0^{1:N} = \{\hat{x}^i_0 = G_\theta(x^i_{t_j}, t_j, x^{<i}_0) \mid i = 1, 2, \dots, N\}

Rolling Forcing 的 DMD 损失(窗口级):

x^01:N={x^0i=(x^0i:i+T−1)j=Gθ(xt1:Ti:i+T−1,t1:T,x0<i)j∣i=1,2,…,N}\hat{x}_0^{1:N} = \{\hat{x}^i_0 = (\hat{x}^{i:i+T-1}_0)_j = G_\theta(x^{i:i+T-1}_{t_{1:T}}, t_{1:T}, x^{<i}_0)_j \mid i = 1, 2, \dots, N\}

其中选择每个窗口的第 jj 帧作为预测,j∼Uniform{0,1,…,T−1}j \sim \text{Uniform}\{0, 1, \dots, T-1\}。

非重叠窗口训练

为降低计算复杂度,采用非重叠窗口策略:

x^01:N={x^0i:i+T−1=Gθ(xt1:Ti:i+T−1,t1:T,x0<i)∣i≡j(modT),1≤i≤N}\hat{x}_0^{1:N} = \{\hat{x}^{i:i+T-1}_0 = G_\theta(x^{i:i+T-1}_{t_{1:T}}, t_{1:T}, x^{<i}_0) \mid i \equiv j \pmod{T}, 1 \leq i \leq N\}

计算复杂度从 O(N)O(N) 降为 O(⌈N/T⌉)O(\lceil N/T \rceil)。

历史上下文机制

时间上下文:缓存最近 LtemL_{\text{tem}} 帧的 KV 状态

全局上下文(注意力汇聚):缓存初始 LgloL_{\text{glo}} 帧的 KV 状态作为全局锚点

Ltem+Lglo+Lwin=LbidirectionalL_{\text{tem}} + L_{\text{glo}} + L_{\text{win}} = L_{\text{bidirectional}}

配置:Ltem=3L_{\text{tem}} = 3, Lglo=3L_{\text{glo}} = 3, Lwin=15L_{\text{win}} = 15 latent frames

噪声调度

采用修正的噪声调度:

t′(k,t)=(kt/1000)/(1+(k−1)(t/1000))⋅1000t'(k, t) = (kt/1000) / (1 + (k-1)(t/1000)) \cdot 1000

去噪窗口的噪声等级:[t5,t4,t3,t2,t1]=[1000,800,600,400,200][t_5, t_4, t_3, t_2, t_1] = [1000, 800, 600, 400, 200]

模型参数化:

Gθ(x,t,c)=cskip⋅ϵ−cout⋅vθ(cin⋅xt,cnoise(t′),c)G_\theta(x, t, c) = c_{\text{skip}} \cdot \epsilon - c_{\text{out}} \cdot v_\theta(c_{\text{in}} \cdot x_t, c_{\text{noise}}(t'), c)

其中 cskip=cin=cout=1c_{\text{skip}} = c_{\text{in}} = c_{\text{out}} = 1, cnoise(t)=tc_{\text{noise}}(t) = t。

不同范式对比

不同自回归视频生成范式

范式方法特点
(a) Teacher Forcing基础训练条件于干净历史帧
(b) Diffusion ForcingSkyReels-V2条件于噪声历史帧
(c) Self ForcingCausVid, Self Forcing逐帧去噪,严格因果
(d) Rolling Forcing本文滚动窗口联合去噪

四、核心能力

实时流式生成

  • 帧率:16 FPS 实时生成
  • 延迟:0.76 秒(单 GPU)
  • 时长:可生成多分钟长视频
  • 硬件:单 GPU 即可

支持的应用场景

  • 交互式世界模型:实时响应用户输入
  • 神经游戏引擎:游戏画面实时生成
  • 交互式视频流:用户可中途更改提示词引导视频方向

交互式视频流

五、实验结果

主要定量对比(VBench)

模型参数量吞吐量 (FPS) ↑延迟 (s) ↓Temporal Flickering ↑Subject Consistency ↑Background Consistency ↑Motion Smoothness ↑Aesthetic Quality ↑Imaging Quality ↑Δ Drift Quality ↓
双向视频扩散模型
SkyReels-V21.3B0.4911297.4389.2393.4598.7661.5562.905.59
MAGI-14.5B0.1928298.2190.8693.2599.2059.9159.872.15
蒸馏自回归模型
CausVid1.3B15.380.7896.8487.9989.9998.0960.9566.382.18
Self Forcing1.3B15.380.7897.4986.4890.2998.4760.5468.681.66
Rolling Forcing (Ours)1.3B15.790.7697.6192.8093.7198.7062.3970.750.01

关键发现:

  • Δ Drift Quality: Self Forcing 1.66 → Rolling Forcing 0.01(降低 99.4%),误差累积几乎消除
  • Subject Consistency: 86.48 → 92.80(+6.32),主体一致性大幅提升
  • Background Consistency: 90.29 → 93.71(+3.42),背景一致性显著提升
  • 吞吐量: 15.79 FPS,略高于 Self Forcing (15.38)
  • 甚至超越双向模型 SkyReels-V2 的 Subject Consistency (89.23 → 92.80)

VBench 完整质量评估

模型Subject ConsistencyBackground ConsistencyTemporal FlickeringMotion SmoothnessDynamic DegreeAesthetic QualityImaging QualityQuality Score
CausVid89.5090.0099.4198.0663.8861.8265.3080.89
Self Forcing88.6189.5398.9098.5768.0560.6068.9881.39
Rolling Forcing94.8095.6998.9398.6360.1462.8172.3184.08

VBench 语义评估

模型Object ClassMultiple ObjectsHuman ActionColorSpatialScene StyleTemporal StyleAppearanceOverallSemantic
CausVid78.5658.8481.0081.0259.6231.3222.5120.0423.1665.85
Self Forcing80.0662.8883.0079.8074.7630.5923.7820.4124.8069.17
Rolling Forcing85.9264.8673.0088.1678.8430.5223.5219.4524.5669.78

消融实验

模型Temp. Flick. ↑Subj. Cons. ↑Back. Cons. ↑Mot. Smooth. ↑Aes. Qual. ↑Img. Qual. ↑Δ Drift ↓
w/o RF inference95.4586.0189.9497.3657.5965.195.53
w/o RF training95.9187.5090.8698.0560.4169.240.89
w/o SF training90.8383.2788.1495.6355.3062.001.62
w/o attention sink97.5383.2287.9998.5658.9967.304.63
Ours full97.6192.8093.7198.7062.3970.750.01

消融发现:

  • w/o RF inference:Δ Drift 从 0.01 飙升到 5.53,验证滚动窗口推理的关键作用
  • w/o RF training:Δ Drift 从 0.01 升到 0.89,滚动窗口训练也有贡献
  • w/o SF training:Subject Consistency 大幅下降 (92.80→83.27),Self Forcing 目标对运动自然度至关重要
  • w/o attention sink:Subject Consistency 下降 (92.80→83.22),全局上下文对一致性很重要

消融实验可视化

定性对比

与现有方法的对比

Rolling Forcing 在长时间生成中保持高保真度和时间一致性,而 Self Forcing 和 CausVid 出现明显的质量退化。

六、实现细节

配置值
基础模型Wan2.1-T2V-1.3B
分辨率832 × 480
帧率16 FPS
生成时长5 秒(评估),多分钟(流式)
去噪步数4 步
窗口大小Lwin=15L_{\text{win}} = 15 latent frames
时间上下文Ltem=3L_{\text{tem}} = 3 latent frames
全局上下文Lglo=3L_{\text{glo}} = 3 latent frames
噪声等级[1000, 800, 600, 400, 200]
训练帧数21-27 latent frames(随机采样)
DMD 学习率1.5×10−61.5 \times 10^{-6}
SF 学习率4.0×10−74.0 \times 10^{-7}

动态 RoPE

采用动态旋转位置编码 (Dynamic RoPE) 来处理流式生成中的位置索引。固定 RoPE 索引会导致严重的”跳跃”伪影(视频突然重置到初始帧)。

固定 RoPE vs 动态 RoPE

七、与现有方法对比

方法类型吞吐量延迟Δ Drift主要局限
SkyReels-V2双向 DF0.49 FPS112s5.59极慢,误差累积严重
MAGI-1双向0.19 FPS282s2.15极慢
CausVid蒸馏 AR15.38 FPS0.78s2.18误差累积
Self Forcing蒸馏 AR15.38 FPS0.78s1.66误差累积
Rolling Forcing蒸馏 AR15.79 FPS0.76s0.01几乎无误差累积

八、相关工作

方向代表工作与 Rolling Forcing 的关系
双向视频扩散Wan2.1, SkyReels-V2, MAGI-1基础模型
AR 视频扩散CausVid, Self ForcingRolling Forcing 的基线
扩散强制Diffusion Forcing (Chen et al., 2024)替代训练范式
流式生成StreamingT2V, InfinityStream同类工作
注意力汇聚StreamingLLM (Xiao et al., 2023)全局上下文机制的灵感来源

九、总结

核心贡献

  1. 滚动扩散窗口:联合去噪多帧,帧间噪声渐进增加,放松严格因果性,有效抑制误差累积
  2. 注意力汇聚机制:缓存初始帧 KV 状态作为全局上下文锚点,增强长程一致性
  3. 非重叠窗口训练:高效训练算法,支持扩展去噪窗口,避免暴露偏差
  4. 混合训练策略:DMD + Self Forcing 双目标,提升运动自然度
  5. 实时多分钟视频生成:单 GPU 16 FPS,延迟 0.76 秒,Δ Drift 仅 0.01

技术影响

  • Δ Drift Quality 从 1.66 降至 0.01(降低 99.4%),几乎消除了长视频的误差累积问题
  • 为交互式世界模型和神经游戏引擎提供了实用的实时视频生成方案
  • 注意力汇聚机制可推广到其他流式生成任务
  • 滚动窗口去噪范式为 AR 扩散模型提供了新的设计思路

局限性

  • 中间帧离开时间上下文后被丢弃,模型不保留中间内容的记忆
  • 训练 Rolling Forcing 需要较长的训练时间
  • Dynamic Degree 指标略低于 Self Forcing (60.14 vs 68.05)
  • 代码未公开

十、参考资源

  • 论文: arXiv:2509.25161
  • 关键引用:
    • Wan2.1 (Wan et al., 2025) — 基础双向视频扩散模型
    • Self Forcing (Huang et al., 2025) — 主要基线
    • CausVid (Yin et al., 2025) — 早期 AR 蒸馏方法
    • Diffusion Forcing (Chen et al., 2024) — 替代训练范式
    • StreamingLLM (Xiao et al., 2023) — 注意力汇聚机制
    • DMD (Yin et al., 2024b) — 分布匹配蒸馏

分析日期: 2026-06-05