Back to blog

LongLive: Real-time Interactive Long Video Generation

实时交互式长视频生成框架

LongLive: Real-time Interactive Long Video Generation

一、论文概述

项目内容
标题LongLive: Real-time Interactive Long Video Generation
作者Shuai Yang, Wei Huang, Ruihang Chu, Yicheng Xiao, Yuyang Zhao, Xianbang Wang, Muyang Li, Enze Xie, Yingcong Chen, Yao Lu, Song Han, Yukang Chen
论文arXiv:2509.22622
代码承诺开源
发布2025年9月26日(v2: 2025年10月13日)

二、核心思想

问题定义

交互式长视频生成面临质量和效率双重挑战:

质量挑战:

  • 切换用户提示时,保持视觉风格、运动连续性和场景布局的平滑过渡极其困难
  • 微小的不匹配就会破坏叙事流和真实感

效率挑战:

  • 扩散模型的双向注意力无法利用 KV 缓存,推理效率低
  • 现有因果 AR 模型在长视频上训练困难,质量退化严重
  • 需要支持流式提示输入,实时响应用户引导

解决方案概述

本文提出 LongLive,一个帧级自回归框架,实现分钟级实时交互式长视频生成:

  1. KV Recache:在提示切换时重新计算 KV 缓存,兼顾平滑过渡和提示遵循
  2. Streaming Long Tuning:流式长视频微调策略,训练-推理对齐(train-long-test-long)
  3. Short-Window Attention + Frame Sink:短窗口注意力 + 帧级注意力汇聚,加速推理同时保持一致性

关键创新

创新点说明效果
KV Recache提示切换时用已生成帧+新提示重建 KV 缓存平滑过渡+提示遵循,消除 train-inference 不匹配
Streaming Long Tuning流式长视频微调,自监督 DMD 损失32 GPU-days 微调 1.3B 模型到分钟级生成
Short-Window Attention局部注意力窗口 12 latent frames推理速度提升,一致性保持
Frame Sink帧级注意力汇聚(替代 token 级)长程一致性增强,计算高效
INT8 量化模型量化推理模型大小减半,质量损失极小

三、技术架构

整体框架图

LongLive 框架

LongLive 工作流

核心公式

KV Recache 机制

在提示切换边界,用已生成视频前缀和新提示重建 KV 缓存:

三种策略对比:

  • No KV cache:丢弃所有缓存 → 提示遵循好,但过渡突兀
  • KV cache:保留全部缓存 → 过渡平滑,但无法遵循新提示
  • KV recache(本文):用已生成帧+新提示重建缓存 → 兼顾两者

具体流程:

  1. 在切换点,编码已生成视频为视觉上下文
  2. 将视觉上下文与新提示配对
  3. 重新计算 KV 缓存
  4. 后续步骤使用新缓存继续生成

Streaming Long Tuning

自监督流式长视频微调:

第 1 次迭代:从零采样短片段(如 5s),应用 DMD 损失

后续迭代:

  1. 从上一次迭代扩展短片段
  2. 条件于之前存储的 KV 缓存
  3. 生成下一个短片段
  4. 对新片段应用 DMD 损失

关键设计:

  • 每个长序列只包含一次提示切换
  • 训练时执行一次 recache + 继续 rollout
  • 蒸馏时教师模型也用新提示监督

Short-Window Attention

将全注意力替换为局部窗口注意力:

Attn(q,k,v)=softmax(qk[window]d)v[window]\text{Attn}(q, k, v) = \text{softmax}\left(\frac{q k_{[\text{window}]}}{\sqrt{d}}\right) v_{[\text{window}]}

窗口大小选择 12 latent frames,在速度和质量之间取得最优平衡。

Frame Sink(帧级注意力汇聚)

借鉴 LLM 中的 attention sink 机制,但应用于帧级而非 token 级:

  • 缓存初始帧的 KV 状态作为全局锚点
  • 与短窗口注意力结合:9 local + 3 sink = 12 effective window
  • 比长窗口注意力更高效,一致性相当

不同注意力策略对比

训练-推理一致性

Streaming Long Tuning 流程

关键洞察:训练必须在长视频上进行,否则:

  • 短片段训练的模型在长序列外推时质量退化
  • 高效推理策略(窗口注意力、frame sink)需要长视频训练才能生效

四、核心能力

实时交互式长视频生成

  • 帧率:20.7 FPS(单 H100)
  • 时长:支持最长 240 秒视频
  • 交互:支持流式提示输入,实时引导叙事
  • 训练:仅需 32 GPU-days 微调 1.3B 模型

支持的交互模式

交互式长视频示例

  • 流式提示切换:用户可随时更改提示,视频平滑过渡
  • 多提示序列:支持多个连续提示,每个控制不同时段
  • 实时引导:用户可在生成过程中实时调整方向

INT8 量化推理

精度模型大小吞吐量 (FPS)Total ScoreQualitySemantic
INT81.4 GB16.484.3186.2076.74
BF162.7 GB12.684.8786.9776.47

INT8 量化:模型大小减半,FPS 提升 30%(12.6→16.4),质量损失极小。

五、实验结果

短视频生成(VBench)

模型参数量分辨率FPS ↑Total ↑Quality ↑Semantic ↑
双向扩散模型
LTX-Video1.9B768×5128.9880.0082.3070.79
Wan2.11.3B832×4800.7884.2685.3080.09
自回归/蒸馏模型
SkyReels-V21.3B832×4800.4982.6784.7074.53
MAGI-14.5B832×4800.1979.1882.0467.74
CausVid1.3B832×48017.081.2084.0569.80
NOVA0.6B768×5120.8880.1280.3979.05
Pyramid Flow2B768×5126.781.7284.7469.62
Self Forcing (chunk)1.3B832×48017.084.3185.0781.28
Self Forcing (frame)1.3B832×4808.984.2685.2580.30
LongLive1.3B832×48020.784.8786.9776.47

关键发现:

  • Total Score: 84.87,超越所有基线
  • Quality Score: 86.97,显著领先(第二名 Wan2.1 85.30)
  • FPS: 20.7,比 Self Forcing (chunk) 的 17.0 快 22%
  • Semantic: 76.47,低于 Self Forcing 的 81.28(权衡)

长视频生成(VBench-Long)

模型30s Total30s Quality30s Semantic特点
SkyReels-V282.6784.7074.53双向,极慢
FramePack---I2V 模型
Self Forcing84.3185.0781.28因果蒸馏
LongLive84.8786.9776.47因果 AR,实时

交互式长视频生成

在 160 个交互式 60 秒视频(每个包含 6 个连续 10 秒提示)上的评估:

  • LongLive 在 prompt following、visual consistency 和 overall quality 上均优于基线
  • 支持多轮提示切换,过渡平滑

消融实验

KV Recache 策略

策略Background Consistency ↑Subject Consistency ↑Semantic Score ↑
No KV cache低低高(提示遵循好)
KV cache高高低(无法遵循新提示)
KV recache高高高

KV recache 兼顾视觉一致性和语义遵循。

短窗口注意力和 Frame Sink

短窗口注意力消融

窗口大小Long-Range Consistency
3 latent frames低
12 latent frames中高
24 latent frames高(饱和)
9 local + 3 sink高(与 24 相当)

发现:

  • 一致性随窗口增大而提升,在 24 帧时饱和
  • 9 local + 3 sink 达到与 24 帧窗口相当的一致性
  • 小窗口 + frame sink 是最优配置(速度+质量)

LoRA 预算

LoRA rank可训练参数Total Score
3244M81.08
6487M82.68
128175M82.98
256350M83.12
512700M83.04
Full Model1.3B83.52

rank 256 接近全模型质量(83.12 vs 83.52),参数量仅 27%。

定性对比

交互式长视频定性对比

LongLive 展示了:

  • 强提示遵循能力
  • 平滑的提示切换过渡
  • 长程视觉一致性

六、实现细节

配置值
基础模型Wan 2.1 (1.3B)
微调方法LoRA (rank 256)
训练时间32 GPU-days
分辨率832×480
帧率20.7 FPS (H100)
最大时长240 秒
注意力窗口12 latent frames (9 local + 3 sink)
训练数据自监督,Qwen2-72B 生成提示
去噪步数4 步
INT8 量化模型大小 1.4GB,FPS 16.4

训练细节

  • 使用自监督方式,无需额外长视频数据集
  • 文本提示由 Qwen2-72B-Instruct 生成
  • Streaming Long Tuning:每次迭代扩展短片段
  • DMD 损失用于蒸馏

七、与现有方法对比

方法类型FPS最大时长交互式流式提示训练成本
Wan2.1双向扩散0.785s××高
SkyReels-V2Diffusion Forcing0.49长××高
MAGI-1双向扩散0.19长××高
CausVid蒸馏 AR17.05s××中
Self Forcing蒸馏 AR17.0有限××中
Rolling Forcing蒸馏 AR15.79多分钟××中
MotionStream蒸馏 AR29.5无限✓(轨迹)✓中
LongLive因果 AR20.7240s✓(文本)✓低

独特优势:

  • 唯一支持实时流式文本提示切换的长视频生成方法
  • 训练效率极高:仅 32 GPU-days 微调
  • 支持最长 240 秒视频
  • INT8 量化支持,模型仅 1.4GB

八、相关工作

方向代表工作与 LongLive 的关系
双向视频扩散Wan2.1, MAGI-1基础模型
因果蒸馏CausVid, Self Forcing, Rolling Forcing基线方法
Diffusion ForcingSkyReels-V2, FramePack替代范式
流式生成StreamingT2V, InfinityStream同类工作
交互式世界模型MotionStream, GameNGen同类交互系统
Attention SinkStreamingLLM机制灵感来源

九、总结

核心贡献

  1. KV Recache:提示切换时重建 KV 缓存,兼顾平滑过渡和提示遵循
  2. Streaming Long Tuning:自监督流式长视频微调,32 GPU-days 高效训练
  3. Short-Window Attention + Frame Sink:短窗口+帧级汇聚,加速推理保持一致性
  4. INT8 量化:模型大小减半,FPS 提升 30%,质量损失极小
  5. 20.7 FPS 实时生成:单 H100,支持最长 240 秒交互式视频

技术影响

  • 训练效率极高:32 GPU-days 微调 1.3B 模型(vs 需要大量计算的全量训练)
  • VBench Quality Score 86.97,超越所有同类方法
  • KV recache 机制为交互式视频生成提供了通用解决方案
  • Frame sink 机制可推广到其他流式生成任务
  • INT8 量化使部署更实用

局限性

  • Semantic Score (76.47) 低于 Self Forcing (81.28)
  • 最大时长 240 秒(单 H100),超长视频需要更多优化
  • 交互仅限于文本提示切换(不支持轨迹/拖拽控制)
  • 代码尚未开源(承诺开源)

十、参考资源

  • 论文: arXiv:2509.22622
  • 关键引用:
    • Wan 2.1 (Wan et al., 2025) — 基础视频扩散模型
    • Self Forcing (Huang et al., 2025) — 因果蒸馏基线
    • CausVid (Yin et al., 2025) — 因果适应初始化
    • DMD (Yin et al., 2024b) — 分布匹配蒸馏
    • StreamingLLM (Xiao et al., 2023) — Attention Sink 机制
    • SkyReels-V2 (Chen et al., 2025) — Diffusion Forcing 基线

分析日期: 2026-06-05