Back to blog

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

实时直播视频生成的流式系统

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

一、论文概述

项目内容
标题StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation
作者Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu
论文arXiv:2511.07399
代码未公开
发布2025年11月10日(v2: 2026年2月22日)

二、核心思想

问题定义

生成式模型正在重塑直播行业,但将视频扩散模型应用于实时直播面临四大挑战:

挑战 1:固定输入无法满足实时 SLO

  • 直播要求首帧延迟最小化,每帧必须在截止时间内交付
  • 固定批量大小无法适应动态的实时约束

挑战 2:长时生成的漂移累积

  • 逐帧生成会导致误差累积,长时间后质量退化
  • 需要周期性重置机制来维持一致性

挑战 3:运动无关导致质量退化

  • 固定的噪声调度忽略了视频中的运动信息
  • 快速运动区域需要更多去噪步骤,慢速区域则不需要

挑战 4:逐帧延迟约束下的 GPU 扩展性差

  • 现有并行策略(序列并行)在逐帧延迟约束下扩展性差
  • 通信开销成为瓶颈

解决方案概述

本文提出 StreamDiffusionV2,一个训练无关的实时直播视频生成系统:

  1. SLO 感知批调度器:动态调整流批量大小,满足逐帧截止时间
  2. Sink Token 引导的滚动 KV 缓存:周期性重置时间锚点,抑制长时漂移
  3. 运动感知噪声控制器:根据运动幅度自适应调整去噪轨迹
  4. 可扩展流水线编排:跨去噪步骤和网络层并行化,实现近线性 FPS 扩展

关键创新

创新点说明效果
SLO 感知批调度动态调整流批量大小满足逐帧截止时间,最大化 GPU 利用率
Sink Token + 滚动 KV 缓存周期性重置时间锚点抑制长时漂移,维持视觉一致性
运动感知噪声调度L2 运动估计 → 自适应噪声率快速运动区域更多去噪,慢速区域更少
流水线编排跨去噪步骤和网络层并行化近线性 FPS 扩展,低通信开销
Stream Batch流式批处理技术提升流水线效率
DiT 块调度器动态负载均衡异构 GPU 环境下的高效调度

三、技术架构

整体框架图

StreamDiffusionV2 流水线概览

核心组件

SLO 感知批调度器

动态调整流批量大小以满足逐帧截止时间:

  • 输入:目标 FPS、当前延迟、GPU 利用率
  • 输出:最优流批量大小
  • 约束:首帧延迟 < 0.5s,每帧延迟 < 1/FPS

Sink Token 引导的滚动 KV 缓存

滚动 KV 缓存和 Sink Token 设计

  • Sink Token:初始帧的 KV 状态作为全局锚点
  • 滚动 KV 缓存:固定大小的滑动窗口,周期性更新
  • RoPE 刷新:周期性重置位置编码偏移

运动感知噪声控制器

运动估计和动态噪声率

  • L2 运动估计:计算相邻帧的运动幅度
  • 自适应噪声率:快速运动 → 更高噪声率 → 更多去噪步骤
  • 慢速运动 → 更低噪声率 → 更少去噪步骤

流水线编排架构

流水线并行 Stream-Batch 架构

  • DiT 块分布在多个设备上进行流水线并行
  • 计算和通信分离到两个并发流
  • 内核与 P2P 传输重叠,最小化流水线气泡

硬件趋势分析

AI 硬件计算能力和内存带宽的演化趋势

关键洞察:

  • 从 V100 到 GB100,峰值计算增长 83×,但 HBM 带宽仅增长 7×
  • 流式推理工作负载越来越受内存带宽限制
  • 流水线编排比序列并行更适合内存受限场景

四、核心能力

实时直播视频生成

配置首帧延迟 (TTFF)FPS模型大小
1.3B, 4×H100<0.5s64.521.3B
14B, 4×H100<0.5s58.2814B
  • 无需 TensorRT 或量化
  • 支持异构 GPU 环境(H100 NVLink + 4090 PCIe)
  • 灵活去噪步数(1-4 步)

支持的应用场景

  • 实时 AI 直播:风格化视频流实时生成
  • 交互式视频创作:用户实时控制视频内容
  • 企业级直播平台:大规模多 GPU 部署

五、实验结果

延迟和抖动对比(H100 工作站)

方法指标MeanP50P90P95P99Miss Rate (1s)
StreamDiffusionV2Tail Latency357ms361ms484ms497ms585ms0.2%
StreamDiffusionV2Jitter21ms13ms45ms61ms132ms–
CausVidTail Latency1760ms1672ms2958ms3304ms3896ms99.9%
CausVidJitter235ms164ms498ms599ms1310ms–

关键发现:

  • 尾延迟:357ms vs 1760ms(降低 80%)
  • 抖动:21ms vs 235ms(降低 91%)
  • SLO Miss Rate:0.2% vs 99.9%

端到端延迟分布

端到端延迟分布

StreamDiffusionV2 的延迟分布高度集中,而 CausVid 分布分散且延迟高。

首帧延迟 (TTFF)

首帧延迟对比

  • StreamDiffusionV2 (2-step): ~0.35s
  • CausVid (2-step): ~0.8s
  • Wan2.1 (50-step): ~25s
  • Self-Forcing (4-step): ~1.2s

吞吐量结果

1.3B 模型吞吐量

14B 模型吞吐量

1.3B 模型(4×H100):

  • 480p, 2-step: ~65 FPS
  • 720p, 2-step: ~35 FPS

14B 模型(4×H100):

  • 480p, 2-step: ~58 FPS
  • 720p, 2-step: ~30 FPS

吞吐量对比

不同并行推理系统的吞吐量对比

StreamDiffusionV2 在所有配置下均优于基线方法。

生成质量对比

方法Text-Image CLIP ↑Temporal CLIP ↑Warp Error ↓
StreamDiffusion26.4895.24117.01
StreamV2V–96.58102.99
CausVid27.6998.4878.71
StreamDiffusionV229.2998.5173.31

关键发现:

  • Text-Image CLIP: 29.29(最高),比 CausVid 的 27.69 提升 5.8%
  • Temporal CLIP: 98.51(最高),时间一致性最好
  • Warp Error: 73.31(最低),比 CausVid 的 78.71 降低 6.9%

消融实验

Sink TokenDynamic NoisingCLIP Score ↑Warp Error ↓
××98.3879.51
×✓98.3675.71
✓×98.4773.64
✓✓98.5173.13

消融发现:

  • Sink Token:Warp Error 从 79.51 降至 73.64(-7.4%),对一致性贡献最大
  • Dynamic Noising:Warp Error 从 79.51 降至 75.71(-4.8%)
  • 两者结合:Warp Error 73.13,效果最好

定性对比

不同方法的生成结果对比

CausVid vs StreamDiffusionV2 对比

流水线调度效果

调度前后的耗时对比

负载均衡后,各设备耗时趋于一致,效率提升显著。

序列并行 vs 流水线编排

不同并行策略的通信开销

流水线编排的通信开销远低于序列并行。

Stream Batch 效果

Stream Batch 吞吐量对比

Stream Batch 显著提升流水线效率。

六、实现细节

配置值
模型Wan 2.1 (1.3B), Wan 2.2 (14B)
硬件4× NVIDIA H100 SXM (NVLink), 4× RTX 4090 (PCIe)
分辨率480p (832×480), 720p
去噪步数1-4 步(灵活)
首帧延迟<0.5s
1.3B FPS64.52 (4×H100)
14B FPS58.28 (4×H100)
SLO Miss Rate0.2%
Jitter21ms (mean)
训练训练无关(training-free)

REPA 微调(可选)

使用 REPA (Representation Alignment) 策略增强视频质量:

LREPA=−cos⁡(DINOv2(x),Proj(DiTt(x)))\mathcal{L}_{\text{REPA}} = -\cos(\text{DINOv2}(x), \text{Proj}(\text{DiT}_t(x)))

Ltotal=LDMD+λLREPA\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{DMD}} + \lambda \mathcal{L}_{\text{REPA}}

七、与现有方法对比

方法类型FPSTTFF抖动SLO Miss训练
StreamDiffusion图像扩散高低中低无需
CausVid因果蒸馏170.78s235ms99.9%需要
Self Forcing因果蒸馏170.78s中中需要
Rolling Forcing因果蒸馏160.76s低低需要
LongLive因果 AR21–低低需要
MotionStream因果蒸馏290.39s低低需要
StreamDiffusionV2流水线系统650.35s21ms0.2%无需

独特优势:

  • 最高 FPS:64.52 FPS(1.3B)/ 58.28 FPS(14B),比 CausVid 快 3.8×
  • 最低抖动:21ms,比 CausVid 低 91%
  • 训练无关:无需微调或蒸馏
  • 可扩展:近线性 FPS 扩展
  • SLO 保证:0.2% Miss Rate

八、相关工作

方向代表工作与 StreamDiffusionV2 的关系
图像流式扩散StreamDiffusion, TouchDesigner前代系统,时间一致性差
因果蒸馏CausVid, Self Forcing, Rolling Forcing视频生成基线
流式视频生成LongLive, MotionStream同类实时系统
序列并行DeepSpeed-Ulysses, Ring Attention替代并行策略
流水线并行PipeDream, GPipe并行策略灵感
直播系统Daydream应用场景

九、总结

核心贡献

  1. SLO 感知调度:动态调整流批量大小,满足逐帧截止时间
  2. Sink Token + 滚动 KV 缓存:周期性重置时间锚点,抑制长时漂移
  3. 运动感知噪声控制:根据运动幅度自适应调整去噪轨迹
  4. 流水线编排:跨去噪步骤和网络层并行化,近线性 FPS 扩展
  5. 64.52 FPS 实时生成:14B 模型 58.28 FPS,训练无关
  6. 极低抖动:21ms mean jitter,0.2% SLO Miss Rate

技术影响

  • 首次将视频扩散模型应用于实时直播场景,解决 SLO 约束问题
  • 流水线编排比序列并行更适合内存受限的流式推理场景
  • 训练无关方案使得现有视频模型可直接部署
  • 硬件趋势分析表明流式推理将越来越受内存带宽限制
  • 为从个人创作者到企业级平台的实时 AI 直播提供了实用方案

局限性

  • 代码未公开
  • 需要多 GPU 部署(单 GPU 无法达到实时)
  • 训练无关方案的质量上限受限于基础模型
  • 流水线编排需要 NVLink 等高速互连

十、参考资源

  • 论文: arXiv:2511.07399
  • 关键引用:
    • StreamDiffusion (Kodaira et al., 2023) — 前代图像流式系统
    • CausVid (Yin et al., 2025) — 因果蒸馏基线
    • Self Forcing (Huang et al., 2025) — 因果蒸馏基线
    • Wan 2.1/2.2 — 基础视频扩散模型
    • DMD (Yin et al., 2024) — 分布匹配蒸馏
    • REPA (Yu et al., 2024) — 表示对齐训练策略
    • DINOv2 (Oquab et al., 2024) — 视觉编码器

分析日期: 2026-06-05