Back to blog

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation

可学习进化记忆的实时无限视频生成框架,首次实现 24 小时(>130万帧)实时视频生成

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation

一、论文概述

项目内容
标题Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation
作者Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin, Yaowei Li, Junhao Zhuang, Haoran Li, Jie Huang, Haoyang Huang, Nan Duan, Qiang Xu
机构香港中文大学、京东 Joy Future Academy、香港科技大学、清华大学、香港大学、北京大学、中国科学技术大学
论文arXiv:2606.04527
代码github.com/Echo-Team-Joy-Future-Academy-JD/Echo-Infinity
项目页echo-team-joy-future-academy-jd.github.io/Echo-Infinity
发布2026-06-03
许可未明确

二、核心思想

问题定义

自回归视频生成面临两大瓶颈:

瓶颈说明现有方法的局限
KV 缓存无限增长历史帧的 KV 缓存随视频长度线性增长窗口截断丢失历史、启发式压缩不够灵活
RoPE 溢出/外推时序位置编码超出训练范围训练-测试不一致,导致质量退化

核心矛盾:现有方法使用预定义的 KV 缓存调度或固定比例压缩,无法在保持历史信息的同时实现常数计算成本。

解决方案概述

Echo-Infinity 受人类记忆巩固机制启发,提出可学习进化记忆:

  1. Memory Queries:端到端可训练的记忆查询,通过注意力和门控机制动态过滤、抽象、压缩任意长度历史
  2. Unified Relative RoPE Recipe:统一的相对 RoPE 调度,训练和推理时保持所有时序 ID 在预训练范围内
  3. 首次实现 24 小时实时视频生成:在单张 H100 上生成 >130 万帧,仅比无记忆基线多 10.6% 开销

三、技术架构

整体框架图

架构概览

Echo-Infinity 的架构分为三个层次:

Echo-Infinity Architecture
├── Three-Tier KV Cache
│   ├── Sink Frames (N_S=3): 持久全局锚点
│   ├── Memory Queries (N_Q=3): 可学习进化记忆
│   └── Local Window (N_W=9): 短期工作缓冲
├── Memory Update Mechanism
│   ├── Cross-Attention Encoder (L_enc=2 layers)
│   ├── Sigmoid-Gated Residual
│   └── End-to-End Optimization
└── Unified Relative RoPE
    ├── Growth Phase: 时序 ID 增长到 f_max
    └── Mature Phase: 时序 ID 固定在 f_max

核心创新:Memory Queries

记忆机制对比

三层 KV 缓存组织:

组件大小功能类比
Sink FramesN_S=3持久全局锚点基础定义记忆
Local WindowN_W=9短期工作缓冲工作记忆
Memory QueriesN_Q=3进化长期记忆长期记忆巩固

记忆更新公式:

Q~=Enc⁡(Q;Kevict;Vevict)\widetilde{\mathcal{Q}} = \operatorname{Enc}(\mathcal{Q}; K_{\text{evict}}; V_{\text{evict}})

g=σ([Q;Q~]Wgate)\mathbf{g} = \sigma([\mathcal{Q}; \widetilde{\mathcal{Q}}] W_{\text{gate}})

Q←g⊙Q+(1−g)⊙Q~\mathcal{Q} \leftarrow \mathbf{g} \odot \mathcal{Q} + (1 - \mathbf{g}) \odot \widetilde{\mathcal{Q}}

其中:

  • Enc⁡\operatorname{Enc}:2 层交叉注意力编码器
  • WgateW_{\text{gate}}:门控权重矩阵
  • σ\sigma:sigmoid 激活函数

关键特性:

  • 端到端优化:记忆参数与 DiT 联合训练
  • 常数成本:N_Q 固定,计算开销不随视频长度增长
  • 可泛化先验:即使禁用更新,优化后的 Q 仍能提升生成质量

Unified Relative RoPE Recipe

核心思想:训练和推理时使用相同的相对 RoPE 调度

[0,…,NS−1]⏟Sink∥[rstartcur−NW−NQ,…,rstartcur−NW−1]⏟Memory Queries∥[rstartcur−NW,…,rstartcur−1]⏟Local Window∥[rstartcur,…,rendcur]⏟Current Chunk\underbrace{[0, \ldots, N_S - 1]}_{\text{Sink}} \| \underbrace{[r_{\text{start}}^{\text{cur}} - N_W - N_Q, \ldots, r_{\text{start}}^{\text{cur}} - N_W - 1]}_{\text{Memory Queries}} \| \underbrace{[r_{\text{start}}^{\text{cur}} - N_W, \ldots, r_{\text{start}}^{\text{cur}} - 1]}_{\text{Local Window}} \| \underbrace{[r_{\text{start}}^{\text{cur}}, \ldots, r_{\text{end}}^{\text{cur}}]}_{\text{Current Chunk}}

两阶段调度:

  1. 增长阶段:rendcurr_{\text{end}}^{\text{cur}} 从 |sink| 增长到 fmax⁡f_{\max}
  2. 成熟阶段:rendcurr_{\text{end}}^{\text{cur}} 固定在 fmax⁡f_{\max},旧帧 ID 向后旋转

训练流程

两阶段 DMD 训练:

阶段内容时长优化目标
Stage 1标准调优(5s 视频)标准训练端到端优化记忆参数
Stage 2流式长调优(60s 视频)长序列训练跨子片段边界分离 Q 状态

超参数配置:

  • 基础模型:Wan2.1-T2V-1.3B
  • 分辨率:832×480 @ 16 FPS
  • 内存编码器:L_enc=2, d=1536, 12 heads, head_dim=128
  • 查询 token 数:T_Q = 3 × 1560 = 4680
  • 最大时序 RoPE ID:f_max=20

四、核心创新

创新点说明理论/实验依据
Memory Queries端到端可训练记忆,动态过滤/抽象/压缩历史图 2-3,表 1-2
Unified Relative RoPE统一训练-推理 RoPE 调度,避免外推/溢出图 3(c)
Three-Tier KV CacheSink + Memory + Local 三层组织算法 1
24 小时实时生成首次实现 >130 万帧实时视频图 6
可泛化记忆先验优化后的 Q 即使禁用更新仍有效表 3

五、实验结果

长视频生成(30s / 240s)

模型参数量FPS30s Quality30s Semantic30s User Pref240s Quality240s User Pref
LongLive1.3B20.783.5980.2810.47%79.796.13%
MemFlow1.3B18.783.3580.8510.13%79.315.93%
Memorize-and-Generate1.3B21.783.6981.0114.73%75.492.13%
∞-RoPE1.3B17.083.3874.675.13%79.9914.13%
Echo-Infinity1.3B18.585.6182.0159.53%81.2371.67%

关键发现:

  • 30s 用户偏好:59.53%(vs 第二名 14.73%)
  • 240s 用户偏好:71.67%(vs 第二名 14.13%)
  • Quality 和 Semantic 分数均达到 SOTA

交互式长视频生成(60s)

模型Quality Score0-10s10-20s20-30s30-40s40-50s50-60s
LongLive79.3834.0832.0932.0331.5530.8830.49
MemFlow79.9133.4831.9431.9530.8730.5330.23
Memorize-and-Generate79.1533.5831.4331.1430.6530.4830.27
∞-RoPE79.2233.1532.4731.4130.4630.2930.17
Echo-Infinity81.7134.1032.4231.9931.1830.8330.74

关键发现:

  • Quality Score: 81.71(超越所有基线)
  • CLIP Score 在各时间段均保持最高

24 小时实时生成

24小时生成

  • 规模:>130 万帧 @ 18.5 FPS
  • 时长:24 小时连续生成
  • 效率:仅比无记忆基线多 10.6% 开销
  • 硬件:单张 NVIDIA H100

短视频生成泛化

即使禁用记忆更新(Eq. 4),优化后的 Memory Queries 仍能作为可泛化的视频生成先验,提升生成质量。

六、消融实验

记忆机制消融

配置30s Quality30s User Pref
Window Only83.5910.47%
+ Handcrafted KV83.3510.13%
+ Heuristic Compression83.6914.73%
+ Memory Queries (Echo-Infinity)85.6159.53%

RoPE 调度消融

配置30s Quality30s Semantic
Absolute RoPE83.3874.67%
Relative RoPE (inference only)79.99-
Unified Relative RoPE85.6182.01%

七、相关工作

工作方法差异
LongLive窗口截断 + sink frames丢失历史信息
MemFlow文本检索 KV 缓存管理离线规则,固定预算
Memorize-and-Generate启发式压缩预定义压缩比,分离目标
VideoSSMSSM 进化全局记忆需要架构级状态空间模块
∞-RoPE推理时相对 RoPE训练-测试不一致

八、总结

核心贡献

  1. Memory Queries:端到端可训练记忆,替代手工记忆管理,支持任意压缩比
  2. Unified Relative RoPE:统一训练-推理 RoPE 调度,消除外推/溢出风险
  3. Three-Tier KV Cache:Sink + Memory + Local 三层组织,模仿人类记忆层级
  4. 24 小时实时生成:首次实现 >130 万帧实时视频,仅 10.6% 额外开销
  5. 可泛化记忆先验:优化后的 Q 即使禁用更新仍有效

技术影响

  • 无限视频生成:为实时无限视频生成提供实用路径
  • 记忆机制创新:可学习记忆查询可推广到其他序列建模任务
  • RoPE 调度:统一的相对 RoPE 方案可应用于其他长序列任务
  • 产业应用:直播、游戏、虚拟现实等场景的实时视频生成

局限性

  • 计算成本:虽然常数开销,但仍有 10.6% 额外计算
  • 分辨率限制:当前仅支持 832×480 分辨率
  • 帧率限制:16 FPS,对于某些应用可能不够
  • 记忆容量:N_Q=3 可能无法捕获所有必要历史信息
  • 评估局限:主要在 VBench-Long 和 MovieGen 上评估

九、参考资源