Back to blog

LTX-Video: 实时视频潜在扩散模型

Lightricks 提出的实时文/图生视频模型:把 patchify 操作从 Transformer 输入端移入 Video-VAE,实现 1:192 高压缩(32×32×8 时空下采样 + 128 潜通道),并让 VAE 解码器承担最后一步去噪,无需额外超分模块。1.9B 参数即可在单张 H100 上以 2 秒生成 5 秒 768×512@24fps 视频(快于实时),人评 T2V 胜率 85%、I2V 胜率 91% 显著超越同量级开源模型。

LTX-Video: 实时视频潜在扩散模型

一、论文概述

项目内容
标题LTX-Video: Realtime Video Latent Diffusion
作者Yoav HaCohen 等(16 位作者)
机构Lightricks
发布arXiv:2501.00103(2024-12-30)
代码/模型开源(Apache-2.0,模型权重公开)
主题文生视频 / 图生视频、潜在扩散、Video-VAE、DiT、实时生成

一句话总结:通过把 patchify 从 Transformer 端下沉到 VAE,并让 VAE 解码器兼任”最后一步去噪 + 潜变量转像素”,LTX-Video 在极高压缩率下实现了快于实时、消费级 GPU 可跑的高质量视频生成。

二、核心思想

现有视频潜在扩散模型普遍存在两个割裂:

  1. VAE 与扩散 Transformer 相互独立——VAE 只负责压缩/重建,Transformer 在潜空间独立完成全部去噪;
  2. 压缩不足——为保证生成质量,多数模型采用较低压缩率(如 8×8×4),导致潜空间 token 数量庞大、计算昂贵,且常需级联的超分模块。

LTX-Video 提出一种 holistic(整体式)潜在扩散范式,把 VAE 与去噪 Transformer 深度融合:

  • 把 patchify 操作移入 VAE 输入端:传统 DiT 在 Transformer 入口做 patch 化(如 2×2 patch),LTX-Video 把这一步整合进 VAE 编码器,使 VAE 直接输出可供 Transformer 使用的紧凑潜表示,实现 1:192 的总压缩率(32×32×8 时空下采样 + 128 个潜通道)。
  • VAE 解码器承担最后一步去噪:不再由 Transformer 在潜空间完成全部去噪,而是让 VAE 解码器在”潜变量→像素”转换的同时执行最后一步去噪(denoising decoder)。高压缩带来的高频细节损失,正好由解码器的最后一步去噪补偿,因此无需额外的超分/上采样模块。

这种设计让整条链路在紧凑潜空间中高效运行,1.9B 参数即达到 SOTA,单张 H100 上 2 秒即可生成 5 秒 768×512@24fps 视频(快于实时)。

三、整体架构

LTX-Video 由两大组件构成:Video-VAE(高压缩编码器 + 去噪解码器)与 Video Transformer(潜空间去噪主干),二者共享同一个扩散目标。

3.1 共享扩散目标(Shared Diffusion Objective)

Fig 2. 整体去噪策略:Transformer 完成大部分去噪步,VAE 解码器完成最后一步

传统流程:Transformer 在潜空间完成 全部 去噪 → VAE 解码器无噪重建像素。

LTX-Video 流程:Transformer 完成 绝大部分 去噪步 → 把仍带少量噪声的潜变量交给 VAE 解码器,由解码器在转像素的同时完成 最后一步去噪。二者共享 rectified-flow 扩散目标,形成一个端到端的去噪链路。消融实验(第五节)表明该设计对高速运动视频的细节恢复尤为关键。

四、关键技术

4.1 Video-VAE:高压缩编码器

Fig 4a. VAE 编码器

  • 因果编码器(Causal Encoder):采用 3D 因果卷积,保证时序上只依赖过去帧;第一帧被单独编码为一个独立的潜帧,便于图像条件生成与首帧对齐。
  • 1:192 高压缩:空间 32×32、时间 8 倍下采样,输出 128 个潜通道。像素到 token 比例高达 1:8192,大幅削减 Transformer 需处理的 token 数。
  • 均匀对数方差(Uniform log-variance):在所有潜通道上使用统一的对数方差,防止部分通道”饥饿”(channel starvation),使潜空间分布更均衡、更利于扩散建模。

Fig 3. 潜通道累积可解释方差随训练步的变化——均匀 log-variance 使更多通道被有效利用,缓解通道饥饿

4.2 Video-VAE:去噪解码器

Fig 4b. VAE 去噪解码器

  • 扩散时间步条件(diffusion-timestep conditioning):解码器接收扩散时间步作为条件,从而能执行”最后一步去噪”。
  • 多层噪声注入(Multi-layer noise injection):借鉴 StyleGAN,在解码器多个层级注入噪声,帮助恢复高压缩下丢失的高频纹理细节。
  • 损失函数组合:最终训练损失 = MSE + Video-DWT loss + LPIPS + Reconstruction-GAN。其中 Video-DWT(对视频做 8 个 3D 离散小波变换后取 L1)专门约束多尺度频域细节。

4.3 Reconstruction GAN(新型判别器)

Fig 5. 传统 GAN(左)vs Reconstruction GAN(右)

在 1:192 的极高压缩率下,传统”重建损失 + 标准 GAN 损失”难以稳定重建高频细节,尤其在”快速运动 + 复杂纹理”帧上会出现伪影或帧间不一致。

LTX-Video 提出 Reconstruction GAN:判别器同时看到输入帧和重建帧,任务是判断哪一个是真实的原始帧(而非孤立地判断真/假)。这种成对相对判别方式显著减少了可见伪影(见第五节 Fig 16 消融)。

4.4 Video Transformer 与位置编码

Fig 6. 3D Transformer Block 架构

主干基于 Pixart-α 风格的 DiT,1.9B 参数、hidden dim 2048、28 个 Transformer block,采用 Self-Attention + Cross-Attention 结构。两个关键改进:

(1)归一化分数坐标的 RoPE

Fig 7. 三种坐标:绝对坐标(a)→ 分数坐标(b)→ 归一化分数坐标(c)

对时空 token 使用 RoPE,但坐标采用归一化的分数坐标:空间维度以像素为单位、时间维度以**秒(结合 FPS)**为单位。这样位置编码与真实物理尺度/时长挂钩,可在不同分辨率、不同帧率、不同时长间良好泛化。

(2)指数频率间隔(Exponential frequency spacing)

Fig 8. RoPE 频率间隔:指数 vs 逆指数

RoPE 的频率间隔采用指数而非常见的逆指数(inverse-exponential)间隔。消融(Fig 17)显示指数间隔的训练损失持续更低。

此外,注意力使用 QK-norm(RMSNorm) 稳定训练。

4.5 文本与图像条件

  • 文本条件:T5-XXL 文本编码器 + Cross-Attention 注入。
  • 图像条件(I2V):基于 Open-Sora 的扩展,采用 per-token timestep(逐 token 时间步)——条件帧对应的 token 时间步设为 0(干净),其余 token 正常加噪,使模型能以任意帧作为条件生成视频。

4.6 Rectified-Flow 训练

  • 速度预测(velocity prediction) 的 rectified flow 目标。
  • 对数正态时间步采样,并针对高分辨率向高噪声侧偏移(高分辨率需要更强去噪能力),采样时钳制在 0.5–99.9 百分位区间。
  • 多分辨率训练,配合 0–20% 的随机 token 丢弃(stochastic token dropping) 提升鲁棒性与效率。

4.7 数据准备

构建了专门的视频描述器(video captioner) 生成密集、详细的训练字幕(Fig 12–14 展示了字幕示例、词云与数据统计)。训练用 ADAM-W 优化器,预训练后在高美学子集上微调。

五、实验与结果

5.1 与同量级模型架构对比(Table 1)

模型参数量VAE 压缩Patchifier像素:tokenTransformer block注意力需超分
MovieGen30B——————
HunyuanVideo13B——————
PyramidFlow2B——————
CogVideoX2B/5B8×8×42×2×1——Full/Expert—
LTX-Video1.9B32×32×81×1×1(并入 VAE)1:819228Self+Cross否

LTX-Video 以最小的参数量、最高的压缩率、且无需超分模块,实现了极致的推理效率。

5.2 人评结果(Table 2)

遵循 MovieGen 的评测协议:1000 条 T2V prompt、1000 对 I2V(图像由 FLUX.1 生成),统一 5 秒 768×512、40 步扩散,20 名评测者盲测配对打分(分两组各 10 人,组间胜率差 <2%)。

Fig 9. 图生视频(I2V)推理流程

胜率(wins/(wins+losses)):

任务Open-Sora PlanCogVideoX 2BPyramidFlowLTX-Video
文生视频 T2V20%38%51%85%
图生视频 I2V20%47%35%91%

LTX-Video 在两项任务上均显著领先同量级开源模型,同时具备巨大速度优势。

5.3 消融实验

(1)Reconstruction GAN vs 传统 GAN

Fig 16. VAE 重建对比:输入(左)/ 标准 GAN(中)/ Reconstruction GAN(右)

在 1:192 压缩下,标准 GAN 损失在快速运动 + 复杂细节帧上产生可见伪影(单帧可见,播放时帧间不一致更明显);Reconstruction GAN 显著减少这些伪影。

(2)RoPE 频率间隔:指数间隔的训练损失持续低于逆指数间隔(Fig 17)。

(3)去噪 VAE 解码器:内部用户研究对比”解码器条件 t=0.05(执行最后一步去噪)“与”t=0.0(不去噪)“。结果强烈偏好去噪方案,在高速运动视频上改善尤为明显——高压缩带来的伪影被解码器的最后一步去噪有效缓解,验证了 holistic 设计的核心价值。

六、核心创新与贡献

创新点说明
Holistic 潜在扩散把 patchify 移入 VAE、VAE 解码器兼任最后一步去噪,VAE 与 Transformer 深度融合而非割裂
1:192 极高压缩32×32×8 时空下采样 + 128 潜通道,像素:token = 1:8192,大幅降低计算量
免超分模块最后一步去噪与潜转像素合并,直接输出精细细节,省去级联超分
Reconstruction GAN判别器成对判别输入与重建,缓解极高压缩下的重建伪影
归一化分数坐标 RoPE + 指数频率间隔位置编码挂钩真实物理尺度/时长,跨分辨率/帧率/时长泛化
实时、平民化1.9B 参数、单 H100 2 秒生成 5 秒视频,可在消费级 GPU 运行,全部开源

七、局限性

  • 对 prompt 敏感:措辞模糊或质量低的 prompt 会导致输出连贯性下降。
  • 仅支持短视频:目前限于 ≤10 秒;长视频的时序一致性与 prompt 保真仍是开放问题。
  • 领域泛化未充分验证:对多视角合成、细粒度编辑等专门任务的适配性尚未系统评估。

八、总结

LTX-Video 的核心洞见是:VAE 与扩散 Transformer 不必割裂。通过把 patchify 下沉到 VAE、并让 VAE 解码器承担最后一步去噪,模型得以在 1:192 的极高压缩潜空间中高效运行,用 1.9B 参数换来快于实时的生成速度与 SOTA 质量,且完全开源、可在消费级 GPU 部署。它为”高压缩 + holistic 去噪”这一效率路线提供了有力范例。

九、参考资源