All tags

text-to-video

5 posts tagged with "text-to-video"

LTX-Video: 实时视频潜在扩散模型

Lightricks 提出的实时文/图生视频模型:把 patchify 操作从 Transformer 输入端移入 Video-VAE,实现 1:192 高压缩(32×32×8 时空下采样 + 128 潜通道),并让 VAE 解码器承担最后一步去噪,无需额外超分模块。1.9B 参数即可在单张 H100 上以 2 秒生成 5 秒 768×512@24fps 视频(快于实时),人评 T2V 胜率 85%、I2V 胜率 91% 显著超越同量级开源模型。

Waver: 面向逼真视频生成的统一基础模型

字节跳动 Waver 团队的统一图像/视频生成基础模型:基于 Rectified Flow Transformer,用 Hybrid Stream DiT(Dual Stream 前 16 层对齐模态 + Single Stream 后 40 层提效)在单一网络内统一 T2V/I2V/T2I,原生生成 720p 5–10 秒视频再经 Cascade Refiner 级联超分到 1080p(提速 40%)。配套 MLLM 视频质量模型的数据清洗流水线、REPA 表征对齐、mode 时间步采样、192p 运动预训练、视频 APG、模型平均等训练/推理配方,在 Artificial Analysis T2V/I2V 榜单双双第三,复杂运动场景显著领先。

Video LDM: 高分辨率视频合成的隐扩散模型

Video LDM (Align your Latents) 将 LDM 范式扩展到高分辨率视频生成——先在图像上预训练,再冻结空间层、插入并只训练时序对齐层(时序注意力 + 3D 卷积),把图像生成器转为视频生成器;同时时序微调解码器与超分模型,将 Stable Diffusion 变为最高 1280×2048 的文生视频模型,并首次实现个性化文生视频。

Latte: Latent Diffusion Transformer for Video Generation

首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。