Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
训练无关动态稀疏注意力:通过查询依赖高斯校准阈值、在线 Softmax 内联稀疏化和零阶泰勒代理分数复用,在不修改权重的情况下为视频生成 DiT 提供 2.0×–5.1× 端到端加速
26 posts tagged with "diffusion-transformer"
训练无关动态稀疏注意力:通过查询依赖高斯校准阈值、在线 Softmax 内联稀疏化和零阶泰勒代理分数复用,在不修改权重的情况下为视频生成 DiT 提供 2.0×–5.1× 端到端加速
MiniWorld 提出轻量级可复现的视频世界模型训练框架,基于块因果 Video DiT + Flow Matching + 块级非递减噪声调度 + 滚动 KV Cache 流水线异步去噪,可在单台 8-GPU 服务器上数天内完成训练
LingBot-Video — 首个开源大规模 MoE 视频基础模型,面向具身智能的单流扩散 Transformer,稀疏 MoE + 五阶段课程预训练 + 多维奖励 GRPO 后训练
Lightricks 提出的实时文/图生视频模型:把 patchify 操作从 Transformer 输入端移入 Video-VAE,实现 1:192 高压缩(32×32×8 时空下采样 + 128 潜通道),并让 VAE 解码器承担最后一步去噪,无需额外超分模块。1.9B 参数即可在单张 H100 上以 2 秒生成 5 秒 768×512@24fps 视频(快于实时),人评 T2V 胜率 85%、I2V 胜率 91% 显著超越同量级开源模型。
字节跳动 Waver 团队的统一图像/视频生成基础模型:基于 Rectified Flow Transformer,用 Hybrid Stream DiT(Dual Stream 前 16 层对齐模态 + Single Stream 后 40 层提效)在单一网络内统一 T2V/I2V/T2I,原生生成 720p 5–10 秒视频再经 Cascade Refiner 级联超分到 1080p(提速 40%)。配套 MLLM 视频质量模型的数据清洗流水线、REPA 表征对齐、mode 时间步采样、192p 运动预训练、视频 APG、模型平均等训练/推理配方,在 Artificial Analysis T2V/I2V 榜单双双第三,复杂运动场景显著领先。
统一多模态基础模型,融合空间增强 MLLM 与 MMDiT,实现理解/生成/编辑一体化,支持空间推理
阿里巴巴Qwen团队的统一多模态模型,在文本、图像、音频、视频上无性能退化
Qwen 图像生成基础模型技术报告
面向高质量实时交互式视频生成的自回归扩散蒸馏正确方法
通过跨模态上下文学习改进联合音视频生成
NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真
基于扩散的代码大语言模型,通过Block Diffusion持续预训练超越自回归基线
解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析
通过块级并行计算实现长序列Transformer训练,支持32倍更长上下文
面向高分辨率长视频生成的时空扩散Transformer可扩展推理
A lightweight bridging paradigm that enables SOTA-level VLA performance with only 0.5B parameters, without robotic data pre-training
世界动作模型是否需要测试时未来想象?
腾讯混元多模态3D世界模型:统一生成与重建
Qwen-Image-2.0 全能图像生成基础模型,支持文本到图像生成和图像编辑。
ProCache提出约束感知的特征缓存与选择性计算方法,加速扩散Transformer模型的推理过程。
ShaLa提出多模态共享潜空间建模方法,实现文本、图像等多模态信息的统一表示学习。
基于预训练视频扩散 Transformer 的全音频条件说话人像生成与编辑统一框架,支持无限长度生成和多模态控制
统一多模态上下文学习框架,单架构支持参考图像到视频、视频到视频扩展和音频引导视频生成三大核心范式
世界建模和视频生成已成为人工智能的核心挑战,需要合成时间连贯且逼真的序列。然而,大多数大规模视频扩散模型依赖全局条件去噪架构,同时处理整个时间序列,忽略了时间数据固有的因果结构。
针对扩散 Transformer 的注意力压缩后训练方法,通过三种冗余消除技术实现高达 76% FLOPs 减少
首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。