All tags

diffusion-model

115 posts tagged with "diffusion-model"

LTX-Video: 实时视频潜在扩散模型

Lightricks 提出的实时文/图生视频模型:把 patchify 操作从 Transformer 输入端移入 Video-VAE,实现 1:192 高压缩(32×32×8 时空下采样 + 128 潜通道),并让 VAE 解码器承担最后一步去噪,无需额外超分模块。1.9B 参数即可在单张 H100 上以 2 秒生成 5 秒 768×512@24fps 视频(快于实时),人评 T2V 胜率 85%、I2V 胜率 91% 显著超越同量级开源模型。

Waver: 面向逼真视频生成的统一基础模型

字节跳动 Waver 团队的统一图像/视频生成基础模型:基于 Rectified Flow Transformer,用 Hybrid Stream DiT(Dual Stream 前 16 层对齐模态 + Single Stream 后 40 层提效)在单一网络内统一 T2V/I2V/T2I,原生生成 720p 5–10 秒视频再经 Cascade Refiner 级联超分到 1080p(提速 40%)。配套 MLLM 视频质量模型的数据清洗流水线、REPA 表征对齐、mode 时间步采样、192p 运动预训练、视频 APG、模型平均等训练/推理配方,在 Artificial Analysis T2V/I2V 榜单双双第三,复杂运动场景显著领先。

Veda: Scalable Video Diffusion via Distilled Sparse Attention(蒸馏式稀疏注意力)

面向大规模视频扩散 Transformer(DiT)的稀疏注意力加速框架。核心洞见:生成质量并非由稀疏率本身决定,而取决于稀疏掩码与全注意力 tile 级几何结构的对齐程度。Veda 把 tile 选择建模为对全注意力的显式重建问题:(1) 蒸馏式 tile 打分——用轻量估计器从全注意力 backbone 蒸馏 tile 级分数,配合 TripPool(Avg/Max/Min 三元统计)与逐头 MLP 投影降低估计误差,训练时对 backbone 特征做 stop-gradient 解耦掩码学习与特征学习;(2) 逐头 tiling 搜索(Head-aware Tiling)——为每层每头分配 (p_t,p_h,p_w) 分块配置以最小化稀疏输出与全注意力输出的 Frobenius 误差;(3) 硬件高效 tile-skipping kernel(ThunderKittens/Hopper TMA+Warp Specialization,达 FA3 80% MFU)。在 Waver-T2V-12B 720P 10 秒视频上取得 5.1× 端到端、10.5× 自注意力加速,注意力开销从 92% 降至 50%,且序列越长收益越大。

Video LDM: 高分辨率视频合成的隐扩散模型

Video LDM (Align your Latents) 将 LDM 范式扩展到高分辨率视频生成——先在图像上预训练,再冻结空间层、插入并只训练时序对齐层(时序注意力 + 3D 卷积),把图像生成器转为视频生成器;同时时序微调解码器与超分模型,将 Stable Diffusion 变为最高 1280×2048 的文生视频模型,并首次实现个性化文生视频。

DDiT: 动态 Patch 调度的高效扩散 Transformer

DDiT 提出测试时(training-free)动态分块策略——根据内容复杂度与去噪时间步自适应调整 patch size:高噪声步用粗 patch 建模全局结构、低噪声步用细 patch 精修局部细节;通过三阶有限差分度量潜表示演化速率驱动调度器,在 FLUX-1.Dev / Wan 2.1 上实现最高 3.52×/3.2× 加速且不损画质。

TetriServe: Efficiently Serving Mixed DiT Workloads

TetriServe 针对异构分辨率、紧 SLO 的 Diffusion Transformer 在线服务,首创 step-level sequence parallelism:把连续时间轴离散为固定长度轮次,先用剖析驱动的成本模型为每个请求求最小 GPU-hour 分配以满足 deadline,再以'避免必迟到'为目标做请求打包。相较固定 SP baseline,SLO Attainment Ratio 最高提升 32%,覆盖 FLUX.1-dev 与 SD3、H100 与 A40,稳定应对突发流量。

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

面向真实世界部署的 VLA 全栈综述。系统梳理 VLA 三大挑战(数据稀缺 / 具身迁移 / 算力成本)、架构演进(CNN→Transformer→VLM→Diffusion/Flow→分层控制),并给出三类核心架构(sensorimotor 7 变体 / world model 3 模式 / affordance 3 模式)、模态处理(视觉/语言/动作/音频/触觉/3D)、训练范式(SL/SSL/RL + 预训练/后训练/梯度隔离/LoRA)、数据采集(遥操作/代理设备/人类视频)、公开数据集(Ego4D/OXE/DROID/AgiBot World)、机器人平台与评测基准(LIBERO/CALVIN/ManiSkill/SIMPLER/RoboArena)。最后给出面向实践者的 6 条建议与 8 个未来方向。

M*: A Modular, Extensible, Serving System for Multimodal Models

M* 提出 Walk Graph 抽象把组合式多模态模型建模为组件级 dataflow 图 + 命名 Walks;请求成为图上的遍历。四种组合原语(Sequential/Parallel/Loop/DynamicLoop)与流式边策略统一表达 UMM、Omni、SpeechLM、VLA 与世界模型。BAGEL T2I 端到端延迟低 20%,Qwen3-Omni TTS RTF 快 2.9×、吞吐高 2.7×,V-JEPA 2 机器人 rollout 提速 12.5×。

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

GF-DiT 把 GPU 并行度视为一等可调度资源,将 DiT 请求拆为可独立调度的 trajectory tasks 并支持在线 GPU 重分配;提出 group-free collectives 用符号缓冲区 + 边协商实现毫秒级动态通信组,把 communicator 建立时间从 778 ms 降到约 60 μs;相比静态并行 pipeline 吞吐提升最多 6.01×、平均延迟降低最多 95%、SLO 违约率降低最多 90%。

TurboServe: Serving Streaming Video Generation Efficiently and Economically

首个面向流式视频生成服务的调度系统。将服务建模为在线调度问题,通过迁移感知的 min-max 会话再平衡与负载驱动的 GPU 自动扩缩,配合 GPU-CPU 卸载和 RDMA 会话迁移,联合优化每 chunk 最差延迟与 GPU 成本。在生数科技生产 trace 上,相比基线平均降低最坏每 chunk 延迟 37.5%(最高 51.6%)、降低 GPU 运营成本 37.2%(最高 49.0%),且与离线 oracle 相比调度成本仅差 6.1%。

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

DigenRL:为扩散生成模型 RL 后训练设计的解耦式(disaggregated)系统。用 Generation-Axis Pipeline (GAP) 沿生成维度细粒度流水,Timestep Parallelism (TSP) 替代数据并行提升 trainer GPU 利用率,Elastic Trainer-Assisted Generation (TAG) 让 trainer 空闲时协助 rollout,Trajectory-Consistent Stale Sync (TCSS) 严格约束一步陈旧样本。相比 VeRL-Omni 在 QwenImage 20B 上加速 1.56×–2.21×;HunyuanVideo 1.13×–1.49×;异构 GPU 场景 1.46×–1.85×;消融显示 GAP+TSP+TAG+TCSS 累计将 speedup 从 naive 1.52× 提升到 3.34×。

Qwen-Image-2.0-RL Technical Report

面向 Qwen-Image-2.0 扩散模型的 RLHF + On-Policy Distillation 后训练管线。用 VLM 微调 + 逐点评分 + CoT 构建 T2I(对齐/美学/人像)与编辑(指令遵循/人脸ID)复合奖励;基于 Flow-GRPO 引入混合 CFG(仅 rollout 用 CFG)、组内奖励范围过滤、每类权重校准、高噪声时间步采样;最后用 OPD 通过轨迹级速度匹配(W2 上界)把 T2I 与编辑双教师合并为单学生。Qwen-Image-Bench 57.84(+2.61),T2I Elo 1193(+78),编辑 Elo 1349(+93)。

W4A4 Quantization for Inference on Wan2.2-I2V-A14B

面向ICME 2026 W4A4量化挑战赛的Wan2.2-I2V-A14B视频扩散模型4bit权重/4bit激活推理方案。将LLM量化领域的SmoothQuant逐通道平滑与MixQ稀疏离群列拆分迁移到视频扩散FFN,并叠加块级HiF4权重打包与双分支GEMM。在VBench I2V上各项指标相对FP16降幅控制在2–3.5%,运动平滑度反而提升+0.4%,全面优于原生HiFloat4基线(后者跌约5%)。

DiLaServe: High SLO Attainment Serving for Diffusion Language Models

首个面向扩散语言模型(DLM)的集群级服务系统。DLM 每步并行解掩多个 token,比自回归模型吞吐高 1.75×,但引入置信度阈值这一「速度-质量」旋钮与 TP 度「时延-吞吐」权衡。DiLaServe 以「去噪步」为调度粒度,用 SLO 感知阈值调整 + 自适应负载控制动态选阈、轻量梯度提升 Step Predictor 在线预测剩余步数、按最低步时延调度并支持步级迁移、两阶段 ILP 定期重构集群 TP 配置,并把近似 KV 缓存的 cache/recompute 步异构成本纳入调度。基于 vLLM+Ray 实现(9500 行),真实 trace 上 SLO 达成率 +30.2pp、时延 -46%、质量仅降 0.09;多基准最高 +56.6pp SLO、精度仅降 0.9%

Latte: Latent Diffusion Transformer for Video Generation

首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。