PhiZero: A World Model Built Around Physical Language
A physical world model that learns a compact discrete 'physical language' from in-the-wild videos, then uses a reason-then-render paradigm to generate and understand physically coherent video
115 posts tagged with "diffusion-model"
A physical world model that learns a compact discrete 'physical language' from in-the-wild videos, then uses a reason-then-render paradigm to generate and understand physically coherent video
多块预测(MCP)训练框架,通过轻量辅助模块同时去噪多个未来视频块,加速世界动作模型训练与推理
First generative game engine combining multi-player control, real-time inference, complex physical interaction, and adversarial gameplay in KOF '97
首个 FP4 微缩放注意力推理加速与 INT8 可训练注意力探索
将稀疏注意力与线性注意力融合的 trainable attention 方法,用于加速 DiT 视频生成模型
基于 Wan-1.3B 的生成式格斗游戏引擎,首次实现多玩家控制、实时推理、复杂物理交互和对抗性玩法的统一
一个因果视频生成世界模型,实现无限长、实时响应的交互式世界模拟,支持多种角色动作和环境事件,并引入Pilot-Director双智能体协作框架
LingBot-Video — 首个开源大规模 MoE 视频基础模型,面向具身智能的单流扩散 Transformer,稀疏 MoE + 五阶段课程预训练 + 多维奖励 GRPO 后训练
Jointly trained conditional and unconditional diffusion model enabling guidance without a separate classifier, achieving similar quality-diversity tradeoff as classifier guidance with simpler training
ByteDance's FSVideo achieves 42.3x speedup over Wan2.1 via 64×64×4 compression autoencoder, layer memory self-attention DIT, and few-step latent upsampler
字节跳动提出的首个基于潜空间扩散模型(LDM)的高效文生视频框架。通过在低维潜空间建模视频分布、复用文生图模型的 2D 卷积权重、引入帧级轻量 adaptor 与有向时序注意力,MagicVideo 在单卡上生成 256×256 视频,FLOPs 较 VDM 减少约 64×。
Lightricks 提出的实时文/图生视频模型:把 patchify 操作从 Transformer 输入端移入 Video-VAE,实现 1:192 高压缩(32×32×8 时空下采样 + 128 潜通道),并让 VAE 解码器承担最后一步去噪,无需额外超分模块。1.9B 参数即可在单张 H100 上以 2 秒生成 5 秒 768×512@24fps 视频(快于实时),人评 T2V 胜率 85%、I2V 胜率 91% 显著超越同量级开源模型。
字节跳动 Waver 团队的统一图像/视频生成基础模型:基于 Rectified Flow Transformer,用 Hybrid Stream DiT(Dual Stream 前 16 层对齐模态 + Single Stream 后 40 层提效)在单一网络内统一 T2V/I2V/T2I,原生生成 720p 5–10 秒视频再经 Cascade Refiner 级联超分到 1080p(提速 40%)。配套 MLLM 视频质量模型的数据清洗流水线、REPA 表征对齐、mode 时间步采样、192p 运动预训练、视频 APG、模型平均等训练/推理配方,在 Artificial Analysis T2V/I2V 榜单双双第三,复杂运动场景显著领先。
LingBot-World, an open-sourced world simulator stemming from video generation, featuring minute-level horizon, real-time interactivity, emergent memory, and three-stage evolutionary training pipeline
A comprehensive survey of world models from a robot-learning perspective, examining policy coupling, learned simulators for RL and evaluation, robotic video generation, and benchmarks/datasets across embodied applications
面向大规模视频扩散 Transformer(DiT)的稀疏注意力加速框架。核心洞见:生成质量并非由稀疏率本身决定,而取决于稀疏掩码与全注意力 tile 级几何结构的对齐程度。Veda 把 tile 选择建模为对全注意力的显式重建问题:(1) 蒸馏式 tile 打分——用轻量估计器从全注意力 backbone 蒸馏 tile 级分数,配合 TripPool(Avg/Max/Min 三元统计)与逐头 MLP 投影降低估计误差,训练时对 backbone 特征做 stop-gradient 解耦掩码学习与特征学习;(2) 逐头 tiling 搜索(Head-aware Tiling)——为每层每头分配 (p_t,p_h,p_w) 分块配置以最小化稀疏输出与全注意力输出的 Frobenius 误差;(3) 硬件高效 tile-skipping kernel(ThunderKittens/Hopper TMA+Warp Specialization,达 FA3 80% MFU)。在 Waver-T2V-12B 720P 10 秒视频上取得 5.1× 端到端、10.5× 自注意力加速,注意力开销从 92% 降至 50%,且序列越长收益越大。
无仿真训练连续归一化流(CNF)的新范式:通过回归条件概率路径的向量场,统一并超越扩散模型,并引入最优传输(OT)路径
DiT 用在 latent patch 上操作的 Transformer 替换扩散模型常用的 U-Net 骨干,提出 adaLN-Zero 条件注入块,证明 Gflops(通过增大深度/宽度或 token 数)与 FID 强负相关;DiT-XL/2 在 ImageNet 256×256 取得 SOTA FID 2.27,是 Sora/SD3/FLUX 等现代生成模型的架构基石。
Video LDM (Align your Latents) 将 LDM 范式扩展到高分辨率视频生成——先在图像上预训练,再冻结空间层、插入并只训练时序对齐层(时序注意力 + 3D 卷积),把图像生成器转为视频生成器;同时时序微调解码器与超分模型,将 Stable Diffusion 变为最高 1280×2048 的文生视频模型,并首次实现个性化文生视频。
Stability AI 的 SD3 论文:改进的 Rectified Flow 时间步采样 + 多模态 MM-DiT 架构,在高分辨率文生图上超越 DALL·E 3 等 SOTA
Meta 的 Movie Gen 媒体基础模型全家桶:30B 文生视频 + 13B 视频音频生成,Flow Matching + LLaMa3 风格 Transformer,支持 1080p HD 视频、同步音频、个性化与指令式视频编辑,多任务达到 SOTA。
腾讯混元视频生成基础模型,130亿参数,涵盖数据清洗、架构设计、渐进缩放训练和高效基础设施,综合性能超越Runway Gen-3和Luma 1.6等闭源模型。
LinGen 用线性复杂度的 MATE 模块(Bidirectional Mamba2 + TESA)替换 DiT 中二次复杂度的自注意力,首次实现单 GPU 上高分辨率分钟级视频生成,最高 15× FLOPs 加速。
PPFlow 用金字塔分块化(高噪声时间步用大 patch、低噪声时间步用小 patch)替换 DiT 固定 patch size,仅切换 Patchify/Unpatchify 线性投影而共享 DiT blocks,实现 1.6–2.0× 去噪加速且质量不降,从预训练模型适配仅需 +8.9% 训练 FLOPs。
腾讯轻量级开源视频生成模型,仅83亿参数即达SOTA视觉质量,支持SSTA稀疏注意力加速、视频超分到1080p、消费级GPU推理
DDiT 提出测试时(training-free)动态分块策略——根据内容复杂度与去噪时间步自适应调整 patch size:高噪声步用粗 patch 建模全局结构、低噪声步用细 patch 精修局部细节;通过三阶有限差分度量潜表示演化速率驱动调度器,在 FLUX-1.Dev / Wan 2.1 上实现最高 3.52×/3.2× 加速且不损画质。
DC-DiT 用学习式 encoder-router-decoder 支架替换扩散 Transformer 的固定 patchify,端到端学习内容自适应的动态分块 tokenization,实现跨空间/时间步的自适应计算与单一 checkpoint 弹性推理,FLOPs 降低 36.8%、FID 提升 37.8%。
Mario Larcher 在 Towards Data Science 对 DiT 论文《Scalable Diffusion Models with Transformers》的教学式讲解精读,含扩散公式、无分类器引导、潜在扩散、Patchify、adaLN-Zero 等背景与核心设计
Patch-level pipeline parallelism for DiT inference that eliminates pipeline bubbles and enables PCIe-scale multi-GPU inference at 8K resolution
rRCM reformulates generative denoising as discriminative latent-space learning for certified robustness with 85× speedup
A general-purpose interactive text/image-to-video world model supporting camera navigation, scene revisits, and promptable events with 16 FPS streaming on 8x RTX 5090
MrFlow achieves 10x+ training-free acceleration for flow-matching diffusion models via a four-stage low-to-high resolution pipeline
TetriServe 针对异构分辨率、紧 SLO 的 Diffusion Transformer 在线服务,首创 step-level sequence parallelism:把连续时间轴离散为固定长度轮次,先用剖析驱动的成本模型为每个请求求最小 GPU-hour 分配以满足 deadline,再以'避免必迟到'为目标做请求打包。相较固定 SP baseline,SLO Attainment Ratio 最高提升 32%,覆盖 FLUX.1-dev 与 SD3、H100 与 A40,稳定应对突发流量。
面向真实世界部署的 VLA 全栈综述。系统梳理 VLA 三大挑战(数据稀缺 / 具身迁移 / 算力成本)、架构演进(CNN→Transformer→VLM→Diffusion/Flow→分层控制),并给出三类核心架构(sensorimotor 7 变体 / world model 3 模式 / affordance 3 模式)、模态处理(视觉/语言/动作/音频/触觉/3D)、训练范式(SL/SSL/RL + 预训练/后训练/梯度隔离/LoRA)、数据采集(遥操作/代理设备/人类视频)、公开数据集(Ego4D/OXE/DROID/AgiBot World)、机器人平台与评测基准(LIBERO/CALVIN/ManiSkill/SIMPLER/RoboArena)。最后给出面向实践者的 6 条建议与 8 个未来方向。
M* 提出 Walk Graph 抽象把组合式多模态模型建模为组件级 dataflow 图 + 命名 Walks;请求成为图上的遍历。四种组合原语(Sequential/Parallel/Loop/DynamicLoop)与流式边策略统一表达 UMM、Omni、SpeechLM、VLA 与世界模型。BAGEL T2I 端到端延迟低 20%,Qwen3-Omni TTS RTF 快 2.9×、吞吐高 2.7×,V-JEPA 2 机器人 rollout 提速 12.5×。
GF-DiT 把 GPU 并行度视为一等可调度资源,将 DiT 请求拆为可独立调度的 trajectory tasks 并支持在线 GPU 重分配;提出 group-free collectives 用符号缓冲区 + 边协商实现毫秒级动态通信组,把 communicator 建立时间从 778 ms 降到约 60 μs;相比静态并行 pipeline 吞吐提升最多 6.01×、平均延迟降低最多 95%、SLO 违约率降低最多 90%。
首个面向流式视频生成服务的调度系统。将服务建模为在线调度问题,通过迁移感知的 min-max 会话再平衡与负载驱动的 GPU 自动扩缩,配合 GPU-CPU 卸载和 RDMA 会话迁移,联合优化每 chunk 最差延迟与 GPU 成本。在生数科技生产 trace 上,相比基线平均降低最坏每 chunk 延迟 37.5%(最高 51.6%)、降低 GPU 运营成本 37.2%(最高 49.0%),且与离线 oracle 相比调度成本仅差 6.1%。
DigenRL:为扩散生成模型 RL 后训练设计的解耦式(disaggregated)系统。用 Generation-Axis Pipeline (GAP) 沿生成维度细粒度流水,Timestep Parallelism (TSP) 替代数据并行提升 trainer GPU 利用率,Elastic Trainer-Assisted Generation (TAG) 让 trainer 空闲时协助 rollout,Trajectory-Consistent Stale Sync (TCSS) 严格约束一步陈旧样本。相比 VeRL-Omni 在 QwenImage 20B 上加速 1.56×–2.21×;HunyuanVideo 1.13×–1.49×;异构 GPU 场景 1.46×–1.85×;消融显示 GAP+TSP+TAG+TCSS 累计将 speedup 从 naive 1.52× 提升到 3.34×。
面向 Qwen-Image-2.0 扩散模型的 RLHF + On-Policy Distillation 后训练管线。用 VLM 微调 + 逐点评分 + CoT 构建 T2I(对齐/美学/人像)与编辑(指令遵循/人脸ID)复合奖励;基于 Flow-GRPO 引入混合 CFG(仅 rollout 用 CFG)、组内奖励范围过滤、每类权重校准、高噪声时间步采样;最后用 OPD 通过轨迹级速度匹配(W2 上界)把 T2I 与编辑双教师合并为单学生。Qwen-Image-Bench 57.84(+2.61),T2I Elo 1193(+78),编辑 Elo 1349(+93)。
面向ICME 2026 W4A4量化挑战赛的Wan2.2-I2V-A14B视频扩散模型4bit权重/4bit激活推理方案。将LLM量化领域的SmoothQuant逐通道平滑与MixQ稀疏离群列拆分迁移到视频扩散FFN,并叠加块级HiF4权重打包与双分支GEMM。在VBench I2V上各项指标相对FP16降幅控制在2–3.5%,运动平滑度反而提升+0.4%,全面优于原生HiFloat4基线(后者跌约5%)。
首个面向扩散语言模型(DLM)的集群级服务系统。DLM 每步并行解掩多个 token,比自回归模型吞吐高 1.75×,但引入置信度阈值这一「速度-质量」旋钮与 TP 度「时延-吞吐」权衡。DiLaServe 以「去噪步」为调度粒度,用 SLO 感知阈值调整 + 自适应负载控制动态选阈、轻量梯度提升 Step Predictor 在线预测剩余步数、按最低步时延调度并支持步级迁移、两阶段 ILP 定期重构集群 TP 配置,并把近似 KV 缓存的 cache/recompute 步异构成本纳入调度。基于 vLLM+Ray 实现(9500 行),真实 trace 上 SLO 达成率 +30.2pp、时延 -46%、质量仅降 0.09;多基准最高 +56.6pp SLO、精度仅降 0.9%
无需训练的视频扩散模型加速策略,通过动态特征复用和 CFG-Cache 实现 1.67x 加速同时保持高质量生成
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
去噪扩散概率模型
使用稀疏 MoE 扩展扩散 Transformer 到 16.5B 参数
使用自适应专家选择路由扩展扩散 Transformer
基于时间步嵌入感知的缓存策略加速视频扩散模型推理
滑动瓦片注意力加速视频扩散 Transformer 推理
高效扩散模型综述:算法级、系统级和框架视角
利用稀疏注意力模式加速视频扩散 Transformer 推理
自适应混合缓存策略加速视频扩散模型推理
具有扩散噪声搜索的强度可控时间一致说话头生成
具有空间理解和在线强化学习的视觉-语言-动作模型
通过潜在轨迹引导实现运动可控的视频生成
基于可学习 token 稀疏化的 DiT 加速框架
基于 PCA 旋转的 DiT 4-bit 后训练量化框架
从权重稀疏到激活稀疏:DiT 模型的 N:M 半结构化稀疏加速
基于 MLLM 语义规划和 DiT 渲染的统一视频生成与编辑框架
无训练方法解决自回归视频扩散模型的长视频生成退化问题
通过差分缩放和动态间隔缓存实现 DiT 的极端加速
Qwen 图像生成基础模型技术报告
实时自回归长视频扩散生成技术
实时交互式运动控制视频生成
实时直播视频生成的流式系统
面向高质量实时交互式视频生成的自回归扩散蒸馏正确方法
通过对比策略优化对齐自回归视频生成
面向快速视频生成的自洽分布匹配与缓存感知训练框架
面向少步自回归世界模型推理的跨分块缓存加速
NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真
一种无需训练的结构化推理加速框架,用于加速扩散式视觉-语言-动作模型
基于扩散的代码大语言模型,通过Block Diffusion持续预训练超越自回归基线
通过知识蒸馏实现高效视频帧选择的查询无关方法,在低帧预算下显著优于现有方法
NVIDIA全模态世界模型,统一语言、图像、视频、音频和动作的理解与生成,为Physical AI提供通用骨干网络
首个Vision Transformer算法-加速器协同设计框架,通过固定稀疏注意力模式和自编码器实现高效加速
免训练扩散模型加速框架,利用U-Net高层特征的时间冗余实现缓存复用
面向扩散Transformer的层缓存加速方法,通过可微分路由器学习最优缓存策略
通用分布式加速框架,通过异步去噪实现扩散模型的多设备并行推理
PostDiff:免训练扩散模型压缩框架,通过混合分辨率去噪和混合模块缓存降低单步推理成本
解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析
全栈开源框架,将T2V/TI2V基础模型转换为相机可控的少步自回归视频世界模型
基于查询感知模型扩展的文本到图像扩散模型高效服务系统
利用时空稀疏性加速视频扩散Transformer推理,实现2.28×/2.33×端到端加速
自强制训练范式解决自回归视频扩散模型的暴露偏差问题,实现单GPU 17FPS实时视频生成
基于树结构自适应神经老虎机路由器的在线MoE推理优化,实现45%延迟降低和25%内存节省
通过随机共激活采样和层次化路由器损失,实现MoE模型推理时弹性扩展,有效扩展范围达训练时k的2-3倍
统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成
小米机器人团队发布的先进VLA模型,通过精心设计的训练方案和部署策略实现高性能实时执行
世界动作模型是否需要测试时未来想象?
Qwen-Image-2.0 全能图像生成基础模型,支持文本到图像生成和图像编辑。
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
Matrix-3D 提出从单张图像生成全方位可探索 3D 世界的统一框架。
自回归解码因其顺序性而受到瓶颈限制。投机解码(Speculative Decoding, SD)已成为加速推理的标准方法,通过使用快速草稿模型预测慢速目标模型即将生成的 token,然后通过一次目标模型前向传播并行验证。
基于扩散的大型语言模型(dLLMs)是一种有前景的范式,利用同时去噪实现全局规划和迭代细化。虽然这些能力对于长上下文生成特别有利,但部署此类模型面临来自严重系统低效的内存容量障碍。
ProCache提出约束感知的特征缓存与选择性计算方法,加速扩散Transformer模型的推理过程。
全面综述人体运动生成技术,涵盖视觉、文本、音频三种模态,200+论文,10+子任务
ShaLa提出多模态共享潜空间建模方法,实现文本、图像等多模态信息的统一表示学习。
通过稳定性准则统一逐步和逐token稀疏决策的扩散模型加速框架
通过为每个 token 分配独立噪声级别,统一自回归预测与全序列扩散,在视频生成、决策规划和机器人控制中实现稳定长序列生成和灵活引导
首个开源无限长度视频生成模型,融合 MLLM 结构化描述、多阶段预训练、运动质量强化学习和 Diffusion Forcing 框架,在 V-Bench 上达到开源模型最高分
基于预训练视频扩散 Transformer 的全音频条件说话人像生成与编辑统一框架,支持无限长度生成和多模态控制
首个17B参数的交互式世界基础模型,通过两阶段训练(无标签预训练+动作标注训练)实现Minecraft可控制视频生成,支持键盘/鼠标动作控制
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成
提出归纳矩匹配(IMM)框架,通过单阶段训练实现一步或少步生成,在ImageNet-256×256上以8步达到1.99 FID,超越扩散模型
世界建模和视频生成已成为人工智能的核心挑战,需要合成时间连贯且逼真的序列。然而,大多数大规模视频扩散模型依赖全局条件去噪架构,同时处理整个时间序列,忽略了时间数据固有的因果结构。
块级离散去噪扩散语言模型,在自回归和扩散之间插值,实现任意长度生成和 SOTA 似然
重新审视自回归与扩散的二分法,提出推理时扩展的两个轴:序列扩展和状态精炼
现代大语言模型(LLM)的自回归生成特性使其推理速度慢且成本高昂。投机解码(Speculative Sampling)已被证明是解决此问题的有效方案。EAGLE 系列方法通过在特征级进行自回归,复用目标模型的顶层特征,取得了比传统投机解码更好的效果。
首个与双向扩散模型质量匹敌的自回归视频生成方法,通过非对称蒸馏将50步双向DiT蒸馏为4步因果生成器,实现9.4 FPS流式生成
面向扩散 Transformer 的大规模并行推理引擎,混合多种并行策略实现 16 GPU 扩展
SampleAttention通过自适应结构化稀疏注意力实现长上下文LLM推理的近无损加速,显著降低首token延迟。
针对扩散 Transformer 的注意力压缩后训练方法,通过三种冗余消除技术实现高达 76% FLOPs 减少
EAGLE 系列是针对大语言模型(LLM)推理加速的投机解码(Speculative Decoding)方法,由 Yuhui Li 等人提出。该系列从特征级自回归、动态草稿树到训练时测试,逐步提升了投机解码的速度和效率。
首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。
大型自回归模型(如 Transformer)的推理速度很慢——解码 K 个 token 需要 K 次串行运行模型。这成为了部署大型语言模型的主要瓶颈。
通过非马尔可夫扩散过程实现 10-50× 加速采样的扩散模型