Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
针对大规模 MoE LLM 推理中数据移动瓶颈的首次全面 profiling 分析,提取六大系统级洞察并在未来晶圆级 GPU 架构上验证
68 posts tagged with "mixture-of-experts"
针对大规模 MoE LLM 推理中数据移动瓶颈的首次全面 profiling 分析,提取六大系统级洞察并在未来晶圆级 GPU 架构上验证
TriRoute — 单一轻量控制器联合决策注意力分辨率、FFN 专家选择与 KV-Cache 位宽,端到端可训练,单一预算旋钮扫出 Pareto 前沿,缓解跨轴路由坍缩级联
LingBot-Video — 首个开源大规模 MoE 视频基础模型,面向具身智能的单流扩散 Transformer,稀疏 MoE + 五阶段课程预训练 + 多维奖励 GRPO 后训练
腾讯混元原生多模态模型:在自回归框架内统一多模态理解与生成,80B MoE(激活 13B),当前最大最强开源图像生成模型
小米 309B 总参 / 15B 激活的 MoE 推理与 Agent 大模型。混合注意力(5:1 SWA:GA,128 窗口 + 可学习 attention sink,KV/算力近 6× 缩减),27T token 预训练 + MTP,原生 32K 扩展到 256K。提出 Multi-Teacher On-Policy Distillation (MOPD):多领域 RL 教师提供 token 级 KL 稠密奖励 + ORM 结果奖励,学生在自身分布上蒸馏多专家。以 1/2、1/3 的参数比肩 DeepSeek-V3.2 与 Kimi-K2;SWE-Bench Verified 73.4%。三层 MTP 做自投机解码,接受长度达 3.6、解码提速 2.6×。
Gimbal 为 MoE LLM 推理设计跨层协同调度:前端基于 KV / prefill / 队列 / 专家压力的细粒度 DP 引擎选择 + 引擎内 SJF+aging 队列;后端结合源感知路由统计与 MINLP 校准的启发式专家放置,实现前后端反馈闭环,在 vLLM 之上将 TTFT 降 42.9%、TPOT 降 33.3%,高负载吞吐提升 3.0%。
WiSP 将低资源 MoE serving 建模为专家权重与 KV 缓存两条 working-set 争夺同一 VRAM 的问题。核心是 routing-aware expert pager(基于 expert_map 的 LRU 分页,字节等价输出)加 MV-WSA 边际价值分配器,联合分配 expert scratch 与 KV pool。iso-VRAM 下相对 vLLM static offload 解码吞吐最高提升 1.95×,Jamba-52B/MiniMax-M2-229B 等 baseline 无法启动的模型上也能可服务,且揭示单流 decode 中 routing 预测只能省显存不能省延迟。
首个在运行时于专家并行(EP)与张量并行(TP)间无缝切换、不重启引擎、不丢弃在途请求的 MoE 服务系统。核心洞见:EP 与 TP 是同一模型的两种布局而非两个模型,切换只改变「哪个 rank 拥有哪一片」,唯一成本是搬运换主字节,NVLink 使其在两次 decode step 间完成。用统一内存管理器保持 CUDA graph 跨切换有效、融合直传 kernel、双控制平面同时驻留。8×H200 服务 Qwen3-235B-A22B,RL rollout 超越 1.16-1.25×,每次切换 215-434ms,仅 2.4% 显存开销
MoE 在大语言模型中的全面综述,涵盖门控函数、专家网络、训练推理方案、系统设计和应用
通过将 MoE 架构重构为多个独立的专家集群,消除 all-to-all 通信瓶颈,实现高效的分布式推理
开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解
使用稀疏 MoE 扩展扩散 Transformer 到 16.5B 参数
使用自适应专家选择路由扩展扩散 Transformer
发现MoE大语言模型中的超级专家:少量关键专家对模型性能的决定性影响
阿里巴巴Qwen团队的统一多模态模型,在文本、图像、音频、视频上无性能退化
微软AI从零构建的35B/1T MoE推理模型,AIME 2025达97%,SWE-Bench Pro达52.8%
面向细粒度和稀疏 MoE 的 IO 和 Tile 感知优化加速器
面向最优每 FLOP 和每参数精度的 MoE 架构设计
通过组合权重稀疏性和数据稀疏性提升 MoE 计算效率
ServiceNow Research 开源的大语言模型分布式训练库,基于 PyTorch 和 Triton 构建,支持 3D 并行、ZeRO、MoE 等特性
通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM
从硬件约束出发,推导RL训练的最优并行策略、资源分配和流水线设计
大规模MoE模型的高效推理框架,实现26倍吞吐量提升和4-bit量化
通过平滑激活离群值实现LLM的W8A8量化,支持高达530B参数模型的无损量化
面向资源受限环境的MoE模型高效推理系统,通过智能CPU-GPU协作实现最优执行策略
从 Llama 3-8B 高效上循环训练 MoE 模型
基于3D并行的大规模Early-Exit LLM训练与推理框架
通过专家卸载和动态放置实现MoE模型训练的高效扩展,支持67倍专家扩展和17.5倍吞吐量提升
本文深入分析MegaScale-MoE,一个专为大规模MoE模型高效训练设计的生产系统,通过通信高效并行策略、通信-计算重叠和通信压缩,在1,440个NVIDIA Hopper GPU上训练352B MoE模型实现1.41M tokens/s吞吐量,相比Megatron-LM提升1.88倍。
首个完全融合的分布式MoE算子,将专家计算和GPU间通信融合为单一持久化GPU内核
本文提出EaaS,一种将MoE模块解耦为独立无状态服务的新型服务系统,实现细粒度资源扩展和固有容错能力,在模拟硬件故障下吞吐量下降不超过2%,并可节省高达37.5%的计算资源。
面向推理最优的MoE大语言模型扩展律研究
针对MoE模型的专家流水线调度器,通过计算通信重叠实现推理吞吐量提升
基于CPU-GPU-I/O流水线调度的高吞吐量MoE推理系统
通过细粒度专家卸载优化MoE大模型服务的延迟-内存权衡
基于模块级批处理的单GPU高吞吐量MoE推理系统
细粒度MoE模型推理优化分析,探索专家跳过和专家剪枝的效率与性能权衡
面向内存受限GPU的即时MoE推理系统,通过混合压缩和稀疏预测实现48.7×加速
针对MoE模型的高效All-to-All通信调度器,通过两阶段调度解决负载倾斜和incast问题
基于树结构自适应神经老虎机路由器的在线MoE推理优化,实现45%延迟降低和25%内存节省
通过随机共激活采样和层次化路由器损失,实现MoE模型推理时弹性扩展,有效扩展范围达训练时k的2-3倍
面向解耦专家并行的细粒度任务调度框架,实现MoE推理吞吐量提升1.61×
面向MoE模型的弹性推理框架,将故障影响限制在单个worker级别,实现160-213×的停顿减少
通过自辅助推测解码实现高效MoE推理,最高4.30×吞吐量提升
动态模块级专家剪枝框架,实现LoRA-MoE微调参数减少43%且精度不降
通过级联规划器(EAM+EAP)实现高效专家预取,在资源受限设备上加速MoE推理,吞吐量提升65.13%
通过量化填充、专家内存池和层感知调度实现无回退的高效MoE推理,相比MoE-Infinity加速2.86倍
首个在公平比较下超越全注意力的混合线性注意力架构,通过KDA实现75% KV缓存减少和6倍解码吞吐量提升
突破十亿参数通用机器学习原子间势函数的训练壁垒
MiniMax-M2系列:小型激活释放最大真实世界智能
Poolside Laguna M1-XS2:103B参数开放权重前沿编码Agent
DeepSeek-V3: 671B 参数 MoE 语言模型技术报告
将MoE原理应用于注意力机制的长上下文LLM
面向大规模 LLM 训练和推理的统一细粒度模拟器
轻量级原生统一多模态模型,通过双流MoE架构和多任务协同训练实现图像视频理解、生成与编辑
Mixture-of-Experts (MoE) 已被 DeepSeek、GPT、Llama、Qwen 等主流大模型采用,以降低计算开销。然而,MoE 中的 Expert Parallelism (EP) 需要频繁的 GPU 间通信(Dispatch 和 Combine),这成为性能瓶颈——通...
MoE 模型推理优化技术综述,分析问题与挑战,总结最新研究进展。
Routing-Free MoE 提出无需路由的混合专家模型架构。
NVIDIA提出基于Megatron Core的可扩展MoE模型训练方法,支持大规模混合专家模型的高效分布式训练。
基于稀疏混合专家的自适应计算实时目标检测框架,通过动态路由实现按场景复杂度分配计算资源。
LLM 服务越来越多地被 decode attention 主导,这是一个 memory-bound 操作,因为需要从全局内存加载大量的 KV cache。
自适应专家调度与内存协调的MoE推理运行时系统,通过动态步长预测和缓存感知路由消除99.9%等待延迟。
标准 Transformer 注意力机制的二次复杂度在长上下文场景下成为瓶颈。虽然线性注意力方法(如 Mamba2、Gated DeltaNet)可以降低计算复杂度,但它们在表达能力和实际性能上通常不如全注意力机制。
LongCat-Flash 技术报告,探索大语言模型高效推理与训练加速。
X-MoE是一种新型MoE训练系统,通过无填充训练管道、冗余绕过分发和序列分片MoE块等技术,在AMD GPU上实现DeepSeek风格MoE的高效可扩展训练
COMET提出细粒度计算-通信重叠技术,优化混合专家模型的分布式推理效率。
提出全流水线分布式Transformer架构,支持超长上下文语言模型的高效训练。
Lazarus 是首个面向 MoE 模型的弹性容错训练系统,通过自适应专家副本分配和可证明最优的专家放置算法,在频繁节点故障下实现高达 5.7x 的性能提升