Back to blog

LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts

面向最优每 FLOP 和每参数精度的 MoE 架构设计

LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts

一、论文概述

项目内容
标题LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts
作者NVIDIA 研究团队
机构NVIDIA
论文arXiv:2601.18089
代码未开源
发布2026年1月
许可未明确
应用Nemotron-3 Super 和 Ultra 模型

二、核心思想

问题定义

Mixture-of-Experts (MoE) 架构已成为许多最先进开源和专有大语言模型的核心组件。然而,现有 MoE 架构在推理成本(以每浮点运算精度和每参数精度衡量)方面的最优性仍不清楚。

关键挑战:

  • 现有 MoE 主要针对离线、高吞吐量场景优化
  • 对在线部署(严格延迟、内存带宽、通信约束)考虑不足
  • 缺乏从硬件-软件协同设计角度的系统性设计探索

解决方案概述

LatentMoE 从硬件-软件协同设计角度重新审视 MoE 设计,基于实证和理论考虑,引入新的模型架构:

核心创新:将输入 token 投影到低维潜在空间 Rℓ\mathbb{R}^{\ell},在潜在空间中执行专家计算

设计目标:最大化每单位计算的精度(accuracy per FLOP 和 per parameter)

核心性能

  • 精度提升: 在等 FLOP 和等参数约束下,持续优于标准 MoE 架构
  • 规模验证: 在 95B 参数规模和 1T token 训练上验证
  • 实际应用: 已被 NVIDIA Nemotron-3 Super 和 Ultra 模型采用
  • 万亿参数投影: Kimi-K2-1T-LatentMoE 在精度-效率 Pareto 前沿上表现优异

三、技术架构

LatentMoE 架构

LatentMoE 架构

Figure 1(b): LatentMoE 架构

与标准 MoE 对比:

  • 标准 MoE: 输入直接路由到专家,专家在原始维度 dd 上操作
  • LatentMoE: 输入先投影到低维潜在空间 ℓ\ell,专家在潜在空间操作

核心公式

LatentMoE 前向传播:

  1. 下投影: z=W↓x,W↓∈Rℓ×dz = W_{\downarrow} x, \quad W_{\downarrow} \in \mathbb{R}^{\ell \times d}

  2. 路由: g=Router(z)g = \text{Router}(z),选择 top-K 专家

  3. 专家计算: hi=Ei(z;ℓ)h_i = E_i(z; \ell),每个专家在潜在空间操作

    • WFC1(i),Wgate(i)∈Rm×ℓW_{\text{FC1}}^{(i)}, W_{\text{gate}}^{(i)} \in \mathbb{R}^{m \times \ell}
    • WFC2(i)∈Rℓ×mW_{\text{FC2}}^{(i)} \in \mathbb{R}^{\ell \times m}
  4. 聚合: h=∑igi⋅hih = \sum_i g_i \cdot h_i

  5. 上投影: y=W↑h,W↑∈Rd×ℓy = W_{\uparrow} h, \quad W_{\uparrow} \in \mathbb{R}^{d \times \ell}

压缩比: α=d/ℓ\alpha = d / \ell

设计原则

原则 I: 内存带宽瓶颈

Roofline 分析

Figure 2: Qwen3-235B-A22B 的 Roofline 分析

在延迟敏感的小批量场景下,MoE 计算主要受内存带宽瓶颈制约:

  • 算术强度: I=2⋅texp⋅d⋅md⋅m+texp⋅(d+m)I = \frac{2 \cdot t_{\text{exp}} \cdot d \cdot m}{d \cdot m + t_{\text{exp}} \cdot (d + m)}
  • 低 II 值时,操作点位于带宽受限区域

关键洞察: 减少专家权重大小(压缩 dd 到 ℓ\ell)可直接减少内存带宽需求

原则 II: 通信瓶颈

MoE 路由需要 all-to-all 通信,将 token 发送到对应的专家 GPU:

  • 通信量: 与 token 维度 dd 成正比
  • LatentMoE 优势: 在潜在空间 ℓ\ell 中通信,减少 d/ℓd/\ell 倍通信量

原则 III: 有效非线性预算

Ueff=N⋅mU_{\text{eff}} = N \cdot m

其中 NN 是专家数,mm 是中间维度。压缩 dd 到 ℓ\ell 但保持 mm 不变,有效非线性预算不变。

原则 IV: 专家缩放

为补偿压缩带来的精度损失,增加专家数量:

N′=αNN' = \alpha N

实验验证:

专家缩放

Figure 4: 专家缩放对模型质量的影响

  • 绿色曲线(使用专家缩放):精度损失被有效补偿
  • 红色曲线(不使用专家缩放):精度显著下降

压缩比选择

压缩比

Figure 3: 压缩比 α=d/ℓ\alpha = d/\ell 对模型质量的影响

关键发现:

  • α=4\alpha = 4(4× 压缩)在精度和效率之间取得最佳平衡
  • 更高压缩比进一步减少计算但精度下降

四、核心创新

创新点说明理论/实验依据
潜在空间投影将 token 投影到低维空间再路由减少带宽和通信开销
专家缩放压缩后增加专家数量补偿精度有效消除压缩导致的精度损失
硬件-软件协同设计从系统瓶颈角度设计架构针对实际部署约束优化
双维度优化同时优化 per-FLOP 和 per-参数精度全面覆盖推理成本

LatentMoE 变体

变体目标特点
ℓ\ell-MoEeff_{\text{eff}}效率优先匹配基线收敛,减少计算
ℓ\ell-MoEacc_{\text{acc}}精度优先超越基线精度,相同计算

五、实验结果

训练收敛

训练收敛

Figure 6: 95B 模型训练收敛曲线

配置:

  • 基线: 95BT-8BA(95B 总参数,8B 激活参数)
  • ℓ\ell-MoEeff_{\text{eff}}: ℓ=1024,α=4\ell=1024, \alpha=4
  • ℓ\ell-MoEacc_{\text{acc}}: ℓ=1024,α=4\ell=1024, \alpha=4

结果:

  • ℓ\ell-MoEeff_{\text{eff}} 匹配基线收敛
  • ℓ\ell-MoEacc_{\text{acc}} 超越基线精度

16B 消融实验

配置验证损失相对基线
基线 (16BT-2BA)基准-
ℓ\ell-MoEeff_{\text{eff}} (ℓ=512\ell=512)匹配0%
ℓ\ell-MoEacc_{\text{acc}} (ℓ=512\ell=512)更低+改进

万亿参数投影

Pareto 前沿

Figure 7: 万亿参数规模的吞吐量-延迟 Pareto 前沿投影

场景:

  • 左: Decode 密集流量(chunked piggybacking 服务)
  • 右: Prefill 密集流量(分离式服务)

关键结果:

  • Kimi-K2-1T-LatentMoE 实现精度高效的运营点
  • 匹配其精度需要标准 MoE 额外约 350B 参数
  • 在前沿上实现 1.24× - 3.46× 投影加速

混合架构验证

LatentMoE 在混合 Mamba-Attention MoE 架构上也验证了有效性:

架构模型规模结果
Transformer MoE16B/95B有效
Hybrid Mamba-Attention MoE95B有效

六、与现有方法对比

方法类型优化目标精度-效率权衡
LatentMoE训练时架构per-FLOP + per-参数最优 Pareto 前沿
Standard MoE基线per-FLOP基准
MoLAE后训练压缩per-参数有限改进
专家剪枝后训练压缩per-参数精度损失
专家合并后训练压缩per-参数精度损失

LatentMoE 优势:

  • 训练时优化而非后训练压缩
  • 同时优化两个维度(per-FLOP 和 per-参数)
  • 通过专家缩放补偿压缩损失

七、总结

核心贡献

  1. 系统性设计探索: 从硬件-软件协同设计角度分析 MoE 瓶颈
  2. LatentMoE 架构: 将 token 投影到低维潜在空间,减少带宽和通信开销
  3. 专家缩放策略: 压缩后增加专家数量补偿精度损失
  4. 大规模验证: 在 95B 参数和 1T token 上验证有效性
  5. 实际应用: 已被 NVIDIA Nemotron-3 模型采用

技术影响

  • 架构设计: 为 MoE 设计提供新的范式(潜在空间投影)
  • 部署效率: 显著减少推理成本(内存带宽、通信)
  • 扩展性: 支持万亿参数规模的高效部署
  • 通用性: 适用于 Transformer 和混合架构

局限性

  • 需要从头训练(非后训练方法)
  • 最优压缩比 α\alpha 可能因模型规模而异
  • 潜在空间投影引入额外的下投影/上投影计算

未来方向

  • 更长的 token horizon
  • 更大的模型规模
  • 与其他压缩技术(量化、剪枝)组合

八、参考资源