Back to blog

Faster MoE LLM Inference for Extremely Large Models

细粒度MoE模型推理优化分析,探索专家跳过和专家剪枝的效率与性能权衡

Faster MoE LLM Inference for Extremely Large Models

一、论文概述

项目内容
标题Faster MoE LLM Inference for Extremely Large Models
作者Haoqi Yang, Luohe Shi, Qiwei Li, Zuchao Li, Ping Wang, Bo Du, Mengjia Shen, Hai Zhao
机构未明确标注
论文arXiv:2505.03531
发布2025-05-06
领域计算与语言 (cs.CL)

二、核心思想

问题定义

稀疏混合专家(SMoE)大语言模型正在成为超大规模模型的主流方法。然而,现有优化工作主要集中在粗粒度MoE架构上。随着DeepSeek系列模型的出现,细粒度MoE模型(6-8个活跃专家,64-256个总专家)日益流行,但相关研究有限。

核心发现

关键问题:

  1. 细粒度MoE在不同服务负载下的效率动态如何?
  2. 减少活跃专家数量(nan_a)对效率和性能的影响?
  3. 减少总专家数量(nen_e)对效率和性能的影响?

主要发现:

  1. MoE比FFN更难高效执行:尽管计算需求相同,但调度开销更大,批处理效果更弱
  2. 专家跳过可提升吞吐量:在低并发和高并发场景下效果显著
  3. 专家剪枝效果有限:减少总专家数量带来的效率增益有限,但性能下降严重
  4. 最佳方法:可在无性能损失的情况下提升至少**10%**吞吐量

解决方案概述

本文探索了两种优化策略:

  1. 推理时专家跳过(Inference Time Expert Skipping):

    • 减少每个token激活的专家数量 nan_a
    • 在低并发和高并发场景下效果显著
  2. 预推理专家剪枝(Pre-Inference Expert Pruning):

    • 在推理开始前移除部分专家,减少总专家数量 nen_e
    • 可提高计算强度,但性能损失较大

三、技术架构

FFN与MoE对比

FFN与MoE对比

关键区别:

组件FFN粗粒度MoE细粒度MoE
参数利用率100%稀疏激活更稀疏激活
批处理效果强弱更弱
调度开销无中等更高
计算强度高中等较低

效率分析

模拟实验结果

关键观察:

  1. 算术强度(Arithmetic Intensity):

    • 随序列长度L增加,算术强度先升后降
    • 在L≈150时达到峰值效率
  2. FFN每token延迟:

    • 小batch时增加token几乎不增加延迟
    • 参数加载成本被多个token分摊
  3. MoE每token延迟:

    • 延迟更高,达到峰值效率更慢
    • 大模型更容易达到最大效率(AI上限更高)

MoE效率问题根源:

  • 稀疏激活减少了计算需求,但需要加载更多专家参数
  • token在batch内很少复用相同专家
  • 产生额外的内存访问开销

专家并行优势

MoE vs FFN的通信需求:

并行方式FFN通信量MoE通信量
张量并行(TP)2(nd−1)Ld2(n_d-1)Ld更低
专家并行(EP)不适用显著降低

关键洞察:MoE虽然批处理效率较低,但在多设备部署时通信开销显著降低。

推理时专家跳过

专家跳过吞吐量

效率分析:

  1. 低并发场景:

    • 系统处于内存I/O-bound状态
    • 减少 nan_a 立即降低参数加载需求
    • 加速比可达50%(na=2n_a=2时)
  2. 中等并发场景:

    • 系统仍为内存I/O-bound
    • 但已有足够token同时处理
    • 减少 nan_a 对总专家选择数影响有限
    • 加速效果有限
  3. 高并发场景:

    • 系统转为compute-bound
    • 减少 nan_a 降低计算需求
    • 吞吐量增益与计算减少比更接近

理论计算减少上限:da/(ds+da)=45%d_a/(d_s+d_a) = 45\%(不考虑MLA层)

层间专家分配策略

四元组定义:(b,h,e,p)(b, h, e, p)

  • bb:第一层选择的专家数
  • hh:第 pp 层选择的专家数
  • ee:最后一层选择的专家数
  • pp:特殊层索引

目标:在固定总激活专家数下,找到最大化模型性能的层间分配策略。

专家跳过性能

预推理专家剪枝

专家剪枝结果

效率分析:

  • 减少专家数量可提高计算强度
  • 在低吞吐量时加速比显著(最高2.3×)
  • 但加速效果在专家数最小时减弱

性能对比(Table 2):

方法nen_eARC-CARC-EBoolQOBQARTEWinoGrande平均
Baseline6452.980.683.135.873.371.466.0
Random1620.827.260.814.850.550.537.4
Random3219.231.159.415.250.551.237.7
Random4843.775.081.231.265.767.560.7
Soft Count1628.757.362.222.455.660.947.8
Soft Count3239.771.276.131.458.570.257.8
Soft Count4846.876.380.033.876.572.164.2

关键发现:

  1. Soft Count方法 consistently优于其他方法
  2. 减少25%专家时,最佳方法也有一定性能下降
  3. 减少50%专家时,最佳方法性能下降15%
  4. 仅保留25%专家时,随机选择完全失效
  5. 结构化移除(偶数索引/后半部分)优于随机选择,表明存在关键专家

四、核心创新

创新点说明理论/实验依据
细粒度MoE效率分析揭示MoE比FFN更难高效执行的原因算术强度和延迟分析
专家跳过策略在不同并发场景下优化活跃专家数低并发50%加速,高并发与计算减少比接近
层间专家分配四元组(b,h,e,p)(b,h,e,p)定义层间策略结构搜索实验
专家剪枝分析评估减少总专家数的影响Soft Count方法最优,但性能损失大
无损优化最佳方法可在无性能损失下提升10%吞吐量DeepSeek-V3实验验证

五、实验结果

实验设置

模型:

  • DeepSeek-V2-Lite:细粒度MoE模型
  • DeepSeek-V3:细粒度MoE模型

关键参数:

  • nen_e:总专家数(64-256)
  • nan_a:活跃专家数(6-8)
  • dd:隐藏大小
  • ded_e:专家中间大小
  • dsd_s:共享专家中间大小

硬件:NVIDIA GPU(详见Appendix)

测试配置:

  • 输入:1024 tokens(随机采样)
  • 输出:额外生成tokens
  • 并发:不同并发级别

专家跳过效率

DeepSeek-V2-Lite和DeepSeek-V3结果:

并发级别na=2n_a=2加速比说明
低并发50%内存I/O-bound,减少参数加载
中等并发有限内存I/O-bound,但token已充分并行
高并发显著compute-bound,降低计算需求

关键发现:

  • 减少 nan_a 不影响达到峰值吞吐量所需的并发数
  • 加速比曲线呈现复杂模式
  • 低并发和高并发场景效果显著,中等并发效果有限

专家剪枝效率

吞吐量提升:

  • 低吞吐量时:最高**2.3×**加速
  • 高吞吐量时:加速效果减弱
  • 原因:减少专家数提高计算强度

最佳方法性能

DeepSeek-V3结果:

  • 可在无性能损失的情况下提升至少**10%**吞吐量
  • 通过适当的跳过策略,性能退化可进一步缓解

六、相关工作

方法特点本文优势
粗粒度MoE优化仅适用于2专家激活适配细粒度MoE(6-8专家)
Mixtral专家剪枝基于信息度量发现结构化移除优于随机
张量并行高通信开销MoE的专家并行通信更低
批处理优化通用方法揭示MoE批处理效果更弱

七、总结

核心贡献

  1. 细粒度MoE效率分析:揭示MoE比FFN更难高效执行的原因
  2. 专家跳过策略:在不同并发场景下优化活跃专家数,低并发50%加速
  3. 层间专家分配:四元组定义层间策略,最大化性能
  4. 专家剪枝分析:Soft Count方法最优,但性能损失大
  5. 无损优化:最佳方法可在无性能损失下提升10%吞吐量

技术影响

  • 为细粒度MoE模型推理优化提供了系统性分析
  • 揭示了MoE效率优化的关键瓶颈(批处理效果弱、调度开销高)
  • 为DeepSeek系列模型的部署提供了实用指导
  • 指出了未来研究方向:更高效的推理系统设计

局限性

  • 主要关注吞吐量,未深入探讨延迟和SLO
  • 专家剪枝的性能损失仍然较大
  • 未探索与其他优化技术(如量化、蒸馏)的结合
  • 结构化移除的发现需要进一步理论解释

八、关键图片索引

图片说明文件名
Figure 1FFN与MoE对比figure1-ffn-moe-comparison.png
Figure 2模拟实验结果figure2-simulation.png
Figure 3专家跳过吞吐量figure3-expert-skipping-throughput.png
Figure 4专家跳过性能figure4-expert-skipping-performance.png
Figure 5专家剪枝结果figure5-expert-pruning.png

九、参考资源