Back to blog

A Survey on Mixture of Experts in Large Language Models

MoE 在大语言模型中的全面综述,涵盖门控函数、专家网络、训练推理方案、系统设计和应用

A Survey on Mixture of Experts in Large Language Models

一、论文概述

项目内容
标题A Survey on Mixture of Experts in Large Language Models
作者Weilin Cai*, Juyong Jiang*, Fan Wang*, Jing Tang†, Sunghun Kim†, Jiayi Huang†
机构The Hong Kong University of Science and Technology (Guangzhou)
论文arXiv:2407.06204
代码GitHub
发布2024-06-26 (v1), 2025-04-09 (v3)
期刊IEEE Transactions on Knowledge and Data Engineering (TKDE) 2025

二、核心思想

问题定义

大语言模型(LLM)的性能与模型参数量密切相关,但全参数计算带来了巨大的计算开销。混合专家(Mixture of Experts, MoE)通过条件计算(Conditional Computation)实现以最小的计算增量大幅扩展模型容量:

  • Dense MoE: 激活所有专家,计算开销与参数量线性增长
  • Sparse MoE: 仅激活 top-k 专家,计算开销保持可控

解决方案概述

本文提出三层分类体系(Taxonomy):

  1. 算法设计: 门控函数、专家网络、超参数、训练推理方案
  2. 系统设计: 计算优化、通信优化、存储优化
  3. 应用领域: NLP、CV、推荐系统、多模态

三、技术架构

整体框架图

MoE 模型时间线

MoE 层基础结构

MoE 层结构

Dense MoE 公式:

FdenseMoE(x;Θ,{Wi}i=1N)=∑i=1NG(x;Θ)ifi(x;Wi)\mathcal{F}_{\text{dense}}^{\text{MoE}}(\mathbf{x}; \mathbf{\Theta}, \{\mathbf{W}_i\}_{i=1}^N) = \sum_{i=1}^{N} \mathcal{G}(\mathbf{x}; \mathbf{\Theta})_i f_i(\mathbf{x}; \mathbf{W}_i)

Sparse MoE 公式:

G(x;Θ)i=softmax(TopK(g(x;Θ)+Rnoise,k))i\mathcal{G}(\mathbf{x}; \mathbf{\Theta})_i = \text{softmax}(\text{TopK}(g(\mathbf{x}; \mathbf{\Theta}) + \mathcal{R}_{\text{noise}}, k))_i

负载均衡损失:

Lload-balancing=N∑i=1NDiPi\mathcal{L}_{\text{load-balancing}} = N \sum_{i=1}^{N} \mathcal{D}_i \mathcal{P}_i

其中 Di\mathcal{D}_i 是分配给专家 ii 的 token 比例,Pi\mathcal{P}_i 是门控概率分配给专家 ii 的比例。

门控函数分类

门控函数

类型代表方法特点
Token-Choice (Top-1)Switch Transformer每个 token 选择 1 个专家
Token-Choice (Top-k)GShard, Mixtral每个 token 选择 k 个专家
BASE LayerLewis et al.线性分配问题,保证专家均衡
Expert-ChoiceZhou et al.专家选择 token,天然均衡
Attention RouterYuan 2.0使用注意力机制作为路由器
Soft MoEFedus et al.token/专家合并,完全可微

MoPE 在 Transformer 中的位置

MoPE 位置

位置说明代表工作
Attention (K/V)替换注意力中的 Key/Value 投影MoA, JetMoE
FFN替换前馈网络层GShard, Switch Transformer
Transformer Block注意力和 FFN 各自使用独立专家组DS-MoE
Layer-wise整个 Transformer 层作为专家Lory, MoV

训练与推理方案

训练推理方案

方案说明代表工作
Dense2Sparse从密集模型转换为稀疏模型Sparse Upcycling, MoEfication
Sparse2Dense从稀疏模型转换为密集模型OneS, MoE-Pruning
Expert Merging合并多个专家模型Branch-Train-MiX, FoE

并行策略

并行策略

策略说明代表系统
数据并行不同 GPU 处理不同数据DeepSpeed-MoE
专家并行不同 GPU 存储不同专家Tutel, FasterMoE
管道并行不同 GPU 处理不同层Megatron-LM
序列并行不同 GPU 处理序列不同部分SE-MoE

四、核心创新

创新点说明理论/实验依据
三层分类体系算法-系统-应用三维分类覆盖 100+ 篇文献
门控函数统一视角将稀疏/稠密/软门控统一分析对比不同门控的优劣
负载均衡损失对比系统对比 L_aux, L_importance, L_z, L_MITable I 汇总
MoPE 位置分类将专家参数高效微调分为 4 个层级图 6 展示
系统优化全景计算/通信/存储三维度系统优化覆盖 FastMoE 等 20+ 系统

五、代码实现分析

本论文为综述性质,不包含具体代码实现。但维护了一个 GitHub 仓库持续更新 MoE 相关资源:

GitHub 仓库结构:

  • 按年份组织的论文列表
  • 开源模型实现链接
  • 超参数配置汇总
  • 实验评估结果

六、实验结果

代表性 MoE 模型性能对比

模型活跃参数总参数专家数关键性能
Mixtral-8x7B13B46.7B8等效 Llama-2-70B
DeepSeekMoE 16B16B64B64等效 Llama-2-7B,计算减少 40%
Qwen1.5-MoE2.7B14.3B60等效 Mistral-7B
DeepSeek-V221B236B160MLA + DeepSeekMoE

门控函数效果对比

门控类型均衡性性能训练稳定性
Top-1 (Switch)中高高
Top-k (GShard)中高高
BASE Layer高中中
Expert-Choice高中中
Soft MoE高中高

辅助损失函数对比

损失函数公式系数代表工作
L_importance + L_loadCV(Importance)^2 + smooth load0.1, 0.1Shazeer et al., V-MoE
L_auxdot-product approximation0.01GShard, Switch-T, Mixtral
L_aux + L_zL_aux + log-sum-exp penalty0.01, 0.001ST-MoE, OpenMoE
L_MImutual information0.001Mod-Squad, DS-MoE

七、相关工作

综述对比

综述发布时间覆盖范围局限性
本Survey2024/2025算法+系统+应用-
Previous Survey 12012Dense MoE未覆盖 Sparse MoE
Previous Survey 22022基础 MoE未覆盖 LLM 时代进展

关键里程碑模型

年份模型关键创新
2017GShard首个大规模 MoE,提出 L_aux
2021Switch TransformerTop-1 gating,简化 MoE
2023Mixtral-8x7B开源 MoE,等效 70B 性能
2024DeepSeek-V2MLA + DeepSeekMoE,236B 总参数
2024DBRX细粒度专家,16 个专家

八、总结

核心贡献

  1. 全面分类体系: 提出算法-系统-应用三层分类,覆盖 MoE 在 LLM 中的全貌
  2. 门控函数统一分析: 将稀疏/稠密/软门控统一到一个框架下对比
  3. 系统优化全景: 首次系统性综述 MoE 的计算/通信/存储优化
  4. 持续更新仓库: 建立 GitHub 仓库跟踪 MoE 最新进展

技术影响

  • MoE 已成为 LLM 扩展的主流范式: Mixtral、DeepSeek-V2、DBRX 等模型证明 MoE 可以用更少计算达到更大模型性能
  • 门控函数趋于成熟: GShard 的 L_aux 仍是工业界主流选择
  • 系统优化是关键瓶颈: 专家并行的通信开销是主要挑战
  • MoPE 为参数高效微调提供新范式: 将 MoE 思想应用于 PEFT

局限性

  1. 时间限制: 综述基于 2024 年中工作,可能不包含最新进展
  2. 评估不统一: 各 MoE 模型的评估基准和指标不一致
  3. 系统实验有限: 缺乏统一平台下的系统性能对比
  4. 应用深度不足: 对 CV、推荐系统等领域的 MoE 应用分析较浅

九、参考资源