Back to blog

DMEP: Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE

动态模块级专家剪枝框架,实现LoRA-MoE微调参数减少43%且精度不降

一、论文概述

项目内容
标题Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning
作者Weihang Li, Jianchun Liu, Hongli Xu
机构-
论文arXiv:2604.26340
代码-
发布2026-04-29
领域机器学习 (cs.LG)

二、核心思想

问题定义

LoRA-MoE 结合了 LoRA 的低训练成本和 MoE 的增强适应能力,是参数高效微调 (PEFT) 的有效范式。然而,现有 LoRA-MoE 框架存在两个关键问题:

问题 1:固定均匀专家分配

  • 所有 Transformer 模块(如 attention query/key 投影和 MLP 门控网络)使用相同数量的专家
  • 忽略了不同模块的功能角色和容量需求差异
  • 导致局部过度配置、冗余参数和不必要的优化器状态开销

问题 2:强制负载均衡

  • 现有方法在整个训练过程中强制专家负载均衡
  • 早期阶段有益,但一旦路由模式稳定后变得限制性
  • 限制了专家对下游任务的专业化

专家利用率的层内异质性

专家利用率异质性

实验证明不同模块的专家利用率差异显著:

  • 浅层模块倾向于集中路由行为(仅少数专家频繁激活)
  • 深层模块受益于更广泛的专家参与

模块级热力图

解决方案概述

DMEP (Dynamic Module-wise Expert Pruning) 提出三阶段框架:

  1. Phase I: 负载感知密集初始化 - 在线追踪路由频率,辅助负载均衡损失防止早期路由崩溃
  2. Phase II: 细粒度模块级剪枝 - 基于利用率分数,物理移除低效专家及其优化器状态
  3. Phase III: 松弛专业化 - 恢复微调,禁用负载均衡损失,允许专家专业化

核心结果:

  • 可训练参数减少 35%-43%
  • 训练吞吐量提升约 10%
  • 保持或超越下游推理精度

三、技术架构

DMEP 框架

DMEP框架

LoRA-MoE 基础

标准 LoRA 前向传播 (Eq. 1): h=W0x+αrBAx\mathbf{h} = \mathbf{W}_{0}\mathbf{x} + \frac{\alpha}{r}\mathbf{B}\mathbf{A}\mathbf{x}

其中 W0\mathbf{W}_{0} 是冻结的预训练权重,A∈Rr×n\mathbf{A} \in \mathbb{R}^{r \times n},B∈Rm×r\mathbf{B} \in \mathbb{R}^{m \times r},r≪min⁡(m,n)r \ll \min(m,n)

LoRA-MoE 前向传播 (Eq. 2): o=W0x+∑i=1Ngi(x)BiAix\mathbf{o} = \mathbf{W}_{0}\mathbf{x} + \sum_{i=1}^{N} g_{i}(\mathbf{x}) \mathbf{B}_{i}\mathbf{A}_{i}\mathbf{x}

其中 gi(x)g_{i}(\mathbf{x}) 是路由概率,Top-k 门控激活最高分专家

总损失 (Eq. 3): Ltotal=Ltask+λLaux\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{task}} + \lambda \mathcal{L}_{\text{aux}}

路由动力学分析

路由动力学

关键观察:

  • 归一化路由熵 HmH_m 在训练早期快速收敛
  • 约 1 个 epoch 后路由模式趋于稳定
  • 稳定后禁用负载均衡损失不会降低性能

三阶段详细流程

Phase I: 负载感知密集初始化

  • 模型以均匀密集初始化开始
  • 在线追踪器记录离散路由频率(开销可忽略)
  • 辅助负载均衡损失防止早期路由崩溃

Phase II: 细粒度模块级剪枝

利用率评分:基于路由频率计算每个专家的利用率分数

结构化物理剪枝:

  • 根据利用率分数移除低效专家
  • 同时移除对应的优化器状态
  • 产生异构架构(不同模块保留不同数量专家)

最小生存约束:Kmin⁡=2K_{\min} = 2,确保每个模块至少保留 2 个专家

Phase III: 松弛专业化

  • 完全禁用辅助路由正则化 (λ=0\lambda = 0)
  • 消除优化冲突
  • 允许剩余专家实现更尖锐的专业化

剪枝后架构

剪枝后架构

不同模块保留不同数量的专家,形成任务自适应的异构架构。

收敛对比

收敛对比

禁用负载均衡损失后,训练收敛更快且最终精度更高。

四、核心创新

创新点说明理论/实验依据
模块级异构剪枝不同模块保留不同数量专家利用率热力图显示显著异质性
在线路由追踪训练过程中动态追踪专家利用率开销可忽略,无需离线 profiling
结构化物理剪枝真正移除专家参数和优化器状态比伪稀疏(二值掩码)更有效
延迟禁用负载均衡路由稳定后禁用 Laux\mathcal{L}_{\text{aux}}路由熵分析证明合理性

五、实验结果

实验设置

模型:Qwen3-0.6B, Qwen3-8B

数据集:

  • ScienceQA:多模态科学问答(文本推理部分)
  • OpenBookQA:常识和基础科学知识问答
  • GSM8K:数学推理(直接答案预测)

超参数:

参数值
LoRA rankr=8
缩放因子α=16
适配模块q/k/v/o_proj, gate/up/down_proj (7个)
Top-kk=2
训练轮数5 epochs
学习率3×10⁻⁴ (cosine decay, 10% warmup)
有效 batch size128
最大序列长度256
热身轮数E_w=1
最小生存专家K_min=2

核心结果

可训练参数减少:35%-43%

训练吞吐量提升:约 10%

下游推理精度:保持或超越均匀 LoRA-MoE 基线

关键发现

  1. 模块级异质性显著:不同投影模块的专家利用率差异巨大
  2. 早期路由稳定:约 1 epoch 后路由模式趋于稳定
  3. 禁用负载均衡有益:路由稳定后禁用 Laux\mathcal{L}_{\text{aux}} 提升专业化
  4. 物理剪枝优于伪稀疏:真正移除参数比二值掩码更有效

六、相关工作

方法特点DMEP 优势
LoRAMoE标准 LoRA-MoE模块级异构分配
MixLoRA混合 LoRA 专家动态剪枝
MoELoRAMoE + LoRA物理移除冗余
MoLA层级专家数变化模块级(更细粒度)
MALoRA层级异构在线追踪(无需离线 profiling)
DA-MoE动态分配结构化物理剪枝(非伪稀疏)
LoRA-SMoE稀疏 MoE剪枝后禁用负载均衡
AdaLoRA动态 rank与 MoE 正交,可结合

七、总结

核心贡献

  1. DMEP 框架:三阶段动态模块级专家剪枝框架
  2. 模块级异构分配:首次在 LoRA-MoE 中实现模块级(而非层级)的异构专家分配
  3. 在线路由追踪:轻量级在线追踪机制,开销可忽略
  4. 结构化物理剪枝:真正移除冗余参数和优化器状态
  5. 延迟负载均衡禁用:基于路由稳定性分析,合理禁用 Laux\mathcal{L}_{\text{aux}}

技术影响

  • 为 LoRA-MoE 微调提供了新的效率优化范式
  • 模块级异构思想可推广到其他 MoE 架构
  • 在线追踪 + 物理剪枝的方法适用于资源受限场景

局限性

  • 主要验证在 Qwen3 系列模型上
  • 剪枝决策在训练中期固定,不支持后期动态调整
  • 未探索与其他 PEFT 方法(如 Adapter、Prefix Tuning)的结合

八、关键图片索引

图片说明文件名
Figure 1专家利用率层内异质性expert-utilization-heterogeneity.png
Figure 2模块级专家利用率热力图module-wise-heatmap.png
Figure 3路由动力学分析routing-dynamics.png
Figure 4收敛对比convergence-comparison.png
Figure 5DMEP 框架总览dmep-framework.png
Figure 6剪枝后架构post-pruning-architecture.png

九、参考资源