Back to blog

FloE: On-the-Fly MoE Inference on Memory-constrained GPU

面向内存受限GPU的即时MoE推理系统,通过混合压缩和稀疏预测实现48.7×加速

FloE: On-the-Fly MoE Inference on Memory-constrained GPU

一、论文概述

项目内容
标题FloE: On-the-Fly MoE Inference on Memory-constrained GPU
作者Yuxin Zhou, Zheng Li, Jun Zhang, Jue Wang, Yiping Wang, Zhongle Xie, Ke Chen, Lidan Shou
机构Zhejiang University, Ant Group
论文arXiv:2505.05950
代码-
发布2025-05-09
领域机器学习 (cs.LG), 人工智能 (cs.AI)
会议ICML 2025

二、核心思想

问题定义

MoE 模型(如 DeepSeek-R1、GPT-4、Mixtral)通过稀疏激活专家来降低推理成本,但未激活的专家占用大量 GPU 内存:

组件内存占用
Mixtral-8x7B FP16 总计94GB
激活参数 (30%)27.3GB
未激活专家66.8GB

Offloading 技术将专家参数卸载到 CPU 内存,但 PCIe 带宽瓶颈严重制约性能:

带宽速度
DRAM→VRAM (PCIe 4.0)32GB/s
GPU 内存→片上计算300GB/s

关键问题:一个 Mixtral 专家 300MB+,传输需要 15ms,但计算仅需 5ms。

解决方案概述

FloE 提出即时 (on-the-fly) MoE 推理系统,核心洞察:

稀疏激活的专家内部存在大量未被利用的冗余

三大技术创新:

  1. 混合压缩:对不同投影矩阵采用不同压缩策略(稀疏 vs 量化)
  2. 双稀疏预测器:inter-expert 预测 + intra-expert 预测
  3. 系统协同优化:高效稀疏 GEMV 内核 + 紧凑异步传输

核心结果:

  • 推理加速 48.7×(vs DeepSpeed-MII)
  • 参数压缩 9.3×
  • 内存占用减少 8.5×
  • 仅需 11GB VRAM 即可部署
  • 性能下降仅 4.4% ~ 7.6%

三、技术架构

系统对比

系统对比

方案特点问题
(a) Naive Offloading按需加载整个专家PCIe 带宽瓶颈
(b) Advanced Offloading预取 + 缓存仍需传输大量数据
(c) FloE (On-the-Fly)压缩 + 预测 + 重叠传输量大幅减少

MoE 专家前向计算

SwiGLU-based MoE 每个专家包含三个矩阵:

  • W^gate (gate projection)
  • W^down (down projection)
  • W^up (up projection)

前向公式: aE(x):=(SiLU(xWgate)⊙(xWup))Wdowna_E(x) := (\text{SiLU}(xW^{gate}) \odot (xW^{up})) W^{down}

混合压缩策略

激活分布

关键观察:

  • 观察 1:专家内部保持高度稀疏性,激活值集中在零附近
  • 观察 2:up projection 对超低比特量化敏感度最低

混合压缩方案:

投影矩阵压缩方法原因
Gate projection激活稀疏化 S(·)敏感度中等
Down projection激活稀疏化 S(·)敏感度最高
Up projectionINT2 量化 Q(·)敏感度最低

压缩后专家: Eijcompressed={WijS(gate),WijS(down),WijQ(up)}E^{compressed}_{ij} = \{W^{S(gate)}_{ij}, W^{S(down)}_{ij}, W^{Q(up)}_{ij}\}

敏感度分析

敏感度分析

稀疏化敏感度:

投影0%50%70%80%90%
Gate0.72470.72280.70350.66400.5897
Up0.71990.71480.69710.6646-
Down0.72330.72100.71940.7054-

量化敏感度:

  • INT8/INT4:影响极小
  • INT2:down 最敏感,up 最不敏感
  • INT1:up 保持 gate 的 46%、down 的 27% 性能

双稀疏预测器

预测器性能

核心观察 3:连续 MoE 层的隐藏状态余弦相似度 > 0.95

Inter-expert Predictor(专家间预测)

特性说明
类型学习型 MLP
输入上一层隐藏状态 + 专家选择历史轨迹
参数量浅层 32K,深层 2M
精度0.88

Intra-expert Predictor(专家内预测)

特性说明
类型无参数、基于复用
方法隐藏状态 × 复用的 up projection 矩阵
参数量0(无需额外内存)
召回率0.95

对比:PowerInfer/DEJAVU 预测器需要 9GB,SparseInfer 需要 2.19GB

系统协同优化

异步传输

高效稀疏 GEMV 内核

Algorithm 1: Efficient Sparse Kernel
Input: hidden states x, threshold t_ij, E_ij = {W^gate_ij, W^down_T_ij, W^up_ij}

1: v ← x W^up_ij
2: mask ← (|v| > t_ij)
3: x' ← SiLU(x W^gate_ij[mask]) ⊙ v[mask]
4: output ← x' W^down_T_ij

优化:

  • 转置 W^down 并使用列主序存储
  • 基于阈值选择性加载列
  • 融合 SiLU 激活和逐元素乘法

加速:最高 2×

紧凑异步传输

  • DRAM 中紧凑权重布局,减少访问延迟
  • 多线程打包激活专家
  • SIMD 异步数据传输,隐藏延迟于计算中

加速:比朴素方法快 12.6×

四、核心创新

创新点说明理论/实验依据
混合压缩Gate/Down 用稀疏,Up 用 INT2 量化比统一压缩性能好 9.8%
Inter-expert Predictor学习型 MLP 预测下一层专家精度 0.88
Intra-expert Predictor无参数复用预测召回率 0.95,零内存开销
稀疏 GEMV 内核Triton-based 高效实现最高 2× 加速
紧凑异步传输多线程 + SIMD 异步12.6× 传输加速

五、实验结果

实验设置

硬件:

  • GPU:GeForce RTX 3090 (24GB VRAM)
  • CPU:64-core @ 2.3GHz
  • DRAM:256GB
  • 互联:PCIe 4.0

模型:Mixtral-8x7B

基线:DeepSpeed-MII, Mistral-Offloading, HQQ, CATS, Chess

端到端性能

端到端加速

指标FloE
vs DeepSpeed-MII48.7×
参数压缩9.3×
内存减少8.5×
最低 VRAM11GB
性能下降4.4% ~ 7.6%

单专家执行延迟

GPU0%50%70%90%90% 加速
H1000.169ms0.134ms0.114ms0.103ms1.64×
A1000.253ms0.195ms0.176ms0.155ms1.63×
A60000.524ms0.365ms0.305ms0.263ms1.99×
RTX-30900.542ms0.379ms0.316ms0.283ms1.92×

传输效率

传输延迟

  • 紧凑异步传输比朴素方法快 12.6×
  • 接近 PCIe 4.0 实际峰值带宽

DRAM 使用影响

DRAM使用

FloE 在不同 DRAM 使用量下均保持显著优势。

下游任务性能

方法MMLU@5BoolQSciQArc-CArc-E平均
Mixtral-8x7B (baseline)0.6950.8530.9680.5670.8430.720
HQQ int30.6080.8090.9550.4810.8000.665
CATS-80%0.6170.7920.9030.5150.7820.657
Chess-80%0.6120.8020.9120.4980.7810.657
FloE-80%0.6050.8100.9510.5090.8030.676
HQQ int20.2340.4850.3310.2120.2790.311
CATS-90%0.3770.7040.8260.4420.7090.559
Chess-90%0.4240.7270.8390.4100.6940.568
FloE-90%0.5310.8350.9520.4580.7620.644

关键发现:

  • 90% 稀疏度下,FloE 比其他方法高 9.8%
  • 统一 INT2 量化 (HQQ) 性能灾难性下降 (0.311)
  • FloE 的混合方法显著优于统一压缩

六、消融实验

压缩策略消融

压缩消融

策略80% 平均性能
FloE-W^up (仅稀疏 up)0.693
FloE (混合压缩)0.676
CATS0.657
Chess0.657

预测器消融

预测器消融

  • Inter-expert predictor 精度 0.88
  • Intra-expert predictor 召回率 0.95
  • 余弦相似度 > 0.95(除第 0 层)

传输消融

传输消融

紧凑异步传输实现 12.6× 加速。

调度消融

调度消融

调度策略对整体性能的影响。

七、相关工作

方法特点FloE 优势
DeepSpeed-MIIFP16 offloading48.7× 加速
Mistral-Offloading层级缓存混合压缩 + 预测
HQQ统一量化差异化压缩策略
CATS上下文稀疏双预测器 + 量化
Chess稀疏方法更高性能保持
MoE-LightningCPU-GPU-I/O pipeline单 GPU 更简单高效
MoE-GenModule-based batching在线推理更适用

八、总结

核心贡献

  1. 混合压缩方案:根据投影矩阵敏感度差异,对 gate/down 用稀疏化,对 up 用 INT2 量化
  2. 双稀疏预测器:
    • Inter-expert:学习型 MLP,精度 0.88
    • Intra-expert:无参数复用,召回率 0.95
  3. 系统协同优化:
    • 高效稀疏 GEMV 内核(2× 加速)
    • 紧凑异步传输(12.6× 加速)
  4. 实践价值:
    • 仅需 11GB VRAM 即可运行 Mixtral-8x7B
    • 48.7× 推理加速
    • 性能下降仅 4.4% ~ 7.6%

技术影响

  • 使大型 MoE 模型在消费级 GPU 上变得可用
  • 为 MoE 推理的压缩策略提供了新思路
  • 混合压缩 + 预测的范式可推广到其他模型

局限性

  • 主要针对 decode 阶段,prefill 优化较少
  • 预测器需要离线训练
  • 极端稀疏度 (95%+) 下性能下降可能加剧

九、关键图片索引

图片说明文件名
Figure 1系统对比图system-comparison.png
Figure 2激活分布activation-distributions.png
Figure 3敏感度分析sensitivity-analysis.png
Figure 4预测器性能predictor-performance.png
Figure 5紧凑异步传输async-transfer.png
Figure 6端到端加速end-to-end-speedup.png
Figure 7传输延迟transfer-latency.png
Figure 8DRAM 使用影响dram-usage.png
Figure 9压缩消融ablation-compression.png
Figure 10预测器消融ablation-predictor.png
Figure 11传输消融ablation-transfer.png
Figure 12调度消融ablation-scheduling.png

十、参考资源