Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study
边缘/MoE 推理实证:OLMoE-1B-7B 在 Jetson Orin Nano 上比同 active 参数量 Dense 模型慢 31%,能耗高 2.1 倍;边缘带宽受限硬件上推理成本跟随总参数而非激活参数
2 posts tagged with "MoE"
边缘/MoE 推理实证:OLMoE-1B-7B 在 Jetson Orin Nano 上比同 active 参数量 Dense 模型慢 31%,能耗高 2.1 倍;边缘带宽受限硬件上推理成本跟随总参数而非激活参数
2.8T 参数原生多模态 MoE、104B 激活参数、1M token 上下文、Kimi Delta Attention + Attention Residuals + Stable LatentMoE 的开源前沿模型