Back to blog

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax-M2系列:小型激活释放最大真实世界智能

一、论文概述

项目内容
标题The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence
作者MiniMax (100+位作者)
机构MiniMax
论文https://arxiv.org/abs/2605.26494
发布2026-05-26
页数35页,10张图,4个表

核心亮点

  • 229.9B总参数,9.8B激活参数的MoE语言模型
  • 设计原则:mini activations can unleash maximum real-world intelligence
  • 三大核心组件:agent驱动数据流水线、Forge RL系统、自我进化能力
  • M2.7版本在agentic coding、deep search、reasoning等benchmark上达到前沿水平

二、核心思想

问题定义

大语言模型正在从短对话迁移到长程agentic工作流:编写和发布代码、浏览网页、操作工具、产生结构化办公产出。这带来两个挑战:

  1. 效率瓶颈:agentic任务的超长上下文在训练和推理中引入巨大的效率和成本瓶颈
  2. 复杂任务:真实世界部署需要解决高风险复杂任务,如生产级软件工程和知识密集型办公自动化

解决方案概述

MiniMax-M2系列围绕单一设计原则构建:mini activations can unleash maximum real-world intelligence。旗舰模型M2是62层decoder-only Transformer,229.9B总参数,每token仅激活9.8B参数。

性能概览

Figure 1: MiniMax-M2.7与闭源前沿基线在agentic coding、agentic cowork和reasoning & knowledge benchmark上的性能对比。M2.7仅用约10B激活参数,与更大计算量的系统保持竞争力。

三、技术架构

3.1 整体架构

M2是基于MoE架构的大规模稀疏语言模型:

参数值
总参数229.9B
激活参数9.8B/token
层数62层 decoder-only Transformer
隐藏维度3,072
词汇表大小200,064
预训练token数29.2T
最大上下文长度192K
专家数量256 fine-grained experts
激活专家数8/token
注意力头数48 query heads, 8 KV heads (GQA)
位置编码RoPE

每个Transformer块由multi-head self-attention模块和MoE feed-forward层组成。注意力采用full multi-head attention(所有层),使用GQA。MoE层包含256个fine-grained experts,每token激活8个专家,使用sigmoid gating和可学习的expert-specific bias terms。

3.2 MoE设计选择

Fine-Grained Experts:采用更多更小的expert设计,增加路由组合多样性,减少设备间expert利用率方差。

Sigmoid Gating:使用sigmoid门控替代softmax,配合可学习的expert-specific bias terms,改善负载均衡,大幅减少对auxiliary losses的依赖。

消融实验(Table 1):

配置Baselinew/ MTPw/ Fine-Grained
激活参数2B2B2B
总参数17.8B17.8B17.8B
训练token500B500B500B
num_experts3232128
topk228

Fine-Grained Experts在MATH、MMLU、ARC-Challenge、KorBench、HumanEval上均优于baseline。

3.3 注意力机制

M2采用full multi-head attention(所有层),而非hybrid SWA(滑动窗口注意力)。消融实验(Table 2)表明full attention在pretraining评估中优于hybrid SWA。

3.4 Multi-Token Prediction (MTP)

MTP架构

Figure 2: M2中使用的Multi-Token Prediction (MTP)模块架构。

MTP模块在预训练时预测多个未来token,在推理时可扩展为多步speculative decoding的draft path,加速推理。消融实验(Table 1)显示MTP在各benchmark上均有提升。

3.5 预训练数据

  • 数据来源:网页文档、学术文献、书籍、编程代码、结构化问答内容
  • 数据分布:代码、数学和STEM内容显著上采样
  • 长上下文扩展:多阶段训练,从8K → 32K → 192K tokens,衰减阶段使用9.3T tokens

四、Post-Training数据收集

4.1 Agentic Coding

数据流水线

Figure 3: SWE和AppDev任务的agentic coding数据流水线。

三个子领域:

  • Software Engineering (SWE):真实数据驱动收集,从GitHub issues收集真实软件工程任务
  • Application Development (AppDev):专家驱动数据收集,由人类专家设计应用开发任务
  • Terminal-Gym:自动化任务合成和环境生成

4.2 Agentic Cowork

  • Deep Search和Open-Web Research:网页浏览和信息检索任务
  • Knowledge-Worker Office Tasks:知识工作者办公任务
  • Financial Analysis:金融分析和电子表格操作
  • Slide Generation:幻灯片生成和编辑

4.3 Reasoning-Intensive Tasks

推理密集型任务,包括数学、科学推理等。

4.4 General-Purpose Conversation and Writing

通用对话和写作任务。

4.5 Role-Play and Persona Coherence

角色扮演和人格一致性任务。

五、Supervised Fine-Tuning (SFT)

SFT阶段使用收集的高质量数据进行监督微调,覆盖agentic coding、cowork、reasoning等所有能力领域。

六、Reinforcement Learning (RL)

6.1 Forge RL系统

Forge RL系统

Figure 4: Forge RL系统概述。三个解耦模块——Agent Side、Training/Inference Side和中间件抽象层(Gateway Server, Data Pool)——通过标准化接口通信,允许agent和训练循环独立扩展。

核心设计原则:将LLM作为policy,模型生成过程之外的所有内容(上下文管理、内存访问、agent状态转换)视为环境。这种分离提供了清晰的抽象。

MDP建模:

M=(S,A,T,R,γ)M = (S, A, T, R, \gamma)

在每步tt,agent观察状态st∈Ss_t \in S(包含当前上下文窗口内容),生成动作ata_t(文本或tool-call token序列),环境返回下一个状态st+1s_{t+1}。

6.2 RL算法:CISPO

采用Clipped Importance Sampling Policy Optimization (CISPO):

LCISPO=−1G∑i=1G1∣oi∣∑t=1∣oi∣sg[min⁡(ρt,clip(ρt,0,1+ϵhighIS))]A^t\mathcal{L}_{\text{CISPO}} = -\frac{1}{G} \sum_{i=1}^{G} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \text{sg}\left[\min\left(\rho_t, \text{clip}(\rho_t, 0, 1+\epsilon_{\text{high}}^{\text{IS}})\right)\right] \hat{A}_t

其中ρt=πθ(at∣st)πθold(at∣st)\rho_t = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)}是重要性采样比率。

非对称裁剪:上界1+ϵhighIS1+\epsilon_{\text{high}}^{\text{IS}}防止策略更新过大,下界0允许积极降低不probable动作的权重。

6.3 奖励设计

复合奖励框架包含三个组件:

  • Outcome Reward:基于最终结果的奖励
  • Process Reward:密集的中间奖励,针对特定行为模式(语言混合惩罚、工具调用格式错误惩罚、结构化推理步骤奖励)
  • Credit Assignment:在span达192K tokens、数千中间动作的agent轨迹中进行信用分配

6.4 Windowed FIFO调度

Windowed FIFO调度

Figure 5: Windowed FIFO调度。训练调度器仅获取生成队列中大小为WW的滑动窗口内已完成的轨迹:窗口内完成顺序自由(缓解队头阻塞);跨窗口边界强制FIFO(保持分布一致性)。

6.5 Prefix Tree合并

Prefix Tree合并

Figure 6: Prefix tree合并。共享前缀的完成在训练batch中合并为树;共享前缀仅计算一次,计算分支到各个响应段。在loss计算前解构树,过程数学等价于独立样本训练,同时消除冗余前缀重计算。

6.6 白盒和黑盒Agent支持

Forge支持白盒(可访问模型权重)和黑盒(仅API)agent在同一训练循环中训练。

七、Agentic机制

7.1 交错思考 (Interleaved Thinking)

Plan-Act-Reflect循环

Figure 7: M2中交错思考的Plan-Act-Reflect循环。

交错chain-of-thought:模型在每个turntt交替产生推理token rtr_t和动作token ata_t:

Turn t:rt→at→ot\text{Turn } t: r_t \to a_t \to o_t

其中oto_t是执行动作ata_t后返回的观察(工具输出)。每个推理段rtr_t以完整历史为条件。

推理状态持久化:关键架构决策是将turn tt的完整模型输出(包括所有thinking blocks)追加到消息历史中,作为turn t+1t+1的上下文:

Ht+1=Ht⊕[assistant(rt,at)]⊕[tool(ot)]\mathcal{H}_{t+1} = \mathcal{H}_t \oplus [\text{assistant}(r_t, a_t)] \oplus [\text{tool}(o_t)]

Plan-Act-Reflect循环:在每个turn执行结构化认知循环:

  1. Plan:回顾先前推理和观察的累积状态,制定或调整策略
  2. Act:选择并执行基于计划的工具调用
  3. Reflect:评估观察是否符合预期,更新世界模型

7.2 自我进化 (Self-Evolution)

模型迭代系统

Figure 8: (A) 驱动M2.7自主执行的模型迭代系统。(B) RL团队使用的双循环工作流。

M2.7展示了自我进化的早期操作形式:模型自主诊断失败的训练运行,编辑自己的agent scaffold,并在代表性ML-engineering任务上运行多轮自我改进。

模型迭代系统原则:人类引导,模型构建。研究者配置目标、通过聊天引导agent、审查输出决定下一步。agent在”Agent Harness”中运行——工作空间完全由内部M2.7模型生成,零人类编写代码。

双循环工作流:M2.7进入自主执行阶段,分析运行日志、诊断指标异常。通过自动调试代码和调整配置,模型直接干预训练循环,吸收30%到50%的日常迭代工作量。

八、评估结果

8.1 能力演进

能力演进

Figure 9: MiniMax-M2系列在11个benchmark上的能力演进。每个面板按能力领域分组benchmark,每个benchmark三个bar对应M2、M2.5和M2.7。所有11个benchmark在三个checkpoint上持续改进。

8.2 主要结果 (Table 4)

类别BenchmarkM2.7M2.5Opus 4.6Sonnet 4.6GPT 5.4Gemini 3.1 Pro
Coding AgentSWE-bench Pro56.255.457.357.257.754.2
SWE-bench Multilingual76.574.177.875.970.5–
Multi-SWE-bench52.751.350.351.049.0–
NL2Repo39.826.643.743.346.835.9
Terminal-Bench 2.057.051.765.459.175.168.5
MLE Bench Lite66.651.575.772.771.266.6
App DevVIBE-Pro55.654.255.656.1–41.0
HyperTask67.659.475.774.1–50.9
SearchBrowseComp77.876.384.074.782.785.9
Wide Search75.270.379.475.877.9–
RISE64.350.268.558.863.3–
Office & ToolsGDPval-AA50.035.055.057.058.041.0
Toolathlon46.338.347.244.854.648.8
MM Claw62.757.675.464.273.661.8
MEWC v263.349.862.077.276.542.2
Finance Modeling Pro57.033.869.066.275.335.6
ReasoningAIME 202694.287.292.592.797.088.7
GPQA-Diamond89.885.289.687.592.094.1
SciCode47.043.051.946.856.658.9
IFBench76.072.053.156.673.977.1
AA-LCR72.065.070.770.774.072.7
HLE28.019.036.730.041.644.7
MMLU-Pro81.885.289.187.387.591.2

关键结果:

  • AIME 2026: 94.2(超越Opus 4.6的92.5和Sonnet 4.6的92.7)
  • GPQA-Diamond: 89.8(接近Opus 4.6的89.6)
  • IFBench: 76.0(超越所有闭源模型)
  • SWE-bench Pro: 56.2(接近前沿水平)
  • BrowseComp: 77.8(competitive with GPT 5.4的82.7)

8.3 自我进化案例:MLE Bench Lite

MLE Bench奖牌率

Figure 10: M2.7在MLE Bench Lite上迭代试验的奖牌率。

M2.7在MLE Bench Lite上达到66.6%的奖牌率,展示了自我进化能力的有效性。通过多轮迭代,模型能够自主调试和改进其在ML-engineering任务上的表现。

九、核心创新总结

创新点说明效果
Fine-Grained MoE256个fine-grained experts,sigmoid gating229.9B参数,仅9.8B激活
Forge RL系统agent-native RL,白盒+黑盒支持稳定的RL-time scaling
Windowed FIFO调度滑动窗口内自由顺序,跨窗口FIFO吸收轨迹长度方差
Prefix Tree合并共享前缀仅计算一次消除冗余计算
交错思考Plan-Act-Reflect循环多步推理能力提升
自我进化模型自主调试和改进训练30-50%日常迭代自动化
CISPO算法非对称裁剪重要性采样稳定策略优化

十、相关工作

模型总参数激活参数特点
MiniMax-M2.7229.9B9.8BMoE, Agent RL, Self-evolution
Claude Opus 4.6––闭源前沿
GPT 5.4––闭源前沿
Gemini 3.1 Pro––闭源前沿
DeepSeek V3671B37BMoE, 长上下文
Qwen3.5-397B397B–Dense, 多语言

十一、总结

核心贡献

  1. 高效MoE架构:229.9B总参数,仅9.8B激活,实现mini activations释放max intelligence
  2. Forge RL系统:首个支持白盒和黑盒agent的统一RL训练系统
  3. 交错思考机制:Plan-Act-Reflect循环,推理状态持久化
  4. 自我进化能力:M2.7自主调试训练运行,编辑自身scaffold
  5. 完整的agentic数据流水线:覆盖coding、cowork、reasoning等领域

技术影响

  • 效率:仅9.8B激活参数达到接近闭源前沿模型的性能
  • 可扩展性:Forge RL系统支持独立扩展agent和训练循环
  • 实用性:自我进化减少30-50%的人工迭代工作量
  • 开放性:详细披露架构设计、训练细节和评估结果

局限性

  1. 在部分benchmark上仍落后于最强闭源模型(如Terminal-Bench、MLE Bench)
  2. 自我进化能力仍处于早期阶段
  3. 训练需要大规模计算资源
  4. 部分benchmark数据可能包含在预训练语料中

十二、参考资源