Back to blog

Kimi K3: Open Frontier Intelligence

2.8T 参数原生多模态 MoE、104B 激活参数、1M token 上下文、Kimi Delta Attention + Attention Residuals + Stable LatentMoE 的开源前沿模型

Kimi K3: Open Frontier Intelligence

一、论文概述

项目内容
标题Kimi K3: Open Frontier Intelligence (Technical Report of Kimi K3)
作者Kimi Team (Moonshot AI,Tongtong Bai 等 400+ 位署名作者)
机构Moonshot AI(月之暗面)
论文arXiv:2607.24653 · PDF
代码MoonshotAI/MoonEP · FlashKDA · MiniTriton · nano-kpu · AgentENV
模型页Kimi K3 Blog
发布2026-07-27 (arXiv v1)
类别cs.CL (Computation and Language)
许可开源权重(Open Frontier Model)

二、核心思想

Kimi K3 是一款 2.8 万亿总参数、104B 激活参数、原生多模态、100 万 token 上下文 的开源 Mixture-of-Experts (MoE) 模型。它是继 Kimi K2 (1.04T) 和 Kimi K2.5 后 Moonshot AI 发布的旗舰模型,也是世界首个开源的 3T 类别模型。

论文将 LLM 发展的两个扩展轴同时推向前沿:

  • 训练时扩展 (第一轴):把预训练底座扩展到 3T 类参数规模;
  • 测试时扩展 (第二轴):跨 general / agentic / coding 三大领域,在多个 reasoning-effort 层级上进行强化学习,实现 1M 上下文的长视野交互。

问题定义

开源模型生态在推理与 agentic RL 层面推进迅速,但基础模型规模长期停留在 1T 级别 [MiMo-V2.5-Pro / Inkling 等]。当越来越复杂的推理与 RL 方法作用于相近规模的底座时,开源进度会趋同,而与最强专有模型 (Claude Fable 5、GPT-5.6 Sol) 的差距会持续拉大。作者试图通过同时在两个轴上扩展填补这一鸿沟。

具体挑战:

  1. 在 3T 类规模下如何保证训练稳定性与效率;
  2. 如何在深度、序列长度、通道三个维度同时高效扩展信息流;
  3. 如何设计能扩展到 1M 上下文和上千步工具调用的 agentic RL;
  4. 如何在架构复杂性 + 极稀疏 MoE + 百万 token trajectory 下同时兼顾训练与推理成本。

解决方案概述

  • 架构层:Hybrid Attention(3 层 KDA + 1 层 Gated MLA)、Attention Residuals(AttnRes,跨深度选择性检索)、Stable LatentMoE(896 routed × 16 active × 2 shared experts,稀疏度 56)、原生多模态 MoonViT-V2、Per-Head Muon 优化器。
  • 训练层:Cosine LR、Weight Clipping、QAT (MXFP4 权重 / MXFP8 激活)、四阶段渐进式上下文扩展 (8K → 64K → 256K → 1M);相比 Kimi K2 实现 ~2.5× 的整体 scaling efficiency 提升。
  • 后训练层:SFT → 三领域 × 三 effort 级 (9 位专家) RL → Multi-Teacher On-Policy Distillation (MOPD);引入 Agentic Generative Reward Model 与 Reasoning-Effort RL。
  • 基础设施:FlashKDA + KDA Context Parallelism、MoonEP(完美负载均衡 EP)、External KV Cache Pool + AgentENV microVM sandbox、KDA-aware Prefix Cache、Speculative Decoding + EAGLE-3 draft。

三、技术架构

整体框架

Kimi K3 架构总览

Kimi K3 沿三个互补维度扩展信息流:序列 (Hybrid Attention) × 深度 (AttnRes) × 宽度 (Stable LatentMoE)。每个 Block 由 3 层 KDA + 1 层 Gated MLA 组成,每层 attention 后接 Stable LatentMoE。骨干最后额外追加 1 层 Gated MLA,确保最终层始终执行全局注意力。原生视觉通过 MoonViT-V2 + 轻量 MLP projector 注入共享 embedding。

Input (text + image + video)
        │
        ▼
   MoonViT-V2 (27 layers, 401M params) + MLP Projector    ─────┐
        │                                                       │
        ▼                                                       │
   Embedding Layer                                              │
        │                                                       │
        ▼                                                       │
   ┌────────────── Block (× N) ──────────────┐   AttnRes (Block-level,
   │ 3× (KDA + Stable LatentMoE)             │◄──── N=8 blocks with
   │ 1× (Gated MLA + Stable LatentMoE)       │      12 layers each)
   └─────────────────────────────────────────┘
        │
        ▼
   Final Gated MLA (guarantee global attention)
        │
        ▼
   MTP Layer (1 layer, EAGLE-3 style draft during inference)
        │
        ▼
   LM Head

Block 组成比例:61 MLA (K2) → 69 KDA + 24 MLA (K3),即 93 层中 3:1 交替,附加 1 层最终 MLA。

核心公式

1. Kimi Delta Attention (KDA) 递推

在 delta-rule 递推基础上引入通道级遗忘门 αt∈(0,1)dk\alpha_t \in (0,1)^{d_k} 与写强度 βt∈(0,1)\beta_t \in (0,1),隐状态 St∈Rdk×dvS_t \in \mathbb{R}^{d_k \times d_v}:

St=(I−βtktkt⊤)Diag⁡(αt)St−1+βtktvt⊤,o~t=St⊤qt(1)S_t = \left(I - \beta_t k_t k_t^{\top}\right)\operatorname{Diag}(\alpha_t) S_{t-1} + \beta_t k_t v_t^{\top},\quad \tilde{o}_t = S_t^{\top} q_t \tag{1}

Per-head 参数化(对每个 head hh):

qth,kth=L2Norm⁡ ⁣(Swish⁡ ⁣(ShortConv⁡(Wq/khxt)))∈Rdkvth=Swish⁡ ⁣(ShortConv⁡(Wvhxt))∈Rdvβth=Sigmoid⁡(Wβhxt)∈(0,1)zth=Wα↑Wα↓xt+bαh∈Rdk(2)\begin{aligned} q_t^h, k_t^h &= \operatorname{L2Norm}\!\left(\operatorname{Swish}\!\left(\operatorname{ShortConv}(W_{q/k}^h x_t)\right)\right) \in \mathbb{R}^{d_k} \\ v_t^h &= \operatorname{Swish}\!\left(\operatorname{ShortConv}(W_v^h x_t)\right) \in \mathbb{R}^{d_v} \\ \beta_t^h &= \operatorname{Sigmoid}(W_\beta^h x_t) \in (0,1) \\ z_t^h &= W_\alpha^{\uparrow} W_\alpha^{\downarrow} x_t + b_\alpha^h \in \mathbb{R}^{d_k} \end{aligned} \tag{2}

2. Chunkwise 并行形式

将序列分为大小 CC 的 chunk,在 chunk 内并行、chunk 间递推。定义累积衰减 γ[t]i→j:=∏r=ijα[t]r\gamma_{[t]}^{i \to j} := \prod_{r=i}^{j} \alpha_{[t]}^{r},γ[t]r:=γ[t]1→r\gamma_{[t]}^{r} := \gamma_{[t]}^{1 \to r}:

γ[t]i→j:=∏r=ijα[t]r(3)\gamma_{[t]}^{i\to j} := \prod_{r=i}^{j} \alpha_{[t]}^{r} \tag{3}

UT-transform 生成 U[t],W[t]U_{[t]}, W_{[t]},pseudo-value V~[t]:=U[t]−W[t]S[t]\tilde{V}_{[t]} := U_{[t]} - W_{[t]} S_{[t]},chunk 内全部输出并行计算:

A[t]=Tril⁡ ⁣[(Q[t]⊙Γ[t]1→C)(K[t]/Γ[t]1→C)⊤]O[t]=(Γ[t]1→C⊙Q[t])S[t]⏟inter-chunk+A[t]V~[t]⏟intra-chunk(4)\begin{aligned} A_{[t]} &= \operatorname{Tril}\!\left[(Q_{[t]} \odot \Gamma_{[t]}^{1\to C})(K_{[t]}/\Gamma_{[t]}^{1\to C})^{\top}\right] \\ O_{[t]} &= \underbrace{(\Gamma_{[t]}^{1\to C} \odot Q_{[t]}) S_{[t]}}_{\text{inter-chunk}} + \underbrace{A_{[t]} \tilde{V}_{[t]}}_{\text{intra-chunk}} \end{aligned} \tag{4}

3. Lower-bounded Log-Decay(Kimi K3 关键变化)

Kimi Linear 使用 gth=−eAhSoftplus⁡(zth)∈(−∞,0)dkg_t^h = -e^{A_h}\operatorname{Softplus}(z_t^h) \in (-\infty,0)^{d_k},可能溢出 BF16。Kimi K3 改用 scaled sigmoid,将 log-decay 有下界:

gth=gmin⁡Sigmoid⁡ ⁣(eAhzth)∈(gmin⁡,0)dk,αth=exp⁡(gth)∈(egmin⁡,1)dk,gmin⁡=−5(5)g_t^h = g_{\min} \operatorname{Sigmoid}\!\left(e^{A_h} z_t^h\right) \in (g_{\min}, 0)^{d_k},\quad \alpha_t^h = \exp(g_t^h) \in (e^{g_{\min}}, 1)^{d_k},\quad g_{\min} = -5 \tag{5}

保证 16-token tile 上 cumulative log-decay ∈(−80,0)\in (-80, 0),倒数 rescaling 上界 <e80<e^{80},落在 BF16 范围内;所有对角与非对角 tile 都可用 dense Tensor Core matmul,消除 position-pair 对角瓶颈。参见 Figure 3。

KDA 下界衰减参数化与对角 tile 计算

4. KDA Full-Rank Output Gate

将 Kimi Linear 的低秩输出门改为输入相关的全秩投影,先对 recurrent 输出做 head-wise RMSNorm,再门控:

yt=Wo[Sigmoid⁡(Wgxt)⊙RMSNorm⁡(o~t)](6)y_t = W_o \left[\operatorname{Sigmoid}(W_g x_t) \odot \operatorname{RMSNorm}(\tilde{o}_t)\right] \tag{6}

5. Gated MLA (NoPE) 输出门

所有 MLA 层采用 NoPE(无显式位置编码),全局内容交互,位置感由中间的 KDA 层提供。同样引入 full-rank channel-wise 门:

yt=Wo[Sigmoid⁡(Wgxt)⊙o~t](7)y_t = W_o \left[\operatorname{Sigmoid}(W_g x_t) \odot \tilde{o}_t\right] \tag{7}

6. Full Attention Residuals (AttnRes)

对第 ll 层设 pseudo-query ql=wl∈Rdq_l = w_l \in \mathbb{R}^{d},keys/values 取自 embedding 与所有前层输出:

ki=vi={h1i=0fi(hi)1≤i≤l−1(8)k_i = v_i = \begin{cases} h_1 & i = 0 \\ f_i(h_i) & 1 \le i \le l-1 \end{cases} \tag{8}

Softmax kernel ϕ(q,k)=exp⁡ ⁣(q⊤RMSNorm⁡(k))\phi(q,k) = \exp\!\left(q^{\top}\operatorname{RMSNorm}(k)\right),注意力权重与聚合:

αi→l=ϕ(ql,ki)∑j=0l−1ϕ(ql,kj),hl=∑i=0l−1αi→l⋅vi(9)\alpha_{i\to l} = \frac{\phi(q_l, k_i)}{\sum_{j=0}^{l-1}\phi(q_l, k_j)},\quad h_l = \sum_{i=0}^{l-1} \alpha_{i\to l}\cdot v_i \tag{9}

Full 形式代价为 O(L2d)\mathcal{O}(L^2 d) 算力 + O(Ld)\mathcal{O}(Ld) 存储,其中 L<100L < 100。

7. Block Attention Residuals

把 LL 层划为 NN 个 block,每块 S=L/NS = L/N 层。块内求和为 bn=∑j∈Bnfj(hj)b_n = \sum_{j \in B_n} f_j(h_j),块间做 full attention:

V={[b0,b1,…,bn−1]⊤i=1 (first layer of block n)[b0,b1,…,bn−1,bni−1]⊤i≥2(10)V = \begin{cases} [b_0, b_1, \dots, b_{n-1}]^{\top} & i = 1\ \text{(first layer of block } n\text{)} \\ [b_0, b_1, \dots, b_{n-1}, b_n^{i-1}]^{\top} & i \ge 2 \end{cases} \tag{10}

存储/通信开销由 O(Ld)\mathcal{O}(Ld) 降至 O(Nd)\mathcal{O}(Nd),Kimi K3 取 N=8N = 8、每块 12 层,加上 embedding 层共 9 个 block。

8. Stable LatentMoE 前向

设隐维 dd、latent 维 ℓ\ell(ℓ=d/2=3584\ell = d/2 = 3584),routed experts Eirouted:Rℓ→RℓE_i^{\text{routed}}: \mathbb{R}^{\ell} \to \mathbb{R}^{\ell},shared experts Ejshared:Rd→RdE_j^{\text{shared}}: \mathbb{R}^{d} \to \mathbb{R}^{d}:

u=∑i∈Tk(x)piEirouted(W↓x),y=∑j=1NsEjshared(x)+W↑RMSNorm⁡(u)(11)u = \sum_{i \in T_k(x)} p_i E_i^{\text{routed}}(W_{\downarrow} x),\quad y = \sum_{j=1}^{N_s} E_j^{\text{shared}}(x) + W_{\uparrow}\operatorname{RMSNorm}(u) \tag{11}

Kimi K3 固定 Ns=2N_s = 2,routed pool 896,k=16k = 16(稀疏度 56)。RMSNorm 位于聚合后、上投影前,降低对 expert 组合缩放的敏感度。

9. Sigmoid Tanh Unit GLU (SiTU-GLU)

SiTU-GLU⁡(x)=β1tanh⁡ ⁣(Wgxβ1)⊙Sigmoid⁡(Wgx)⊙β2tanh⁡ ⁣(Wuxβ2)(12)\operatorname{SiTU\text{-}GLU}(x) = \beta_1 \tanh\!\left(\frac{W_g x}{\beta_1}\right) \odot \operatorname{Sigmoid}(W_g x) \odot \beta_2 \tanh\!\left(\frac{W_u x}{\beta_2}\right) \tag{12}

Kimi K3 使用 β1=4,β2=25\beta_1 = 4, \beta_2 = 25,输出被界定为 ∣f(x)∣≤β1β2=100|f(x)| \le \beta_1 \beta_2 = 100,同时在原点附近近似 SwiGLU,参见 Figure 4。

GLU / SwiGLU / SiTU-GLU 分支对比

10. Quantile Balancing (QB) 路由

Router score si=Sigmoid⁡(Wrxi)s_i = \operatorname{Sigmoid}(W_r x_i),附加 expert bias bb,Top-k 选择用 biased score,pi 计算不含 bias:

Ti=arg⁡top⁡k(si+b),pi,j=si,j∑r∈Tisi,r, j∈Ti(13)T_i = \arg\operatorname{top}_k(s_i + b),\quad p_{i,j} = \frac{s_{i,j}}{\sum_{r\in T_i} s_{i,r}},\ j \in T_i \tag{13}

对 batch 每个 expert 的 bias 由 margin 分位数一步给出:

b^j(t+1)←−quantile⁡1−k/n ⁣(s:,j−α(t))b(t+1)←b^(t+1)−mean⁡ ⁣(b^(t+1))1(14)\begin{aligned} \hat{b}_j^{(t+1)} &\leftarrow -\operatorname{quantile}_{1-k/n}\!\left(s_{:,j} - \alpha^{(t)}\right) \\ b^{(t+1)} &\leftarrow \hat{b}^{(t+1)} - \operatorname{mean}\!\left(\hat{b}^{(t+1)}\right)\mathbf{1} \end{aligned} \tag{14}

其中 αi(t)\alpha_i^{(t)} 为 Top-(k+1) 路由取得的第 (k+1) 个 biased score。全局分位数使用直方图估计(每个 expert 数百 bin,all-reduce 累加),单次 batch 完成 update,next step 生效以保证因果性。

Quantile Balancing 示意 (m=8, n=4, k=1)

11. Multi-Teacher On-Policy Distillation (MOPD) 奖励

对领域 dd、reasoning effort e∈{low, high, max}e \in \{\text{low, high, max}\},从 9 个专家中选取 πteacher(d,e)\pi_{\text{teacher}}^{(d,e)}。给定 query xx 与 prefix y<ty_{<t},per-token OPD reward:

ropdd(yt∣e,x,y<t)=clip⁡ ⁣(sg⁡log⁡πteacher(d,e)(yt∣x,y<t)πθ(yt∣e,x,y<t), −Rmax⁡, Rmax⁡)(15)r_{\text{opd}}^{d}(y_t \mid e, x, y_{<t}) = \operatorname{clip}\!\left(\operatorname{sg}\log\frac{\pi_{\text{teacher}}^{(d,e)}(y_t\mid x, y_{<t})}{\pi_\theta(y_t\mid e, x, y_{<t})},\ -R_{\max},\ R_{\max}\right) \tag{15}

其中 sg 为 stop-gradient,Rmax⁡R_{\max} 裁剪防止极端 advantage 破坏训练稳定性。

12. Speculative Decoding: LK Loss(EAGLE-3 draft 训练目标)

推测采样接受率为 ∑xmin⁡(p(x),q(x))\sum_x \min(p(x), q(x))(pp target,qq draft)。直接最小化 KL 不保证最大化接受率,改为最大化接受率的负对数:

LLK=−log⁡∑x∈Vmin⁡(p(x),q(x))(16)\mathcal{L}_{\text{LK}} = -\log\sum_{x \in V} \min(p(x), q(x)) \tag{16}

Draft 输入为 target 模型第 1、4、最终 AttnRes block 的低/中/高层特征拼接,通过 bias-free 矩阵 WE3W_{E3} 投影(初始化为 [0 0 I][0\ 0\ I],训练中逐步引入低/中层特征)。

13. KDA Context Parallelism (KCP) 状态分解

KDA 递推 St=MtSt−1+βtktvt⊤S_t = M_t S_{t-1} + \beta_t k_t v_t^{\top}(Mt:=I−βtktkt⊤Diag⁡(αt)M_t := I - \beta_t k_t k_t^{\top} \operatorname{Diag}(\alpha_t))依赖前 state,无法用 S=0S = 0 局部计算后简单求和。KCP 将每段效果分解为两个可局部计算的量:

M[i+1]t←1:=∏r←1tMr∈Rdk×dk,S[i+1]t=S~[i+1]t+M[i+1]t←1S[i]Ti(17)M_{[i+1]}^{t\leftarrow 1} := \prod_{r\leftarrow 1}^{t} M_r \in \mathbb{R}^{d_k \times d_k},\quad S_{[i+1]}^{t} = \tilde{S}_{[i+1]}^{t} + M_{[i+1]}^{t\leftarrow 1} S_{[i]}^{T_i} \tag{17}

其中 S~\tilde{S} 为从 S=0S=0 起算的局部状态;每 rank 只需交换 M[i]Ti←1M_{[i]}^{T_i \leftarrow 1} 与 S~[i]Ti\tilde{S}_{[i]}^{T_i},通过 fixed-size all-gather + prefix-scan 恢复所有 rank 的入 state,实现线性算力扩展。

模型组件

组件说明关键参数 / 数值
Total / ActivatedMoE 参数与激活2.78 T / 104.2 B (K2: 1.04 T / 32.6 B,↑167% / ↑220%)
LayersTransformer 层数93 (K2: 61,↑52%)
Attention CompositionKDA + MLA hybrid69 KDA + 24 MLA + 1 final MLA
Hidden Dimensiondd7,168 (K2 同)
Latent MoE Dimensionℓ\ell3,584 (0.5 × d)
MoE Hidden per ExpertRouted FFN 隐维3,072 (K2: 2,048,↑50%)
Routed Experts每层路由专家896 (K2: 384,↑133%)
Active Experts / Token每 token 激活16 (K2: 8,↑100%)
Shared Experts每层共享专家 NsN_s2 (K2: 1,↑100%)
Attention HeadsHead 数量96 (K2: 64,↑50%)
Dense Layers稠密层数1
Vocab Size词表160 K
Training Context训练上下文1 M tokens (K2: 128 K,↑8×)
Activation FunctionGLU 变体SiTU-GLU (K2: SwiGLU)
Position Encoding位置编码NoPE(KDA 提供隐式位置)
MTP LayerMulti-Token Prediction1 layer (EAGLE-3 draft)
ViTMoonViT-V2401 M params, 27 layers, patch 14, 12 heads, RMSNorm + no bias
Sparsityrouted / active896 / 16 = 56
AttnResBlock 划分N=8N = 8 块 × 12 层 + embedding block(共 9)
OptimizerPer-Head Muon + weight clipping每 head 独立 Newton–Schulz 正交化
QuantizationQATMoE 权重 MXFP4 / 激活 MXFP8,其余高精度
LR Schedule余弦衰减 + 1% linear warmupWeight decay 0.1
KV CacheKDA 固定态 + MLA paged KVHybrid paged pool
Scaling Efficiencyvs K2~2.5 ×

训练流程

Kimi K3 训练全流水线分为 预训练 → 长上下文 cooldown → SFT → RL → MOPD → QAT Draft:

  1. Pre-Training Data:Web / Code / Math / Knowledge 四大文本域 + 大规模视觉语料(captions、interleaved 图文、OCR、感知、视频、visual coding SVG / 3D / Webpage / Game / CAD)。文本经过 rule + classifier + dedup 三重过滤,并按 K2 recipe 进行 rephrase(风格与视角多样化 + chunk-wise 自回归生成 + 与源文档保真度校验)。视觉坐标使用绝对与归一化 [0,1] 双格式。

  2. Progressive Context Extension(四阶段):

    • 预训练:8 K → 64 K
    • Cooldown:256 K → 1 M
    • 长文本 upsample + 跨文档拼接合成长依赖任务,避免退化为局部模式。
  3. Scaling Law:重新调优 batch size、learning rate、TPP (tokens-per-parameter)、模型形状;cosine decay 在各自最优超参下始终优于 WSD;架构 + 数据 + 训练配方联合带来 ~2.5× scaling efficiency 提升(Figure 7)。

    Scaling Law: K2 vs K3

  4. Native Multimodal Training:MoonViT-V2 从头训练,与文本共享 backbone、共享单一 next-token prediction 目标;相比 SigLIP-initialized MoonViT-3D 展现更低、更稳定的梯度范数(Figure 6)。

    Vision Tower Gradient Norm 对比

  5. Post-Training 三阶段:

    1. SFT:使用 XTML (eXtensible Token Markup Language) chat template(附录 F)序列化 agentic trajectory;从 SFT 阶段起启用 QAT (MXFP4/MXFP8)。
    2. RL:三领域 × 三 effort 级 = 9 位 domain × effort 专家。partial rollout(λ 分数完成即启动 policy update)+ per-token 正则处理 off-policy stale 数据;Reasoning-Effort RL 通过预算 b0(x)b_0(x) + 乘子 τ\tau 与超时 reward = -1 逐步 anneal;non-verifiable 任务采用 Agentic Generative Reward Model (GRM) + verbosity budget(σ⋅ℓ0\sigma \cdot \ell_0 超长即败)。
    3. MOPD:以 9 位专家为教师,per-token dense clipped reward(Eq. 15);实验中 top-k 蒸馏未见明显增益。
    4. QAT + Draft FT:MTP 层 fine-tune 为 EAGLE-3 draft,直接优化 LK loss(Eq. 16)。

    RL Scaling: 多任务能力随 RL FLOPs 提升

  6. RL 任务合成与环境:

    • Unified White-Box RL Environment:将 agent harness 抽象为可组合模块(tools / system prompt / context mgr / skills / memories / subagents),可实例化 Kimi Code、Claude Code、Codex、OpenClaw、Hermes 等;训练时动态构造 harness 组合。
    • Knowledge-Graph-Guided Task Synthesis:agent-driven DAG 递归扩展知识图谱,节点 keyword → web 检索 → 合成 coding/knowledge/vision 任务(Figure 9)。
    • Verifiable Agentic Environments:多步搜索、投行 / 数据分析 / 法律 sandbox 工作流、Python 工具视觉推理(模型自主写代码 crop/zoom/verify)。
    • Kernel Optimization Tasks:CUDA/Triton/CuTe/Gluon/ThunderKittens/TileLang,BF16/FP8/FP4;奖励 = 正确性 + performance vs. expert(0.5–1.0 to hardware roofline),带 hacking-detection(防 CUDA graph replay/input caching/精度作弊)。
    • Personal Assistant Tasks:模拟 Gmail/Notion/Slack/Canvas 应用,多日持久环境,一次 rollout 可能 上千工具调用、上百万 context tokens。
    • Autonomous Execution Tasks (AET):黑箱系统复制(Figure 10)、量化因子发现、税务审计;hidden verifier + public diagnostic verifier 防作弊。
    • Web Development Tasks:website / 游戏 / 3D / WebGL / SVG / 全栈应用;containerized sandbox + deterministic checks + model judging,构建失败或伪实现直接零分。

    黑箱系统复制任务(Camera Repair 完成度)

四、核心创新

创新点说明理论/实验依据
Kimi Delta Attention (KDA) + 下界衰减delta-rule + channel-wise forget gate + scaled sigmoid 下界(gmin⁡=−5g_{\min}=-5)Eq. 1–6;对角 tile 可用 dense Tensor Core(Figure 3),显著加速长序列 mixing
Hybrid Attention 3:13 KDA + 1 Gated MLA + NoPE + 末层强制 MLA位置感由 KDA 提供,MLA 只做全局内容交互;context 扩展无需 RoPE 调频/YaRN
Attention Residuals (AttnRes)pseudo-query 对所有前层输出做 softmax attention;Block AttnRes 将存储从 O(Ld)O(Ld) 降到 O(Nd)O(Nd)Eq. 8–10;N=8N=8 恢复 full AttnRes 大部分收益;online-softmax 与 TP all-reduce 融合
Stable LatentMoELatent 维 ℓ=d/2\ell = d/2 + RMSNorm + SiTU-GLU + Quantile BalancingEq. 11–14;896 experts × 16 active,稀疏度 56;软 cap 有效防低精度溢出;QB 用一次直方图 all-reduce 完成全局分位数估计
Per-Head MuonNewton–Schulz 正交化按 head 拆分 momentum均衡 head 更新尺度、减少大规模训练不稳定,同时降低正交化开销
原生多模态从零训练MoonViT-V2 与 LLM joint next-token pretrainingFigure 6:SigLIP-init 存在梯度尖峰,从头训练平稳且在视觉评估上不输
Reasoning-Effort RL + MOPD三领域 × {low/high/max} = 9 专家;per-token clipped log-ratio dense rewardEq. 15;单模型内切换 reasoning effort,token 预算控制过度思考
Agentic GRM + verbosity budget强制协议:读输出→出 rubric→打分→写 scorepad;超过 σ⋅ℓ0\sigma \cdot \ell_0 直接败消除 GRM reward hacking 与冗长输出偏好
MoonEP 完美负载均衡 EP冗余专家上限 E/RE/R,静态计算形状,zero-copy communication证明冗余上限 E/RE/R 紧;在线 ILP planning kernel;对比 DeepEP 通信 buffer 从 S⋅K⋅RS\cdot K\cdot R 降至 S⋅KS\cdot K
KDA Context Parallelism (KCP)每 rank 只交换 MT←1M^{T\leftarrow 1} 与 S~T\tilde{S}^{T},通过 prefix-scan 恢复Eq. 17;实现 KDA 线性算力扩展、fixed-size all-gather
KDA-aware Prefix Cache将 KDA state 与 MLA KV 打包进同一 paged pool;MLA 512-token 细粒度 hash + KDA 稀疏 checkpointFigure 12:6144 = 12 × 512 分层缓存,跨 turn 复用;hit boundary 精细到 512
External KV Cache Pool + AgentENV惰性 write-back CPU DRAM pool;Firecracker microVM 支持 pause/fork/snapshot(checkpoint 133 ms/resume 49 ms)OverlayBD + ublk + copy-on-write memory,memory 超售 6.5×;共创建 51,219,741 sandboxes / 1,505,678 images
MXFP4 QAT + LK loss draftMoE 权重 MXFP4 / 激活 MXFP8 + rollout/training 同精度消除 train–inference 精度偏差;LK loss 直接最大化 speculative 接受率
~2.5× Scaling Efficiency架构+数据+训练配方联合改进Figure 7 拟合 curve

五、代码实现分析

论文并未附带完整开源代码,但其架构与基础设施围绕以下 Moonshot AI 组件搭建,均可访问:

仓库内容用途
MoonshotAI/MoonEP完美负载均衡 Expert Parallelism 系统3T 级 MoE 训练:ILP planning、redundant expert 迁移、zero-copy dispatch
MoonshotAI/FlashKDACUTLASS-based KDA chunkwise kernel训练与 prefill;作为 flash-linear-attention 后端 auto-dispatch
fla-org/flash-linear-attention (PR #691)KDA CP 实现跨 SM 与跨 device 的 KDA 上下文并行
MoonshotAI/minitritonKimi K3 自主开发的 Triton-like 编译器Case study:DSL + MLIR + PTX + 反向 autograd + NCCL 分布式训练
MoonshotAI/nano-kpuKimi K3 自主设计的推理芯片 RTLCase study:4 mm²、100 MHz、8,700 tokens/s、1.46 M cells、0.277 MiB SRAM,INT4 MAC
kvcache-ai/AgentENVFirecracker-based agentic microVM sandboxRL rollout:Pause/Fork/Snapshot,133 ms 检查点/49 ms 恢复

关键实现要点:

  • FlashKDA 内核架构:token-parallel 阶段与 head-parallel recurrence 各自调度调优,重叠 intra-chunk 计算与跨 chunk state 传播,显著优于 Triton reference。
  • MoonEP:online planning kernel(GPU 上近似 ILP),前向根据 router 输出规划冗余 expert 并预取,反向局部 reduce buffer;导入 zero-copy fused permute/unpermute,跨层 kernel-launch 无 host-sync。
  • Memory-Efficient Training:unified activation manager(recompute/quantize/offload/remote-offload 均为 storage policy)、block-wise FP8 激活量化 + CPU offload、Pipeline ZeRO-2 gradient sharding + CPU 存储 + double grad buffer、P2P Muon orthogonalization(只 gather 本 rank 拥有的 shard)。
  • Multimodal Encoder:Dynamic CP 沿 patch 维度拆分大图,gather-KV 跨 CP ranks;ViT 前向被塞进 PP 泡泡内;DEP(Decoupled Encoder Process)将 ViT 与文本训练拆开、跨 PP stage 平衡。
  • 1 M Agentic RL Infra:Co-located training + partial rollout + external KV pool + auto-throttling scheduler + gradient-buffer reuse for non-policy forward。
  • Inference Serving:KDA prefix cache decoupled hash granularity vs. physical block(512 vs. 6144 tokens);WarpDecode 风格 MoE decoding kernel(每 warp 负责一个输出 neuron,lane-team 细分 experts);Block AttnRes intra-block 与 TP all-reduce 融合、inter-block kernel 放侧流;cache-aware affinity scheduling + budget-based admission control。

六、实验结果

主评估配置

  • Baselines:Claude Fable 5 (max, w/ fallback)、GPT-5.6 Sol (max)、Claude Opus 4.8 (max)、GPT-5.5 (xhigh)、GLM-5.2 (max)。
  • Kimi K3 默认:reasoning effort = max,temperature = 1.0;单步任务 top-p = 0.95,agentic 任务 top-p = 1.0。
  • Coding:三种 harness(Kimi Code、Claude Code、Codex)中取最好;SWE-Marathon 用 H20 校准分支(Claude Fable 5 在 35% 任务上触发 fallback);PostTrainBench 用官方 Harbor 在 H20 上 3 次运行平均。

基准测试(主表节选)

Benchmark 概要(首页图)

Reasoning & Knowledge

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2
GPQA Diamond93.592.694.191.093.591.2
CritPt23.428.632.320.927.120.9
AA-LCR74.770.073.767.774.371.3
HLE-Full (no tool / w/ tool)43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.941.4 / 52.2-

Coding

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2
DeepSWE67.570.073.059.067.046.2
ProgramBench77.876.877.671.970.863.7
Terminal-Bench 2.188.388.088.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE-Marathon42.035.039.040.014.013.0
PostTrainBench36.641.434.634.128.434.3
MLS-Bench-Lite48.349.946.242.835.540.4
SciCode58.760.256.153.556.150.5

Kimi K3 在 ProgramBench (77.8) 和 SWE-Marathon (42.0,超 Fable 5 +7) 上取得 SOTA;Terminal-Bench 2.1 与 GPT-5.6 Sol 相差 0.5 pt。DeepSWE 官方 leaderboard 使用 mini-SWE-agent harness 时 Kimi K3 达 67.3。

Agentic (节选)

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2
BrowseComp91.288.090.484.384.4-
DeepSearchQA (F1)95.094.2-93.1--
ResearchRubrics76.2-73.873.564.071.1
GDPval-AA v2 (Elo)168617471736159314911510
Toolathlon-Verified76.577.974.976.273.559.9
MCPMark-Verified94.587.492.976.492.9-
MCP-Atlas84.284.783.683.682.882.6
AutomationBench30.829.129.727.222.712.9
JobBench54.357.445.448.438.343.4
AA-Briefcase (Elo)154815831495135411581260
Agents’ Last Exam28.325.7†29.627.026.620.4
OSWorld-Verified84.885.083.083.479.0-
OSWorld 2.058.366.162.655.749.5-
τ³-Banking33.426.833.027.631.326.8
Harvey Lab-AA94.693.687.291.186.391.0
CorpFin v271.671.864.466.768.466.1
SpreadsheetBench 234.834.732.431.629.128.1

BrowseComp 上启用 300K token 触发的 context compaction 得 91.2;关闭 compaction 使用整个 1 M 窗口得 90.4。

Vision

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5
WorldVQA ForceAnswer51.056.741.839.138.5
OmniDocBench91.189.885.887.989.4
PerceptionBench58.557.259.747.255.8
Video-MME (w/ sub)90.0-89.586.089.3
MMVU82.1-81.279.281.7
BabyVision w/ Python85.790.588.981.283.6
MMMU-Pro (no / w/ Python)81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.781.2 / 83.2
CharXiv (RQ, no / w/ Python)84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.984.1 / 89.0
Math-Vision (no / w/ Python)94.3 / 97.894.8 / 98.695.8 / 97.886.7 / 97.192.2 / 96.8
ZeroBench-main pass@5 (no / w/ Py)23.0 / 41.023.0 / 46.017.0 / 35.017.0 / 34.022.0 / 41.0

内部评估(Kimi 自建 benchmark)

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2
Kimi Code Bench 2.0 (Claude Code)73.776.9-71.7-64.2
Kimi Code Bench 2.0 (Kimi Code)72.9---66.0-
Coding Experience (Claude Code)59.959.8-58.0-53.3
24/7 ClawBench 2.048.347.452.047.248.543.2
MIRA Bench64.172.962.259.854.6-
KAET83.5-85.478.779.774.7
CLIF Bench52.4-50.648.852.339.2
Agentic Vision Bench78.381.182.982.876.9-
Swarm Bench76.3-73.272.661.858.5
Online Experience77.974.284.069.473.764.0
Deep Research Bench90.0-85.387.281.984.0
Finance Bench62.6-62.760.758.455.4
DECK Bench73.573.074.766.968.268.6
Faithfulness (1-hallucination)85.5-84.883.686.574.8

Kimi Webdev Bench(Kimi K3 vs Claude Opus 4.8,盲评):

DomainWinTieLoseWin − Lose
Games55.6%3.7%40.7%+14.9%
3D / WebGL / Shader72.7%13.7%13.6%+59.1%
Website / UI Clone52.6%21.1%26.3%+26.3%
Overall58.6%13.8%27.6%+31.0%

网络安全评估(Tier 1 + Tier 2)

  • Tier 1(漏洞发现):在数十个广泛部署系统(OS kernel / DB / AI service / Web framework / blockchain / VPN)中发现数百个候选漏洞,人工复核确认率约 70%,其中包含 16 个 6 个项目的 0-day;两个 Linux kernel 案例:远程可触发 heap OOB write(远程 DoS)+ RDMA 子系统 Dirty-COW 类本地提权。
  • Tier 2(exploit 开发):36 个任务分 user-space (16) + Linux kernel (20)。Kimi K3 解 14/36 (38.9%) vs GLM-5.2 8/36 (22.2%);14 个成功中 10 个来自 user-space 轨道;每个任务人工专家需 ~15 h(全套 540 h)。
  • 失败模式:(i) 已获 primitive 后未能完成 exploit chain 最后一步;(ii) mitigation 下策略选择差(坚持 control-flow hijack 而非 data-only);(iii) 陷入长时间无产出 debug loop;(iv) 提交前 verification 不足。
  • UK AISI + NIST CAISI 联合评估:ExploitBench 32% vs GLM-5.2 24%;32-step 模拟企业网络 17 vs 11 步;41 个 end-to-end exploit 全为 0 完成,仍落后 frontier 模型。

第三方评估(2026-07-23 起)

SourceMetricKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2
Artificial Analysis Intelligence Index v4.1 (#4/580)AAII57.159.958.955.755.051.1
Vals AI Index (#2/39)%74.775.173.170.468.065.0
WebDev Arena Elo (#1/99)Elo1,6781,6341,6301,5651,5071,592
Text Arena Elo (#8/200)Elo1,4861,5071,4851,4841,4821,469
Agent Arena (#4/37)score9.112.710.19.88.86.5

Kimi K3 是首个登顶 WebDev Arena 的开源模型。

成本效率

Score vs Cost per Task

  • Kimi Code Bench 2.0:落后 Fable 5 4.0 pt 但 成本仅 38%;high effort 已经追平 Opus 4.8 的 max,成本约 1/3。
  • BrowseComp:最高 91.2 分 @ $2.03/task,比 GPT-5.6 Sol 便宜一半,比 Claude 系列在 max 便宜一个数量级。
  • GDPval-AA v2:与 GPT-5.6 Sol 相差 <50 Elo 但成本低 13%;比 Fable 5 便宜 2.6×。
  • AA-Briefcase:分数第二,成本约为 Fable 5 的一半。

消融/案例研究

Case Study:GPU Kernel Optimization on AttnRes

  • GPU Kernel Optimization(24 h budget,四个 kernel:AttnRes / DSA / KDA / MLA head=512):Kimi K3 全面提升,AttnRes 从 283.6 ms → 114.4 ms、DSA -55.1%、KDA -73.6%、MLA 达到 >50% peak TFLOPS;打平 Claude Fable 5 (fallback),超 Opus 4.8 / GPT-5.6 Sol / GPT-5.5。图 14 显示 Kimi K3 在 20 h 达到 +59.7% 提升(Fable 5 +57.1%)。
  • MiniTriton 编译器(Case Study,Figure 15):DSL frontend + MLIR + PTX + autograd + NCCL;L20 上超 torch eager / torch.compile 几何平均;tensor-core matmul 达机器 roof ~90%;DSL KDA prefill 内核显著超 Triton reference;训练 GPT,梯度差异 <torch fp32 舍入误差 10−410^{-4}。
  • Nano-KPU 芯片设计(48 h 自主):hybrid KDA + NoPE-MLA + Block AttnRes (block=2) + sigmoid MoE (1 shared),group-wise INT4 (group=128);4 mm²、Nangate45、100 MHz timing closure,RTL decode >8,700 tokens/s,1.46 M cells + 0.277 MiB SRAM + INT4 MAC + fused dequant。
  • I–Love–Q 关系复现:审阅 20+ 论文、300+ equations of state、3,000+ 行 Python、发现已发表公式错误 → 约 2 小时 vs 人类 1–2 周。
  • Kimi Work 大型 deliverables:42 年 AI ASIC 行业调研(120+ 迭代 / 2,800+ 搜索 / 1,100+ terminal 查询 / 87 季报 + 99 PDF>11,000 页);GWTC-5 391 次引力波事件 + 20+ 并发 subagents。
  • 视频剪辑:3Blue1Brown 风格架构解释视频 + 56 clips 拼接。

与现有方法对比

维度Kimi K2Kimi K3变化
总参数 / 激活1.04T / 32.6B2.78T / 104.2B↑167% / ↑220%
层数6193↑52%
Routed / Active experts384 / 8896 / 16↑133% / ↑100%
Shared experts12↑100%
Attention Heads6496↑50%
Attention 机制MLAHybrid KDA + MLA (NoPE)全新
ActivationSwiGLUSiTU-GLU引入软 cap
训练上下文128 K1 M8×
Native Vision✗✓ (MoonViT-V2 from scratch, 401M, 27L)新增
Scaling Efficiency1×~2.5×—
RL 结构单一9 experts (3 domains × 3 effort) + MOPD新增
Quantization—MXFP4/MXFP8 QAT throughout post-training新增
SandboxcontainerAgentENV microVM (133 ms/49 ms checkpoint)新增

七、相关工作

  • Kimi 系列:Kimi K1.5 [118](RL scaling with LLMs)、Kimi K2 [58](Open Agentic Intelligence,1.04 T MoE + MLA)、Kimi K2.5 [59](Visual Agentic Intelligence + Agent Swarm)、Kimi Linear [63](KDA 原型)、Kimi-VL [61]、Kimi Work、Perception Bench [62]。
  • KDA 前身:DeltaNet [105] / GDN [138] / Mamba-2 [24]、Kimi Linear [63](低秩输出门 + Softplus decay)、RWKV-7 [91]、HGRN2 [97]、Griffin [27]。
  • MoE:DeepSeekMoE [23]、DeepSeek-V2 [28]、Switch Transformers [33]、GShard [66]、LatentMoE [32]、SonicMoE [41]、Step 3.5 Flash [47]、UltraEP [132]、DeepEP [147]、Expert Threshold Routing [112]。
  • MLA / Attention:DeepSeek-V2/V3/V4 [28, 30, 29]、Ring Attention [72]、Flash Linear Attention [139]、LASP / LASP-2 [113, 114]、Gated Attention [99]。
  • On-Policy Distillation:Kevin Lu / Thinking Machines Lab [75]、MiMo-V2 [134]、DeepSeek-V4 [29]。
  • RL for LLMs:DeepSeek-R1 [40]、OpenAI o-series [83, 84]、Anthropic extended thinking [6, 7]、GLM-5.2 [37]。
  • Speculative Decoding:EAGLE-3 [71]、LK Losses [104]、ReplaySSM [25]、WarpDecode [12]。
  • Sandbox / Infra:Firecracker [3]、Mooncake Transfer Engine [96]、DADI/OverlayBD [68]、ZeRO [100]、Megatron-LM [81]、GPipe [48]、Muon [53, 73]、DeepSpeed Ulysses [50]。
  • Multimodal Encoders:SigLIP-initialized ViT、MoonViT-3D、CharXiv [130]、Math-Vision [128]、ZeroBench [102]、Video-MME [36]、OmniDocBench [88]。
  • Benchmarks:Terminal-Bench [78]、FrontierSWE [35]、SWE-Marathon [117]、BrowseComp [131]、DeepSearchQA [126]、ResearchRubrics [106]、Toolathlon [69, 119]、MCPMark [133]、AA-LCR/Briefcase [9, 2]、GDPval [90]、Agents’ Last Exam [4, 115]、GPQA [101]、HLE [93]、SciCode [121]、OSWorld [136, 143]。

八、总结

核心贡献

  1. 开源前沿预训练:训练出 2.8 T 总参数 / 104.2 B 激活的原生多模态 MoE,1 M token 上下文;KDA、AttnRes、Stable LatentMoE、SiTU-GLU、Per-Head Muon、精炼数据与训练配方联合带来 ~2.5× scaling efficiency 提升。
  2. 多 effort 测试时扩展的 RL:跨 general / agentic / coding 三领域 × 三 reasoning-effort 级共训练 9 位专家,并通过 Multi-Teacher On-Policy Distillation 汇入单一模型;引入 Reasoning-Effort RL、Agentic GRM + verbosity budget、Autonomous Execution Tasks。
  3. 多万亿参数百万 token 基础设施:KDA 系统协同(FlashKDA、KCP、状态感知 prefix cache)、MoonEP 完美负载 EP、memory-efficient MoE 训练、AgentENV microVM sandbox、cache/budget-aware fleet scheduling。
  4. 开源前沿模型:完整开源 Kimi K3 权重,成为世界首个开源 3T 类模型、首个登顶 WebDev Arena 的开源模型;Artificial Analysis Intelligence Index v4.1 = 57.1(第 3/580)。

技术影响

  • 证明在同一模型内可同时扩展训练时参数与测试时 reasoning + agentic RL,开源生态无需在两轴之间取舍。
  • KDA + NoPE + AttnRes 组合展示了长上下文、无 RoPE、稳定训练的一条可行路径;SiTU-GLU + RMSNorm + QB 让 896-expert 极稀疏 MoE 稳定收敛。
  • MOPD 将 domain × effort 多专家融合为单模型的做法为 post-training 汇合范式提供成熟蓝本。
  • MoonEP 的 E/RE/R 冗余上限证明与 zero-copy static-shape 通信为大规模 EP 提供了可移植的最佳实践。
  • AgentENV + 51,219,741 sandboxes × 1,505,678 images 展示了 microVM 支撑百万 trajectory agentic RL 的工程范式。
  • 案例研究(MiniTriton、Nano-KPU)显示前沿开源模型已具备端到端编译器与芯片设计的自主生成能力,突破 kernel-optimization 层级。

局限性

  1. HLE-Full / CritPt:research-level reasoning 仍落后于 Claude Fable 5 / GPT-5.6 Sol(HLE-Full 43.5 vs 53.3;CritPt 23.4 vs 32.3)。
  2. GDPval-AA v2 / AA-Briefcase / JobBench:Elo 型知识工作评估仍落后 Claude Fable 5。
  3. 网络安全 Tier 2 kernel exploitation:无论 Kimi K3 还是 GLM-5.2 均未能解出 3/4 的 kernel exploit 任务;AISI/CAISI 报告显示 41 个 end-to-end exploit 全为 0 完成。
  4. 失败模式:exploit chain 收尾、mitigation 下策略选择、debug loop 陷入、submission 前的自 verification。
  5. 专有旗舰仍领先:整体能力上仍逊于 Claude Fable 5 与 GPT-5.6 Sol。
  6. 1 M 长上下文成本:一次 personal-assistant rollout 可达上千工具调用 + 百万 token,仍高度依赖专用 infra(KCP / prefix cache / AgentENV)。

九、参考资源