Back to blog

Kimi Linear: An Expressive, Efficient Attention Architecture

首个在公平比较下超越全注意力的混合线性注意力架构,通过KDA实现75% KV缓存减少和6倍解码吞吐量提升

Kimi Linear: An Expressive, Efficient Attention Architecture

一、论文概述

项目内容
标题Kimi Linear: An Expressive, Efficient Attention Architecture
作者Kimi Team (Yu Zhang, Zongyu Lin, Xingcheng Yao, Jiaxi Hu, Fanqing Meng, Chengyin Liu, Xin Men, Songlin Yang, Zhiyuan Li, Wentao Li, Enzhe Lu, Weizhou Liu, Yanru Chen, Weixin Xu, Longhui Yu, Yejie Wang, Yu Fan, Longguang Zhong, Enming Yuan, Dehao Zhang, Yizhi Zhang, T.Y. Liu, Haiming Wang, Shengjun Fang, Weiran He, Shaowei Liu, Yiwei Li, Jianlin Su, Jiezhong Qiu, Bo Pang, Junjie Yan, Zhejun Jiang, Weixiao Huang, Bohong Yin, Jiacheng You, Chu Wei, Zhengtao Wang, Chao Hong, Yutian Chen, Guanduo Chen, Yucheng Wang, Huabin Zheng, Feng Wang, Yibo Liu, Mengnan Dong, Zheng Zhang, Siyuan Pan, Wenhao Wu, Yuhao Wu, Longyu Guan, Jiawen Tao, Guohong Fu, Xinran Xu, Yuzhi Wang, Guokun Lai, Yuxin Wu, Xinyu Zhou, Zhilin Yang, Yulun Du)
机构Moonshot AI (Kimi Team)
论文https://arxiv.org/abs/2510.26692
代码https://github.com/MoonshotAI/Kimi-Linear
发布2025-10-30 (v1), 2025-11-01 (v2)
许可CC BY-NC-ND 4.0

二、核心思想

问题定义

随着大语言模型(LLM)演变为越来越强大的智能体,推理的计算需求——特别是在长视野和强化学习(RL)设置中——正在成为核心瓶颈。标准注意力机制存在根本性低效:softmax注意力的二次时间复杂度和线性增长的键值(KV)缓存引入了大量计算和内存开销,阻碍了吞吐量、上下文长度扩展和实时交互性。

解决方案概述

本文提出Kimi Linear,一种混合线性注意力架构,首次在公平比较下超越全注意力——涵盖短上下文、长上下文和强化学习(RL)扩展场景。其核心是Kimi Delta Attention (KDA),一种表达性强的线性注意力模块,扩展了Gated DeltaNet,具有更细粒度的门控机制,能够更有效地利用有限的有限状态RNN内存。

性能vs加速

三、技术架构

整体框架图

模型架构

Kimi Linear架构由以下组件组成:

  • Kimi Delta Attention (KDA):核心线性注意力模块
  • Multi-Head Latent Attention (MLA):全注意力层
  • 混合比例:3:1(3层KDA + 1层MLA)
  • MoE通道混合:每个token混合层后跟MoE层

核心公式

KDA状态更新(Delta Rule + 细粒度门控): St=(I−βtktkt⊤)Diag⁡(αt)St−1+βtktvt⊤\mathbf{S}_t = \left(\mathbf{I} - \beta_t \boldsymbol{k}_t \boldsymbol{k}_t^{\top}\right) \operatorname{Diag}\left(\boldsymbol{\alpha}_t\right) \mathbf{S}_{t-1} + \beta_t \boldsymbol{k}_t \boldsymbol{v}_t^{\top}

其中:

  • St∈Rdk×dv\mathbf{S}_t \in \mathbb{R}^{d_k \times d_v} 是矩阵值循环状态
  • αt∈[0,1]dk\boldsymbol{\alpha}_t \in [0,1]^{d_k} 是通道级衰减(细粒度门控,区别于GDN的标量门控)
  • βt∈[0,1]\beta_t \in [0,1] 是学习率
  • kt,vt\boldsymbol{k}_t, \boldsymbol{v}_t 是键值向量

分块并行算法(Chunkwise Algorithm): S[t]r=P[t]r⋅S[t]0+H[t]r\mathbf{S}_{[t]}^r = \mathbf{P}_{[t]}^r \cdot \mathbf{S}_{[t]}^0 + \mathbf{H}_{[t]}^r

其中WY表示将一系列秩-1更新打包为紧凑表示: P[t]r=Diag⁡(γ[t]r)−∑i=1rDiag⁡(γ[t]i→r)k[t]iw[t]i⊤\mathbf{P}_{[t]}^r = \operatorname{Diag}\left(\boldsymbol{\gamma}_{[t]}^r\right) - \sum_{i=1}^r \operatorname{Diag}\left(\boldsymbol{\gamma}_{[t]}^{i\to r}\right) \boldsymbol{k}_{[t]}^i \boldsymbol{w}_{[t]}^{i\top}

UT变换(减少非矩阵乘法FLOPs): M[t]=(I+StrictTril(Diag⁡(β[t])(Γ[t]1→C⊙K[t])(K[t]Γ[t]1→C)⊤))−1Diag⁡(β[t])\mathbf{M}_{[t]} = \left(\mathbf{I} + \text{StrictTril}\left(\operatorname{Diag}\left(\beta_{[t]}\right)\left(\boldsymbol{\Gamma}_{[t]}^{1\to C} \odot \mathbf{K}_{[t]}\right)\left(\frac{\mathbf{K}_{[t]}}{\boldsymbol{\Gamma}_{[t]}^{1\to C}}\right)^{\top}\right)\right)^{-1} \operatorname{Diag}\left(\beta_{[t]}\right)

输出计算(块间循环 + 块内并行): O[t]=(Γ[t]1→C⊙Q[t])S[t]⏟inter-chunk+Tril⁡((Γ[t]1→C⊙Q[t])(K[t]Γ[t]1→C)⊤)⏟intra-chunk(U[t]−W[t]S[t])⏟pseudo-value term\mathbf{O}_{[t]} = \underbrace{\left(\boldsymbol{\Gamma}_{[t]}^{1\to C} \odot \mathbf{Q}_{[t]}\right) \mathbf{S}_{[t]}}_{\text{inter-chunk}} + \underbrace{\operatorname{Tril}\left(\left(\boldsymbol{\Gamma}_{[t]}^{1\to C} \odot \mathbf{Q}_{[t]}\right)\left(\frac{\mathbf{K}_{[t]}}{\boldsymbol{\Gamma}_{[t]}^{1\to C}}\right)^{\top}\right)}_{\text{intra-chunk}} \underbrace{\left(\mathbf{U}_{[t]} - \mathbf{W}_{[t]} \mathbf{S}_{[t]}\right)}_{\text{pseudo-value term}}

神经参数化: qth,kth=L2Norm(Swish(ShortConv(Wq/khxt)))\boldsymbol{q}_t^h, \boldsymbol{k}_t^h = \text{L2Norm}\left(\text{Swish}\left(\text{ShortConv}\left(\mathbf{W}_{q/k}^h \boldsymbol{x}_t\right)\right)\right) vth=Swish⁡(ShortConv⁡(Wvhxt))\boldsymbol{v}_t^h = \operatorname{Swish}\left(\operatorname{ShortConv}\left(\mathbf{W}_v^h \boldsymbol{x}_t\right)\right) αth=f(Wα↑Wα↓xt)∈[0,1]dk\boldsymbol{\alpha}_t^h = f\left(\mathbf{W}_\alpha^{\uparrow} \mathbf{W}_\alpha^{\downarrow} \boldsymbol{x}_t\right) \in [0,1]^{d_k} βth=Sigmoid⁡(Wβhxt)\beta_t^h = \operatorname{Sigmoid}\left(\mathbf{W}_\beta^h \boldsymbol{x}_t\right)

输出门控: ot=Wo(Sigmoid⁡(Wg↑Wg↓xt)⊙RMSNorm⁡(KDA⁡(qt,kt,vt,αt,βt)))\boldsymbol{o}_t = \mathbf{W}_o\left(\operatorname{Sigmoid}\left(\mathbf{W}_g^{\uparrow} \mathbf{W}_g^{\downarrow} \boldsymbol{x}_t\right) \odot \operatorname{RMSNorm}\left(\operatorname{KDA}\left(\boldsymbol{q}_t, \boldsymbol{k}_t, \boldsymbol{v}_t, \boldsymbol{\alpha}_t, \beta_t\right)\right)\right)

模型组件

组件说明关键参数
KDAKimi Delta Attention,细粒门控线性注意力通道级衰减 α ∈ [0,1]^d_k
MLAMulti-Head Latent Attention,全注意力NoPE(无位置编码)
ShortConv深度可分离卷积,捕获局部token依赖核大小=4
输出门Sigmoid门控,缓解Attention Sink低秩参数化
MoE混合专家通道混合256专家,激活8个

模型配置

  • 激活参数:3B
  • 总参数:48B(MoE架构)
  • 专家数:256(激活8个,含1个共享专家)
  • 混合比例:3:1(KDA:MLA)
  • 上下文长度:最高1M tokens
  • 训练tokens:1.4T(对比实验)/ 5.7T(最终模型)

四、核心创新

创新点说明理论/实验依据
细粒度门控通道级衰减 Diag(α_t) 替代标量门控更精确的内存遗忘控制
DPLR特化绑定a=b=k的特化DPLR变体比通用DPLR减少约50%计算
3:1混合比例3层KDA + 1层MLA的最佳平衡消融实验验证最优
NoPE for MLA全注意力层不使用位置编码KDA负责位置信息编码
UT变换减少非矩阵乘法FLOPs提高硬件利用率

五、实验结果

合成任务

Palindrome任务

MQAR任务

Stack任务

KDA在所有合成任务上表现最佳:

  • Palindrome:序列长度2048时仍保持100%准确率(GDN 35%,Mamba2 0%)
  • MQAR:收敛速度显著快于GDN
  • Stack:状态跟踪能力优于GDN和Mamba2

缩放定律

缩放定律

  • Kimi Linear相比MLA实现约1.16倍计算效率
  • 相同计算预算下,Kimi Linear损失更低

短上下文预训练结果(1.4T tokens)

基准MLAGDN-HKimi Linear
HellaSwag81.782.282.9
ARC-challenge64.666.567.3
MMLU71.672.273.8
MMLU-Pro47.247.951.0
BBH71.670.672.9
GSM8K83.781.783.9
CEval79.379.179.5

短上下文SFT结果

基准MLAGDN-HKimi Linear
MMLU75.775.677.0
MMLU-Pro65.764.867.4
GPQA-Diamond57.158.662.1
AIME 202520.621.121.3
HMMT 202511.311.312.5
LiveCodeBench v625.125.426.0

长上下文结果(128k context)

基准MLAGDN-HKimi Linear (RoPE)Kimi Linear
RULER81.380.578.884.3
MRCR22.623.922.029.6
HELMET-ICL88.085.588.090.0
RepoQA63.063.066.568.5
Long Code Arena (Lib)32.834.731.337.1
平均52.251.251.854.5

RL扩展结果

RL训练准确率曲线

Kimi Linear在Math RL训练中持续优于MLA:

  • 训练集准确率增长速度显著快于MLA
  • 在MATH500和AIME2025测试集上实现更快更好的提升

效率提升

  • KV缓存减少:最多75%
  • 解码吞吐量:1M上下文时提升最多6倍
  • TPOT:1M tokens时1.84ms vs MLA的11.48ms(6.3倍更快)

TPOT vs 解码长度

预填充与解码性能

预填充时间

解码TPOT

  • 预填充:128k序列长度起Kimi Linear显著快于MLA,1M序列快2.9倍
  • 解码:1M上下文时Kimi Linear比全注意力快6倍

内核执行时间

内核执行时间

KDA相比通用DPLR显著减少计算:

  • 64K输入长度:KDA 32ms vs DPLR 64ms(2倍加速)

六、相关工作

方向代表工作与Kimi Linear的关系
线性注意力Linear Attention, GLA, Mamba2KDA扩展了这些方法
Delta规则DeltaNet, GDNKDA引入细粒度门控
混合架构Jamba, Griffin, RWKVKimi Linear采用3:1混合比例
高效推理FlashAttention, PagedAttentionKDA减少KV缓存需求

七、总结

核心贡献

  1. Kimi Delta Attention (KDA):改进delta规则的细粒度门控线性注意力机制
  2. Kimi Linear架构:3:1 KDA-to-MLA混合设计,减少内存占用同时超越全注意力质量
  3. 公平实验验证:1.4T token训练,Kimi Linear在短/长上下文和RL评估中均优于全注意力

技术影响

  • 效率突破:KV缓存减少75%,解码吞吐量提升6倍
  • 质量提升:首次在线性注意力架构中超越全注意力
  • 开源贡献:KDA内核、vLLM集成、预训练和指令微调模型检查点

局限性

  • 纯线性注意力在极长序列检索上仍有挑战
  • 3:1混合比例需要至少25%的全注意力层
  • 当前实现基于特定硬件(NVIDIA GPU)

八、参考资源