Back to blog

Kwai Summary Attention (KSA):一种序列级 KV Cache 压缩的高效长上下文注意力机制

快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention

Kwai Summary Attention (KSA):一种序列级 KV Cache 压缩的高效长上下文注意力机制

一、论文概述

项目内容
标题Kwai Summary Attention Technical Report
作者Chenglong Chu, Guorui Zhou*, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng*, Hui Wang, Jian Liang, Jiangxia Cao†, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang†, Ruitao Wang*, Xinchen Luo*, Yi Su*, Zhiyuan Liang, Ziqi Wang 等(快手 OneRec Team)
机构快手 OneRec Team
论文arXiv:2604.24432
代码github.com/Kuaishou-OneRec/KSA
模型HuggingFace: OpenOneRec/KSA-4B-base
发布2026-04-27 (v1) / 2026-07-05 (v2)
许可Apache 2.0

核心问题与贡献

该论文解决长上下文推理下 vanilla attention 的双重开销问题:随序列长度增长,KV cache 线性膨胀(O(n)O(n))、注意力计算二次膨胀(O(n2)O(n^2)),存储与算力开销不可承受。KSA 主张走一条被忽视的中间道路——序列级语义压缩:既不追求最小 KV cache(如 MLA/GDN 的严格线性/常数压缩),也不保留完整 token 级历史(如 Full/SWA),而是以 O(n/k)O(n/k) 的 KV cache 保留对远距离历史的完整可寻址性与可解释性。

主要贡献包括:

  • 提出 Kwai Summary Attention (KSA):通过可学习 summary token 做序列级压缩,KV cache 复杂度降为 O(n/k)O(n/k)
  • 设计 Sliding Chunk Attention (SCA) 与三段式连续 KV cache 布局,实现无需拼接/gather 的高效解码内核
  • 证明 KSA 与 GQA/MLA 正交,压缩率可相乘(KSA+GQA≈0.78%,KSA+MLA≈0.22%)
  • 提出 Hybrid-KSA(KSA:Full=3:1)架构配方,在 11 个基准上系统验证:长上下文匹配或超越 Full attention,通用基准差距最小

二、核心思想

背景:长上下文成为 LLM 关键 scaling 维度

Transformer 的 scaling law 已在数据量、参数量、算力三个方向取得成功;序列长度提供了同样关键的第四个维度。随着并行基础设施进步,有效上下文窗口已从早期约 1K 扩展至 128K~1M(Anthropic Claude Opus 4.6、Kimi K2.6、LongCat、Qwen3.5、GLM-5)。长上下文能力能显著降低幻觉,并孵化 Code Agent、推荐系统超长用户行为建模等复杂应用。在 Agent 时代,跨多轮获取巨大记忆并精确检索历史上下文,是高度智能体与长链推理的前提。

核心瓶颈

标准 Softmax Attention 面临两个不可接受的开销:

  1. KV Cache 线性增长 O(n)O(n):成为长序列推理的内存瓶颈
  2. Attention 计算二次增长 O(n2)O(n^2):训练与 prefill 阶段成本急剧上升

现有两条技术路线及其局限

路线一:单层内压缩 KV Cache(GQA、MLA)

  • GQA:按 head 分组共享 KV,KV Cache 降为 g/hg/h
  • MLA(DeepSeek-V2/V3):低秩投影(dc+dr≪2hdd_c+d_r \ll 2hd)压缩每层 KV
  • 局限:KV Cache 仍与序列长度保持严格 1:1 线性关系

路线二:KV Cache 友好的架构混合(SWA、Linear/GDN)

  • SWA:每个 token 仅关注窗口内邻居,KV Cache 为 O(w)O(w)
  • 线性 Attention(RWKV/Mamba/GDN):用固定大小状态替代注意力矩阵
  • 局限:线性 Attention 固定状态为有损压缩,远期信息模糊不可追溯;SWA 完全丢弃窗口外信息

KSA 的核心洞察——被忽视的中间路径

作者认为存在第三条路径:

维持 KV Cache 与序列长度的线性关系,但通过特定压缩比 kk 实现语义级压缩,即 O(n/k)O(n/k) 路径。

这条路径不追求”最小 KV Cache”(如 Linear Attn 的 O(1)O(1)),而是以可接受的内存代价,换取对长程依赖的完整、可参考、可解释保留。


三、技术架构

整体框架与核心机制

KSA 核心机制:摘要 token 注入 + 信息路由规则

KSA 核心机制:

  1. 摘要 Token 注入:输入序列 T=[t0,…,tn−1]T=[t_0,\dots,t_{n-1}] 按 chunk size kk 切分为 n/kn/k 个 chunks,在每个 chunk 末尾注入可学习摘要 embedding ss
  2. 信息路由规则:
    • 摘要 token sjs_j → 仅 attend 当前 chunk 内的原始 tokens
    • 文本 token tit_i → 关注滑动窗口内文本 + 之前所有 chunks 的摘要 tokens
    • 非重叠设计:每个 past chunk 要么”作为原始文本完全可见”,要么”仅通过其 summary 访问”,永不双重计数

核心公式

1. 序列分块与 Summary Token 注入

把长度为 nn 的序列切成大小为 kk 的 chunk,每个 chunk 末尾追加共享可学习 summary token ss:

T^=[chunk⁡0,chunk⁡1,…,chunk⁡nk−1],chunk⁡j=[tjk,…,tjk+(k−1),sj]\hat{\mathcal{T}} = \left[ \operatorname{chunk}_0, \operatorname{chunk}_1, \dots, \operatorname{chunk}_{\frac{n}{k}-1} \right],\quad \operatorname{chunk}_j = [t_{jk}, \ldots, t_{jk+(k-1)}, s_j]

2. 文本 token 的完整可见范围(Eq. 2–3)

当前位置 ii 的局部上下文(Sliding Chunk)为:

\left[ t_{(\lfloor i/k\rfloor - C)\cdot k}, \ldots, t_{i-1}, t_i \right] \tag{2}

远距离历史通过已累积的 summary token 访问,二者拼接为完整可见范围:

\underbrace{\left[ s_0, s_1, \ldots, s_{\lfloor i/k\rfloor - C - 1} \right]}_{\text{distant summary tokens}} \cup \underbrace{\left[ \text{local sliding chunk} \right]}_{\text{recent text}} \tag{3}

其中 CC 为滑动窗口覆盖的 chunk 数(默认 128)。

3. 摘要 token 独立参数与退火融合

摘要 token 使用独立投影权重(退火前):

WSQ=WQ+WSS,Q,WSK=WK+WSS,K,WSV=WV+WSS,VW_S^Q = W^Q + W_S^{S,Q},\quad W_S^K = W^K + W_S^{S,K},\quad W_S^V = W^V + W_S^{S,V}

退火融合策略——λ\lambda 从 1 线性递减到 0,最终独立摘要权重完全融入主权重,推理时无额外参数:

x~s=λxs+(1−λ)xsmain,x∈{q,k,v}\tilde{x}_s = \lambda x_s + (1-\lambda) x_s^{\text{main}}, \quad x \in \{q, k, v\}

对 text/summary 分别投影(统一写法):

\hat{X}_t = \begin{cases} \hat{\mathcal{T}}_t(W^X)^\top, & t \notin \mathcal{S}, \\ \hat{\mathcal{T}}_t(W_\mathcal{S}^X)^\top, & t \in \mathcal{S}. \end{cases} \tag{8}

4. KSA 注意力(带 chunk 结构掩码)

标准注意力 O=softmax⁡(QK⊤/d)VO = \operatorname{softmax}(QK^\top/\sqrt{d})V 扩展为带结构掩码 MKSA\mathcal{M}_{\mathrm{KSA}} 的形式:

\hat{O} = \operatorname{softmax}\left(\hat{Q}\hat{K}^\top/\sqrt{d} + \mathcal{M}_{\mathrm{KSA}}\right)\hat{V}. \tag{10}

5. 训练目标——注意力蒸馏

用 Full attention 作为 teacher,对 text token 的中间表示与最终分布做 MSE + KL 蒸馏:

\mathcal{L} = \mathcal{L}_{LM} + \alpha \mathcal{L}_{MSE} + \beta \mathcal{L}_{KL} \tag{1}

LMSE=1L⋅∣T∣∑ℓ=1L∥Oℓ−O^ℓ∥T2,LKL=KL ⁣(softmax⁡(hLWh⊤) ∥ softmax⁡(h^LWh⊤))\mathcal{L}_{\mathrm{MSE}} = \frac{1}{L\cdot|\mathcal{T}|}\sum_{\ell=1}^{L}\left\|O_\ell - \hat{O}_\ell\right\|_{\mathcal{T}}^2,\qquad \mathcal{L}_{\mathrm{KL}} = \mathrm{KL}\!\left(\operatorname{softmax}(h_L W_h^\top)\,\|\,\operatorname{softmax}(\hat{h}_L W_h^\top)\right)

Sliding Chunk Attention(而非 token 级 SWA)

SWA(token 级)vs SCA(chunk 级)边界对比

传统 SWA(token-level 滑动窗口)在与摘要 token 配合时会出现边界切割问题——窗口可能截断某个 chunk,导致部分 text token 既不在窗口内也不被视为远处摘要,造成信息割裂。KSA 采用 Sliding Chunk Attention (SCA),以 chunk 为滑动粒度,保证”每个 past chunk 要么全在窗口内、要么全在窗口外”。

Token 类型可见范围作用
摘要 Token (sjs_j)仅当前 chunk 内的文本 tokens专注压缩当前 chunk 语义,避免递归压缩误差累积
文本 Token (tit_i)① 滑动窗口内相邻文本 tokens + ② 之前 chunks 的全部摘要 tokens局部细粒度 + 全局摘要

三段式连续 KV Cache 布局

KSA 连续 KV Cache 布局

KSA 的 KV Cache 组织为三个连续区域(Current Chunk / Sliding Chunk ring buffer / Summary Token Buffer):解码时无需拼接、gather 或动态 mask,所有 tensor 连续存放,物理布局直接编码可见性规则,支持高效内存访问;生命周期包括写入新 token、插入 summary、原地回收 chunk。

Hybrid-KSA

KSA 层与 Full attention 层按 3:1 交错(默认配置):纯 KSA 在极长依赖检索上略弱,插入少量 Full 层充当”跨 chunk 集成器”,恢复全局精确寻址,兼顾检索精度与成本。


四、核心创新

创新点说明理论/实验依据
序列级语义压缩(非 token-level)以 chunk 为单位压缩序列长度维度,而非 head 或 embedding 维度,实现 O(n/k)O(n/k) KV Cache128K 下 KV cache 仅 Full 的 ~12.5%,压缩 2.5–2.8×
压缩正交性KSA 压缩 PastToken、GQA 压缩 HeadNum、MLA 压缩 EmbeddingDim,三轴独立可相乘KSA+GQA≈0.78%,KSA+MLA≈0.22%
Sliding Chunk Attention以 chunk 为滑动粒度对齐边界,避免 token 级 SWA 的边界切割导致的信息割裂消融显示 SCA 优于 SWA(RULER 全长领先)
块稀疏注意力内核利用 KSA mask 的结构化稀疏性,仅加载非零 block pair,避免 dense mask训练/Prefill 阶段显著加速
连续 KV Cache 布局物理布局编码可见性规则,解码期单次连续切片读取,无需 concat/gather硬件友好,16K decode 吞吐达 Full 的 1.06×
非重叠 token 路由窗口内看原始 token,远处仅通过摘要访问避免双重计数,信息不重叠
参数退火融合摘要独立权重按 λ\lambda 逐步融入主权重推理零额外参数开销

五、代码实现分析

项目结构

KSA/
├── muse/                           # 核心训练框架
│   ├── modeling_qwen3sa.py         # Qwen3-SA 模型定义(含 KSA 注意力层)
│   ├── layers/                     # 自定义注意力层逻辑
│   └── train/                      # 训练循环
├── recipes/                        # 统一预训练入口脚本
├── summary_attention_kernel/       # 块稀疏注意力 CUDA 内核
│   ├── prefill_kernel.cu           # Prefill 阶段内核
│   └── decode_kernel.cu            # Decoding 阶段内核
├── examples/
│   ├── pretrain/                   # 渐进式长度扩展配方
│   │   ├── model_config/           # 模型配置 JSON
│   │   ├── run_pretrain_{8,32,64,128}k.sh
│   │   └── hf_template/            # HuggingFace 兼容模板
│   └── inference/                  # 推理与权重转换
├── dockerfile/                     # Ubuntu 24.04 + CUDA 12.6 + PyTorch 2.6.0
└── data/                           # 用户需自行放置 mmap 语料库

关键文件

文件功能
muse/modeling_qwen3sa.py主模型定义,包含 KSA 注意力层的 forward 计算
summary_attention_kernel/prefill_kernel.cu块稀疏 prefill CUDA 核,利用结构化稀疏避免 dense mask
summary_attention_kernel/decode_kernel.cu解码内核,配合三段式连续 KV cache 布局
examples/pretrain/model_config/不同长度下的超参配置(chunk size、sliding chunks、hybrid ratio)

训练配置

基础模型:基于 Qwen3

  • 1.9B:从零训练(from scratch),开源代码与配置,不发布权重
  • 4B:持续预训练(CPT),基于 Qwen3-4B-base 注入 128K 上下文能力,权重已开源

分布式训练:FSDP + DCP (Distributed Checkpointing) + FlashAttention 2 + 自定义块稀疏内核

关键实现细节:

  • 推理阶段退火融合后无需 additional parameters
  • 块稀疏 kernel 利用 KSA mask 结构化稀疏,仅计算非零 block pair
  • 三段式连续 KV cache 生命周期确定:写入 token → 插入 summary → 原地回收 chunk

六、实验结果

实验设置

模型配置(表 2):

ConfigurationFrom ScratchContinual Pretraining
Number of layers2436
Hidden size20482560
Intermediate size61449728
Attention heads (Q/KV)16/1632/8
Head dimension128128
Hybrid architecture ratio (KSA:Full)3:13:1
Summary chunk size88
Sliding chunk number128128
Tied embeddingsFalseTrue

训练配方(表 3):

ConfigurationFrom ScratchContinual Pretraining
Sequence Length Stages8K/32K/64K/128K32K/64K/128K
Token Budget per Stage250B/50B/50B/50B25B/35B/25B
Max Learning Rate8K:4×10−44\times10^{-4}; ≥32K:1×10−51\times10^{-5}All:1×10−41\times10^{-4}
Min Learning Rate1×10−71\times10^{-7}1×10−71\times10^{-7}
RoPE Theta8K:10410^4; ≥32K:10610^610610^6
OptimizerAdamW (β1=0.9,β2=0.95\beta_1{=}0.9,\beta_2{=}0.95)AdamW
Weight Decay0.010.01
LR ScheduleWSDWSD
Gradient Clipping1.01.0

预训练数据分布

持续预训练(CPT)性能对比(表 4)

在 RULER 长上下文检索与通用/数学/代码基准上,Hybrid-KSA 全面接近或超越 Full attention,且显著优于 Hybrid-SWA / Hybrid-SCA / Hybrid-Linear。

BenchmarksFullHybrid-SWAHybrid-SCAHybrid-LinearKSAHybrid-KSA
RULER-4K92.8891.3086.0286.3991.5592.97
RULER-8K91.3888.0384.2883.8686.7890.53
RULER-16K89.1282.8780.6778.0684.7888.86
RULER-32K84.7478.9476.8976.4880.3086.65
RULER-64K78.1673.8868.8873.5076.0976.04
RULER-128K65.8666.2760.9467.9866.8171.67
MMLU71.8370.5769.8364.3370.7370.50
CMMLU75.0073.6972.5968.4173.2972.63
C-Eval73.6672.3671.6667.4272.1472.66
MMLU-Pro46.3645.2345.1138.8345.7045.39
CMath83.4184.8483.1679.0984.5884.25
GSM8K82.7581.9280.1072.4481.0979.50
MATH47.4848.2447.4542.5748.1547.56
MBPP61.3061.7059.6055.3061.5062.20
HumanEval58.5461.8961.8954.5860.9762.50
Average73.5072.1269.9467.2872.3073.59

要点:RULER-128K 上 Hybrid-KSA 71.67,超过 Full 65.86(+5.81);平均 73.59 与 Full 73.50 基本持平,但 KV cache 仅 Full 的 ~12.5%。

从零训练(From-Scratch)性能对比(表 5)

From-Scratch 性能对比

BenchmarksFullHybrid-SWAHybrid-SCAHybrid-GDNKSAHybrid-KSA
RULER-4K76.0874.5477.7279.8370.4480.65
RULER-8K72.8571.6975.2276.0165.9173.35
RULER-16K73.2469.5472.5574.0466.7474.07
RULER-32K69.0667.8667.7470.4162.5472.30
RULER-64K65.3263.0363.5469.3957.1369.95
RULER-128K48.7556.6458.0159.8739.2965.35
MMLU44.9946.8446.7746.2346.8346.83
CMMLU44.4145.8946.4247.1945.5946.88
C-Eval44.2843.5447.6245.5445.6944.13
MMLU-Pro19.4820.4620.1021.2221.7222.52
CMath55.3354.8362.3358.0058.5061.83
GSM8K48.2947.4652.3950.9554.8159.14
MATH23.3831.4628.8233.3030.0436.92
MBPP30.6030.0031.6034.8035.8036.40
HumanEval25.6128.0526.8327.4429.8831.71
Average49.4450.1251.8452.9548.7354.80

要点:从零训练下 KSA 差距被放大(RULER-128K 仅 39.29),但 Hybrid-KSA 65.35 远超 Full 48.75(+16.60),平均 54.80 亦为各方案最高——说明混合 Full 层对从零训练的长上下文收敛至关重要。

Needle-in-a-Haystack(表 6)

NIAH 128K 检索结果

SubtasksFullHybrid-SWAHybrid-SCAHybrid-LinearKSAHybrid-KSA
NIAH-Single100.00100.0099.16100.0097.50100.00
NIAH-Multikey75.0074.1670.8479.1674.1675.84
NIAH-Multivalue88.1283.7591.2595.6283.7598.75
NIAH-Multiquery95.6293.1298.1299.3895.6298.12
VT60.5067.5042.5087.5065.5090.50
FWE51.6651.6633.3323.3372.5065.84
SQuAD30.0030.0015.0035.0032.5042.50

复杂检索子任务上 Hybrid-KSA 优势明显:NIAH-Multivalue 98.75(+10.63)、VT 90.50(+30.0)、FWE 65.84(+14.18)、SQuAD 42.50(+12.5)。

推理效率分析

KV Cache 大小随序列长度增长对比

KV Cache 显存占用(128K 上下文): Hybrid-KSA 6.47 GB,相对 Full (GQA) 18.6 GB 压缩约 2.5–2.8×。

Decode 吞吐效率对比

Decode Throughput(128K 上下文):

机制Tokens/s相对 Full
Full (GQA)11.01.0×
Hybrid-SWA27.52.5×
Hybrid-Linear34.73.2×
Hybrid-KSA25.42.3×

Hybrid-KSA 显存减少约 2.8× 的同时保持接近最优的 decode 吞吐;16K decode 吞吐可达 Full 的 1.06×。

训练收敛

训练收敛效率对比

设置FullHybrid-KSA
From Scratch 最低 loss1.5721.524
CPT 最低 loss1.8911.867

Hybrid-KSA 在多阶段训练中收敛更快且达到更低 loss。

设计消融(表 7)

(a) Chunk Num (N):N=64 平均最高(83.16),N=128 默认下 RULER-64K 反而最好(76.35),说明更大滑动窗口利于超长检索。 (b) Chunk Size (S):S=8 默认在 RULER-64K(76.35)与平均上均衡;S 增大检索掉点,但短上下文略有收益(S=64 在 4K 达 86.50)。 (c) Hybrid Ratio (Summary:Full):1:1 长上下文最弱(RULER-128K 69.36),3:1 默认在 64K 检索最佳(76.35),5:1 在短上下文(4K 93.75)更强但 128K 掉到 70.31——3:1 是性能/成本的最优折中。

Configuration4K8K16K32K64KRULER Avg.GSM8KCMathMBPP
N=3291.0289.4684.4278.3570.7482.8081.2383.5960.50
N=6493.3688.6587.2176.9169.6983.1680.1383.0061.20
N=128 (Default)88.6988.0183.6278.1976.3582.9780.7582.4860.20
N=25692.0588.3083.8679.4065.7381.8781.1684.9261.60
S=8 (Default)88.6988.0183.6278.1976.3582.9780.7582.4860.20
S=1688.7783.7882.2077.3471.9780.8280.8183.5961.20
S=3290.2184.6680.2677.3175.0981.5081.2383.2561.20
S=6486.5081.6178.1272.6370.0977.7980.4881.8462.10
1:184.5082.8582.1674.7669.3678.7281.0984.5060.40
3:1 (Default)88.6988.0183.6278.1976.3582.9780.7582.4860.20
5:193.7589.1287.5478.4770.3183.8479.8383.4159.20
8:190.8085.8878.9471.8366.1978.7379.9882.9158.10

KV Cache 压缩率全景对比(表 1)

MechanismEffective ContextKV Cache Size (n→∞)Compression Rate
MHAnn (exactly)2nhd2 n h d-
GQAnn (exactly)2ngd2 n g dg/h≈6.25%g/h \approx 6.25\%
MLAnn (exactly)n(dc+dr)n(d_c+d_r)≈1.76%\approx 1.76\%
GDNnn (ambiguous)2hd22 h d^2d/n≈0%d/n \approx 0\%
SWAww (exactly)2wgd2 w g dw/n⋅g/h≈0%w/n \cdot g/h \approx 0\%
KSA (k=8k{=}8)nn (summarized)2(n/k)gd2 (n/k) g d1/k≈12.5%1/k \approx 12.5\%
KSA + GQAnn (summarized)2(n/k)gd2 (n/k) g d1/k⋅g/h≈0.78%1/k \cdot g/h \approx 0.78\%
KSA + MLAnn (summarized)(n/k)(dc+dr)(n/k)(d_c+d_r)≈0.22%\approx 0.22\%

(参数:k=8k=8、h=128h=128、d=128d=128、g=8g=8、dc=512d_c=512、dr=64d_r=64。)关键洞察:KSA 减少的是要 attend 的 token 数量本身,GQA/MLA 减少的是每 token 的存储维度,二者正交、压缩比可相乘。


七、相关工作

Sequence-Level Compression 家族

方法机制与 KSA 差异
AutoCompressors (Chevalier et al., 2023)跨 chunk 递归积累 last-layer summary vectorsKSA 无递归,每个 token 恰好被压缩一次
Activation Beacon (Zhang et al., 2025b)逐层 key-value 激活压缩并跨 chunk 累积KSA 在注意力层面压缩,非激活层面
UniGist (Deng et al., 2025)统一稀疏 gist layout,单遍训练KSA 采用 chunk-local 而非全局 gist
DAST (Chen et al., 2025)推理时动态按信息密度分配 soft-token 预算KSA 使用固定 chunk boundary 压缩
AdmTree (Li et al., 2025)自适应语义树 + 双向自注意力聚合 leaf gistKSA 为单向 chunk-boundary,无树结构

与高效 Attention 的定位对比

特性KSALinear/GDNSWASparse Attn
KV Cache 增长O(n/k)O(n/k)O(1)O(1)O(w)O(w)O(k⋅n)O(k\cdot n)
远期信息可追溯✅ 完整可查❌ 有损模糊❌ 窗口外不可见✅ 选择性
实现复杂度中等低极低高(需动态路由)
硬件友好度高(连续内存)高极高低
适用场景长程检索+推理生成速度优先本地模式为主均衡

横向定位(与已分析工作对比)

论文优化层面核心手段主要收益
SageAttention2++注意力计算内核FP8 Matmul 改用 FP16 累加器相对 FA2 最高 3.9× 加速,精度无损
FlashAccel推理内存/硬件HBF 高带宽闪存 + GPU 协同每 GPU 吞吐 2.54×、能效 1.93×
KSA(本文)注意力算法/表示chunk summary token + sliding chunkKV cache 压缩 2.5×,长上下文精度≥Full

三者互补:KSA 改”算什么”,SageAttention2++ 改”怎么算得快”,FlashAccel 改”存得下”,工程上可叠加。


八、总结

核心贡献

  1. 提出 KSA 机制:一种序列级压缩注意力,通过可学习 summary token 实现 O(n/k)O(n/k) 的 KV Cache,兼具完整可寻址性与可解释性
  2. 块稀疏训练内核 + 连续 KV Cache 布局:支持高效训练与推理,退火融合后推理零额外参数
  3. Hybrid-KSA 架构配方:3:1 混合比例取得最佳性价比
  4. 在 11 个基准上的系统性验证:几乎所有长上下文任务超越或匹配 Full attention,通用基准差距最小(CPT RULER-128K 71.67>Full 65.86;From-Scratch 65.35>Full 48.75,+16.60)
  5. 完全开源:训练脚本、CUDA 内核、HF 兼容模板与 4B 权重均已公开

技术影响

  • 长上下文推理经济:128K 上下文 KV Cache 减少约 2.5–2.8×,吞吐提升约 2.3×
  • 与主流架构正交:可与 GQA/MLA 组合,最高进一步压缩至 0.22%
  • 特别适合 Agentic RL:完整可追溯的远程依赖对多步推理与用户行为建模至关重要

局限性

  • 当前仅完成 Pre-training 阶段,尚未探索 post-training(SFT、偏好优化、RLHF)
  • 压缩比 kk 与模型容量、任务难度的 Scaling Laws 尚未充分探索
  • 纯 KSA 在从零训练与极端检索上弱于 Hybrid;summary token 的语义上限、超大上下文(>128K)下 summary 膨胀、与实际推理框架(vLLM/TensorRT-LLM)的 kernel 集成仍待深入

未来方向

  1. 稀疏摘要注意力:基于 query 条件化地选择摘要 token
  2. KSA post-training:SFT、偏好优化、推理 RL、多教师 OPD
  3. 压缩比的 Scaling Laws:建立类似参数/数据的序列级压缩 scaling 定律
  4. 与 OneRec/OneReason 的统一:构建 generative recommendation foundation model

九、参考资源

类型链接
arXiv 论文https://arxiv.org/abs/2604.24432
代码仓库github.com/Kuaishou-OneRec/KSA
开源模型HuggingFace: OpenOneRec/KSA-4B-base
RULER 长上下文基准Hsieh et al. (2024)
Needle-in-a-HaystackKamradt (2023)
WSD 学习率调度Yu et al. (2025)
GQA / MLA 对比基线Ainslie et al. (2023) / DeepSeek-V2 (2024)

引用

@article{chu2026ksa,
  title={Kwai Summary Attention Technical Report},
  author={Chu, Chenglong and Zhou, Guorui and others},
  journal={arXiv preprint arXiv:2604.24432},
  year={2026}
}

Analysis generated using paper-analyzer skill. 正文公式与 7 张结果表由 MinerU full.md 提取(PDF→MinerU 全文回退路径);配图由源 PDF 按页渲染并裁剪至 docs/figures/ksa/。