Back to blog

The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs

最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系

The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs

一、论文概述

属性内容
论文标题The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
论文编号arXiv:2504.17768 (v1: 2025-04-24, v3: 2026-06-22)
作者Piotr Nawrot, Robert Li, Renjie Huang, Sebastian Ruder, Kelly Marchisio, Edoardo M. Ponti
机构University of Edinburgh, Cohere, Meta
代码https://github.com/pnawrot/sparse-frontier
会议/期刊arXiv preprint, TMLR 2026 (under review)
图表21 幅图 / 5 张表
主题分类cs.CL, cs.LG

摘要:稀疏注意力为扩展 Transformer LLM 的长上下文能力提供了有前景的策略,但其效率-精度权衡仍不清晰,缺乏全面评估。本文是迄今为止最大规模的训练无关稀疏注意力实证分析,在 3 个模型家族(Qwen 2.5、Llama 3.1、Gemma 3)、多个模型规模、长达 128K token 的序列、稀疏度高达 0.95(即 1/20 注意力预算)以及 9 个多样化任务上评估了 6 种方法。本文首先将快速演进的稀疏注意力方法沿四个设计轴组织为分类法,然后得出可操作的洞见:(1) 稀疏注意力是有效的——在等价成本下,更大的稀疏模型优于更小的稠密模型,改进了 Pareto 前沿;(2) 对于所研究的训练无关方法,prefilling 期间细粒度的 per-query 重要性估计仍然不实用(由于估计成本和缺乏将细粒度稀疏转化为实际加速的稀疏核),迫使在 global-to-token 与 block-to-block 选择之间做任务依赖的取舍。Decoding 期间,token-to-page 选择变得可行,能实现更好的泛化与更高的稀疏容忍度;(3) 更长的序列容忍更高的稀疏度,暗示生产环境中的固定预算方法次优。

二、研究背景与动机

2.1 长上下文建模的计算瓶颈

Transformer LLM 的长序列建模能力是长上下文处理和推理时计算扩展的核心。自注意力机制是根本性瓶颈:

  • Prefilling 阶段:计算复杂度相对于序列长度呈二次 O(n2)O(n^2),导致 time-to-first-token 与部署成本急剧膨胀
  • Decoding 阶段:KV 缓存相对于序列长度线性增长,每步生成时加载不断扩展的 KV 缓存主导运行时

2.2 稀疏注意力的现状

稀疏注意力机制通过仅计算 QK 交互的子集来近似稠密注意力输出,涵盖:

  • 训练式变体:DMS、DeepSeek NSA、OpenAI gpt-oss、谷歌 Gemma 3 中的 SWA
  • 训练无关方法:Vertical-Slash(已部署在 Qwen 2.5-1M 并集成 vLLM)

在 2025 年 1 月至 2026 年 1 月间,arXiv 提交了超过 150 篇标题含 “sparse attention” 的论文。然而,由于缺乏大规模全面评估,稀疏注意力的可行性与稳健性仍不清晰。

2.3 现有评估的局限

  • Li et al. 2025 (SCBench):未控制序列长度,每个家族最多评估两个模型
  • Liu et al. 2025b:仅考察 ≤10B 模型,未涉及 prefilling 阶段
  • Yuan et al. 2024:序列长度仅至 32K,模型 ≤10B

本文是首个系统性地对稀疏注意力进行 isoCost 分析 的工作,提供效率-精度权衡与跨模型规模/序列长度/稀疏度的泛化新洞见。

三、四轴分类法

本文将快速演进的稀疏注意力方法沿四个设计轴系统化(Table 1):

3.1 稀疏化单元(Unit of Sparsification)

稀疏化单元是注意力矩阵中被剪枝或保留的结构单元。常见单元包括:

  • 局部窗口(local windows):围绕每个 query 的连续区域
  • 垂直列(vertical columns):所有 query 全局可访问的 token
  • 斜线(slashes):距每个 query 固定偏移的 token
  • 块(blocks):注意力矩阵的固定大小 tile(如 64×64 tokens)

块方法:Star Attention 用局部块+首前缀块近似;MInference 的 Block-Sparse 模式对每块 query token 增加动态选择的块;Quest、InfLLM 将 KV 缓存分为连续 page 并为每个解码 token 选择子集。

Vertical-Slash 模式:早期方法(LM-Infinite、StreamingLLM)用局部滑动窗口+前缀 attention sinks;Tri-shape 增加后缀 token 全注意力;SnapKV 引入动态选择的垂直列;MInference 通过任意偏移的对角斜线扩展局部窗口。

稀疏模式可视化

图 1 稀疏注意力模式可视化。Block-Sparse 与 Vertical-Slash 在 prefilling 期间操作(显示 query-key 注意力矩阵),SnapKV 与 Quest 在 decoding 期间操作(显示解码 token 关注 KV 缓存位置)。颜色表示从 0.5(红)到 0.9(蓝)的稀疏度。黑色竖线标记 prefill/decode 边界。

3.2 重要性估计(Importance Estimation)

  • 固定模式(Fixed patterns):通过离线校准识别,跨所有输入一致应用
    • StreamingLLM、LM-Infinite、MoA 确定初始 token 数(attention sinks)与局部窗口宽度
  • 内容感知方法(Content-aware methods):估计 QK 单元重要性以保留 top-k
    • SparQ 用最高幅度维度的近似注意力分数
    • MInference 的 Vertical-Slash 用块级池化 token 表示
    • SampleAttention 子采样 query
    • SnapKV 同样子采样 query,但用于解码
    • H2O、TOVA 用聚合注意力分数或最新 query 引导选择
    • 补充启发式:key 范数(Devoto et al. 2024)、value 范数(Guo et al. 2024)

关键洞见:稀疏注意力的成本包括稀疏操作与重要性估计开销;已实现的速度提升不仅取决于节省的 FLOPs,还取决于核利用所得稀疏模式的效率。Prefilling 期间,精确 per-query 重要性估计是二次的,且细粒度选择产生不规则内存访问模式,与基于块的 FlashAttention 核不匹配。DeepSeek Sparse Attention (DSA) 通过学习 “lightning indexer” 绕过这些约束,但在训练无关领域中,没有方法结合高效细粒度估计器与将所得稀疏转化为墙钟收益的核——因此实际方法要么全局选择细粒度单元,要么使用较粗的 block-to-block 选择。Decoding 期间 per-query 选择可行,因为每步只处理一个 query。

3.3 预算分配(Budget Allocation)

在模型组件(层与头)上分配计算资源以达到目标稀疏度:

  • 均匀分配(Uniform):如 Block-Sparse、SnapKV——简单但忽略层/头的差异贡献
  • 自适应(Adaptive):
    • PyramidKV、PyramidInfer:层越深,注意力分数熵越低,早期层分配更大预算
    • Mixture of Sparse Attention (MoA):用 Taylor 近似优化全局预算跨层分配
    • Ada-KV:按头灵活分配 top-(k×h) token
    • 阈值方法:Twilight、FlexPrefill、Tactic、SampleAttention 设置覆盖阈值(如 95% 注意力质量),每个头动态选择

3.4 KV 缓存管理(KV Cache Management)

  • 驱逐(Eviction):H2O、SnapKV——永久丢弃所选 token
  • 完整保留(Full retention):Quest、SparQ——保留整个缓存但选择性加载

3.5 评估的 6 种方法

方法阶段单元预算KV 缓存管理
Vertical-SlashPrefillverticals + slashesuniformN/A
FlexPrefillPrefillverticals + slashesthreshold-basedN/A
Block-SparsePrefillblocksuniformN/A
SnapKVDecodetokensuniformeviction
Ada-SnapKVDecodetokensadaptiveeviction
QuestDecodepagesuniformfull cache

Table 1 实验基准的 6 种内容感知稀疏注意力方法。

四、实验设置

4.1 模型

家族规模层数Q头KV头HuggingFace ID
Qwen 2.57B/14B/32B/72B28/48/64/8028/40/40/644/8/8/8Qwen2.5-*-Instruct
Llama 3.18B/70B32/8032/648/8meta-llama/Llama-3.1-*-Instruct
Gemma 34B/12B/27B34/48/628/16/324/8/16google/gemma-3-*-it

Table 5 评估模型概览。Qwen 2.5 与 Llama 3.1 官方支持 128K 上下文;Gemma 3 在该长度表现近零,故仅评估至 64K。

Qwen 2.5 作为主要家族的理由(同时满足):

  1. 原生 128K 上下文支持
  2. 多个规模在所有序列长度上保持合理性能
  3. 有 instruction-tuned 版本以支持 CoT 评估

Gemma 3 特殊性:6 层中 5 层使用 1024 token 滑动窗口,每 6 层用全局注意力——已通过架构大幅稀疏化。

所有实验使用 vLLM 推理引擎,bf16 精度。

4.2 任务

9 个长上下文任务沿 3 个关键维度选择(Table 2):

任务描述分散度范围自然
QA (SQuAD)在含干扰文档中开放式 QALowLow✓
QA (QuALITY, TOEFL)在含干扰文档中多选 QALowLow✓
Ruler NIAH在大量干扰键值对中提取指定键的 4 个值LowLow×
Ruler VT通过链式赋值识别解析为目标值的变量HighLow×
Ruler CWE从含干扰词的列表中识别 10 个最频繁的词LowHigh×
Story Retrieval关于长叙事中特定章节回答 16 个 factoid 问题LowLow✓
Story Multi-hop跨章节识别目标物品之前立即获取的物品HighLow✓
Story Filtering识别长叙事中无物品购买发生的章节LowHigh✓

Table 2 9 个评估任务摘要。

分散度(Dispersion) 指定位所需信息的难度,范围(Scope) 指必须处理的信息量。自然性(Naturalness) 维度同样关键——合成任务产生与自然语言不同的 token 表示分布。

3 个新任务(Story 系列) 填补 RULER 任务(合成)与真实长上下文用例之间的空白。

4.3 评估配置

  • 序列长度:16K、32K、64K(全部模型),128K(仅 Qwen、Llama,方法限于 Vertical-Slash 与 Quest)
  • 稀疏度等级:0, 0.33, 0.5, 0.6, 0.7, 0.8, 0.87, 0.9, 0.93, 0.95(对应注意力预算 1/1.5, 1/2, 1/2.5, 1/3.33, 1/5, 1/7.5, 1/10, 1/15, 1/20)
  • 样本数:Qwen 100/配置,Llama 与 Gemma 50/配置
  • 总配置数:7065 个
  • 计算资源:约 4 个节点,每节点 8 张 H100 GPU,运行 21 天
  • 输入长度约束:95-100% 目标最大 token 长度
  • 指标:Exact Match Accuracy / IoU / F1 score(均 [0,1])

五、计算成本建模

5.1 Prefilling FLOPs 分解

Fprefill=B⋅(Femb+Fattn+Fmlp+Flogits)(1)F_{\text{prefill}} = B \cdot (F_{\text{emb}} + F_{\text{attn}} + F_{\text{mlp}} + F_{\text{logits}}) \tag{1} Femb=2Ld(2)F_{\text{emb}} = 2 L d \tag{2} Fattn=N[2Ld(2d+2dhnkv)+ρhL2(4dh+3)](3)F_{\text{attn}} = N \left[ 2 L d \left(2d + 2 d_h n_{kv}\right) + \rho h L^2 \left(4 d_h + 3\right) \right] \tag{3} Fmlp=2NLdmlp(3d+1)(4)F_{\text{mlp}} = 2 N L d_{\text{mlp}} (3d + 1) \tag{4} Flogits=2Ld∣V∣(5)F_{\text{logits}} = 2 L d |V| \tag{5}

其中 LL 序列长度,dd 隐藏维度,hh 与 nkvn_{kv} query 与 KV 头数,dhd_h 头维度,NN 层数,dmlpd_{\text{mlp}} MLP 中间维度,∣V∣|V| 词汇表大小,BB 批大小,ρ=1−sparsity\rho = 1 - \text{sparsity} 注意力密度。

5.2 Decoding 内存访问分解

Mdecode=Mweights+B⋅Mkv(6)M_{\text{decode}} = M_{\text{weights}} + B \cdot M_{\text{kv}} \tag{6} Mkv=2NLdhnkvρ(7)M_{\text{kv}} = 2 N L d_h n_{kv} \rho \tag{7} Mweights=N(4d2+3ddmlp)+d(∣V∣+1)(8)M_{\text{weights}} = N(4d^2 + 3 d d_{\text{mlp}}) + d(|V| + 1) \tag{8}

5.3 重要性估计开销

Vertical-Slash:

FVS=BNh[2dLq+5Lq+2Llog⁡2L+L64(kv+ks)](9)F_{\text{VS}} = B N h \left[ 2 d L_q + 5 L_q + 2 L \log_2 L + \frac{L}{64} (k_v + k_s) \right] \tag{9}

其中 qq 用于重要性估计的 query 数,kvk_v、ksk_s 选择的 vertical/slash 模式数。

Quest:加载 page 表示

MQuest=2BNnkvd⋅Lp(10)M_{\text{Quest}} = 2 B N n_{kv} d \cdot L_p \tag{10}

其中 pp page 大小(实验中为 16)。

六、核心结果

6.1 RQ1: isoCost 分析——稀疏注意力是否有效?

isoCost 分析

图 2 Qwen 2.5(128K tokens)与 Gemma 3(64K tokens)的 isoCost 分析。每个点对应一个 (模型规模, 稀疏度) 配置,性能聚合自 9 个任务。左列:Vertical-Slash(FLOPs)。右列:Quest(内存传输)。批大小 B=64。虚线显示 Pareto 前沿。

关键发现:

  1. 稀疏注意力改进了 Pareto 前沿:存在效率交叉点——在等价计算成本下,更大的稀疏模型优于更小的稠密模型
  2. Qwen 128K:仅高稀疏度配置位于 Pareto 前沿上;prefilling 期间 0.8-0.93 稀疏度(1/5 至 1/15 预算)保持最优,0.95(1/20 预算)低于最优边界
  3. Decoding 对高稀疏度更具弹性:即使 0.95 稀疏度配置也优于更小的稠密模型
  4. Gemma 趋势不同:由于滑动窗口架构注意力占比低,prefilling 期间配置无重叠

6.2 Prefilling 计算分解

Prefilling 计算分解

图 12 Prefilling 计算分解与稀疏度收益,平均自 Qwen 7B-72B。左:随序列长度从 16K 增至 128K,注意力占总 FLOPs 从 40% 升至 80%。右:相应地,5× 注意力稀疏度带来递增加速——从 16K 的 1.5× 到 128K 的 2.8×。

Prefilling 关键事实:

  • 注意力 FLOPs 随序列长度二次缩放 O(L2)O(L^2),非注意力成本(MLP、embeddings、logits)线性缩放 O(L)O(L)
  • 16K tokens:注意力占 40%,5× 稀疏度仅得 1.5× 加速
  • 64K tokens:注意力占 68%,2.2× 加速
  • 128K tokens:注意力主导 80%,2.8× 加速
  • 标准差跨模型规模 ±4-6%,关系与规模无关

6.3 Decoding 计算分解

Decoding 计算分解

图 13 Decoding 成本分解与稀疏度收益,平均自 Qwen 7B-72B。左:KV 缓存比例随序列长度与批大小同时增加。右:5× KV 缓存稀疏度对应加速。批大小 1 时收益极小;批大小 64 时加速达 2.8-4.7×。

Decoding 关键事实:

  • 与 prefilling 不同,decoding 成本依赖序列长度和批大小
  • 批大小 1:KV 缓存仅占 7%(16K)至 35%(128K)——权重加载主导
  • 批大小 8:KV 缓存达 35-80%
  • 批大小 64:KV 缓存主导 80-97%,稀疏注意力变得高效,2.8-4.7× 加速
  • 标准差 ±1-9%,跨模型规模稳健

6.4 滑动窗口架构的影响

Qwen 14B vs Gemma 12B 对比

图 14 Qwen 14B(稠密注意力)与 Gemma 12B(滑动窗口注意力)在批大小 8 下的注意力成本比例对比。Gemma 的架构稀疏性导致明显更低的注意力比例,需要更长序列才能从额外稀疏注意力中获益。

具体数字(64K tokens, 批大小 8):

  • Prefilling:Qwen 14B 76% vs Gemma 12B 42%
  • Decoding:Qwen 79% vs Gemma 61%
  • 128K tokens 时 Gemma 升至 54%(prefill)/ 75%(decode)

实际影响:Gemma 在 64K 注意力占比低,稀疏 prefilling 削减的 FLOPs 比例较小,故密集-稀疏前沿在更高成本/更长序列处重叠。

6.5 RQ2: Per-Task 分析——哪种方法应被使用?

Per-Task 性能对比

图 3 稀疏注意力方法的 per-task 性能对比,聚合自 Qwen 2.5、Llama 3.1、Gemma 3,序列长度 16K-64K。误差棒表示标准误。左列:prefilling(Vertical-Slash、FlexPrefill、Block-Sparse)。右列:decoding(SnapKV、Ada-SnapKV、Quest)。任务按信息检索特征分组。

6.5.1 Prefill 与 decode 阶段呈现不同灵活性

如 §2 所述,每个推理阶段的计算约束——重要性估计成本与核将稀疏转化为墙钟收益的能力——塑造了哪些模式是实用的,进而影响任务间泛化。

Prefilling 阶段:

  • 训练无关领域中没有方法结合次二次(或近似二次)细粒度估计器与有效利用所得不规则稀疏的核
  • 现有方法落入两种策略:全局细粒度单元选择(Vertical-Slash) 或 block-to-block 选择(Block-Sparse)
  • 无一种主导——最优选择依赖任务
  • Vertical-Slash 在检索任务(Low Scope, Low Dispersion)表现强,因支持细粒度 token 定位
  • Block-Sparse 在需更广上下文或多步推理的任务(High Scope 或 Dispersion,如 Ruler VT、Story Filtering)有优势,可为每个 query 块选择不同 key-token 块

Decoding 阶段:

  • token-to-page 选择变得便宜(每步仅一个 query)
  • 更大灵活性使 Quest 跨任务泛化更好、容忍更高压缩,且保留完整 KV 缓存
  • 驱逐式方法(SnapKV、Ada-SnapKV)展示永久丢弃 token 的代价——不可逆压缩在丢弃 token 后续变相关时有害
  • Quest 在合成任务(如 Ruler NIAH)可能降级——随机符号序列产生与自然语言相比更不易区分的 key 表示(page 级粒度放大此效应)

6.5.2 动态预算分配收益依赖阶段

  • Prefilling:FlexPrefill 匹配或低于 Vertical-Slash 均匀分配——可能由于 “attention sink 现象”:阈值选择捕获高注意力 token,但错过分布长尾中的信息
  • Decoding:Ada-SnapKV 一致优于均匀 SnapKV,尤其在多 query 任务(Story Retrieval),但两者驱逐方法仍劣于 Quest 的完整缓存方法

6.5.3 稀疏容忍度跨任务差异巨大

  • Single QA 任务(QuALITY、SQuAD、TOEFL):容忍 0.95 稀疏度(1/20 预算)且所有方法降级极小
  • Multiple QA 任务(Ruler NIAH、Story Retrieval):在 0.8-0.9(1/5 至 1/10 预算)显著降级
  • High Scope 或 High Dispersion 任务:即使在 0.5-0.67(1/2 至 1/3 预算)也对某些方法降级

部署风险:仅在 Single QA 基准上评估或跨任务类型求平均会掩盖这些脆弱性。仅在检索任务上安全的稀疏度可能在聚合或多跳推理任务上失败。

序列自然性不对称影响方法:Quest 在自然语言检索(Story Retrieval)优于 Ada-SnapKV,但在合成检索(Ruler NIAH)劣于——强调需要跨越自然与合成数据的基准。

6.6 RQ3: 序列长度对稀疏容忍度的影响

序列长度与稀疏度关系

图 4 序列长度对稀疏容忍度的影响。相对误差为 (pˉdense−pˉsparse)/pˉdense(\bar{p}_{\text{dense}} - \bar{p}_{\text{sparse}}) / \bar{p}_{\text{dense}},pˉ\bar{p} 表示平均性能。结果聚合自所有任务、方法、模型(Qwen 2.5、Llama 3.1、Gemma 3)。

关键发现:对于固定注意力预算比例,更长序列导致更小降级:

  • 1/20 预算下,相对误差从 ≈0.33(16K)降至 ≈0.26(32K)和 ≈0.20(64K)
  • 模式跨所有模型家族一致

解释:可能由 Herdan 定律 解释——新信息随距离变稀少,从而支持随序列长度的更高稀疏度。

转换为预算缩放(作为近似 iso-error 曲线解读):

  • 目标相对误差 ≈0.2 时所需预算比例:1/10(16K)→ 1/15(32K)→ 1/20(64K)
  • 对比固定 token 预算:随长度增长,比例变为 1/10 → 1/20 → 1/40——这在 32K 已超过 ≈0.2 误差目标
  • 更严格目标 ≈0.1:1/5 在 16K 与 32K 都保持 <0.1,64K 仅需适度降低稀疏度

实际含义:最优 token 预算应随序列长度次线性增长——翻倍上下文不需要翻倍 token 预算,但保持预算恒定会导致降级递增。生产环境中的固定预算方法次优,未来设计应将稀疏度适配到序列长度。

6.7 跨家族结果

Qwen Per-Task 图 15 Qwen 2.5 模型(7B-72B)per-task 性能,序列长度 16K、32K、64K。左:prefilling 方法;右:decoding 方法。

Llama Per-Task 图 16 Llama 3.1 模型(8B、70B)per-task 性能。

Gemma Per-Task 图 17 Gemma 3 模型(4B、12B、27B)per-task 性能。

序列长度跨家族 图 18 各模型家族的序列长度对稀疏容忍度影响。

模型规模聚合 图 20 模型规模对稀疏容忍度的影响,聚合自所有任务。

Qwen 模型规模 图 21 Qwen 2.5(7B-72B)的模型规模对稀疏容忍度影响。

七、实现细节

7.1 关键超参(A.1 节)

Block-Sparse:

  • 块大小 16×16(基于 Qwen-7B 16K 消融)
  • top-k 关键块,k 通过二分搜索确定
  • 总是保留 attention sinks(首个 key 块)和局部上下文(对角 key 块)

Vertical-Slash:

  • 统一分配 vertical + slash 预算
  • 用近似窗口估计重要性;任务相关最优窗口:512 tokens(检索密集任务)、256 tokens(其他)
  • 保留前 4 前缀 token + 最近 64 局部 token

FlexPrefill:

  • 阈值参数 α + 最小预算 min_budget
  • 设置 τ=0 禁用 Query-Aware 注意力(隔离动态预算分配机制评估)
  • min_budget=512 显著提升性能
  • 高压缩比时 α=0(回退为 Vertical-Slash 均匀分配)

SnapKV:

  • 均匀 token 预算
  • 近似窗口 256 tokens
  • 1D 平均池化核大小 21
  • 保留前 4 + 最近 128 tokens

Ada-SnapKV:

  • 头级动态 token 预算
  • 用 max-aggregation(而非平均)跨 query 位置和头计算分数
  • 每头最小预算 20% 容量(最优),10-50% 范围稳定
  • 接近 100% 时降级急剧(确认动态分配收益)

Quest:

  • 页面大小 16 tokens(基于消融)
  • 用 page 内 key 的最小和最大值表示 page
  • 每步选择最相关 pages,始终包含当前 token 所在 page

7.2 任务 token 长度统计

任务均值最小-最大
QA QuALITY243.63196-423
QA SQuAD217.08210-235
QA ToeflQA237.67202-270
RULER CWE227.00227-227
RULER NIAH337.74330-350
RULER VT230.00230-230
Story Filtering184.00184-184
Story Multi-hop192.97192-195
Story Retrieval457.54452-462

Table 3 各任务问题与指令的 token 长度统计(100 样本)。该数据指导 Vertical-Slash 与 FlexPrefill 的近似窗口选择。

八、消融研究

Block-Sparse 块大小 图 5 Block-Sparse 块大小消融(16×16 vs 其他)。

Quest 页面大小 图 6 Quest 页面大小消融(16 tokens 为最优)。

Ada-SnapKV 最小预算 图 7 Ada-SnapKV 最小预算消融(20% 容量最优)。

FlexPrefill 最小预算 图 8 FlexPrefill 最小预算消融(512 显著提升)。

SnapKV 近似窗口 图 9 SnapKV/Ada-SnapKV 近似窗口消融(256 最优)。

SnapKV 核大小 图 10 SnapKV/Ada-SnapKV 核大小消融(21 选中)。

Vertical-Slash 窗口 图 11 Vertical-Slash 近似窗口的 per-task 消融。

九、与现有研究比较(Appendix C)

工作模型规模序列长度Prefilling 评估序列长度控制
SCBench (Li et al. 2025)单家族 ≤2 个模型未控制无无
Liu et al. 2025b≤10B-无-
Yuan et al. 2024≤10B≤32K--
本文 (Sparse Frontier)4B-72B16K-128K✓✓ 跨 4 个长度

Table 与现有稀疏注意力评估研究的比较。

本文是首个系统性进行 isoCost 分析 的工作,提供效率-精度权衡与跨模型规模/序列长度/稀疏度的泛化新洞见。

十、核心创新

创新点描述理论/实验依据
四轴分类法沿 unit/estimation/budget/KV cache 四个轴组织方法景观综述 150+ arXiv 论文
isoCost 分析框架在等价 FLOPs(prefill)或内存传输(decode)下比较方法Pareto 前沿揭示效率交叉点
9 任务基准引入 3 个新 Story 任务填补合成-自然空白RULER 任务自然性不足
7065 配置实证涵盖 3 家族、4 长度、10 稀疏度等级4×8 H100 GPU × 21 天
首次量化两阶段不对称揭示 prefill/decode 在稀疏模式选择上的根本差异per-task 性能对比
Herdan 定律解释序列长度-稀疏容忍度关系的语言学解释跨家族一致趋势

十一、核心结论

11.1 RQ1 答案:稀疏注意力有效

在等价计算成本下,更大的稀疏模型优于更小的稠密模型。稀疏注意力改进了 Pareto 前沿。对于长序列,仅高稀疏度配置位于 Pareto 前沿。

11.2 RQ2 答案:阶段决定方法选择

Prefilling 阶段:训练无关方法中,没有方法结合细粒度估计器与将所得稀疏转化为墙钟收益的核——迫使在 global-to-token (Vertical-Slash) 与 block-to-block (Block-Sparse) 选择之间做任务依赖取舍。

Decoding 阶段:per-query 选择便宜,token-to-page 方法(如 Quest)实现更好泛化与更高压缩容忍度。

11.3 RQ3 答案:长序列容忍更高稀疏度

在固定注意力预算比例下,更长序列导致更小降级。模式跨所有模型家族一致。生产环境中的固定预算方法次优——未来设计应将稀疏度适配到序列长度(次线性增长)。

十二、局限性

  1. 仅评估训练无关方法:训练式方法可能减少训练-推理失配,但需大量计算资源与可能的专有数据访问
  2. 实验覆盖范围有限:3 个模型家族(满足受控缩放实验方法学要求);其他家族可能表现不同
  3. Gemma 3 在 128K 表现近零:限制了对该架构在超长序列上的洞见

十三、实用部署建议

基于本文发现,给出以下实践指导:

  1. Prefilling 阶段:
    • 检索密集任务(低范围低分散度)→ 优先 Vertical-Slash
    • 多跳推理或广上下文任务(高范围或高分散度)→ 优先 Block-Sparse
  2. Decoding 阶段:
    • 优先 Quest(token-to-page 完整缓存)以实现更好泛化与更高压缩
    • 内存受限时考虑 Ada-SnapKV,但需接受驱逐不可逆性
  3. 稀疏度选择:
    • 短序列(16K):保守 ≤ 0.5(1/2 预算)
    • 长序列(≥64K):可激进至 0.93-0.95(1/15 至 1/20 预算)
    • 避免固定预算跨所有长度
  4. 评估建议:
    • 跨多种任务类型评估,仅在 Single QA 基准评估会掩盖脆弱性
    • 包含自然语言与合成数据——Quest 在自然语言优于 Ada-SnapKV,反之亦然

十四、参考资源