Back to blog

R-KV: Redundancy-aware KV Cache Compression for Reasoning Models

面向推理模型的冗余感知KV缓存压缩

R-KV: Redundancy-aware KV Cache Compression for Reasoning Models

一、论文概述

项目内容
标题R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
作者Zefan Cai, Wen Xiao, Hanshi Sun, Cheng Luo, Yikai Zhang, Ke Wan, Yucheng Li, Yeyang Zhou, Li-Wen Chang, Jiuxiang Gu, Zhen Dong, Anima Anandkumar, Abedelkadir Asi, Junjie Hu
机构University of Wisconsin-Madison, Microsoft, CMU, Caltech, UC San Diego, University of Surrey, UC Berkeley
论文arXiv:2505.24133
代码GitHub
领域cs.CL, KV Cache压缩, 推理模型优化

二、核心思想

问题定义

推理模型(如DeepSeek-R1)在链式思维(CoT)推理中表现出色,但会产生过长的输出,导致KV缓存内存急剧增长。

冗余分析

推理模型的独特挑战:

特性说明影响
超长输出推理模型生成8-14×更多tokenKV缓存内存爆炸
高重复性1-/2-gram频率比ground truth高5-7×大量冗余token
自反思冗余不必要的反思、迭代重评估浪费缓存空间

核心数据:

  • DeepSeek-R1-Distill-Llama-8B生成32K token消耗4.1GB KV缓存
  • 超过一半的token对任务性能贡献极小

现有方法的失败

SnapKV冗余问题

方法设计目标推理模型问题
SnapKV长输入prompt压缩重复内容获得高注意力分数,被过度保留
H2OHeavy-Hitter Oracle忽略冗余,保留大量重复自反思
StreamingLLM流式推理不适用于超长生成输出

关键发现:重复内容在注意力分数中获得不成比例的高权重,导致现有方法过度保留冗余token。

解决方案概述

R-KV提出冗余感知的解码时KV缓存压缩方法:

组件功能方法
重要性评分识别关键token基于注意力权重
冗余估计识别重复token基于key向量语义相似度
联合选择平衡重要性和冗余加权组合策略

三、技术架构

整体框架

R-KV框架

R-KV包含三个关键步骤:

解码时压缩

与现有方法的区别:

方法压缩阶段目标
SnapKV, H2O预填充阶段长输入prompt
R-KV解码阶段长生成输出

压缩流程:

  1. 分配缓存:Btotal=Bbudget+BbufferB_{\text{total}} = B_{\text{budget}} + B_{\text{buffer}}
  2. 每生成固定长度文本段后触发压缩
  3. 保留最后α\alpha个token作为观察token
  4. 从候选token中选择top-kk保留

重要性评分(基于注意力权重)

Multi-Head Attention (MHA):

Ah=softmax(Qh⋅(Kh)⊤/d)A^h = \text{softmax}(Q^h \cdot (K^h)^\top / \sqrt{d})

Grouped-Query Attention (GQA):

Agrouph,g=Qh,g⋅(Kh)⊤/d,g=0,…,G−1A_{\text{group}}^{h,g} = Q^{h,g} \cdot (K^h)^\top / \sqrt{d}, \quad g = 0, \dots, G-1 Agrouph=maxpool([Agrouph,0,…,Agrouph,G−1])A_{\text{group}}^h = \text{maxpool}([A_{\text{group}}^{h,0}, \ldots, A_{\text{group}}^{h,G-1}])

重要性评分:

A~j,ih=max⁡(Aj,i−Wh,…,Aj,ih,…,Aj,i+W−1h)\tilde{A}_{j,i}^h = \max(A_{j,i-W}^h, \ldots, A_{j,i}^h, \ldots, A_{j,i+W-1}^h) Iih=1α∑j=0α−1A~j,ihI_i^h = \frac{1}{\alpha} \sum_{j=0}^{\alpha-1} \tilde{A}_{j,i}^h

冗余估计(基于语义相似度)

余弦相似度计算:

K‾ih=Kih∥Kih∥2+ϵ,Sh=K‾h(K‾h)⊤,Si,ih←0\overline{K}_i^h = \frac{K_i^h}{\|K_i^h\|_2 + \epsilon}, \quad S^h = \overline{K}^h (\overline{K}^h)^\top, \quad S_{i,i}^h \leftarrow 0

保留最近token:对于高相似度token集合Tih\mathcal{T}_i^h,保留β\beta个最近的token,将其相似度置零。

冗余评分:

Sˉih=1n∑j=0n−1Sj,ih,Rih=softmax([Sˉ0h,…,Sˉn−1h])i\bar{S}_i^h = \frac{1}{n} \sum_{j=0}^{n-1} S_{j,i}^h, \quad R_i^h = \text{softmax}([\bar{S}_0^h, \ldots, \bar{S}_{n-1}^h])_i

联合选择策略

最终选择分数:

Zih=λIih−(1−λ)RihZ_i^h = \lambda I_i^h - (1-\lambda) R_i^h
  • λ\lambda:重要性vs冗余的权衡参数
  • 默认λ=0.1\lambda = 0.1(更重视减少冗余)

选择策略:选择ZihZ_i^h最高的k=Bbudget−αk = B_{\text{budget}} - \alpha个token保留。

四、核心创新

创新点说明理论/实验依据
冗余感知压缩首次针对推理模型冗余特性设计50%+ token贡献极小
解码时压缩区别于预填充阶段压缩适用于长生成输出
语义相似度冗余估计基于key向量余弦相似度识别重复自反思
联合选择策略平衡重要性和冗余λ=0.1\lambda = 0.1最优

五、实验结果

实验设置

配置详情
模型DeepSeek-R1-Distill-Llama-8B, DeepSeek-R1-Distill-Qwen-14B
数据集MATH-500, AIME 2024
基线SnapKV, FullKV
评估pass@1 (64 responses/question), temperature=0.6, top-p=0.95
硬件NVIDIA A100 80G
超参数Bbuffer=128B_{\text{buffer}}=128, α=8\alpha=8, λ=0.1\lambda=0.1

准确率结果

R1-Llama-8B - AIME24:

方法KV缓存比例准确率vs FullKV
FullKV100%基准100%
SnapKV10%~60%60%
R-KV10%~100%~100%
R-KV16%~105%105%

关键发现:

  • R-KV用10% KV缓存达到近100% FullKV性能
  • R-KV用16% KV缓存达到105% FullKV性能(超过完整缓存!)
  • SnapKV仅能达到60%性能

R1-Qwen-14B - AIME24:

方法KV缓存比例准确率vs FullKV
FullKV100%基准100%
SnapKV10%~60%60%
R-KV25%~100%~100%
R-KV33%~105%105%

固定预算分析

R1-Llama-8B:

数据集预算无损压缩
MATH-5001024 tokens✓
AIME-20241536 tokens✓

R1-Qwen-14B:

数据集预算无损压缩
MATH-5001536 tokens✓
AIME-20243072 tokens✓

效率提升

指标提升
内存节省90%
吞吐量提升6.6×

超参数分析

λ\lambda敏感度:

  • λ=0.1\lambda = 0.1:最优平衡(更重视减少冗余)
  • λ\lambda过大:过度重视重要性,冗余token保留过多
  • λ\lambda过小:过度重视冗余,可能误删重要token

六、相关工作

方法类别代表方法特点与R-KV的区别
注意力驱逐SnapKV, H2O基于注意力分数选择忽略冗余,重复token被过度保留
层级压缩PyramidKV动态层级预算分配正交于R-KV
头级压缩Not All Heads Matter头级预算分配正交于R-KV
量化KVQuant, KIVI降低数值精度可与R-KV结合
流式推理StreamingLLM注意力汇不适用于长生成

七、总结

核心贡献

  1. 首次系统分析推理模型冗余:超过50% token贡献极小
  2. 冗余感知压缩框架:结合重要性和冗余的联合选择策略
  3. 解码时压缩:区别于预填充阶段,适用于长生成输出
  4. 显著性能提升:10%缓存达到100%性能,16%缓存达到105%性能

技术影响

  • 内存效率:90%内存节省
  • 推理速度:6.6×吞吐量提升
  • 训练无关:无需额外训练
  • 模型无关:适用于各种推理模型
  • 可与其他方法结合:预算分配、量化等正交技术

局限性

  1. 超参数调优:λ\lambda需要根据任务调整
  2. 相似度阈值TT:需要设定固定阈值
  3. 计算开销:余弦相似度矩阵计算O(n2)O(n^2)
  4. 模型依赖:主要在DeepSeek-R1系列上验证

八、参考资源