Back to blog

LightVLM: Accelerating Large Multimodal Models with Pyramid Token Merging and KV Cache Compression

通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理

LightVLM: Accelerating Large Multimodal Models with Pyramid Token Merging and KV Cache Compression

一、论文概述

项目内容
标题LightVLM: Accelerating Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
作者Lianyu Hu, Fanhua Shang, Wei Feng, Liang Wan
论文https://arxiv.org/abs/2509.00419
发布2025-08-30

二、核心思想

问题定义

现有VLM面临推理效率问题:

问题说明
图像Token冗余一张图像被编码为数千个token(如QWen2.5-VL使用16384个)
注意力分布不均少数token主导大部分注意力分数
KV缓存膨胀长序列解码时内存和计算开销大

观察发现

论文通过实验发现两个关键现象:

  1. 图像token注意力稀疏:文本输入比图像token获得多得多的注意力
  2. 少数token主导:在深层网络中,仅3%的图像token占据90%的注意力分数

Figure 2: 注意力分布分析

解决方案概述

LightVLM 提出两个互补的加速策略:

  1. 金字塔Token合并(Pyramid Token Merging):在编码阶段逐层减少图像token
  2. KV缓存压缩(KV Cache Compression):在解码阶段压缩不必要的缓存

核心优势:

  • 训练无关(Training-free):无需重新训练,即插即用
  • 双阶段加速:同时加速编码和解码过程
  • 高性能保持:仅保留35% token即可保持100%性能

三、技术架构

整体框架

Figure 3: LightVLM框架

VLM推理流程:

输入图像 → 图像编码器 → 图像Token序列 → LLM解码 → 文本输出
          ↓                                        ↑
    [LightVLM加速1]                         [LightVLM加速2]
    金字塔Token合并                          KV缓存压缩

核心公式

金字塔Token合并:

Tokensl+1=Merge(Tokensl,keep_ratiol)\text{Tokens}_{l+1} = \text{Merge}(\text{Tokens}_l, \text{keep\_ratio}_l)

其中 keep_ratiol\text{keep\_ratio}_l 随层数增加而递减:

层数保留比例说明
Layer 1-9100%保留所有token
Layer 10-1850%合并一半token
Layer 19-2725%仅保留关键token

KV缓存压缩:

KV_Cachecompressed=Select(KV_Cache,keep_ratio)\text{KV\_Cache}_{compressed} = \text{Select}(\text{KV\_Cache}, \text{keep\_ratio})

基于注意力分数选择最重要的缓存条目。

模型组件

组件说明关键参数
金字塔Token合并器逐层合并图像tokenkeep_ratio: 100%→50%→25%
KV缓存选择器基于注意力分数选择缓存keep_ratio: 可调
注意力分数统计实时计算token重要性无需额外训练

训练流程

LightVLM是训练无关的:

  1. 无需训练:直接在现有VLM上部署
  2. 即插即用:作为插件集成到VLM推理流程
  3. 自适应:根据输入动态调整token保留比例

四、核心创新

创新点说明优势
金字塔Token合并逐层递减保留比例,模拟VLM内部信息聚合高效压缩,保持性能
KV缓存压缩基于注意力分数选择重要缓存减少内存和计算开销
双阶段加速同时加速编码和解码整体推理速度大幅提升
训练无关无需重新训练,即插即用部署灵活,兼容性强
极端压缩仅保留3%token仍保持98%性能适用于资源受限场景

五、代码实现分析

关键代码逻辑:

def pyramid_token_merging(tokens, layer_idx, total_layers):
    if layer_idx < total_layers * 0.33:
        return tokens  # 前1/3层保留所有token
    elif layer_idx < total_layers * 0.67:
        return merge_tokens(tokens, keep_ratio=0.5)  # 中间1/3保留50%
    else:
        return merge_tokens(tokens, keep_ratio=0.25)  # 后1/3保留25%

def kv_cache_compression(kv_cache, attention_scores, keep_ratio):
    top_k = int(len(kv_cache) * keep_ratio)
    indices = torch.topk(attention_scores, top_k).indices
    return kv_cache[indices]

六、实验结果

图像理解基准测试

QWen2.5-VL 7B模型结果:

方法MMMUMMBenchMMStarRWQA平均
原始(100%)58.682.663.968.565.3
LightVLM (35%)58.782.563.868.665.3
SparseVLM (35%)56.479.060.665.662.5
FasterVLM (35%)57.780.962.167.564.0
VisionZip (35%)57.881.262.767.364.3
LightVLM (3%)57.681.361.368.263.9
FasterVLM (3%)50.369.553.157.655.0
VisionZip (3%)52.972.655.260.857.9

关键发现:

  • 35% token:LightVLM保持100%性能,甚至略有提升
  • 3% token:LightVLM保持97.8%性能,大幅超越其他方法
  • 压缩图像token可帮助VLM更好感知(去噪效应)

Figure 1: 性能对比

视频理解基准测试

QWen2.5-VL 7B模型结果:

方法VideoMMEMVBenchEgoSMLVU平均
原始(100%)71.6/65.169.665.070.268.3
LightVLM (35%)71.7/65.169.765.070.168.3
LightVLM (15%)71.3/65.069.464.169.667.8
LightVLM (3%)70.5/64.168.664.068.767.1
FasterVLM (3%)61.0/55.559.355.459.852.5
VisionZip (3%)64.2/58.362.458.262.961.1

大模型加速效果

使大模型更快:

模型配置MMMUMMStar吞吐量
InternVL2.5 8B(原始)56.062.8基准
InternVL2.5 26B + LightVLM60.166.6更高
QWen2.5-VL 3B(原始)53.354.6基准
QWen2.5-VL 7B + LightVLM58.862.6更高

关键发现:LightVLM使大模型(如26B)比小模型(如8B)更快且性能更好

效率分析

推理速度提升:

方法吞吐量(img/s)增速首token延迟加速
QWen2.5-VL 7B1.86-428ms-
PyramidDrop2.971.60×237ms1.80×
SparseVLM3.071.65×251ms1.71×
FasterVLM3.311.78×223ms1.92×
VisionZip3.832.06×96ms4.46×
LightVLM3.752.02×117ms3.65×

长序列生成加速:

  • 生成4096 token时,LightVLM减少3.21×推理时间
  • 内存使用也显著降低

Figure 5: 长序列延迟对比

七、相关工作

Token减少方法

方法策略局限性
SparseVLM稀疏注意力性能下降明显
FasterVLMtoken选择极端压缩效果差
PyramidDrop层级丢弃缺乏自适应性
VisionZip视觉压缩不够精细

八、总结

核心贡献

  1. 发现VLM注意力稀疏性:图像token注意力分布极不均匀
  2. 提出金字塔Token合并:逐层递减保留比例,高效压缩
  3. 提出KV缓存压缩:基于重要性选择,减少内存开销
  4. 训练无关部署:即插即用,兼容多种VLM

技术影响

  • 推理加速:2.02×吞吐量提升,3.65×首token加速
  • 极端压缩:3%token保持98%性能
  • 大模型加速:使大模型比小模型更快
  • 部署灵活:无需训练,适用于多种VLM

局限性

  1. 压缩上限:低于3%token时性能下降明显
  2. 架构依赖:主要验证于Transformer架构VLM
  3. 动态调整:保留比例需手动设置
  4. 视频任务:长视频处理仍有优化空间

九、参考资源

论文

相关方法

  • SparseVLM: Zhang et al., 2025
  • FasterVLM: Zhang et al., 2024
  • PyramidDrop: Xing et al., 2025
  • VisionZip: Yang et al., 2025