Back to blog

OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs

OmniSparse提出训练感知的细粒度稀疏注意力机制,优化长视频多模态大语言模型的推理效率。

OmniSparse: 长视频多模态大语言模型的训练感知细粒度稀疏注意力

一、论文概述

1.1 基本信息

项目内容
标题OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
作者Feng Chen, Yefei He, Shaoxuan He, Yuanyu He, Jing Liu, Lequan Lin, Akide Liu, Zhaoyang Li, Jiyuan Zhang, Zhenbang Sun, Bohan Zhuang, Qi Wu
机构(多机构合作)
提交日期2025年11月15日
arXiv ID2511.12201
领域多模态大语言模型、高效注意力机制、长视频理解

1.2 摘要

现有稀疏注意力方法主要针对推理时加速,通过在预定义稀疏模式下选择关键 token 来实现。然而,这些方法往往无法弥合训练与推理之间的差距,并且缺乏在查询(queries)、键值对(KVs)和注意力头(heads)等多个维度上进行细粒度 token 选择的能力,导致性能次优且加速收益有限。

本文提出了 OmniSparse——一种面向长视频多模态大语言模型(MLLMs)的训练感知细粒度稀疏注意力框架,在训练和推理阶段均采用动态 token 预算分配策略。OmniSparse 包含三个自适应且互补的机制:

  1. 查询选择(Query Selection):通过惰性-活跃分类(lazy-active classification)保留捕获广泛语义相似性的活跃查询,丢弃大部分仅关注有限局部上下文且功能冗余度高的惰性查询
  2. 键值选择(KV Selection):采用头级动态预算分配,基于最平坦的注意力头确定共享预算,确保注意力召回率
  3. KV 缓存瘦身(KV Cache Slimming):根据头级解码查询模式选择性获取视觉 KV 缓存,减少头级冗余

实验结果表明,OmniSparse 在匹配全注意力性能的同时,实现了 prefill 阶段 2.7 倍加速和解码阶段 2.4 倍内存减少。

二、核心思想

2.1 问题动机

长视频多模态大语言模型面临的核心挑战是注意力机制的二次方计算复杂度。现有方法存在两个关键问题:

  1. 训练-推理差距(Training-Inference Gap):现有方法仅在推理时使用稀疏注意力,而训练时使用全注意力,这种不一致导致注意力模式的差异,最终降低泛化能力和性能
  2. 粗粒度 token 选择:现有方法通常仅关注查询、键值对、注意力头中的一个或两个维度,限制了计算节省和模型效率的潜力

2.2 核心观察

Figure 1: OmniSparse 的三个关键观察

论文基于三个关键观察提出解决方案:

观察内容启示
查询稀疏性大多数查询仅关注不到 100 个 token(约 2,600 中的 3%)可安全移除”惰性”查询
头间异质性不同注意力头的稀疏度差异显著需要头级动态预算分配
头间 token 关注差异不同头关注不同的 KV 对需要头级 KV 选择

2.3 设计理念

OmniSparse 的核心设计理念是训练-推理一致性:在训练和推理阶段均应用相同的稀疏注意力机制,避免模式不匹配。通过 Top-p 逐 token 稀疏化策略,在查询、键值对和注意力头三个维度上实现细粒度稀疏。

三、技术架构

3.1 整体架构

Figure 2: OmniSparse 整体架构

OmniSparse 由三个组件构成:

输入序列 X = [X_v, X_t]
    ├── X_v: 视觉 tokens (N_v × d)
    └── X_t: 语言 tokens (N_t × d)

┌─────────────────────────────────────────────────┐
│                  OmniSparse 框架                   │
│                                                   │
│  ┌─────────────┐  ┌─────────────┐  ┌───────────┐ │
│  │  查询选择    │  │  KV 选择    │  │ KV 缓存   │ │
│  │ (Prefill)   │  │  (Prefill)  │  │ 瘦身      │ │
│  │             │  │             │  │ (Decoding) │ │
│  └──────┬──────┘  └──────┬──────┘  └─────┬─────┘ │
│         │                │               │       │
│         ▼                ▼               ▼       │
│  惰性-活跃分类    头级动态预算      选择性获取    │
│  移除冗余查询    确定 KV 预算      视觉 KV 缓存  │
└─────────────────────────────────────────────────┘

3.2 查询选择:惰性-活跃二分类

Figure 3: 查询冗余性观察

核心思想:将查询模式建模为惰性-活跃二分类问题。

具体方法:

  • 对于每个注意力头 ii,将注意力汇聚点(attention sink,第一个 token)对应的键 Ki(lazy)\mathbf{K}^{(\text{lazy})}_i 作为惰性参考
  • 通过对所有视觉键进行平均池化,得到活跃参考键 Ki(act)\mathbf{K}^{(\text{act})}_i
  • 构建紧凑的探测键矩阵,计算二分类 logits:

Ai(la)=σ(QiKi(la)⊤di),Ki(la)=[Ki(lazy),Ki(act)]\mathbf{A}^{(\text{la})}_i = \sigma\left(\frac{\mathbf{Q}_i \mathbf{K}^{(\text{la})^{\top}}_i}{\sqrt{d_i}}\right), \quad \mathbf{K}^{(\text{la})}_i = [\mathbf{K}^{(\text{lazy})}_i, \mathbf{K}^{(\text{act})}_i]

  • 如果查询对活跃类别的注意力分数超过阈值 τ\tau,则被分类为活跃查询
  • 保留第一个注意力头的所有查询作为活跃查询,以维持信息完整性

活跃查询掩码: (MiQ)n,:={1,if (Ai(la))n,2>τ or i=10,otherwise(\mathbf{M}^{Q}_i)_{n,:} = \begin{cases} \mathbf{1}, & \text{if } (\mathbf{A}^{(\text{la})}_i)_{n,2} > \tau \text{ or } i = 1 \\ \mathbf{0}, & \text{otherwise} \end{cases}

3.3 KV 选择:头级动态预算分配

核心思想:基于最平坦注意力头确定统一 token 预算,确保所有头的注意力召回率。

具体方法:

  1. 计算累积注意力分数:对每个头 ii,计算每个键 kk 的累积注意力分数 ai,k=∑m(Ai)k,ma_{i,k} = \sum_m (\mathbf{A}_i)_{k,m}

  2. 识别最平坦头:通过计算 aia_i 的峰度(kurtosis)rir_i 评估注意力稀疏度,rir_i 最小的头即为最平坦头

  3. 确定共享预算 bb: b=min⁡{b∈Z  |  ∑j=1ba∗sorted(j)≥p×N}b = \min\left\{b \in \mathbb{Z} \;\middle|\; \sum_{j=1}^{b} a_{*}^{\text{sorted}(j)} \geq p \times N\right\}

其中 NN 是查询数量,pp 是控制保留注意力比例的阈值。

  1. 构建键掩码: (MiK)n,:={1,if ai,n≥aisorted(b)0,otherwise(\mathbf{M}_{i}^{K})_{n,:} = \begin{cases} \mathbf{1}, & \text{if } a_{i,n} \geq a_{i}^{\text{sorted}(b)} \\ \mathbf{0}, & \text{otherwise} \end{cases}

由于键和值对天然耦合,设置 MiV=MiK\mathbf{M}_{i}^{V} = \mathbf{M}_{i}^{K}。

设计优势:

  • 在预定义全局 Top-k 策略(高效但固定)和逐头动态分配(自适应但计算慢)之间取得平衡
  • 通过峰度识别最平坦头,避免逐头计算预算的开销
  • 支持 GPU 批处理的高效实现

3.4 KV 缓存瘦身:头级冗余消除

核心思想:在解码阶段,根据查询分类选择性获取视觉 KV 缓存。

具体方法:

  • 使用方程 (3) 探测解码查询模式,识别惰性解码查询
  • 构建解码查询掩码 Miq\mathbf{M}^{q}_i
  • 仅对活跃查询对应的头获取视觉 KV 缓存,跳过惰性查询对应的头

解码注意力计算: Oi=σ(qi[Kivdiag(Miq),Kit,Kia]⊤di)[Vivdiag(Miq),Vit,Via]\mathbf{O}_i = \sigma\left(\frac{\mathbf{q}_i [\mathbf{K}^{v}_i \text{diag}(\mathbf{M}^{q}_i), \mathbf{K}^{t}_i, \mathbf{K}^{a}_i]^{\top}}{\sqrt{d_i}}\right) [\mathbf{V}^{v}_i \text{diag}(\mathbf{M}^{q}_i), \mathbf{V}^{t}_i, \mathbf{V}^{a}_i]

注意:惰性解码查询对应的头不会被完全剪枝,因为它们仍然会关注文本 token 和已解码答案的 KV 缓存。

3.5 块状探测与稀疏 Flash Attention 内核

  • 采用块状探测策略(block size = 256),通过在序列维度上对查询和键进行池化来近似全注意力
  • 使用定制的块状稀疏 Flash-Attention 内核进行高效注意力处理
  • 为避免为选中的查询定制探测注意力掩码的开销,对所有查询应用池化

四、核心创新

4.1 创新点总结

创新点描述优势
训练感知稀疏注意力训练和推理阶段均应用相同稀疏注意力消除训练-推理差距
惰性-活跃查询分类基于注意力汇聚点和视觉键池化的二分类移除冗余查询,减少计算
头级动态预算分配基于最平坦头的峰度确定统一预算平衡效率与注意力召回率
KV 缓存瘦身根据解码查询模式选择性获取 KV 缓存减少解码阶段内存访问
多维度稀疏化同时在查询、KV、头三个维度进行稀疏化细粒度 token 选择

4.2 与现有方法的对比

方法训练感知查询选择KV 选择头级适配解码优化
FastV否否Top-k否否
MInference否否模式搜索是否
ZipVL否否Top-p否是
MOBA是否块级否否
OmniSparse是是头级动态是是

4.3 关键技术细节

查询冗余性分析(如图 3 所示):

  • 不同注意力头的查询关注相似的 token
  • 空间相邻位置的查询功能重叠
  • 时间相邻位置的查询功能重叠
  • 这种冗余性使得查询选择成为可能

最平坦头策略的优势:

  • 最平坦头需要最大的 token 预算以保持注意力召回率
  • 使用该预算作为统一基准,确保所有头的召回率不低于阈值
  • 过度选择(over-selection)在可接受范围内

五、实验结果

5.1 实验设置

配置项详情
基础模型LLaVA-Video (Qwen2.5-7b-Instruct 作为 LLM 骨干)
视觉编码器SigLip-400M
适配器2 层 MLP,每帧编码为 256 个 token
训练数据Long-VITA 训练数据
上下文长度256k 和 1M tokens
训练硬件256 块 H100 GPU
超参数τ=0.08, p=0.82(训练和推理)

5.2 训练感知稀疏注意力对比(Table 1)

模型推理方法Atten FLOPs 减少KV Cache 减少ActNet-QAVideoDCNext-QAVideoMME
baseline-256kFull0%0%57.43.7279.063.6
baseline-256kFastV71.7%46.4%55.83.6878.463.3
baseline-256kMInference35.3%0%56.33.7078.363.5
baseline-256kZipVL63.5%40.2%56.93.6978.363.5
baseline-256kOmniSparse72.6%53.4%57.43.7179.163.5
MOBA-256kMOBA84%0%55.43.6278.863.4
OmniSparse-256kOmniSparse85.7%66.8%57.63.7278.963.9
OmniSparse-1MOmniSparse86.1%67.1%58.23.7479.564.0

关键发现:

  • OmniSparse 在匹配全注意力性能的同时,实现了 85.7% 的 FLOPs 减少和 66.8% 的 KV 缓存减少
  • 相比 MOBA,OmniSparse 在 ActivityNet-QA 上提升 2.2%
  • 训练感知一致性带来额外 13.1% 的 FLOPs 减少和 13.4% 的内存减少

5.3 训练无关稀疏注意力对比(Table 2)

模型方法Atten FLOPs 减少KV Cache 减少ActNet-QAVideoDCNext-QAVideoMME平均
LongVA-7bFull0%0%50.53.1467.552.950.6
LongVA-7bFastV71.7%46.4%49.73.0666.952.049.8
LongVA-7bOmniSparse82.2%64.9%50.43.1368.152.950.7
LLaVA-Video-7bFull0%0%59.63.6681.264.760.5
LLaVA-Video-7bFastV71.7%46.4%59.23.6080.264.159.9
LLaVA-Video-7bOmniSparse75.9%63.7%60.43.6581.364.760.8
LongVILA-7bFull0%0%59.52.7680.760.156.9
LongVILA-7bFastV71.7%46.4%59.12.7280.157.856.1
LongVILA-7bOmniSparse82.3%68.4%59.62.7880.760.057.0

5.4 解码速度对比(Table 3)

方法TTFT (秒)吞吐量 (tokens/s)
FastV13.68.5
MInference12.94.3
ZipVL13.38.4
VisionZip11.69.7
OmniSparse10.111.1

上下文长度 64k,批大小 1,Nvidia H100 GPU。

5.5 不同输入长度的延迟和吞吐量(Table 4)

输入长度方法TTFT (秒)吞吐量 (tokens/s)
16kFlashAttention3.5215.50
16kOmniSparse3.0240.61
32kFlashAttention6.40OOM
32kOmniSparse5.3716.32
64kFlashAttention15.45OOM
64kOmniSparse10.0611.10
128kFlashAttention44.82OOM
128kOmniSparse20.05OOM

Figure 4: 不同序列长度下的 Prefill 延迟和解码内存使用

关键发现:

  • OmniSparse 实现 2.7 倍 prefill 加速
  • 实现 2.4 倍解码内存减少
  • 在 64k 长度下 FlashAttention OOM,而 OmniSparse 仍可运行

5.6 消融实验(Table 5)

稀疏注意力消融:

稀疏注意力查询选择KV 选择Token 比例Attn FLOPs 减少VideoMME
100%--100%0%64.7
✓✓-72.8%54.4%64.7
✓-✓74.2%51.5%64.7
✓✓✓47.1%77.9%64.7

KV 缓存压缩消融:

KV 缓存压缩KV 选择KV 剪枝KV 重组KV Cache 减少VideoMME
----0%64.7
✓✓--15.5%64.7
✓-✓-29.7%64.7
✓--✓51.5%64.7
✓✓✓✓64.1%64.7

Figure 5: 最平坦头和最尖锐头之间的逐层稀疏度差异

关键发现:

  • 查询选择和 KV 选择具有互补性,组合使用可实现 77.9% 的 FLOPs 减少
  • KV 缓存压缩技术组合可实现 64.1% 的内存减少
  • 保留第一个注意力头可避免过度剪枝,仅损失 3% 的额外 FLOPs 减少但带来 0.4% 的准确率提升
  • 过度选择冗余随注意力召回率增加而增加,p=0.82 是性能与效率的平衡点

六、相关工作

6.1 训练无关稀疏注意力

方法核心思想局限性
FastV第 2 层后选择关键 token,减少 1/4 QKV 计算训练-推理差距
FlexPrefill动态搜索每个头的预定义模式训练-推理差距
MInference模态感知动态稀疏注意力,加速 prefill训练-推理差距
VisionZip选择关键视觉 token,合并上下文 token训练-推理差距
AIM基于嵌入相似度逐步剪枝和合并冗余 token训练-推理差距

6.2 长视频多模态大语言模型

方法类别代表方法核心思路
上下文压缩LongVLM, MaxInfo分层合并/选择关键帧
扩展上下文长度LongVA, LongVITA, LongVILA利用/训练长上下文能力

6.3 训练感知稀疏注意力

方法核心思想与 OmniSparse 的区别
MOBA块级注意力选择无查询选择,无头级适配,无解码优化
SeerAttention学习内在稀疏注意力未针对多模态/长视频优化
Native Sparse Attention硬件对齐的可训练稀疏注意力未涉及多维度稀疏化

七、总结

7.1 主要贡献

  1. 提出 OmniSparse:一种训练感知的细粒度稀疏注意力框架,在查询、键值对和注意力头三个维度上减少冗余计算
  2. 多维度稀疏化:动态适应头级多样性以实现高效 prefill,通过跳过惰性解码查询的视觉 KV 获取进一步减少解码阶段内存开销
  3. 显著性能提升:在匹配全注意力性能的同时,实现 2.7 倍 prefill 加速和 2.4 倍解码内存减少

7.2 局限性与未来工作

  • 阈值敏感性:惰性-活跃查询分类的阈值可能因层而异,影响计算效率和模型性能的平衡
  • 未来方向:进一步研究注意力层在视频感知和理解中的作用

7.3 技术亮点

特性描述
训练-推理一致性训练和推理阶段应用相同稀疏注意力
多维度稀疏化查询、KV、头三个维度的细粒度选择
动态预算分配基于峰度的头级自适应预算
双阶段优化Prefill 加速 + 解码内存优化
高效实现块状探测 + 定制稀疏 Flash-Attention 内核

八、参考资源

8.1 论文链接

资源链接
arXiv 论文https://arxiv.org/abs/2511.12201
PDF 下载https://arxiv.org/pdf/2511.12201
HTML 版本https://arxiv.org/html/2511.12201v1

8.2 关键数据集

数据集用途链接
ActivityNet-QA视频问答https://arxiv.org/abs/1906.06147
VideoMME多模态视频评估https://arxiv.org/abs/2405.21075
NExT-QA时序问答https://arxiv.org/abs/2105.08276
VideoDC视频详细描述https://huggingface.co/datasets/lmms-lab/VideoDetailCaption
EgoSchema长视频理解https://arxiv.org/abs/2308.09126
LongVideoBench长上下文视频理解https://arxiv.org/abs/2407.15754

8.3 相关模型和工具

模型/工具描述链接
LLaVA-Video视频指令调优模型https://arxiv.org/abs/2410.02713
LongVA长上下文视觉语言模型https://arxiv.org/abs/2406.16852
LongVILA长上下文视觉语言模型https://arxiv.org/abs/2408.10188
Qwen2.5-7b-InstructLLM 骨干https://arxiv.org/abs/2412.15115
SigLip-400M视觉编码器https://arxiv.org/abs/2303.15343
FlashAttention-2高效注意力实现https://arxiv.org/abs/2307.08691

8.4 关键参考文献

  1. Vaswani et al. (2017). “Attention is All You Need.” NeurIPS.
  2. Chen et al. (2024a). “An Image is Worth 1/2 Tokens After Layer 2.” ECCV.
  3. Li et al. (2025b). “MMInference: Accelerating Pre-filling for Long-Context VLMs.”
  4. He et al. (2024). “ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification.”
  5. Lu et al. (2025). “MoBA: Mixture of Block Attention for Long-Context LLMs.”
  6. Gao et al. (2024). “SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs.”
  7. Yuan et al. (2025). “Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention.”
  8. Lin et al. (2025). “Twilight: Adaptive Attention Sparsity with Hierarchical Top-p Pruning.”
  9. Xiao et al. (2023). “Efficient Streaming Language Models with Attention Sinks.”
  10. Dao (2024). “FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.” ICLR.

分析日期:2025-05-30 论文版本:v2 (2025-11-18)