The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系
75 posts tagged with "long-context"
最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系
ResKV 将固定 KV 预算划分为精确主缓存和紧凑残差缓存,通过共享 softmax 重建被丢弃 token 的注意力贡献,显著提升长上下文推理效率
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
A selective KV recomputation method using attention-norm criteria from query to context tokens to identify information-flow-critical tokens for long-context inference
Model-agnostic extractive prompt compression framework using sentence-frequency-ordered lexical trie to prevent theme collapse under tight budgets
快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention
Thong Thanh Nguyen 的博士论文,从时间维度系统性地推进视频理解,围绕三大研究目标(推进边界 / 高效捕获时间 / 有效捕获时间)提出五项贡献:(1) MAMA 用减性角度间隔对比 + 元优化样本加权自动标注海量视频;(2) READ 在轻量适配器瓶颈内嵌 RNN,仅微调适配器即在低资源时间定位/视频摘要上超越全量微调;(3) GSMT 用门控状态空间模型(SSM)对密集采样帧建全局语义,配套 Ego-QA/MAD-QA 长视频问答基准;(4) MCL 用运动感知对比学习 + 强运动 tube 选择做时间全景场景图;(5) MSCL 多尺度跨尺度对比 + 特征金字塔做时间定位;并给出面向时间的 LVLM 训练配方(QueryFormer 接口 + 时间训练方案 + 记忆库 + MoE 四步扩展)。
Position persistent sparse attention leveraging spatial coherence of high-attention tokens across Transformer layers for 2.1× decoding speedup
小米 309B 总参 / 15B 激活的 MoE 推理与 Agent 大模型。混合注意力(5:1 SWA:GA,128 窗口 + 可学习 attention sink,KV/算力近 6× 缩减),27T token 预训练 + MTP,原生 32K 扩展到 256K。提出 Multi-Teacher On-Policy Distillation (MOPD):多领域 RL 教师提供 token 级 KL 稠密奖励 + ORM 结果奖励,学生在自身分布上蒸馏多专家。以 1/2、1/3 的参数比肩 DeepSeek-V3.2 与 Kimi-K2;SWE-Bench Verified 73.4%。三层 MTP 做自投机解码,接受长度达 3.6、解码提速 2.6×。
RateQuant用率失真理论把KV cache按注意力头分配bit宽度:假设量化MSE满足$D(b)=\alpha\beta^{-b}$,用reverse waterfilling闭式求最优分配,并识别distortion model mismatch这一失效模式——不同量化器$\beta$从3.6到5.3变化,套错模型比uniform更差。校准per-quantizer $\beta$并对K/V单独分配预算后,Qwen3-8B在KIVI 2.5bit的PPL从49.3降到14.9(−70%),QuaRot改善6.6 PPL;全流程校准仅1.6秒,推理零开销。
Tangram 利用「Head-wise 保留量存在输入无关的两级结构」的观察,把非均匀 KV 压缩静态化:Budget Reservation 在调度时固定每头预算、Ragged Paging 用同预算 head 组成独立 page 表消除碎片、AOT Load Balancing 预算 CTA 划分。作为 vLLM drop-in 层,在五个模型 SCBench 上匹配原精度同时端到端吞吐相较 Full-KV 最高提升 2.6×。
Tropical 在 disaggregated LLM 服务基础上引入 SLO-aware 多路复用:Multiplexing Toggle 用 slack 检测把短 prefill 借道 decode worker 执行、长 prefill 走独占 prefill worker,兼得低排队与低干扰。在 Mooncake 真实 trace 上 SLO 内可服务请求提升 2.02×,P90 TTFT 相比 DistServe 优化 9×,P90 TPOT 相比 vLLM 优化 2.33×。
块级粒度的灵活上下文并行范式,通过任意点对点通信 + bin-packing 调度,在 256 张 NVIDIA GPU 上实现近线性扩展,attention MFU 提升 1.13x–2.21x
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速
将位置无关 KV 复用(PIC)的恢复粒度从「token 级」提升到「注意力头级」——离线将每个 (layer, head) 分类为 global(12-15%,复用时重算)/ local(85-88%,滑窗内原样复用),配合 token 选择性稀疏 FFN 攻克短上下文 FFN 瓶颈;再以 SegPagedAttention 按 (layer, head) 分页物化头级稀疏、走 FlashAttention 快路避开 attn_mask 4.9-7.6× 惩罚。8×H800 上 TTFT 加速 1.6-3.54×(DeepSeek-V4 达 5.16×)、并发会话 4.7-7.8×、prefill FLOPs 降 67-79.5%,精度媲美稠密
通过Reference Sliding Window Attention实现恒定KV缓存,支持单次前向传播解析数十页文档
CXL-Enabled KV-Cache Management Beyond GPU Limits
提出 CPU-GPU 混合注意力框架 HybridGen,通过注意力 logit 并行化、反馈调度器和语义感知 KV Cache 映射,实现长上下文 LLM 推理的高效协同计算
开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解
端到端序列到序列学习的开创性工作
实时自回归长视频扩散生成技术
实时交互式运动控制视频生成
SparseVLM 和 SparseVLM+ 的完整技术分析,涵盖文本引导的视觉Token稀疏化方法、注意力重力校正、优先头选择等核心创新
通过低秩Key缓存和CPU卸载Value缓存实现高吞吐量长上下文LLM推理
通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM
发现Attention Sink现象,提出StreamingLLM框架实现无限长度流式推理
通过区分检索头和流式头,同时优化长上下文LLM推理的内存和计算效率
通过重要性基�的固定容量循环状态实现视频VLM的线性时间预填充,在长视频理解中接近全自注意力性能
分离prefill和decoding阶段的KV缓存压缩框架,解决长文本生成中的heavy hitter偏移问题
基于分块软匹配的在线KV缓存聚类框架,实现80%内存节省和3.19倍解码加速
面向单个消费级GPU的高效长上下文LLM推理系统,通过自适应分层KV管理实现3.46倍加速
梯形KV缓存模式,实现长上下文LLM推理的高效内存管理与连续生成
面向延迟最优的混合小语言模型,通过深度-宽度优化、算子搜索和权重归一化实现SOTA效率
通过块级并行计算实现长序列Transformer训练,支持32倍更长上下文
面向长上下文LLM服务的分层上下文缓存框架
面向大语言模型训练的工作负载均衡4D并行
通过非对称深度哈希加速长上下文LLM推理
支持超长序列 Transformer 模型训练的系统优化
用于近无限上下文的环形注意力与分块 Transformer
通过推测流水线执行实现高效解码
针对因果 Transformer 的更快 Ring Attention 算法
高效扩展大语言模型上下文长度的训练方案
BFloat16精度下RoPE在长上下文训练中的问题与AnchorAttention解决方案
支持100万token上下文长度的Qwen2.5模型
将MoE原理应用于注意力机制的长上下文LLM
ByteScale:在超过 12,000 GPU 上高效扩展 2048K 上下文 LLM 训练
从 128K 到 4M:高效训练超长上下文大语言模型
基于稀疏注意力的长上下文泛化
基于语义聚类的高效KV缓存管理
使SSD支持的KV缓存在长上下文LLM服务中实用化
通用长上下文预填充加速框架,支持混合架构和连续批处理
重新定义长上下文LLM推理中的KV缓存驱逐问题
基于全局保留门的KV缓存驱逐方法,可改善长上下文推理性能
Qwen-Image-2.0 全能图像生成基础模型,支持文本到图像生成和图像编辑。
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
UniPrefill 提出通用的长上下文 Prefill 加速框架。
USP 提出统一序列并行方法,用于长上下文生成式 AI 模型。
大语言模型长上下文推理优化技术综述,涵盖 KV Cache 压缩、注意力优化等。
TriForce 提出层次化推测解码方法,实现长序列生成的无损加速。
FlashAttention 常用接口介绍,包括基本使用方法和性能优化技巧。
FCP:面向异构长上下文数据的自适应上下文并行策略,支持非2幂并行度、毫秒级调度开销,训练吞吐提升1.46倍
基于扩散的大型语言模型(dLLMs)是一种有前景的范式,利用同时去噪实现全局规划和迭代细化。虽然这些能力对于长上下文生成特别有利,但部署此类模型面临来自严重系统低效的内存容量障碍。
标准 Transformer 注意力机制的二次复杂度在长上下文场景下成为瓶颈。虽然线性注意力方法(如 Mamba2、Gated DeltaNet)可以降低计算复杂度,但它们在表达能力和实际性能上通常不如全注意力机制。
长上下文建模能力已成为下一代大语言模型(LLM)的关键能力。许多新兴应用(如长文档理解、仓库级代码分析、自主 Agent 系统、长链推理)需要LLM 处理跨越数十万到数百万 token 的序列。
Transformer 注意力机制的二次复杂度在长上下文训练中成为主要瓶颈。当前研究沿两个方向推进:
通过为每个 token 分配独立噪声级别,统一自回归预测与全序列扩散,在视频生成、决策规划和机器人控制中实现稳定长序列生成和灵活引导
大语言模型(LLM)处理长上下文的能力对 LLM agents 和长推理任务等新兴应用至关重要,这些应用现在可以处理扩展到数百万 token 的上下文窗口。在这些高要求的长上下文场景中,标准自回归解码的高推理延迟成为一个显著的瓶颈。
LServe通过统一稀疏注意力机制实现高效长序列LLM服务,优化KV缓存管理和注意力计算。
在现代大语言模型(LLM)推理引擎中,改善首 token 延迟(Time-to-First-Token, TTFT)是一个至关重要的目标。优化 TTFT 可以直接提高最大 QPS,并满足许多关键应用的需求。
通过长和丰富上下文(LRC)建模,增强视频多模态大语言模型的细粒度细节感知和长时序结构捕获能力
Marconi为混合架构LLM提出高效前缀缓存机制,支持注意力层和非注意力层的统一缓存管理。
提出全流水线分布式Transformer架构,支持超长上下文语言模型的高效训练。
SampleAttention通过自适应结构化稀疏注意力实现长上下文LLM推理的近无损加速,显著降低首token延迟。