Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
训练无关动态稀疏注意力:通过查询依赖高斯校准阈值、在线 Softmax 内联稀疏化和零阶泰勒代理分数复用,在不修改权重的情况下为视频生成 DiT 提供 2.0×–5.1× 端到端加速
51 posts tagged with "sparse-attention"
训练无关动态稀疏注意力:通过查询依赖高斯校准阈值、在线 Softmax 内联稀疏化和零阶泰勒代理分数复用,在不修改权重的情况下为视频生成 DiT 提供 2.0×–5.1× 端到端加速
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
A novel fused Indexer-TopK kernel that exploits the curse of dimensionality to accelerate sparse attention in long-context LLM inference, achieving up to 3.38x speedup on B200.
面向视频 DiT 推理的训练无关稀疏注意力系统,通过运行时负载均衡(RLB)和松弛感知稀疏增强(SASA)解决 Top-p 路由在多 GPU 序列并行下的负载不均衡问题
面向 LLM 训练的 GQA-based blockwise sparse attention 机制,通过轻量 Index Branch 实现 per-GQA-group Top-k 选择,在 109B MoE 模型上实现 28.4× FLOPs 减少和 14.2× prefill / 7.6× decoding 加速
一种基于 EMA 预测器和在线 Softmax 增量修复的投机注意力运行时,打破 DSA 中 selection-to-attention 的关键路径依赖
Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding
Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding via Speculative Execution and Incremental Repair
基于 Johnson-Lindenstrauss 引理的旋转二进制量化 KV Cache 框架,通过高吞吐 binary-INT4 算术实现无偏代理分数估计,支持自适应 Top-p 检索,在长上下文推理中实现 2.16× 端到端加速且精度几乎无损
在华为昇腾 NPU SuperPOD 上对万亿参数 MoE 模型(DeepSeek-V4)进行全参数后训练的系统优化与面向运筹学的 CPT-SFT 工作流
Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
作为预训练长上下文 Transformer 的即插即用分层路由算法,保留原始注意力投影,仅通过查询-键内容路由选择历史 token 进行精确 token 级注意力计算
基于分层 Top-p 剪枝的自适应注意力稀疏框架,加速长上下文 LLM 推理
训练无关的通用稀疏注意力,加速所有模型推理(语言、图像、视频生成)
首个 FP4 微缩放注意力推理加速与 INT8 可训练注意力探索
基于分层 Top-p 的稀疏注意力框架,通过聚类级估计 + Token 级自适应分配优化长上下文 LLM 推理
TriRoute — 单一轻量控制器联合决策注意力分辨率、FFN 专家选择与 KV-Cache 位宽,端到端可训练,单一预算旋钮扫出 Pareto 前沿,缓解跨轴路由坍缩级联
面向大规模视频扩散 Transformer(DiT)的稀疏注意力加速框架。核心洞见:生成质量并非由稀疏率本身决定,而取决于稀疏掩码与全注意力 tile 级几何结构的对齐程度。Veda 把 tile 选择建模为对全注意力的显式重建问题:(1) 蒸馏式 tile 打分——用轻量估计器从全注意力 backbone 蒸馏 tile 级分数,配合 TripPool(Avg/Max/Min 三元统计)与逐头 MLP 投影降低估计误差,训练时对 backbone 特征做 stop-gradient 解耦掩码学习与特征学习;(2) 逐头 tiling 搜索(Head-aware Tiling)——为每层每头分配 (p_t,p_h,p_w) 分块配置以最小化稀疏输出与全注意力输出的 Frobenius 误差;(3) 硬件高效 tile-skipping kernel(ThunderKittens/Hopper TMA+Warp Specialization,达 FA3 80% MFU)。在 Waver-T2V-12B 720P 10 秒视频上取得 5.1× 端到端、10.5× 自注意力加速,注意力开销从 92% 降至 50%,且序列越长收益越大。
小米 309B 总参 / 15B 激活的 MoE 推理与 Agent 大模型。混合注意力(5:1 SWA:GA,128 窗口 + 可学习 attention sink,KV/算力近 6× 缩减),27T token 预训练 + MTP,原生 32K 扩展到 256K。提出 Multi-Teacher On-Policy Distillation (MOPD):多领域 RL 教师提供 token 级 KL 稠密奖励 + ORM 结果奖励,学生在自身分布上蒸馏多专家。以 1/2、1/3 的参数比肩 DeepSeek-V3.2 与 Kimi-K2;SWE-Bench Verified 73.4%。三层 MTP 做自投机解码,接受长度达 3.6、解码提速 2.6×。
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速
将位置无关 KV 复用(PIC)的恢复粒度从「token 级」提升到「注意力头级」——离线将每个 (layer, head) 分类为 global(12-15%,复用时重算)/ local(85-88%,滑窗内原样复用),配合 token 选择性稀疏 FFN 攻克短上下文 FFN 瓶颈;再以 SegPagedAttention 按 (layer, head) 分页物化头级稀疏、走 FlashAttention 快路避开 attn_mask 4.9-7.6× 惩罚。8×H800 上 TTFT 加速 1.6-3.54×(DeepSeek-V4 达 5.16×)、并发会话 4.7-7.8×、prefill FLOPs 降 67-79.5%,精度媲美稠密
PRR 推理运行时,通过 EMA 预测器+增量修复内核将动态稀疏注意力的选择-注意力依赖瓶颈降低 30%+
开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解
利用稀疏注意力模式加速视频扩散 Transformer 推理
基于softmax阈值的动态块稀疏注意力,无需训练和预计算,同时加速预填充和解码阶段
系统梳理Sparse Attention在LLM推理中的技术演进、核心方法与工程实践
基于KV缓存管理的LLM加速综述,系统梳理Token级、模型级和系统级三层优化策略
FlashInfer:面向LLM推理服务的高效可定制注意力引擎,通过块稀疏格式、JIT编译和负载均衡调度实现高性能注意力计算
通过反斜线评分实现高效块稀疏注意力,加速长上下文推理高达13.5倍
面向生成式推荐的高效推理系统,通过xAttention/xBeam/xSchedule三层优化实现3.49倍吞吐量提升
面向设备端LLM的动态分层稀疏注意力长上下文建模
通过动态稀疏注意力加速长上下文LLM预填充
硬件对齐且可原生训练的稀疏注意力机制
基于稀疏注意力的长上下文泛化
长上下文注意力基准测试:从内核效率到分布式上下文并行
GLM-5 模型技术报告,探索从 Vibe Coding 到 Agentic Engineering 的演进。
NSA 提出原生可训练稀疏注意力机制,实现高效长上下文推理。
VSA 提出可训练稀疏注意力机制,加速视频扩散模型推理。
大语言模型长上下文推理优化技术综述,涵盖 KV Cache 压缩、注意力优化等。
OmniSparse提出训练感知的细粒度稀疏注意力机制,优化长视频多模态大语言模型的推理效率。
长上下文建模能力已成为下一代大语言模型(LLM)的关键能力。许多新兴应用(如长文档理解、仓库级代码分析、自主 Agent 系统、长链推理)需要LLM 处理跨越数十万到数百万 token 的序列。
通过解耦视觉稀疏性,在预填充和解码阶段分别进行查询无关剪枝和查询感知检索,实现高效VLM推理
Transformer 注意力机制的二次复杂度在长上下文训练中成为主要瓶颈。当前研究沿两个方向推进:
LongCat-Flash 技术报告,探索大语言模型高效推理与训练加速。
LongCat-Video 技术报告,探索视频生成与理解的大语言模型方法。
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成
LServe通过统一稀疏注意力机制实现高效长序列LLM服务,优化KV缓存管理和注意力计算。
通过动态输入剪枝和缓存感知掩码实现高效LLM推理,降低计算和内存开销。
通过可学习的 AttnGate 门控机制和自蒸馏训练,直接从 LLM 学习块级注意力稀疏性,128K 序列下实现 7.3× 内核加速。
SampleAttention通过自适应结构化稀疏注意力实现长上下文LLM推理的近无损加速,显著降低首token延迟。