Flash Sparse Attention: An Alternative Efficient Implementation of Native Sparse Attention Kernel
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
98 posts tagged with "efficient-attention"
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention
基于分层 Top-p 剪枝的自适应注意力稀疏框架,加速长上下文 LLM 推理
训练无关的通用稀疏注意力,加速所有模型推理(语言、图像、视频生成)
首个 FP4 微缩放注意力推理加速与 INT8 可训练注意力探索
基于 FP8 Matmul + FP16 累加器指令进一步加速 SageAttention2 的注意力量化内核实现,在保持精度的同时取得相对 FlashAttention 最高 3.9× 加速。
基于分层 Top-p 的稀疏注意力框架,通过聚类级估计 + Token 级自适应分配优化长上下文 LLM 推理
arXiv 2512.18134,来自 CudaDMA/Singe 同一血统的团队(Bauer/Aiken + Stanford/NVIDIA/Toronto)。首次把软件流水线(Software Pipelining, SWP)与 warp 特化(Warp Specialization, WS)表述为一个可交给现成约束求解器求解的联合优化问题。核心洞见:SWP 与 WS 不应分开处理——WS 恰恰是实现 Tensor Core GPU 上 SWP schedule 所必需的代码生成手段(解决多 warp 协作发射 TC、寄存器工作集、变长延迟操作、阻塞同步中断四大难题)。方法上先用模调度(modulo scheduling,ℤLP 最优求解)得到初始 initiation interval I 与 modulo schedule M,再将 M/I 展开为一段直线程序 Q,在其上叠加 SWP 约束(Uniqueness/Consistency/Completion/Dependence/Capacity)、内存感知约束(活跃变量 live 传播 + 内存容量/SSA)、warp 分配约束(Warp Uniqueness/Variable Latency/Register Limit/Cross-Warp Spills/Concurrency),交给 SMT 求解器(Yices2 QFLIA)联合求解得到 M*、I*、A*。关键实现技巧:成本归一化(cycle count 比值保持的 ℤLP,令问题可解)、变长流式操作(TMA load)零延迟建模 + 深度作为 autotuning 参数、不可满足时单调增大 I/L 重试。系统 Twill 从 Triton TTGIR 抽取依赖图,无启发式、易扩展新架构、对单层循环保证最优。评估在 H100(Hopper)/B200(Blackwell) 上对 Flash Attention 前向/后向传播自动重新发现 FA3(ping-pong scheduling)与 FA4(三组 warp 策略)专家手工方案,性能达 cuDNN/FA 手工实现的 1%~2% 以内。
面向大规模视频扩散 Transformer(DiT)的稀疏注意力加速框架。核心洞见:生成质量并非由稀疏率本身决定,而取决于稀疏掩码与全注意力 tile 级几何结构的对齐程度。Veda 把 tile 选择建模为对全注意力的显式重建问题:(1) 蒸馏式 tile 打分——用轻量估计器从全注意力 backbone 蒸馏 tile 级分数,配合 TripPool(Avg/Max/Min 三元统计)与逐头 MLP 投影降低估计误差,训练时对 backbone 特征做 stop-gradient 解耦掩码学习与特征学习;(2) 逐头 tiling 搜索(Head-aware Tiling)——为每层每头分配 (p_t,p_h,p_w) 分块配置以最小化稀疏输出与全注意力输出的 Frobenius 误差;(3) 硬件高效 tile-skipping kernel(ThunderKittens/Hopper TMA+Warp Specialization,达 FA3 80% MFU)。在 Waver-T2V-12B 720P 10 秒视频上取得 5.1× 端到端、10.5× 自注意力加速,注意力开销从 92% 降至 50%,且序列越长收益越大。
CGO 2026 论文,Cornell + NVIDIA 合作。提出 Tawa——首个面向现代 NVIDIA GPU(Hopper+)的**全自动 warp 特化编译流程**,从未经修改、无标注的 Triton 程序出发,自动分区为 producer/consumer warp group,自动管理软件流水线。核心创新是**异步引用(asynchronous reference, aref)**——一种形式化语义保证的 IR 抽象,将 warp 间通信建模为带硬件 mbarrier 的单槽信道(put/get/consumed),封装 TMA 描述符配置、mbarrier 初始化/相位管理等底层细节。编译器三步变换:① 基于语义标记的任务感知分区(iteration stmt → producer, tile stmt → consumer,依赖闭包 + 计算复制);② 基于 aref 的多槽环形缓冲自动构建跨 warp 数据流;③ 多级软件流水线(细粒度:CUDA 地址计算与 MMA 重叠;粗粒度:CUDA Core 变换与 TC 流水线装配线)。额外优化:协作计算 warp group(多 WG 共享 tile 寄存器预算)、持久化 kernel。在 H100 上:GEMM 达 cuBLAS 水平(FP16 +1.01×,FP8 +1.06×);Attention 达 FA3 手工优化内核的 96%,超 Triton 1.21×。ablation 显示 +Auto WS 提升 3.78×,最终 GEMM 达 718 TFLOPs/s(baseline 的 ~7×)。
LinGen 用线性复杂度的 MATE 模块(Bidirectional Mamba2 + TESA)替换 DiT 中二次复杂度的自注意力,首次实现单 GPU 上高分辨率分钟级视频生成,最高 15× FLOPs 加速。
PSA提出渐进式稀疏注意力机制,通过阈值驱动的自适应KV块选择替代固定top-k策略,结合流水线迭代执行和统一内存管理,在保证精度的同时最大化推理吞吐。
腾讯轻量级开源视频生成模型,仅83亿参数即达SOTA视觉质量,支持SSTA稀疏注意力加速、视频超分到1080p、消费级GPU推理
Patch-level pipeline parallelism for DiT inference that eliminates pipeline bubbles and enables PCIe-scale multi-GPU inference at 8K resolution
Position persistent sparse attention leveraging spatial coherence of high-attention tokens across Transformer layers for 2.1× decoding speedup
A quantitative analysis of FP8 E4M3 attention P-casting revealing P-collapse under attention sink and characterizing S=256 as the optimal static scaling factor
A general-purpose interactive text/image-to-video world model supporting camera navigation, scene revisits, and promptable events with 16 FPS streaming on 8x RTX 5090
A benchmark framework for evaluating LLMs' ability to generate fast and correct GPU kernels across 250 PyTorch workloads
A systematic analysis of NVIDIA NCCL's internal architecture covering API, protocols, transports, and collective algorithms
块级粒度的灵活上下文并行范式,通过任意点对点通信 + bin-packing 调度,在 256 张 NVIDIA GPU 上实现近线性扩展,attention MFU 提升 1.13x–2.21x
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速
Generative Recommenders (GR) 将推荐重新定义为序列转导任务,HSTU 编码器比 FlashAttention2 Transformer 快 5.3x-15.2x,1.5 万亿参数模型在线 A/B 测试提升 12.4%
滑动瓦片注意力加速视频扩散 Transformer 推理
基于可学习 token 稀疏化的 DiT 加速框架
RTPurbo: 将全注意力 LLM 转化为稀疏模型,仅需数百步训练
使用模型并行训练数十亿参数语言模型
神经语言模型的缩放定律:模型大小、数据集大小和计算量与损失之间的幂律关系
无训练方法解决自回归视频扩散模型的长视频生成退化问题
基于异步引用的现代 GPU 自动 Warp 特化编译器
面向最优每 FLOP 和每参数精度的 MoE 架构设计
分解大语言模型的高效并行推理系统
一种将全局剪枝分解为可管理子问题的LLM压缩框架
首个免训练、即插即用的VLA推理加速框架,通过动作复用和视觉token剪枝实现55.7% FLOPs降低和36.0%延迟降低
发现Attention Sink现象,提出StreamingLLM框架实现无限长度流式推理
通过区分检索头和流式头,同时优化长上下文LLM推理的内存和计算效率
基于微缩放和自动缩放的高效FP8 LLM训练方法,实现34%吞吐量提升
基于softmax阈值的动态块稀疏注意力,无需训练和预计算,同时加速预填充和解码阶段
通过重要性基�的固定容量循环状态实现视频VLM的线性时间预填充,在长视频理解中接近全自注意力性能
系统梳理Sparse Attention在LLM推理中的技术演进、核心方法与工程实践
面向扩散Transformer的层缓存加速方法,通过可微分路由器学习最优缓存策略
从 Llama 3-8B 高效上循环训练 MoE 模型
面向延迟最优的混合小语言模型,通过深度-宽度优化、算子搜索和权重归一化实现SOTA效率
通过块级并行计算实现长序列Transformer训练,支持32倍更长上下文
面向推理最优的MoE大语言模型扩展律研究
首个将FlashAttention与量化算法结合的注意力加速方案,实现1.8倍延迟加速和2.37倍吞吐量提升
FlashInfer:面向LLM推理服务的高效可定制注意力引擎,通过块稀疏格式、JIT编译和负载均衡调度实现高性能注意力计算
利用时空稀疏性加速视频扩散Transformer推理,实现2.28×/2.33×端到端加速
通过灵活高效的卸载打破内存约束实现设备端LLM推理
通过反斜线评分实现高效块稀疏注意力,加速长上下文推理高达13.5倍
面向生成式推荐的高效推理系统,通过xAttention/xBeam/xSchedule三层优化实现3.49倍吞吐量提升
面向扩散Transformer分布式推理的可扩展序列并行引擎
优化树结构LLM推理的注意力内核和运行时
软件定义的流水线编译器,实现异构硬件单元的高效计算流水线
首个在公平比较下超越全注意力的混合线性注意力架构,通过KDA实现75% KV缓存减少和6倍解码吞吐量提升
面向设备端LLM的动态分层稀疏注意力长上下文建模
通过更好的并行性和工作分配实现更快的注意力
用于近无限上下文的环形注意力与分块 Transformer
针对因果 Transformer 的更快 Ring Attention 算法
面向百万级LLM推理的空间压缩KV缓存
通过动态稀疏注意力加速长上下文LLM预填充
基于GPU虚拟内存管理的高效LLM推理张量结构
面向GPU集群长上下文注意力的拓扑感知解码
面向大语言模型的混合精度自回归并行推理
BFloat16精度下RoPE在长上下文训练中的问题与AnchorAttention解决方案
支持100万token上下文长度的Qwen2.5模型
KVTuner:敏感度感知的层级混合精度 KV 缓存量化
硬件对齐且可原生训练的稀疏注意力机制
将MoE原理应用于注意力机制的长上下文LLM
基于稀疏注意力的长上下文泛化
长上下文注意力基准测试:从内核效率到分布式上下文并行
通过核心注意力分解实现高效长上下文语言模型训练
受 LLM 启发的序列优先点击率预测建模范式
LLM推理中KV缓存管理策略的比较表征
面向大规模 LLM 训练和推理的统一细粒度模拟器
Mixture-of-Experts (MoE) 已被 DeepSeek、GPT、Llama、Qwen 等主流大模型采用,以降低计算开销。然而,MoE 中的 Expert Parallelism (EP) 需要频繁的 GPU 间通信(Dispatch 和 Combine),这成为性能瓶颈——通...
GLM-5 模型技术报告,探索从 Vibe Coding 到 Agentic Engineering 的演进。
NSA 提出原生可训练稀疏注意力机制,实现高效长上下文推理。
VSA 提出可训练稀疏注意力机制,加速视频扩散模型推理。
大语言模型长上下文推理优化技术综述,涵盖 KV Cache 压缩、注意力优化等。
FlashAttention 常用接口介绍,包括基本使用方法和性能优化技巧。
基于扩散的大型语言模型(dLLMs)是一种有前景的范式,利用同时去噪实现全局规划和迭代细化。虽然这些能力对于长上下文生成特别有利,但部署此类模型面临来自严重系统低效的内存容量障碍。
ProCache提出约束感知的特征缓存与选择性计算方法,加速扩散Transformer模型的推理过程。
强化学习 (RL) 已成为提升大语言模型 (LLM) 推理能力的事实范式。然而,构建一个高效、可扩展、可抢占的 RL 训练框架面临四大挑战:
LLM 服务越来越多地被 decode attention 主导,这是一个 memory-bound 操作,因为需要从全局内存加载大量的 KV cache。
OmniSparse提出训练感知的细粒度稀疏注意力机制,优化长视频多模态大语言模型的推理效率。
标准 Transformer 注意力机制的二次复杂度在长上下文场景下成为瓶颈。虽然线性注意力方法(如 Mamba2、Gated DeltaNet)可以降低计算复杂度,但它们在表达能力和实际性能上通常不如全注意力机制。
Transformer 注意力机制的二次复杂度在长上下文训练中成为主要瓶颈。当前研究沿两个方向推进:
用于可扩展百万Token推理的上下文并行技术
通过异步KV缓存预取技术加速LLM推理吞吐量,减少内存访问延迟。
大语言模型(LLM)处理长上下文的能力对 LLM agents 和长推理任务等新兴应用至关重要,这些应用现在可以处理扩展到数百万 token 的上下文窗口。在这些高要求的长上下文场景中,标准自回归解码的高推理延迟成为一个显著的瓶颈。
DiLoCo 等分布式优化方法将更新分为两部分:
通过可学习的 AttnGate 门控机制和自蒸馏训练,直接从 LLM 学习块级注意力稀疏性,128K 序列下实现 7.3× 内核加速。
SampleAttention通过自适应结构化稀疏注意力实现长上下文LLM推理的近无损加速,显著降低首token延迟。
针对扩散 Transformer 的注意力压缩后训练方法,通过三种冗余消除技术实现高达 76% FLOPs 减少
LeanAttention提出硬件感知的可扩展注意力机制,优化Transformer解码阶段的注意力计算效率。
多层级张量程序超级优化器,通过统一搜索空间生成高效注意力内核
分布式低通信语言模型训练方法,通过内层优化器减少跨设备通信