August 6, 2026 Bole: Efficient Tree Speculation for Hybrid-Attention Language Models 内核-运行时协同设计:通过闭式树验证、值域分块GPU核和因子化推测状态,将混合注意力LLM的树投机解码吞吐量提升至自回归解码的4.72× tree-speculative-decoding hybrid-attention linear-attention gdn llm-inference sglang gpu-kernel-optimization closed-form-parallelization
July 18, 2026 Kwai Summary Attention (KSA):一种序列级 KV Cache 压缩的高效长上下文注意力机制 快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention llm-inference long-context efficient-attention kv-cache sequence-compression hybrid-attention