The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系
6 posts tagged with "training-free"
最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系
ScalingAttention:通过权重编码的内在稀疏注意力拓扑发现机制(WEST)与保真度感知的稀疏度自适应调节(FAST)以及位级块稀疏注意力内核(crm kernel),实现视频扩散Transformer的高效训练无关推理加速
训练无关动态稀疏注意力:通过查询依赖高斯校准阈值、在线 Softmax 内联稀疏化和零阶泰勒代理分数复用,在不修改权重的情况下为视频生成 DiT 提供 2.0×–5.1× 端到端加速
免训练的两阶段渐进式 token 压缩框架:LLM 前的模态特异结构压缩 + LLM 内的查询条件音视协同精炼
Training-free parallel decoding framework for block-wise diffusion LLMs using gated wavefront execution and heterogeneous wavefront packing
无需训练的视频扩散模型加速策略,通过动态特征复用和 CFG-Cache 实现 1.67x 加速同时保持高质量生成