All tags

llm-training

101 posts tagged with "llm-training"

DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention

用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速

SIA: Self Improving AI with Harness & Weight Updates

提出 SIA 自改进循环——由 Feedback-Agent 同时更新任务专属 agent 的「harness(脚手架)」与「模型权重(LoRA)」,打破自改进 AI 的两大孤岛(仅改 scaffold / 仅改 weights)。在中文法律分类、GPU kernel 优化、单细胞 RNA 去噪三个对比领域上,双杠杆组合全面超越单独 scaffold 迭代:LawBench +25.1%、GPU kernel 快 12.4%、去噪 +20.4%(均超先前 SOTA)