July 7, 2026 Training Compute-Optimal Large Language Models (Chinchilla) Chinchilla论文提出计算最优的LLM缩放定律:模型大小和训练token数应按同等比例缩放(各为C^0.5),发现当前LLM严重欠训练,Chinchilla(70B/1.4T)在相同计算量下显著超越Gopher(280B)/GPT-3(175B)。 large-language-model model-scaling training-optimization scaling-laws
June 26, 2026 Towards Greater Leverage MoE语言模型的效率杠杆缩放定律,通过300+模型训练验证高效MoE架构设计原则 moe scaling-laws efficiency-leverage expert-activation model-architecture compute-optimization