July 7, 2026 Training Compute-Optimal Large Language Models (Chinchilla) Chinchilla论文提出计算最优的LLM缩放定律:模型大小和训练token数应按同等比例缩放(各为C^0.5),发现当前LLM严重欠训练,Chinchilla(70B/1.4T)在相同计算量下显著超越Gopher(280B)/GPT-3(175B)。 large-language-model model-scaling training-optimization scaling-laws
July 2, 2026 Mimose: An Input-Aware Checkpointing Planner for Efficient Training on GPU Mimose - 输入感知型张量检查点规划器,用于GPU高效训练 gpu-memory checkpointing memory-planner training-optimization dynamic-batching deep-learning-systems