ESC

Type to search articles...

No articles found.

↑ ↓ Navigate ↵ Open
Esc Close
Blog Tags GitHub
All tags

training-optimization

2 posts tagged with "training-optimization"

July 7, 2026

Training Compute-Optimal Large Language Models (Chinchilla)

Chinchilla论文提出计算最优的LLM缩放定律:模型大小和训练token数应按同等比例缩放(各为C^0.5),发现当前LLM严重欠训练,Chinchilla(70B/1.4T)在相同计算量下显著超越Gopher(280B)/GPT-3(175B)。

large-language-model model-scaling training-optimization scaling-laws
July 2, 2026

Mimose: An Input-Aware Checkpointing Planner for Efficient Training on GPU

Mimose - 输入感知型张量检查点规划器,用于GPU高效训练

gpu-memory checkpointing memory-planner training-optimization dynamic-batching deep-learning-systems

Navigation

  • Work

Resources

  • Lexington Themes.

Socials

  • @Mike_Andreuzza
© 2025 MicroStudio. All rights reserved.

MicroStudio is not affiliated with Stripe, Breeew, Astro, or Tailwind Labs, nor is it endorsed or sponsored by them.