Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines
End-to-end TPU migration for Gemma 4 31B: 1.61× faster training at 2.12× lower cost, with 66% higher long-context inference throughput
17 posts tagged with "parallelism-tp"
End-to-end TPU migration for Gemma 4 31B: 1.61× faster training at 2.12× lower cost, with 66% higher long-context inference throughput
波形流水线并行策略,提升大模型训练效率
通过尾部批处理和全栈系统优化解决RL训练中长尾rollout导致的GPU利用率低问题
覆盖并行策略、序列并行、MoE并行、内存优化、通信优化、容错与系统框架
本文深入分析MegaScale-MoE,一个专为大规模MoE模型高效训练设计的生产系统,通过通信高效并行策略、通信-计算重叠和通信压缩,在1,440个NVIDIA Hopper GPU上训练352B MoE模型实现1.41M tokens/s吞吐量,相比Megatron-LM提升1.88倍。
面向大语言模型训练的工作负载均衡4D并行
PyTorch 全分片数据并行的规模化经验
针对因果 Transformer 的更快 Ring Attention 算法
灵活高效的 RLHF 分布式训练框架
ByteScale:在超过 12,000 GPU 上高效扩展 2048K 上下文 LLM 训练
现代大规模语言模型预训练严重依赖单程序多数据(SPMD)范式,需要在加速器之间进行紧密耦合。由于这种耦合,瞬时减速、硬件故障和同步开销会阻塞整个计算,在大规模训练时浪费大量计算时间。
现代 GPU 工作负载,特别是大语言模型(LLM)推理,受到内核启动开销和粗粒度同步的限制,阻碍了内核间并行性。
Llama 3 405B 模型在 16K H100 GPU 上的四维并行训练系统设计,涵盖灵活流水线并行、上下文并行、大规模调试方法及硬件建议
首个面向晶圆级加速器(Cerebras WSE-2,85 万核)的 LLM 推理系统。提出 PLMR 设备模型刻画晶圆级硬件特征,配合细粒度二维并行、Shift 式 KV 缓存管理,以及 PLMR 合规的 MeshGEMM(两跳传输)与 MeshGEMV(K-tree allreduce),相比多卡 A100 SGLang 端到端提速 10–20×、能效 2–2.5×。
大规模语言模型(LLM)训练通常分布 across 大量加速器以减少训练时间。由于内部状态和参数梯度需要在每个梯度步骤中交换,所有设备需要使用低延迟高带宽通信链路 co-locate。
面向扩散 Transformer 的大规模并行推理引擎,混合多种并行策略实现 16 GPU 扩展
ReaL提出基于参数重分配的高效RLHF训练框架,通过动态调整GPU间的参数分布优化大语言模型对齐训练。