Hanayo: Harnessing Wave-like Pipeline Parallelism for Enhanced Large Model
波形流水线并行策略,提升大模型训练效率
8 posts tagged with "parallelism-pp"
波形流水线并行策略,提升大模型训练效率
覆盖并行策略、序列并行、MoE并行、内存优化、通信优化、容错与系统框架
通过流水线并行实现高准确率零气泡推测解码,突破传统多token预测的结构限制
本文深入分析MegaScale-MoE,一个专为大规模MoE模型高效训练设计的生产系统,通过通信高效并行策略、通信-计算重叠和通信压缩,在1,440个NVIDIA Hopper GPU上训练352B MoE模型实现1.41M tokens/s吞吐量,相比Megatron-LM提升1.88倍。
现代 GPU 工作负载,特别是大语言模型(LLM)推理,受到内核启动开销和粗粒度同步的限制,阻碍了内核间并行性。
Llama 3 405B 模型在 16K H100 GPU 上的四维并行训练系统设计,涵盖灵活流水线并行、上下文并行、大规模调试方法及硬件建议
面向扩散 Transformer 的大规模并行推理引擎,混合多种并行策略实现 16 GPU 扩展
ReaL提出基于参数重分配的高效RLHF训练框架,通过动态调整GPU间的参数分布优化大语言模型对齐训练。