Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP
块级粒度的灵活上下文并行范式,通过任意点对点通信 + bin-packing 调度,在 256 张 NVIDIA GPU 上实现近线性扩展,attention MFU 提升 1.13x–2.21x
4 posts tagged with "parallelism-cp"
块级粒度的灵活上下文并行范式,通过任意点对点通信 + bin-packing 调度,在 256 张 NVIDIA GPU 上实现近线性扩展,attention MFU 提升 1.13x–2.21x
覆盖并行策略、序列并行、MoE并行、内存优化、通信优化、容错与系统框架
ByteScale:在超过 12,000 GPU 上高效扩展 2048K 上下文 LLM 训练
Llama 3 405B 模型在 16K H100 GPU 上的四维并行训练系统设计,涵盖灵活流水线并行、上下文并行、大规模调试方法及硬件建议