Chopper: 多层次 GPU 表征工具及 LLM 训练低效来源分析
AMD 提出的 Chopper 多粒度 GPU 剖析框架,对 8 卡 MI300X 上 Llama 3 8B 的 FSDP 训练做端到端表征,揭示频率开销(DVFS)是理论与实测性能差距的最大来源。
32 posts tagged with "parallelism-dp"
AMD 提出的 Chopper 多粒度 GPU 剖析框架,对 8 卡 MI300X 上 Llama 3 8B 的 FSDP 训练做端到端表征,揭示频率开销(DVFS)是理论与实测性能差距的最大来源。
Meta 提出的容错混合分片数据并行 FT-HSDP:以数据并行副本为容错单元,通过 CPU-GPU 混合 FTAR 全归约与非阻塞追赶协议实现异步恢复,在 10 万 GPU 规模将有效训练时间从 44% 提升至 80%。
使用模型并行训练数十亿参数语言模型
端到端序列到序列学习的开创性工作
通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM
覆盖并行策略、序列并行、MoE并行、内存优化、通信优化、容错与系统框架
通用分布式加速框架,通过异步去噪实现扩散模型的多设备并行推理
从 Llama 3-8B 高效上循环训练 MoE 模型
通过设备内并行实现最优LLM服务吞吐量
通过动态模型重分片实现高吞吐量LLM推理
自适应向量搜索索引系统,在动态工作负载下实现1.5-38×延迟降低
面向CXL Pod的分布式内存数据库,使用CXL内存原子操作同步跨主机并发访问
面向大语言模型训练的工作负载均衡4D并行
MineDraft:批量并行推测解码框架
突破十亿参数通用机器学习原子间势函数的训练壁垒
利用历史先验的生成式压缩模型实现高达10000倍地球观测数据压缩
GPU上稀疏矩阵乘法的设计原则
PyTorch 全分片数据并行的规模化经验
通过推测流水线执行实现高效解码
针对因果 Transformer 的更快 Ring Attention 算法
高效生成式大语言模型服务综述:从算法到系统
ByteScale:在超过 12,000 GPU 上高效扩展 2048K 上下文 LLM 训练
通用长上下文预填充加速框架,支持混合架构和连续批处理
现代大规模语言模型预训练严重依赖单程序多数据(SPMD)范式,需要在加速器之间进行紧密耦合。由于这种耦合,瞬时减速、硬件故障和同步开销会阻塞整个计算,在大规模训练时浪费大量计算时间。
自回归解码因其顺序性而受到瓶颈限制。投机解码(Speculative Decoding, SD)已成为加速推理的标准方法,通过使用快速草稿模型预测慢速目标模型即将生成的 token,然后通过一次目标模型前向传播并行验证。
X-MoE是一种新型MoE训练系统,通过无填充训练管道、冗余绕过分发和序列分片MoE块等技术,在AMD GPU上实现DeepSeek风格MoE的高效可扩展训练
Llama 3 405B 模型在 16K H100 GPU 上的四维并行训练系统设计,涵盖灵活流水线并行、上下文并行、大规模调试方法及硬件建议
DiLoCo 等分布式优化方法将更新分为两部分:
大规模语言模型(LLM)训练通常分布 across 大量加速器以减少训练时间。由于内部状态和参数梯度需要在每个梯度步骤中交换,所有设备需要使用低延迟高带宽通信链路 co-locate。
ReaL提出基于参数重分配的高效RLHF训练框架,通过动态调整GPU间的参数分布优化大语言模型对齐训练。
大语言模型服务动态调度系统,支持KV缓存迁移与跨实例负载均衡
分布式低通信语言模型训练方法,通过内层优化器减少跨设备通信