June 25, 2026 DeMo: Decoupled Momentum Optimization 通过解耦动量更新和结构化稀疏化,将分布式训练通信量降低高达85倍 optimizer distributed-training communication-efficiency gradient-compression sparsification momentum
June 25, 2026 DeMo: Decoupled Momentum Optimization 精读文档 分布式训练通信压缩优化器的深度技术分析 optimizer distributed-training communication-efficiency gradient-compression sparsification momentum deep-dive
June 22, 2026 Federation of Experts: Communication Efficient Distributed Inference for Large Language Models 通过将 MoE 架构重构为多个独立的专家集群,消除 all-to-all 通信瓶颈,实现高效的分布式推理 llm mixture-of-experts distributed-inference communication-efficiency expert-parallelism