May 1, 2026 TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference 首个在低延迟推理场景下为张量并行LLM推理实现高效计算通信重叠的系统,通过融合AllReduce-RMSNorm核和波感知智能分割达成最高1.28×加速 LLM Inference Tensor Parallelism Compute-Communication Overlap CUDA Kernel Fusion NVSHARP Multimem RMSNorm vLLM