Back to blog

MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services

软件定义的多路径内存访问系统,打破LLM服务中的主机-GPU带宽瓶颈

MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services

一、论文概述

项目内容
标题MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
作者未明确
机构未明确
论文arXiv:2512.16056
代码未明确
发布2024-12
领域Systems, LLM Serving

二、核心思想

问题定义

主机-GPU数据移动已成为LLM服务中的延迟关键瓶颈,出现在常见路径中,如模型权重移动和KV缓存卸载/获取。当前问题:

  1. 单路径限制:每个主机-GPU复制仅限于目标GPU的PCIe路径
  2. 资源闲置:现代多GPU服务器中其他PCIe链路和高带宽GPU互连未被利用
  3. 带宽瓶颈:主机-GPU带宽成为性能限制因素

解决方案概述

MMA(MultiPath Memory Access)是首个软件定义的多路径主机-GPU数据传输系统。核心创新:

  1. 多路径传输:跨可用直接和中继路径扩展单个主机-GPU复制
  2. 语义保持:保持CUDA流语义
  3. 轻量级同步:分布式微传输完成的轻量级同步机制

三、技术架构

核心设计

组件说明关键特点
多路径传输跨多个路径传输数据利用闲置带宽
依赖保持Dummy Task保持CUDA流语义无需修改应用
轻量级同步分布式微传输同步低开销协调
队列反压无显式链路状态反馈的路由自适应流量控制

关键技术

多路径传输:

  • 利用对等GPU的PCIe链路
  • 利用高带宽GPU互连
  • 扩展单个复制到多个路径

语义保持:

  • 使用依赖保持Dummy Task
  • 保持CUDA流语义
  • 无需修改应用程序

轻量级同步:

  • 分布式微传输完成同步
  • 低开销协调机制
  • 队列反压路由流量

四、核心创新

创新点说明理论/实验依据
多路径传输跨多个路径传输数据利用闲置带宽
软件定义无需硬件/驱动修改易于部署
语义保持保持CUDA流语义无需修改应用
轻量级同步分布式微传输同步低开销

五、实验结果

性能提升

指标结果说明
峰值带宽245 GB/s8-GPU NVIDIA H20服务器
带宽提升4.62×相比原生CUDA复制
KV缓存获取TTFT1.14-2.38× 降低延迟显著降低
模型唤醒/切换延迟1.12-2.48× 降低延迟显著降低

关键发现

  • 现代多GPU服务器中存在大量未利用的I/O容量
  • 多路径传输可以显著提高主机-GPU带宽
  • 软件定义方法无需硬件修改即可实现

六、相关工作

方向代表工作MMA的优势
主机-GPU传输原生CUDA复制多路径,4.62×带宽提升
KV缓存优化各种卸载策略降低获取延迟
GPU互连NVLink, PCIe利用所有可用路径

七、总结

核心贡献

  1. 首个软件定义多路径系统:实现高效的主机-GPU多路径数据传输
  2. 4.62×带宽提升:在8-GPU服务器上显著提高带宽
  3. 语义保持:保持CUDA流语义,无需修改应用
  4. 延迟降低:KV缓存获取和模型切换延迟显著降低

技术影响

  • 带宽优化:利用现代多GPU服务器中未使用的I/O容量
  • LLM服务性能:降低关键路径延迟
  • 易于部署:软件定义方法无需硬件修改

局限性

  • 需要多GPU服务器环境
  • 可能增加系统复杂性
  • 对某些工作负载可能收益有限

八、参考资源