MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
软件定义的多路径内存访问系统,打破LLM服务中的主机-GPU带宽瓶颈
MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services |
| 作者 | 未明确 |
| 机构 | 未明确 |
| 论文 | arXiv:2512.16056 |
| 代码 | 未明确 |
| 发布 | 2024-12 |
| 领域 | Systems, LLM Serving |
二、核心思想
问题定义
主机-GPU数据移动已成为LLM服务中的延迟关键瓶颈,出现在常见路径中,如模型权重移动和KV缓存卸载/获取。当前问题:
- 单路径限制:每个主机-GPU复制仅限于目标GPU的PCIe路径
- 资源闲置:现代多GPU服务器中其他PCIe链路和高带宽GPU互连未被利用
- 带宽瓶颈:主机-GPU带宽成为性能限制因素
解决方案概述
MMA(MultiPath Memory Access)是首个软件定义的多路径主机-GPU数据传输系统。核心创新:
- 多路径传输:跨可用直接和中继路径扩展单个主机-GPU复制
- 语义保持:保持CUDA流语义
- 轻量级同步:分布式微传输完成的轻量级同步机制
三、技术架构
核心设计
| 组件 | 说明 | 关键特点 |
|---|---|---|
| 多路径传输 | 跨多个路径传输数据 | 利用闲置带宽 |
| 依赖保持Dummy Task | 保持CUDA流语义 | 无需修改应用 |
| 轻量级同步 | 分布式微传输同步 | 低开销协调 |
| 队列反压 | 无显式链路状态反馈的路由 | 自适应流量控制 |
关键技术
多路径传输:
- 利用对等GPU的PCIe链路
- 利用高带宽GPU互连
- 扩展单个复制到多个路径
语义保持:
- 使用依赖保持Dummy Task
- 保持CUDA流语义
- 无需修改应用程序
轻量级同步:
- 分布式微传输完成同步
- 低开销协调机制
- 队列反压路由流量
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| 多路径传输 | 跨多个路径传输数据 | 利用闲置带宽 |
| 软件定义 | 无需硬件/驱动修改 | 易于部署 |
| 语义保持 | 保持CUDA流语义 | 无需修改应用 |
| 轻量级同步 | 分布式微传输同步 | 低开销 |
五、实验结果
性能提升
| 指标 | 结果 | 说明 |
|---|---|---|
| 峰值带宽 | 245 GB/s | 8-GPU NVIDIA H20服务器 |
| 带宽提升 | 4.62× | 相比原生CUDA复制 |
| KV缓存获取TTFT | 1.14-2.38× 降低 | 延迟显著降低 |
| 模型唤醒/切换延迟 | 1.12-2.48× 降低 | 延迟显著降低 |
关键发现
- 现代多GPU服务器中存在大量未利用的I/O容量
- 多路径传输可以显著提高主机-GPU带宽
- 软件定义方法无需硬件修改即可实现
六、相关工作
| 方向 | 代表工作 | MMA的优势 |
|---|---|---|
| 主机-GPU传输 | 原生CUDA复制 | 多路径,4.62×带宽提升 |
| KV缓存优化 | 各种卸载策略 | 降低获取延迟 |
| GPU互连 | NVLink, PCIe | 利用所有可用路径 |
七、总结
核心贡献
- 首个软件定义多路径系统:实现高效的主机-GPU多路径数据传输
- 4.62×带宽提升:在8-GPU服务器上显著提高带宽
- 语义保持:保持CUDA流语义,无需修改应用
- 延迟降低:KV缓存获取和模型切换延迟显著降低
技术影响
- 带宽优化:利用现代多GPU服务器中未使用的I/O容量
- LLM服务性能:降低关键路径延迟
- 易于部署:软件定义方法无需硬件修改
局限性
- 需要多GPU服务器环境
- 可能增加系统复杂性
- 对某些工作负载可能收益有限
八、参考资源
- 论文: arXiv:2512.16056
- 应用场景: LLM服务、主机-GPU传输优化