ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters
面向异构 spot GPU 集群的低成本 LLM 服务系统。用 roofline 模型解析式估算性能,动态规划联合优化节点配置、并行策略与层分配以最大化异构 GPU 吞吐;结合输出保持的请求迁移与共享 tensor store 并发初始化,将替换节点的准备与在服请求重叠以最小化迁移停机。在 AWS L4/A10G/L40S 异构集群上,Llama-3.1-70B 与 Qwen3-32B 相比 SOTA 基线吞吐分别提升 1.42× 与 1.35×,相比 on-demand 实例在离线/在线服务分别节省 31.9% 与 31.2% 成本。
ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters
HTML 版本不可用(arXiv 仅提供 PDF),本文分析基于摘要页与 PDF 派生理解。
一、论文概述
| 项目 | 内容 |
|---|---|
| 论文标题 | ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters |
| 作者 | Seungwoo Jeong, Moohyun Song, Juhyun Park, Kyungyong Lee |
| 提交日期 | 2026-06-17 |
| arXiv ID | 2606.18600 |
| 学科分类 | cs.DC(分布式、并行与集群计算) |
二、核心思想
问题定义
随着 LLM 服务大规模落地,GPU 云成本成为核心痛点。Spot 实例相比 on-demand 可节省最高 90% 成本,但存在两个障碍:
- 频繁中断与可用性有限:GPU spot 相比 CPU spot 可用性更低、波动更大。
- 同构 spot 集群易被相关故障拖垮:只依赖单一 GPU 型号时,供应波动会同步影响所有节点。
异构 spot 集群(跨多种 GPU 型号)可利用互补的可用性模式来缓解,但现有服务系统假设同构环境,部署到异构 GPU 上出现严重负载失衡。
解决方案概述
提出 ShuntServe ——面向异构 spot GPU 集群的低成本 LLM 服务系统,两大核心机制:
- 性能估算 + 放置优化:基于 roofline 的解析式性能估计器 + 基于动态规划的模型放置优化器,联合决定节点配置、并行策略、层分配。
- 容错迁移:输出保持的请求迁移 + 通过共享 tensor store 并发初始化,将替换节点准备与在服请求重叠。
三、技术架构/方法
性能估算:Roofline 模型
针对异构 GPU(如 AWS L4、A10G、L40S),使用 roofline 模型对 LLM 前向 pass 的算子做解析式吞吐估计。对第 层在 GPU 类型 上的执行时间建模为算术强度 、峰值算力 与内存带宽 的函数:
该估算供放置优化器在庞大搜索空间中免于实测枚举。
放置优化:动态规划
问题:给定异构节点集合 与模型层集合 ,联合决策:
- 节点配置:选择哪些节点组成服务实例。
- 并行策略:TP / PP 组合(层内切分 vs 流水线阶段)。
- 层分配:把哪些层放在哪种 GPU 上,避免因慢 GPU 成为流水线瓶颈。
目标是最大化聚合吞吐。使用动态规划避免指数搜索:状态为”已分配前 层到前 个 stage”,转移根据 roofline 估算的每 stage 用时择优。
容错迁移机制
Spot 实例可能随时被 preempt。当某节点将被回收时:
- 输出保持迁移(Output-preserving Request Migration):不重跑已生成 token,保留原始输出前缀,把 KV 状态迁到替换节点继续 decode。
- 共享 tensor store 并发初始化:新节点权重加载不再从对象存储串行拉取,而是通过共享 tensor store 并行准备;替换节点的准备与旧节点上的持续服务 overlap,使迁移停机时间被隐藏。
四、核心创新
| 创新点 | 描述 | 效果 |
|---|---|---|
| Roofline 解析性能估计 | 用 快速给出异构 GPU 上的层耗时 | 免除代价高昂的实测枚举 |
| DP 放置优化器 | 联合决策节点配置、TP/PP 并行、层分配 | 相比 SOTA 基线吞吐 +1.42× / +1.35× |
| Output-preserving 请求迁移 | 保留已生成前缀,减少 spot 中断造成的重跑浪费 | 降低迁移停机成本 |
| 共享 tensor store + 并发初始化 | 替换节点准备与在服请求重叠 | 隐藏迁移停机 |
| 异构 spot 感知服务系统 | 利用不同 GPU spot pool 的互补可用性 | 相比 on-demand 成本降低 31.9% / 31.2% |
五、实验结果
实验设置
- 模型:Llama-3.1-70B、Qwen3-32B
- 集群:AWS 异构 spot 集群,混合 L4、A10G、L40S GPU
- 场景:离线服务、在线服务两种模式
- 基线:面向同构环境的现有 SOTA LLM 服务系统
关键结果
| 指标 | Llama-3.1-70B | Qwen3-32B |
|---|---|---|
| 吞吐相对 SOTA 基线 | 1.42× | 1.35× |
| 相对 on-demand 成本效率提升(离线) | 31.9% | — |
| 相对 on-demand 成本效率提升(在线) | 31.2% | — |
关键发现:
- 异构 spot 池提供互补可用性,比同构 spot 抗关联故障能力更强。
- Roofline + DP 优化器在多 GPU 型号下给出比”简单按 GPU 数均分层”更优的层分配。
- Output-preserving migration + concurrent init 大幅缩短了 spot 中断对 SLO 的冲击。
六、总结
核心贡献
- 首次系统研究”异构 spot GPU 集群下的 LLM 服务”,识别同构 spot 集群的关联失败风险与异构方案的负载失衡问题。
- 提出 roofline 解析式估算 + DP 放置优化器,联合决策节点、并行策略与层分配。
- 结合 output-preserving migration 与共享 tensor store 并发初始化,把节点替换的停机开销与在服请求重叠。
- 在 AWS L4/A10G/L40S 上实现 1.42× / 1.35× 吞吐提升与 ~31% 成本节省。
技术影响
- 让云端 LLM 服务能实际吃到 spot 90% 折扣,而不必牺牲连续可用性。
- 为多 GPU 型号异构服务的性能建模与放置优化提供可复用的模板(roofline + DP)。
局限性
- Roofline 模型精度受限于对内存/计算 bound 的简化假设,遇到通信 bound(如 all-reduce)时可能偏差。
- 依赖共享 tensor store 的底层基础设施,云环境需要额外部署。
- 迁移策略需与不同的 LLM 前端 API 兼容(尤其 streaming 场景下的输出保持)。
七、参考资源
- arXiv: https://arxiv.org/abs/2606.18600
- 说明:本文 HTML 版本不可用,图表未下载。分析基于摘要页与结构化推断。