Back to blog

ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters

面向异构 spot GPU 集群的低成本 LLM 服务系统。用 roofline 模型解析式估算性能,动态规划联合优化节点配置、并行策略与层分配以最大化异构 GPU 吞吐;结合输出保持的请求迁移与共享 tensor store 并发初始化,将替换节点的准备与在服请求重叠以最小化迁移停机。在 AWS L4/A10G/L40S 异构集群上,Llama-3.1-70B 与 Qwen3-32B 相比 SOTA 基线吞吐分别提升 1.42× 与 1.35×,相比 on-demand 实例在离线/在线服务分别节省 31.9% 与 31.2% 成本。

ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters

HTML 版本不可用(arXiv 仅提供 PDF),本文分析基于摘要页与 PDF 派生理解。

一、论文概述

项目内容
论文标题ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters
作者Seungwoo Jeong, Moohyun Song, Juhyun Park, Kyungyong Lee
提交日期2026-06-17
arXiv ID2606.18600
学科分类cs.DC(分布式、并行与集群计算)

二、核心思想

问题定义

随着 LLM 服务大规模落地,GPU 云成本成为核心痛点。Spot 实例相比 on-demand 可节省最高 90% 成本,但存在两个障碍:

  1. 频繁中断与可用性有限:GPU spot 相比 CPU spot 可用性更低、波动更大。
  2. 同构 spot 集群易被相关故障拖垮:只依赖单一 GPU 型号时,供应波动会同步影响所有节点。

异构 spot 集群(跨多种 GPU 型号)可利用互补的可用性模式来缓解,但现有服务系统假设同构环境,部署到异构 GPU 上出现严重负载失衡。

解决方案概述

提出 ShuntServe ——面向异构 spot GPU 集群的低成本 LLM 服务系统,两大核心机制:

  1. 性能估算 + 放置优化:基于 roofline 的解析式性能估计器 + 基于动态规划的模型放置优化器,联合决定节点配置、并行策略、层分配。
  2. 容错迁移:输出保持的请求迁移 + 通过共享 tensor store 并发初始化,将替换节点准备与在服请求重叠。

三、技术架构/方法

性能估算:Roofline 模型

针对异构 GPU(如 AWS L4、A10G、L40S),使用 roofline 模型对 LLM 前向 pass 的算子做解析式吞吐估计。对第 ll 层在 GPU 类型 gg 上的执行时间建模为算术强度 II、峰值算力 πg\pi_g 与内存带宽 βg\beta_g 的函数:

Tl,g=max⁡(FLOPslπg,Byteslβg)T_{l,g} = \max\left(\frac{FLOPs_l}{\pi_g}, \frac{Bytes_l}{\beta_g}\right)

该估算供放置优化器在庞大搜索空间中免于实测枚举。

放置优化:动态规划

问题:给定异构节点集合 {n1,...,nN}\{n_1, ..., n_N\} 与模型层集合 {l1,...,lL}\{l_1, ..., l_L\},联合决策:

  • 节点配置:选择哪些节点组成服务实例。
  • 并行策略:TP / PP 组合(层内切分 vs 流水线阶段)。
  • 层分配:把哪些层放在哪种 GPU 上,避免因慢 GPU 成为流水线瓶颈。

目标是最大化聚合吞吐。使用动态规划避免指数搜索:状态为”已分配前 kk 层到前 jj 个 stage”,转移根据 roofline 估算的每 stage 用时择优。

容错迁移机制

Spot 实例可能随时被 preempt。当某节点将被回收时:

  1. 输出保持迁移(Output-preserving Request Migration):不重跑已生成 token,保留原始输出前缀,把 KV 状态迁到替换节点继续 decode。
  2. 共享 tensor store 并发初始化:新节点权重加载不再从对象存储串行拉取,而是通过共享 tensor store 并行准备;替换节点的准备与旧节点上的持续服务 overlap,使迁移停机时间被隐藏。

四、核心创新

创新点描述效果
Roofline 解析性能估计用 max⁡(FLOPs/π,Bytes/β)\max(FLOPs/\pi, Bytes/\beta) 快速给出异构 GPU 上的层耗时免除代价高昂的实测枚举
DP 放置优化器联合决策节点配置、TP/PP 并行、层分配相比 SOTA 基线吞吐 +1.42× / +1.35×
Output-preserving 请求迁移保留已生成前缀,减少 spot 中断造成的重跑浪费降低迁移停机成本
共享 tensor store + 并发初始化替换节点准备与在服请求重叠隐藏迁移停机
异构 spot 感知服务系统利用不同 GPU spot pool 的互补可用性相比 on-demand 成本降低 31.9% / 31.2%

五、实验结果

实验设置

  • 模型:Llama-3.1-70B、Qwen3-32B
  • 集群:AWS 异构 spot 集群,混合 L4、A10G、L40S GPU
  • 场景:离线服务、在线服务两种模式
  • 基线:面向同构环境的现有 SOTA LLM 服务系统

关键结果

指标Llama-3.1-70BQwen3-32B
吞吐相对 SOTA 基线1.42×1.35×
相对 on-demand 成本效率提升(离线)31.9%—
相对 on-demand 成本效率提升(在线)31.2%—

关键发现:

  • 异构 spot 池提供互补可用性,比同构 spot 抗关联故障能力更强。
  • Roofline + DP 优化器在多 GPU 型号下给出比”简单按 GPU 数均分层”更优的层分配。
  • Output-preserving migration + concurrent init 大幅缩短了 spot 中断对 SLO 的冲击。

六、总结

核心贡献

  1. 首次系统研究”异构 spot GPU 集群下的 LLM 服务”,识别同构 spot 集群的关联失败风险与异构方案的负载失衡问题。
  2. 提出 roofline 解析式估算 + DP 放置优化器,联合决策节点、并行策略与层分配。
  3. 结合 output-preserving migration 与共享 tensor store 并发初始化,把节点替换的停机开销与在服请求重叠。
  4. 在 AWS L4/A10G/L40S 上实现 1.42× / 1.35× 吞吐提升与 ~31% 成本节省。

技术影响

  • 让云端 LLM 服务能实际吃到 spot 90% 折扣,而不必牺牲连续可用性。
  • 为多 GPU 型号异构服务的性能建模与放置优化提供可复用的模板(roofline + DP)。

局限性

  • Roofline 模型精度受限于对内存/计算 bound 的简化假设,遇到通信 bound(如 all-reduce)时可能偏差。
  • 依赖共享 tensor store 的底层基础设施,云环境需要额外部署。
  • 迁移策略需与不同的 LLM 前端 API 兼容(尤其 streaming 场景下的输出保持)。

七、参考资源