Back to blog

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

通过复用闲置尾部模型服务作为远程草稿模型,实现资源高效的 LLM 推理服务

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

论文信息: arXiv:2605.08151 [cs.DC] 4 May 2026

作者: Jincheng Xie, Yawen Ling, Qi Xiao, Feiyu Zhang, Zhongyi Huang, Wen Hu, Yu Zheng

代码: https://github.com/sgl-project/sglang/pull/22272

许可: arXiv 非独占分发许可


一、论文概述

1.1 研究背景

LLM 服务平台越来越多地部署为多模型云系统,其中用户需求通常呈长尾分布:少数流行的大模型接收大部分请求,而许多较小的尾部模型利用率不足。这种不平衡为复用闲置尾部模型容量来辅助高负载的大模型服务提供了机会。

核心挑战:

挑战说明
资源利用不均大模型高负载,尾部模型闲置
推测解码限制传统串行模式无法充分利用并行性
多租户干扰共享草稿模型需同时服务正常请求
回滚开销接受率下降时并行模式可能降低吞吐量

1.2 核心贡献

贡献说明
混合普通-并行策略基于吞吐量分析的阈值动态切换执行模式
推测优先级调度在多租户流量下保持草稿-目标重叠
草稿侧提示压缩减少草稿延迟,提高并行效率
资源高效服务复用闲置尾部模型,提高整体资源利用率

二、核心思想

2.1 问题定义

在多模型云服务中,大模型(如 Qwen3-235B)通常处于高负载状态,而尾部小模型(如 Qwen3-0.6B)则相对闲置。传统的推测解码方法将草稿生成和目标验证串行执行,无法充分利用这种资源不平衡。

传统推测解码 vs SPECTRE:

特性传统推测解码SPECTRE
草稿来源本地小模型远程闲置尾部模型
执行模式串行混合普通-并行
资源利用单模型多模型协同
多租户支持无推测优先级调度

2.2 解决方案概述

SPECTRE 概览 图 1:SPECTRE 概览。大模型服务通过 ZMQ 从闲置的尾部模型服务获取推测草稿。

SPECTRE 的三个核心技术:

  1. 混合普通-并行策略:基于回滚比率阈值动态切换执行模式
  2. 推测优先级调度:在多租户流量下优先处理推测请求
  3. 草稿侧提示压缩:当目标验证速度超过草稿生成时压缩提示

三、技术架构

3.1 执行模式对比

执行模式时间线对比 图 2:普通推测解码、并行推测解码和 SPECTRE 的时间线对比。

模式特点适用场景
普通模式草稿生成和目标验证串行执行回滚比率高时
并行模式草稿生成和目标验证并行执行回滚比率低时
SPECTRE动态切换两种模式所有场景

3.2 核心公式

回滚比率计算:

r^n=∣Rn∣B\hat{r}_{n} = \frac{|\mathcal{R}_{n}|}{B}

其中 Rn\mathcal{R}_{n} 是第 nn 轮的回滚请求集合,BB 是批大小。

模式选择规则:

moden+1={\textscParallel,r^n≤r∗,\textscordinary,r^n>r∗.\mathrm{mode}_{n+1} = \begin{cases} \textsc{Parallel}, & \hat{r}_{n} \leq r^{*}, \\ \textsc{ordinary}, & \hat{r}_{n} > r^{*}. \end{cases}

其中 r∗r^{*} 是基于吞吐量分析推导的阈值。

候选序列构建:

对于回滚请求 i∈Rni \in \mathcal{R}_{n}:

yn(i)=[bn(i),d^n(i)]\mathbf{y}_{n}^{(i)} = \left[b_{n}^{(i)}, \hat{\mathbf{d}}_{n}^{(i)}\right]

对于非回滚请求 i∈Sni \in \mathcal{S}_{n}:

yn(i)=dˉn(i)\mathbf{y}_{n}^{(i)} = \bar{\mathbf{d}}_{n}^{(i)}

3.3 SPECTRE 解码流程

SPECTRE 解码流程 图 3:SPECTRE 解码流程。草稿模型在服务正常请求的同时生成候选 token,目标模型通过拒绝采样进行验证。

流程步骤:

  1. 草稿生成:草稿模型 MDM_D 在服务正常请求的同时生成候选 token
  2. 候选传输:通过 ZMQ 将候选序列发送给目标模型
  3. 目标验证:目标模型 MTM_T 通过拒绝采样验证候选 token
  4. 模式切换:根据回滚比率决定下一轮执行模式
  5. 回滚处理:对被拒绝的请求重新生成草稿

3.4 模型组件

组件说明关键参数
草稿模型轻量级模型,生成候选 tokenQwen3-0.6B, DeepSeek-R1-1.5B
目标模型大模型,验证候选 tokenQwen3-32B, Qwen3-235B-A22B
通信层ZMQ 实现远程通信低延迟、高吞吐
调度器推测优先级调度保持草稿-目标重叠

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
混合执行模式基于回滚比率动态切换吞吐量分析推导阈值
推测优先级调度多租户下保持重叠实验验证干扰最小化
草稿侧提示压缩减少草稿延迟目标验证速度分析
资源复用利用闲置尾部模型长尾分布特性

4.2 技术细节

吞吐量分析:

假设草稿模型处理延迟为 TdT_d,目标模型验证延迟为 TvT_v,接受率为 α\alpha。

在普通模式下,每轮总延迟为: Tordinary=Td+TvT_{\text{ordinary}} = T_d + T_v

在并行模式下,每轮总延迟为: Tparallel=max⁡(Td,Tv)T_{\text{parallel}} = \max(T_d, T_v)

当回滚比率较低时,并行模式可显著降低延迟;当回滚比率较高时,普通模式更稳定。


五、代码实现分析

5.1 实现概览

组件语言说明
SGLang 框架Python基于 SGLang v0.5.7 实现
通信层PythonZMQ 实现远程草稿传输
调度器Python推测优先级调度逻辑
提示压缩Python草稿侧提示压缩

5.2 部署架构

  • 草稿服务器:部署轻量级模型,同时服务正常请求和推测请求
  • 目标服务器:部署大模型,验证草稿模型生成的候选 token
  • 通信:通过 ZMQ 实现低延迟远程通信
  • 调度:推测请求优先级高于正常请求

六、实验结果

6.1 TP1 目标模型吞吐量加速

Qwen3-32B (TP=1) 结果:

批大小方法GSM8KMath500Minerva MathShareGPTLongBench
32AR100910011003753308
EAGLE31380 (1.37x)1436 (1.43x)1284 (1.28x)878 (1.17x)248 (0.81x)
PEARL1256 (1.24x)1021 (1.02x)1242 (1.23x)945 (1.25x)532 (1.73x)
Standalone1559 (1.54x)1595 (1.59x)1589 (1.58x)994 (1.32x)489 (1.59x)
SPECTRE1765 (1.75x)1729 (1.73x)1777 (1.77x)1185 (1.57x)654 (2.12x)
64AR143314231422807311
EAGLE31783 (1.24x)1798 (1.26x)1776 (1.25x)959 (1.19x)236 (0.76x)
Standalone1923 (1.34x)1946 (1.37x)1925 (1.35x)1015 (1.26x)518 (1.67x)
SPECTRE2183 (1.52x)2148 (1.51x)2152 (1.51x)1353 (1.68x)707 (2.28x)

关键发现:

  • SPECTRE 在所有基准测试中均达到最佳性能
  • 相比 Standalone 平均提升 13-22%
  • 在 LongBench 上提升最显著(2.28x)

6.2 TP8 目标模型吞吐量加速

TP8 吞吐量对比 图 4:Qwen3-235B-A22B (TP=8) 在高并发设置下的吞吐量对比。

Qwen3-235B-A22B (TP=8) 结果:

方法GSM8KMath500Minerva Math
AR245.3243.7244.1
EAGLE3389.2 (1.59x)392.1 (1.61x)385.7 (1.58x)
Standalone412.5 (1.68x)415.3 (1.70x)408.9 (1.67x)
SPECTRE528.7 (2.15x)531.2 (2.18x)524.8 (2.15x)

关键发现:

  • SPECTRE 相比 AR 实现 2.15-2.18x 加速
  • 相比 Standalone 提升 28-30%
  • 在 TP8 大模型部署中效果显著

6.3 共享草稿流量下的性能

草稿流量影响 图 5:混合草稿流量下的吞吐量。草稿模型同时服务推测请求和背景用户请求。

草稿 QPS目标吞吐量降级比例
0100%0%
1098.5%1.5%
2096.2%3.8%
3093.1%6.9%

关键发现:

  • 中等草稿负载(QPS=10-20)对目标吞吐量影响很小
  • 支持复用共享尾部模型作为远程草稿器的实用性

6.4 消融实验

接受长度分析:

模型对平均接受长度
Qwen3-0.6B → Qwen3-32B3.42
Qwen3-0.6B → Qwen3-235B-A22B3.28
DeepSeek-R1-1.5B → DeepSeek-R1-32B3.56

七、相关工作

7.1 推测解码方法

方法类型特点
EAGLE-3本地草稿使用小型模型作为草稿器
PEARL本地草稿并行草稿生成
MineDraft远程草稿批量并行草稿生成
SPECTRE远程草稿混合普通-并行策略

7.2 LLM 服务优化

方法优化目标技术
vLLM吞吐量PagedAttention
SGLang吞吐量RadixAttention
TensorRT-LLM延迟图优化、量化
SPECTRE资源效率推测解码 + 资源复用

八、总结

8.1 核心贡献

  1. 混合执行模式:基于回滚比率阈值动态切换普通和并行模式
  2. 推测优先级调度:在多租户流量下保持草稿-目标重叠
  3. 草稿侧提示压缩:减少草稿延迟,提高并行效率
  4. 资源高效服务:复用闲置尾部模型,提高整体资源利用率

8.2 技术影响

  • 资源利用率:显著提高多模型云服务的资源利用率
  • 服务成本:降低大模型服务的运营成本
  • 吞吐量:在 Qwen3-235B-A22B 上实现 2.28x 加速
  • 实用性:支持多租户环境下的实际部署

8.3 局限性

  • 草稿模型依赖:需要合适的轻量级草稿模型
  • 通信开销:远程通信引入额外延迟
  • 模型兼容性:草稿和目标模型需要架构兼容
  • 长上下文:在极长上下文场景下效果可能下降

九、参考资源

9.1 论文链接

9.2 关键图表

图表说明路径
图 1SPECTRE 概览figure-1-overview.png
图 2执行模式时间线对比figure-2-timeline-comparison.png
图 3SPECTRE 解码流程figure-3-spectre-decoding.png
图 4TP8 吞吐量对比figure-4-tp8-throughput.png
图 5草稿流量影响figure-5-draft-traffic.png

9.3 相关论文

论文作者年份关系
EAGLE-3Li et al.2025推测解码基线
PEARLLiu et al.2025并行推测解码
MineDraftTang et al.2026远程草稿生成
SGLangZheng et al.2024服务框架

9.4 关键技术术语

术语英文说明
推测解码Speculative Decoding草稿-目标验证的加速方法
回滚比率Rollback Ratio被拒绝请求的比例
接受率Acceptance Rate被接受的草稿 token 比例
多租户Multi-Tenant多个模型共享服务资源
远程草稿Remote Drafter草稿模型部署在独立服务器

分析完成时间:2026年6月22日 分析工具:Claude Code + paper-analyzer skill + agent-browser