Back to blog

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer

SmartGen 解决自托管 LLM 推理中 P/D 分离架构的网络瓶颈问题,通过三种 KV 缓存传输路径(Profile-based Proactive、Parallel On-demand、Speculative Transfer)实现无缝分离推理

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer

一、论文概述

项目内容
标题SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer
作者Xuchuan Luo, Jiacheng Shen, Xin Wang, Yangfan Zhou
机构Shanghai Jiao Tong University(推测)
论文arXiv:2607.28150
发布2026-07-30
领域LLM 推理系统、P/D 分离、KV 缓存优化

二、核心思想

问题定义

LLM 推理中的 P/D 分离架构(Prefill/Decoding Disaggregation)通过将两个阶段分配到独立节点实现灵活的资资源配。然而,自托管(self-hosted)部署场景面临严峻的网络瓶颈:

  • KV 缓存传输时间开销巨大:48K token 上下文传输耗时是 prefill 计算的 6.5×
  • 云 GPU 实例网络带宽有限:L4、L40S 等实例仅提供 15–25 Gbps
  • 现有方案逐层传输 KV 缓存,无法缓解网络饱和问题

解决方案概述

SmartGen 提出选择性 KV 缓存传输,通过三种传输路径协同工作:

  1. Profile-based Proactive Transfer:基于位置相似性识别通用重要 KV 条目,在 prefill 阶段主动推送
  2. Parallel On-demand Transfer:将 KV 索引拆分为本地/远程两部分,双车道并行加载
  3. Speculative Transfer:利用注意力计算期间的空闲资源,在后台传输剩余 KV 条目

三、技术架构

整体框架

SmartGen 整体架构

SmartGen 将 KV 缓存条目分为三类,对应三条传输路径:

KV 类型传输路径时机目标
通用重要条目Profile-based ProactivePrefill 阶段提前推送
上下文相关条目Parallel On-demandDecoding 阶段按需获取
次要条目Speculative解码后台投机传输

核心机制

0. 位置相似性观察

位置相似性

1. 位置相似性(Positional Similarity)

重要 KV 条目在输入序列中倾向于出现在相似位置。论文通过分析发现,InfiniGen 选择的 KV 条目在不同模型和数据集上呈现高度一致的位置分布。

2. 双车道并行获取

将 KV 索引拆分为本地索引和远程索引:

  • 本地车道:从 host memory 加载已缓存的 KV 条目
  • 远程车道:通过 RDMA RPC 从 prefill 节点获取缺失条目
  • 两个车道并行执行,消除网络往返的关键路径延迟

双车道并行获取

3. 投机传输

利用注意力计算期间暴露的空闲 CPU 和 RDMA NIC 资源:

  • 在当前层执行注意力计算时,后台传输下一层所需的远程 KV 条目
  • 避免与 on-demand 传输竞争网络和计算资源

投机传输机制


四、核心创新

创新点说明实验依据
选择性 KV 传输通过 KV 选择算法减少传输量传输时间减少 60%+
位置相似性观察重要 KV 条目具有跨样本位置一致性Figure 5 验证
双车道并行本地/远程 KV 并行加载消除网络往返延迟
投机传输利用空闲网络资源后台传输TBT 开销最小化
通用性设计兼容 InfiniGen 和 HATA 等选择算法与两种基线集成均有效

五、代码实现分析

实验设置

测试平台:阿里云 GPU 实例

实例类型GPUvCPUDRAM网络
ecs.gn8is-2x.8xlarge2× L20 (2×48GB)32256GB32 Gbps
ecs.gn8is.4xlarge1× L20 (48GB)16128GB25 Gbps
ecs.gn8is.2xlarge1× L20 (48GB)864GB15 Gbps

模型:Qwen3、Llama-3.1、Gemma-3、Phi-4

工作负载:LongBench 基准(MultiFieldQA、GovReport、SAMSum、LCC)

参数配置

  • KV 块数 MM:1K
  • DP 程度:6
  • 输出长度:64 tokens
  • 投机比例:10%
  • prefix cache 命中率:75%

六、实验结果

主要性能对比

CTL 时间序列

CTL 分解

关键指标:

  • CTL(Cumulative Per-Token Latency):平均每请求累计延迟
  • TTST(Time-to-Second-Token):KV 传输性能
  • TBT(Time-Between-Tokens):解码开销

性能提升

相比 Full Transfer 基线,SmartGen 实现:

  • TTST 降低 60%+:消除 stage-transition stall
  • CTL 显著改善:平均延迟大幅下降
  • 精度保持:在 LongBench 上保持与 full-cache 相当的准确率

批量大小影响

批量大小性能

带宽敏感性

带宽敏感性

在不同网络带宽下(15 Gbps / 25 Gbps / 32 Gbps),SmartGen 均显著优于 Full Transfer 和 HACK 量化方案。

消融研究

各技术组件的贡献: 因子分析

  1. Profile-based Proactive Transfer:消除 prefill 阶段传输阻塞
  2. Parallel On-demand Transfer:消除解码阶段网络往返
  3. Speculative Transfer:进一步降低 TBT 开销

投机传输效果

主动传输效果

敏感性分析


七、相关工作

LLM 推理系统

  • vLLM, TGI, SGLang:单体推理引擎
  • DistServe, Splitwise, TetriInfer:P/D 分离架构
  • Mooncake, Dynamo:商业级分离推理系统

KV 缓存管理

  • InfiniGen, HATA:KV 选择算法
  • Quest, H2O:基于注意力分数的缓存压缩
  • RetroInfer:检索增强的 KV 缓存管理

量化方案

  • HACK:同态量化压缩 KV 缓存到 int2

八、总结

核心贡献

  1. 识别并量化了自托管 P/D 分离推理的网络瓶颈:48K 上下文传输耗时是 prefill 的 6.5×
  2. 提出位置相似性观察:重要 KV 条目具有跨样本位置一致性
  3. 设计三种传输路径协同的 SmartGen 引擎:Proactive + On-demand + Speculative
  4. 实验验证显著性能提升:在多种模型和云实例配置下均有效

技术影响

  • 为自托管 LLM 部署提供了实用的 P/D 分离解决方案
  • 位置相似性观察可启发其他 KV 缓存优化研究
  • 三路径架构可推广到其他受限网络场景的推理系统

局限性

  • 依赖 KV 选择算法的准确性
  • 投机传输可能受网络波动影响
  • 当前评估主要在阿里云平台,需更多云厂商验证

九、参考资源

  • SmartGen 论文: https://arxiv.org/abs/2607.28150
  • InfiniGen: OSDI 2024
  • HATA: ACL 2025
  • HACK: SIGCOMM 2025
  • Mooncake: FAST 2025
  • DistServe: OSDI 2024
  • Splitwise: ISCA 2024
  • LongBench: ACL 2024