Back to blog

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

面向现代 LLM 推理服务的离散事件模拟器,支持解耦架构、运行时优化和有状态工作负载,吞吐量误差低于 4%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

论文信息: arXiv:2605.21312 [cs.DC] 13 Jun 2026

作者: Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构: The Chinese University of Hong Kong, Anuttacon, StepFun

代码: https://github.com/NetX-lab/Frontier

许可: arXiv.org perpetual non-exclusive license


一、论文概述

1.1 研究背景

现代 LLM 服务系统已不再是同质化或单体化的架构。生产系统现在结合了解耦执行、复杂并行策略、运行时优化和有状态工作负载(如推理、Agent 和 RL rollout)。模拟是探索这一日益增长的设计空间的有效方法,但现有模拟器缺乏架构完整性和决策级保真度。

核心挑战:

挑战说明
架构不完整现有模拟器假设同质单体复制集,不支持解耦架构
保真度不足平均情况分析代理可能扭曲 SLA 预测,甚至反转优化结论
运行时优化缺失CUDA Graph、投机解码等优化未被正确建模
有状态工作负载推理、Agent、RL rollout 等新兴工作负载的复杂性

1.2 核心贡献

贡献说明
解耦抽象支持 PDD(Prefill-Decode 解耦)和 AFD(Attention-FFN 解耦)架构
运行时优化建模正确建模 CUDA Graph、投机解码、前缀缓存等优化
高保真预测吞吐量误差低于 4%,延迟误差从 44.9% 降至 6.4%
可扩展性支持超过 1K GPU 的模拟

二、核心思想

2.1 问题定义

现有 LLM 推理模拟器存在两个根本性缺陷:

1. 架构不完整:

  • 大多数模拟器(如 Vidur、APEX)假设同质单体复制集
  • 无法支持解耦架构(PDD、AFD)
  • 运行时优化被视为分析补丁而非一等行为

2. 保真度不足:

  • 平均情况分析代理无法捕捉批处理异质性
  • 导致 SLA 预测错误,甚至优化结论反转

2.2 解决方案概述

Frontier 是一个面向现代 LLM 推理服务的离散事件模拟器,采用解耦抽象,将硬件感知预测与控制和执行平面分离。

Frontier 系统架构 图 6:Frontier 系统架构。


三、技术架构

3.1 系统架构

Frontier 由四个模块组成:

模块功能
Workload and Config定义服务场景:模型、服务架构、并行策略、运行时选项、请求工作负载
Fidelity Plan提供校准的每算子、通信和内存容量预测
Control Plane提供解耦原语和基于依赖的控制流
Execution Plane启用特性特定的执行流,推进请求通过调度、批处理、运行时适配和跨集群传输

3.2 解耦架构支持

Frontier 支持三种服务架构:

架构说明特点
Co-locationPrefill 和 Decode 在同一集群单调度器,KV 缓存共享
PDDPrefill-Decode 解耦计算密集 Prefill 与内存密集 Decode 分离
AFDAttention-FFN 解耦Decode 阶段的 Attention 和 FFN 分离到不同硬件池

3.3 并行策略表达

Frontier 引入双域分解来表达并行策略:

  • Replica 参数化:(pp,tpattn,dpattn,tpffn,epffn)(pp, tp_{attn}, dp_{attn}, tp_{ffn}, ep_{ffn})
    • pppp:Pipeline 并行度
    • tpattntp_{attn}:Attention 张量并行度
    • dpattndp_{attn}:Attention 数据并行度
    • tpffntp_{ffn}:FFN 张量并行度
    • epffnep_{ffn}:FFN 专家并行度

3.4 保真度平面

保真度平面提供三类预测:

预测类型说明
算子延迟基于核函数级建模,支持 BF16/FP8
通信成本建模跨集群 KV 缓存传输和激活传输
内存容量KV 缓存预算建模,考虑非 KV 缓存内存开销

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
解耦抽象支持 PDD 和 AFD 架构系统架构设计
运行时优化建模CUDA Graph、投机解码、前缀缓存事件级建模
有状态工作负载支持推理、Agent、RL rollout多阶段推理调度
核函数级保真度逐算子延迟预测实验验证

4.2 CUDA Graph 建模

CUDA Graph 影响 图 1:CUDA Graph 对 TPOT 的影响。

关键发现:

  • Frontier 在 co-location 下匹配 vLLM 的解码加速(误差 1.7%)
  • 在 PDD 下误差 6.1%,保持 2.86-3.05× 加速包络
  • AIConfigurator 忽略图捕获建模,产生工作负载无关的 TPOT 表面

4.3 投机解码建模

事件级 MTP 建模:

  • 追踪每个请求的计划、验证、接受和提交 token
  • 将 MTP 建模为 draft→verify→commit 循环
  • 保留批内每请求的投机深度和接受方差

结果:TTFT、TPOT、吞吐量和 E2E p95 误差均在 11.28% 以内。


五、代码实现分析

5.1 项目结构

组件说明
Control Plane仿真编译器、并行原语、依赖控制流
Execution Plane调度器、批处理引擎、运行时适配器
Fidelity Plane算子延迟预测、通信成本预测、内存容量预测
Workload Generator请求到达事件生成

5.2 关键实现

  • 事件驱动仿真循环:每个 Cluster Worker 由独立的离散事件引擎驱动
  • 跨集群协调:通过集群间事件队列协调解耦架构
  • 指标追踪:记录每个请求的完整生命周期

六、实验结果

6.1 算子保真度

算子误差 CDF 图 7:H800 上 attention 和 MoE 算子的相对误差 CDF。

BF16 结果:

算子p50 误差p95 误差
Attention3.5%14.2%
Linear3.3%6.4%
GroupedGEMM1.4%5.3%

FP8 结果:

  • Attention p95 误差降至 8.8%

Vidur 对比:

  • Attention p50/p95:55.4%/376.1%(token-only 预测器)
  • GroupedGEMM:未定义

6.2 内存保真度(KV 缓存预算)

模式并行配置vLLMFrontier 误差分析基线误差
Co-loc(1,8,1,8)31k+0.02%+14.10%
Co-loc(4,2,1,2)58.0k+1.76%+21.38%
Disagg(2,2,2,4)27.0k+1.89%+27.95%
Disagg(1,4,1,4)12.0k+0.01%+39.73%

关键发现:分析基线高估可用块数 14.10%-39.73%,因为忽略了运行时非 KV 缓存内存开销。

6.3 端到端保真度

端到端保真度 图 11:16 卡 H800 测试平台上的端到端保真度。

Co-location 结果:

  • Frontier 在 32 个案例中跟踪 vLLM 误差在 9.37% 以内
  • TPOT-p95 和 E2E makespan 在除一个案例外均在 6.4% 以内
  • Vidur 误差范围:2.9%-45.5%

PDD 结果:

  • Frontier 平均误差:TTFT 2.75%,TPOT 4.37%,吞吐量 0.80%,E2E 5.01%

6.4 与现有模拟器对比

模拟器支持 PDD支持 AFD支持 MoE支持 CUDA Graph支持投机解码
Frontier✓✓✓✓✓
AIConfigurator✓✗✓✗有限
Vidur✗✗✗✗✗
LLMServingSim2.0✗✗✓✗✗
Apex✗✗有限✗✗

七、应用场景

7.1 SLA 依赖的 Pareto 前沿探索

Pareto 前沿 图 13:256×H800 GPU 上的吞吐量-生成速度 Pareto 前沿。

关键发现:

  • 松弛 TTFT 约束(≤3000ms):PDD 最优,达 137.4K toks/s
  • 严格 TTFT 约束(≤500ms):AFD 最优,达 116.2K toks/s
  • Co-location 仅达 27.7K toks/s

7.2 异构 GPU 解耦服务

问题:在解耦架构中,异构 GPU 如何影响性能-成本权衡?

发现:

  • PDD 和 AFD 可以将硬件折扣转化为成本效率
  • 不同角色分配产生不同的性能-成本曲线

7.3 有状态推理调度验证

相位感知调度 图 15:多轮推理的相位感知调度。

问题:现有调度器(如 vLLM)无法有效处理多阶段推理工作负载。

解决方案:提出 H2Q-BR(History-Aware Two-Queue Scheduling with Bounded Release)调度算法。

7.4 RL Rollout 动态并行重配置

动态重配置 图 16:动态重配置的性能增益。

问题:RL 训练的 rollout 阶段需要动态调整并行策略。

发现:Frontier 可以验证动态并行重配置策略的有效性。


八、总结

8.1 核心贡献

  1. 解耦抽象:支持 PDD 和 AFD 架构,正确建模跨集群数据传输
  2. 运行时优化建模:CUDA Graph、投机解码、前缀缓存等优化的一等建模
  3. 高保真预测:吞吐量误差低于 4%,延迟误差显著降低
  4. 可扩展性:支持超过 1K GPU 的模拟
  5. 应用场景:SLA 优化、异构 GPU 分配、调度算法验证、RL 重配置

8.2 技术影响

  • 系统设计:为解耦架构提供准确的性能建模工具
  • 资源优化:支持 SLA 依赖的 Pareto 前沿探索
  • 算法验证:为新兴调度算法和运行时优化提供验证平台
  • 成本优化:支持异构 GPU 分配的成本效率分析

8.3 局限性

  • AFD 实现:目前使用内部实现,缺乏公开的 AFD 实现
  • 模型支持:主要验证了 MoE 和 dense 模型,其他架构需进一步验证
  • 硬件覆盖:主要在 H800 上验证,其他 GPU 类型需进一步测试

九、参考资源

9.1 论文链接

9.2 关键图表

图表说明路径
图 1CUDA Graph 影响figure-1-cuda-graph-impact.png
图 6系统架构figure-6-system-architecture.png
图 7算子误差 CDFfigure-7-operator-error-cdf.png
图 11端到端保真度figure-11-e2e-fidelity.png
图 13Pareto 前沿figure-13-pareto-frontiers.png
图 15相位感知调度figure-15-phase-aware-scheduling.png
图 16动态重配置figure-16-dynamic-reconfiguration.png

9.3 相关论文

论文作者年份关系
VidurAgrawal et al.2024离散事件模拟器,缺乏解耦支持
AIConfiguratorXu et al.2026NVIDIA SOTA 模拟器,分析工作流
vLLMKwon et al.2023推理引擎,Ground Truth
SGLangZheng et al.2024推理引擎,前缀缓存

9.4 关键技术术语

术语英文说明
Prefill-Decode 解耦Prefill-Decode Disaggregation (PDD)将计算密集 Prefill 与内存密集 Decode 分离
Attention-FFN 解耦Attention-FFN Disaggregation (AFD)将 Decode 阶段的 Attention 和 FFN 分离
离散事件模拟Discrete-Event Simulation基于事件驱动的仿真方法
CUDA GraphCUDA Graph减少内核启动开销的优化技术
投机解码Speculative Decoding加速自回归生成的技术
KV 缓存预算KV-cache Budget可用于存储 KV 缓存的内存容量

分析完成时间:2026年6月23日 分析工具:Claude Code + paper-analyzer skill