A Photonic-CXL Memory Appliance for Scalable KV Cache Management in LLM Inference
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
83 posts tagged with "inference-serving"
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
CXL-Hybrid Memory-based remote KV-cache tier for scalable multi-turn LLM serving
A selective KV recomputation method using attention-norm criteria from query to context tokens to identify information-flow-critical tokens for long-context inference
面向 LLM 推理的 HBF(高带宽闪存)与 HBM GPU 软硬件协同设计:通过架构级 SRAM 缓存/预取、专用数据布局与异构存储管理层,将 HBF 的容量优势转化为吞吐与能效。
一个因果视频生成世界模型,实现无限长、实时响应的交互式世界模拟,支持多种角色动作和环境事件,并引入Pilot-Director双智能体协作框架
PSA提出渐进式稀疏注意力机制,通过阈值驱动的自适应KV块选择替代固定top-k策略,结合流水线迭代执行和统一内存管理,在保证精度的同时最大化推理吞吐。
Adrenaline提出注意力分离与卸载机制,将解码阶段的注意力计算卸载到预填充实例,解决PD分离导致的资源利用率低下问题,最高提升1.68×推理吞吐。
TaiChi提出一种统一的LLM推理服务系统,通过混合模式推理和延迟迁移调度策略,在任意TTFT和TPOT SLO组合下实现最优goodput。
面向 PD 分离式 LLM 服务的负载感知 Prefill 偏转调度器 Kairos:让 decode 节点以 chunked-prefill 方式代跑 prefill,消除跨节点 KV 传输,P95 TTFT 最高降低 81%。
End-to-end TPU migration for Gemma 4 31B: 1.61× faster training at 2.12× lower cost, with 66% higher long-context inference throughput
Autoscaling framework using token velocity metric and convertible decoders for 80-96% SLO attainment in disaggregated LLM serving
TetriServe 针对异构分辨率、紧 SLO 的 Diffusion Transformer 在线服务,首创 step-level sequence parallelism:把连续时间轴离散为固定长度轮次,先用剖析驱动的成本模型为每个请求求最小 GPU-hour 分配以满足 deadline,再以'避免必迟到'为目标做请求打包。相较固定 SP baseline,SLO Attainment Ratio 最高提升 32%,覆盖 FLUX.1-dev 与 SD3、H100 与 A40,稳定应对突发流量。
ProServe 将多优先级 LLM 服务形式化为服务增益最大化问题,提出 Token-level Deadline-aware Gain (TDG);引擎层 SlideBatching 用滑动 urgent/normal 边界结合密度与截止时间排序,服务层 GoRouting 做增益导向、感知能力的分发,跨四个开源数据集与工业追踪相对 SOTA 系统增益提升最多 35%、SLO 达成率提升最多 52%。
Nightjar 将投机长度选择建模为上下文多臂赌博机(Contextual MAB),按 batch 大小自适应选择 γ 或彻底关闭投机,并在高负载下把 draft 模型 offload 到 CPU 释放显存扩大 KV cache;在动态请求率下相比标准 SD 吞吐提升最高 14.76%、延迟降低最高 20.18%,相比无 SD 平均提升 27.29%。
PASTE 通过 Pattern Tuple 抽象从历史执行中挖掘控制流与数据依赖,基于风险感知的机会式调度在 LLM 生成阶段就投机执行未来工具调用;跨深度研究、编码、科学 agent 工作负载将端到端任务完成时间平均降低 43.5%,工具延迟降低 1.8×,验证空闲达 10×。
RouterWise 首次将多模型 LLM 路由与 GPU 资源分配联合建模,通过对偶价格公式化的分数最大化路由 + setup 特化的延迟分析模型,搜索可行的 tensor 并行/GPU 线程份额组合,在满足延迟 SLO 前提下最大化输出质量。实验表明同一 GPU 集群下不同 setup 的可达质量差异高达 87%,证明资源分配是路由性能的关键决定因素。
Tangram 利用「Head-wise 保留量存在输入无关的两级结构」的观察,把非均匀 KV 压缩静态化:Budget Reservation 在调度时固定每头预算、Ragged Paging 用同预算 head 组成独立 page 表消除碎片、AOT Load Balancing 预算 CTA 划分。作为 vLLM drop-in 层,在五个模型 SCBench 上匹配原精度同时端到端吞吐相较 Full-KV 最高提升 2.6×。
首次系统性研究GPU上LLM推理引擎的软件老化现象。以三种部署栈(vLLM standalone/Triton+vLLM/PyTorch+HF)在NVIDIA L40S上做6×36小时=216小时压力测试,结合Mann-Kendall/Theil-Sen统计流水线,发现所有部署均存在统计显著的进程私有内存泄漏,泄漏率跨约两个数量级(1.8→157 KB/h),且最脏配置为Triton包裹的旧V0引擎。
M* 提出 Walk Graph 抽象把组合式多模态模型建模为组件级 dataflow 图 + 命名 Walks;请求成为图上的遍历。四种组合原语(Sequential/Parallel/Loop/DynamicLoop)与流式边策略统一表达 UMM、Omni、SpeechLM、VLA 与世界模型。BAGEL T2I 端到端延迟低 20%,Qwen3-Omni TTS RTF 快 2.9×、吞吐高 2.7×,V-JEPA 2 机器人 rollout 提速 12.5×。
GF-DiT 把 GPU 并行度视为一等可调度资源,将 DiT 请求拆为可独立调度的 trajectory tasks 并支持在线 GPU 重分配;提出 group-free collectives 用符号缓冲区 + 边协商实现毫秒级动态通信组,把 communicator 建立时间从 778 ms 降到约 60 μs;相比静态并行 pipeline 吞吐提升最多 6.01×、平均延迟降低最多 95%、SLO 违约率降低最多 90%。
Gimbal 为 MoE LLM 推理设计跨层协同调度:前端基于 KV / prefill / 队列 / 专家压力的细粒度 DP 引擎选择 + 引擎内 SJF+aging 队列;后端结合源感知路由统计与 MINLP 校准的启发式专家放置,实现前后端反馈闭环,在 vLLM 之上将 TTFT 降 42.9%、TPOT 降 33.3%,高负载吞吐提升 3.0%。
将 LLM 连续批处理下的 KV-Cache 内存增长建模为离散动力系统,证明同质负载下无驱逐平衡点不稳定,最坏极限环吞吐损失可达 50%;异质负载在共素解码长度下才能稳定;给出速率限制准入与请求混合两种消驱逐策略。
Tropical 在 disaggregated LLM 服务基础上引入 SLO-aware 多路复用:Multiplexing Toggle 用 slack 检测把短 prefill 借道 decode worker 执行、长 prefill 走独占 prefill worker,兼得低排队与低干扰。在 Mooncake 真实 trace 上 SLO 内可服务请求提升 2.02×,P90 TTFT 相比 DistServe 优化 9×,P90 TPOT 相比 vLLM 优化 2.33×。
首个针对真实编码 Agent(Claude Code)负载的系统研究:会话闭环、上下文持续膨胀、工具触发主导;CacheWise 在 vLLM 上以约 2500 行代码扩展前缀感知调度 + 基于工具元数据的预测式 KVCache 驱逐,评测中 KV 驱逐减少 2–2.6×,session 完成时间最高降低 3.5×,token goodput 提升 1.64–2×。
针对分布式 LLM 服务中 worker 故障同时丢失 KV cache 与服务容量的问题,提出以负载感知协调决策来做故障恢复的 LUMEN。三大机制:负载感知 KV checkpointing(用 $h(r)=\arg\min_w(q_w+\lambda p_w(r))$ 把 checkpoint 分散到低负载 worker)、局部性感知恢复调度(先按 checkpoint holder 路由再按 average-based 规则重平衡)、投机辅助渐进恢复(在恢复 worker 上加载 draft model,通过 fused batch 单次前向验证辅助最拥堵的存活 worker)。SGLang 原型上,Qwen3-32B/14B 相比 Stop-and-Restart 降低 TTFT 44.4%/29.6%、recovery time 50.0%/64.1%;大规模模拟中在 64 worker、25% 故障率下仍有 46.8-51.2% TTFT 降幅。
针对异构 LLM 服务栈的两层调度割裂(router 忽略实例负载,load balancer 忽略质量)问题,将模型路由与负载均衡融合为对具体模型实例的在线赋值。对每批请求求解 quality-latency-cost 三维单纯形加权得分:batched MiniLM+KNN 一次估算 prompt 内在的 quality/output-length,per-tier XGBoost TPOT + dead-reckoning 在线估计延迟,按 LPT 顺序贪心分派。在 13 实例 28 GPU 异构集群、四种模型规模上,单套栈只调权重就能横跨 quality-cost-throughput 前沿;平衡预设在 2.8 s 端到端延迟与 30 req/s 下领先增强版 BEST-Route 2.6-4.1×,最高质量 DeepEval 0.419(+0.013 优于最强基线)。
针对第三方共享加速器基础设施上的模型外泄威胁(如 Hermes 通过被动 PCIe 观测无损重建 DNN、TunnelS 通过驱动级访问以高吞吐外泄 HBM),提出软件层内存混淆框架 CloakLM。结合 PCIe 流量整形、层间/层内权重乱序与物理 HBM 页面重映射三种机制,让授权执行保持有效虚拟内存布局且开销可忽略,而未授权观察者看到的是碎片化、语义不连贯的状态。集成于 vLLM 与 PyTorch,与机密计算互补,在 LLaMA/Qwen 分布式推理上实现接近原生的性能同时大幅提高对 PCIe 窃听与 HBM dump 攻击的抵抗力。
面向异构 spot GPU 集群的低成本 LLM 服务系统。用 roofline 模型解析式估算性能,动态规划联合优化节点配置、并行策略与层分配以最大化异构 GPU 吞吐;结合输出保持的请求迁移与共享 tensor store 并发初始化,将替换节点的准备与在服请求重叠以最小化迁移停机。在 AWS L4/A10G/L40S 异构集群上,Llama-3.1-70B 与 Qwen3-32B 相比 SOTA 基线吞吐分别提升 1.42× 与 1.35×,相比 on-demand 实例在离线/在线服务分别节省 31.9% 与 31.2% 成本。
首个面向流式视频生成服务的调度系统。将服务建模为在线调度问题,通过迁移感知的 min-max 会话再平衡与负载驱动的 GPU 自动扩缩,配合 GPU-CPU 卸载和 RDMA 会话迁移,联合优化每 chunk 最差延迟与 GPU 成本。在生数科技生产 trace 上,相比基线平均降低最坏每 chunk 延迟 37.5%(最高 51.6%)、降低 GPU 运营成本 37.2%(最高 49.0%),且与离线 oracle 相比调度成本仅差 6.1%。
FlashRT 提出 execution-state capsule:把整个 forward 用 CUDA Graph 静态缓冲区捕获,再把已提交边界处的 KV / 循环 / 卷积 / MTP / 元数据整个 buffer set 作为可 freeze/restore/fork/rollback 的显式对象。相较 vLLM 冷路径,同 hybrid LLM 单流 TTFT 从 200/365/723ms 降到 51/53/54ms,相较 vLLM APC 也快 1.4–2.8×;16k prefix 时相较自身 cold 加速 27×,restore/snapshot 亚毫秒完成,KV-only 恢复的 97.9% token 会发散,证明 hybrid recurrent 状态必须整体 snapshot。
WiSP 将低资源 MoE serving 建模为专家权重与 KV 缓存两条 working-set 争夺同一 VRAM 的问题。核心是 routing-aware expert pager(基于 expert_map 的 LRU 分页,字节等价输出)加 MV-WSA 边际价值分配器,联合分配 expert scratch 与 KV pool。iso-VRAM 下相对 vLLM static offload 解码吞吐最高提升 1.95×,Jamba-52B/MiniMax-M2-229B 等 baseline 无法启动的模型上也能可服务,且揭示单流 decode 中 routing 预测只能省显存不能省延迟。
本文提出工业级 ML 推理容量测试框架 Vanguard:基于自适应反馈搜索(dampening / spike tolerance / convergence detection)、多指标健康评估状态机、以及流量回放的负载生成器,为 GPU 上多类别模型(推荐/排序/视觉/NLP)精确估计可持续吞吐量。14 个工业模型上估计误差中位 5.2%,与实测容量 R²=0.94,单个模型 GPU 减配 49–83%。
首个交互感知(interaction-aware)的实时 Omni-LM 服务系统:把播放进度、语音活动、barge-in 事件暴露给调度与 KV 管理。调度器用 U0/U1/U2 三级紧急度优先 first-audio 与近欠载会话、限制超前播放前沿的生成;KV 管理器用 next-use 感知驱逐替代 LRU、并在用户说话时预加载可能需要的 KV 以隐藏 reload 延迟。基于 vLLM-Omni,在两个 Omni-LM 与混合负载上把 P90 音频 TTFP 平均降 1.55×(至多 2.21×),完成请求吞吐平均升 1.15×(至多 1.56×),把大部分 KV reload 移出下一轮关键路径
系统性刻画 Intel TDX + NVIDIA GPU-CC 机密计算下 CVM–GPU 桥被串行化的性能规律,并给出可迁移的运行时/加载器/KV 恢复策略;同时首次公开 B300 机密多 GPU NVSwitch 租户能力
在固定 KV-cache 显存预算下研究异构 prefill/decode 长度的离线 LLM 服务调度:证明问题 NP-hard、FCFS/最短输出优先/总长度优先均有无界近似比;提出 Sorted-F 算法——用 F-metric(平均输出长度 / 批大小)平衡批并发与下游解码成本,证明常数因子近似比 ≤48;配三种 Phase-1 求解器(精确 DP、局部交换、分位贪心)与 LP 引导 / receding-horizon 变体。真实混合负载上相对 FCFS 提速 4.87×、相对 MC-SF 提速 2.09×,与 LP 下界差距仅 1.03-1.09×
面向 prefill-decode 分离式 LLM 服务的 GPU 友好、无损 KV cache 传输压缩器。核心洞见:BF16 KV 激活的冗余集中在指数字段(指数熵仅 2.89-3.59 bit,而 BF16 指数占 8 bit),Top-16 高频指数即覆盖 ≥99.3%。SplitZip 用定长 4-bit 码编码高频指数(两码打包一字节),罕见指数走稀疏 escape 流(位置+原值),符号-尾数原样保留——比特级无损。离线校准 Top-16 码本消除在线直方图;规整稠密路径 + 稀疏 escape 修正使编解码在 GPU 上无分支高效。真实 BF16 激活上达 613.3 GB/s 压缩、2181.8 GB/s 解压(超越所有已测无损压缩器);端到端 BF16 KV 传输加速 1.32×、TTFT 1.30×、请求吞吐 1.23×;同法扩展 FP8 在 E5M2 上再压 1.14×
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
将位置无关 KV 复用(PIC)的恢复粒度从「token 级」提升到「注意力头级」——离线将每个 (layer, head) 分类为 global(12-15%,复用时重算)/ local(85-88%,滑窗内原样复用),配合 token 选择性稀疏 FFN 攻克短上下文 FFN 瓶颈;再以 SegPagedAttention 按 (layer, head) 分页物化头级稀疏、走 FlashAttention 快路避开 attn_mask 4.9-7.6× 惩罚。8×H800 上 TTFT 加速 1.6-3.54×(DeepSeek-V4 达 5.16×)、并发会话 4.7-7.8×、prefill FLOPs 降 67-79.5%,精度媲美稠密
首个在运行时于专家并行(EP)与张量并行(TP)间无缝切换、不重启引擎、不丢弃在途请求的 MoE 服务系统。核心洞见:EP 与 TP 是同一模型的两种布局而非两个模型,切换只改变「哪个 rank 拥有哪一片」,唯一成本是搬运换主字节,NVLink 使其在两次 decode step 间完成。用统一内存管理器保持 CUDA graph 跨切换有效、融合直传 kernel、双控制平面同时驻留。8×H200 服务 Qwen3-235B-A22B,RL rollout 超越 1.16-1.25×,每次切换 215-434ms,仅 2.4% 显存开销
首个面向扩散语言模型(DLM)的集群级服务系统。DLM 每步并行解掩多个 token,比自回归模型吞吐高 1.75×,但引入置信度阈值这一「速度-质量」旋钮与 TP 度「时延-吞吐」权衡。DiLaServe 以「去噪步」为调度粒度,用 SLO 感知阈值调整 + 自适应负载控制动态选阈、轻量梯度提升 Step Predictor 在线预测剩余步数、按最低步时延调度并支持步级迁移、两阶段 ILP 定期重构集群 TP 配置,并把近似 KV 缓存的 cache/recompute 步异构成本纳入调度。基于 vLLM+Ray 实现(9500 行),真实 trace 上 SLO 达成率 +30.2pp、时延 -46%、质量仅降 0.09;多基准最高 +56.6pp SLO、精度仅降 0.9%
Prism 通过 GPU 内存气球技术实现多 LLM 共享服务,统一时间共享和空间共享,SLO 达标率下支持 2.3-3.5x 更多请求,已在 10K+ GPU 生产环境部署
硬件感知的TB级CTR模型训练框架,通过k步模型合并和拓扑感知通信优化实现4倍加速
编译器驱动的注意力编程模型,用几行PyTorch代码实现优化的注意力内核
从生产实践角度重新审视KV缓存压缩技术,揭示吞吐量、响应长度和负样本三个被忽视的关键维度
消除 Hopper GPU 上低精度训练和推理的填充需求
分解大语言模型的高效并行推理系统
NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真
基于微缩放和自动缩放的高效FP8 LLM训练方法,实现34%吞吐量提升
免训练扩散模型加速框架,利用U-Net高层特征的时间冗余实现缓存复用
首个面向企业级LLM推理的开源高效KV缓存层,支持跨查询复用和PD分离架构
面向多轮LLM Agent RL训练的可扩展基础设施,通过Rollout-as-a-Service解耦训练与推理
面向长上下文LLM服务的分层上下文缓存框架
本文提出EaaS,一种将MoE模块解耦为独立无状态服务的新型服务系统,实现细粒度资源扩展和固有容错能力,在模拟硬件故障下吞吐量下降不超过2%,并可节省高达37.5%的计算资源。
阿里巴巴高性能LLM推理引擎,服务超1亿用户的大规模部署
通过设备内并行实现最优LLM服务吞吐量
基于查询感知模型扩展的文本到图像扩散模型高效服务系统
细粒度MoE模型推理优化分析,探索专家跳过和专家剪枝的效率与性能权衡
通过随机共激活采样和层次化路由器损失,实现MoE模型推理时弹性扩展,有效扩展范围达训练时k的2-3倍
通过聚合异构互连(NVLink、PCIe、RDMA NIC)提升节点内集合通信带宽
软件定义的多路径内存访问系统,打破LLM服务中的主机-GPU带宽瓶颈
面向MoE模型的弹性推理框架,将故障影响限制在单个worker级别,实现160-213×的停顿减少
通过O(1)主机缓存实现快速、实时的大模型自动扩展
通过退出感知结构化dropout增强早期退出Vision Transformer性能
面向多模态大模型的EPD阶段解耦推理系统,在昇腾NPU上实现57-69%吞吐量提升
基于最大流的异构GPU集群LLM推理服务系统
小米机器人团队发布的先进VLA模型,通过精心设计的训练方案和部署策略实现高性能实时执行
DVM:基于字节码虚拟机的动态张量计算方法
Polar:在任意Agent Harness上规模化进行Agentic RL训练
GPU上稀疏矩阵乘法的设计原则
基于GPU虚拟内存管理的高效LLM推理张量结构
受 LLM 启发的序列优先点击率预测建模范式
面向异步GPU架构的稀疏矩阵乘法加速
Agentic RL 正在重塑 LLM 后训练,但端到端训练时间被计算密集的多轮 rollout 主导,占总时间的 70% 以上。关键挑战:
Routing-Free MoE 提出无需路由的混合专家模型架构。
OdysseyLLM 提出可部署的大语言模型量化加速方案。
OmniQuant 提出全方位校准的大语言模型量化方法。
通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理
针对资源受限环境的低延迟视觉语言模型推理流水线
云原生LLM推理基础设施框架,通过协同设计实现高密度LoRA管理、分布式KV缓存和异构GPU调度
A pragmatic approach to building a design system that scales with your startup without slowing you down.
Learn how to build fast, content-focused websites with Astro's island architecture and zero-JS-by-default approach.
面向大规模分布式模型训练的故障机器检测系统,基于LSTM-VAE无监督异常检测与机器级相似性分析,实现秒级故障响应。
大型自回归模型(如 Transformer)的推理速度很慢——解码 K 个 token 需要 K 次串行运行模型。这成为了部署大型语言模型的主要瓶颈。