Topology-Aware Data Movement for Disaggregated GPU Inference
TopKV — 拓扑感知的KV缓存传输编排器,利用GPU互连层次结构将KV缓存传输延迟降低3-18倍
106 posts tagged with "kv-cache"
TopKV — 拓扑感知的KV缓存传输编排器,利用GPU互连层次结构将KV缓存传输延迟降低3-18倍
首个将张量生命周期管理从计算栈中解耦的分布式服务层,通过 Artifact/Operation/Plan/Signal 四抽象实现 TaaS 范式,集成 vLLM/SGLang 后权重物化加速 60×、KV 缓存共享 TTFT 降低 87.5%
SmartGen 解决自托管 LLM 推理中 P/D 分离架构的网络瓶颈问题,通过三种 KV 缓存传输路径(Profile-based Proactive、Parallel On-demand、Speculative Transfer)实现无缝分离推理
ResKV 将固定 KV 预算划分为精确主缓存和紧凑残差缓存,通过共享 softmax 重建被丢弃 token 的注意力贡献,显著提升长上下文推理效率
MiniWorld 提出轻量级可复现的视频世界模型训练框架,基于块因果 Video DiT + Flow Matching + 块级非递减噪声调度 + 滚动 KV Cache 流水线异步去噪,可在单台 8-GPU 服务器上数天内完成训练
Resource-Fair Scheduling 将 LLM 推理中的 batching 外部性形式化为资源公平问题,提出 LJF 和 ISJL 两种公平调度算法,并建立利润分解理论将吞吐量与线性定价下的运营成本对齐
BF16下KV缓存的增量构建与一次性prefill虽然token相同但产生不同轨迹;FP32消除分歧;双向K/V缓存移植使所有分歧轨迹跟随donor
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
CXL-Hybrid Memory-based remote KV-cache tier for scalable multi-turn LLM serving
A selective KV recomputation method using attention-norm criteria from query to context tokens to identify information-flow-critical tokens for long-context inference
AAFLOW+系统将KV缓存作为一等分发系统对象,实现零拷贝的多智能体工作流执行状态共享
面向AI加速器的LLM Token阶段优化框架FastTPS,包括全局KV缓存管理、序列维度扁平化、Fusion MLP等技术
A fast, memory-efficient pure-Transformer video decoder that decodes latents to pixels frame by frame using a rolling KV cache, achieving 3.6x-4.7x faster throughput and up to 11x less GPU memory compared to convolutional decoders.
Training-free parallel decoding framework for block-wise diffusion LLMs using gated wavefront execution and heterogeneous wavefront packing
Cost-Efficient Remote KV-Cache Tier Using CXL-Hybrid Memory for Scalable LLM Serving
A KV Cache Framework for Multi-Turn LLM Serving with CXL-Hybrid Memory
A robust KV cache management framework using Wasserstein distributionally robust optimization (DRO) to jointly optimize GPU parallelism, cache reservation, request routing, and prefix caching under output token length uncertainty.
Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding
Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding via Speculative Execution and Incremental Repair
基于 Johnson-Lindenstrauss 引理的旋转二进制量化 KV Cache 框架,通过高吞吐 binary-INT4 算术实现无偏代理分数估计,支持自适应 Top-p 检索,在长上下文推理中实现 2.16× 端到端加速且精度几乎无损
Model-agnostic extractive prompt compression framework using sentence-frequency-ordered lexical trie to prevent theme collapse under tight budgets
作为预训练长上下文 Transformer 的即插即用分层路由算法,保留原始注意力投影,仅通过查询-键内容路由选择历史 token 进行精确 token 级注意力计算
面向同步 Agentic RL 的 workload-aware rollout 系统,通过 model-free speculative decoding (SuffixDecoding) 和 cache-aware scheduling 联合优化解码与调度
基于 Wasserstein DRO 的鲁棒 KV Cache 管理框架,联合优化 GPU 并行配置、缓存预留、请求路由和前缀缓存
快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention
针对大规模 MoE LLM 推理中数据移动瓶颈的首次全面 profiling 分析,提取六大系统级洞察并在未来晶圆级 GPU 架构上验证
First generative game engine combining multi-player control, real-time inference, complex physical interaction, and adversarial gameplay in KOF '97
一个因果视频生成世界模型,实现无限长、实时响应的交互式世界模拟,支持多种角色动作和环境事件,并引入Pilot-Director双智能体协作框架
TriRoute — 单一轻量控制器联合决策注意力分辨率、FFN 专家选择与 KV-Cache 位宽,端到端可训练,单一预算旋钮扫出 Pareto 前沿,缓解跨轴路由坍缩级联
Frequency-guided and hardware-aware KV Cache reuse system achieving 3.72x-4.86x TTFT speedup and 3.93x-6.21x higher throughput via selective recomputation of semantic-critical tokens
CGO 2026 预印本 arXiv 2604.07857。Cornell + NVIDIA 团队(与 Tawa 同作者群)。这是一篇综述论文,系统梳理了 Agentic AI(感知-推理-行动闭环智能体)的能耗挑战与优化方法。核心贡献:① 提出**能量核算框架**,将 Agentic AI 能耗拆解为**计算能量**(FLOPs + 内存访问,DRAM 访问 ~640 pJ vs 算术 <1 pJ)和**通信能量**(token 传输、中间结果交换、多智能体同步)两大瓶颈;② 建立**统一分类学**,四大支柱:模型简化(量化/剪枝/蒸馏/稀疏 MoE/动作简化)、计算控制(token 长度控制/早退/层跳过/解码简化/工作负载调度)、输入与注意力优化(token 剪枝/稀疏注意力/KV 缓存复用)、硬件感知推理(精度调度/DVFS/内存 I/O 优化);③ 探讨**跨层协同设计**:跨层优化变量(传输-推理耦合/移动感知调度/模型-信道自适应)、用户-边缘-云协作(分割推理/自适应卸载/协作缓存)、通信-推理联合设计(语义通信/RAG 通信/能量感知调度);④ 识别五大开放挑战:不确定性量化自适应推理、跨模态/跨智能体协作能效、绿色 AI 与性能权衡、联邦绿色学习、碳感知智能体、6G 原生 Agentic AI、能量收集自维持系统。
PSA提出渐进式稀疏注意力机制,通过阈值驱动的自适应KV块选择替代固定top-k策略,结合流水线迭代执行和统一内存管理,在保证精度的同时最大化推理吞吐。
Adrenaline提出注意力分离与卸载机制,将解码阶段的注意力计算卸载到预填充实例,解决PD分离导致的资源利用率低下问题,最高提升1.68×推理吞吐。
面向 PD 分离式 LLM 服务的负载感知 Prefill 偏转调度器 Kairos:让 decode 节点以 chunked-prefill 方式代跑 prefill,消除跨节点 KV 传输,P95 TTFT 最高降低 81%。
Tree-structured speculative rollout cache for RL that eliminates redundant computation across rollouts, enabling faster policy optimization
Position persistent sparse attention leveraging spatial coherence of high-attention tokens across Transformer layers for 2.1× decoding speedup
rRCM reformulates generative denoising as discriminative latent-space learning for certified robustness with 85× speedup
Autoscaling framework using token velocity metric and convertible decoders for 80-96% SLO attainment in disaggregated LLM serving
Nightjar 将投机长度选择建模为上下文多臂赌博机(Contextual MAB),按 batch 大小自适应选择 γ 或彻底关闭投机,并在高负载下把 draft 模型 offload 到 CPU 释放显存扩大 KV cache;在动态请求率下相比标准 SD 吞吐提升最高 14.76%、延迟降低最高 20.18%,相比无 SD 平均提升 27.29%。
RateQuant用率失真理论把KV cache按注意力头分配bit宽度:假设量化MSE满足$D(b)=\alpha\beta^{-b}$,用reverse waterfilling闭式求最优分配,并识别distortion model mismatch这一失效模式——不同量化器$\beta$从3.6到5.3变化,套错模型比uniform更差。校准per-quantizer $\beta$并对K/V单独分配预算后,Qwen3-8B在KIVI 2.5bit的PPL从49.3降到14.9(−70%),QuaRot改善6.6 PPL;全流程校准仅1.6秒,推理零开销。
Tangram 利用「Head-wise 保留量存在输入无关的两级结构」的观察,把非均匀 KV 压缩静态化:Budget Reservation 在调度时固定每头预算、Ragged Paging 用同预算 head 组成独立 page 表消除碎片、AOT Load Balancing 预算 CTA 划分。作为 vLLM drop-in 层,在五个模型 SCBench 上匹配原精度同时端到端吞吐相较 Full-KV 最高提升 2.6×。
将 LLM 连续批处理下的 KV-Cache 内存增长建模为离散动力系统,证明同质负载下无驱逐平衡点不稳定,最坏极限环吞吐损失可达 50%;异质负载在共素解码长度下才能稳定;给出速率限制准入与请求混合两种消驱逐策略。
首个针对真实编码 Agent(Claude Code)负载的系统研究:会话闭环、上下文持续膨胀、工具触发主导;CacheWise 在 vLLM 上以约 2500 行代码扩展前缀感知调度 + 基于工具元数据的预测式 KVCache 驱逐,评测中 KV 驱逐减少 2–2.6×,session 完成时间最高降低 3.5×,token goodput 提升 1.64–2×。
针对分布式 LLM 服务中 worker 故障同时丢失 KV cache 与服务容量的问题,提出以负载感知协调决策来做故障恢复的 LUMEN。三大机制:负载感知 KV checkpointing(用 $h(r)=\arg\min_w(q_w+\lambda p_w(r))$ 把 checkpoint 分散到低负载 worker)、局部性感知恢复调度(先按 checkpoint holder 路由再按 average-based 规则重平衡)、投机辅助渐进恢复(在恢复 worker 上加载 draft model,通过 fused batch 单次前向验证辅助最拥堵的存活 worker)。SGLang 原型上,Qwen3-32B/14B 相比 Stop-and-Restart 降低 TTFT 44.4%/29.6%、recovery time 50.0%/64.1%;大规模模拟中在 64 worker、25% 故障率下仍有 46.8-51.2% TTFT 降幅。
FlashRT 提出 execution-state capsule:把整个 forward 用 CUDA Graph 静态缓冲区捕获,再把已提交边界处的 KV / 循环 / 卷积 / MTP / 元数据整个 buffer set 作为可 freeze/restore/fork/rollback 的显式对象。相较 vLLM 冷路径,同 hybrid LLM 单流 TTFT 从 200/365/723ms 降到 51/53/54ms,相较 vLLM APC 也快 1.4–2.8×;16k prefix 时相较自身 cold 加速 27×,restore/snapshot 亚毫秒完成,KV-only 恢复的 97.9% token 会发散,证明 hybrid recurrent 状态必须整体 snapshot。
WiSP 将低资源 MoE serving 建模为专家权重与 KV 缓存两条 working-set 争夺同一 VRAM 的问题。核心是 routing-aware expert pager(基于 expert_map 的 LRU 分页,字节等价输出)加 MV-WSA 边际价值分配器,联合分配 expert scratch 与 KV pool。iso-VRAM 下相对 vLLM static offload 解码吞吐最高提升 1.95×,Jamba-52B/MiniMax-M2-229B 等 baseline 无法启动的模型上也能可服务,且揭示单流 decode 中 routing 预测只能省显存不能省延迟。
首个交互感知(interaction-aware)的实时 Omni-LM 服务系统:把播放进度、语音活动、barge-in 事件暴露给调度与 KV 管理。调度器用 U0/U1/U2 三级紧急度优先 first-audio 与近欠载会话、限制超前播放前沿的生成;KV 管理器用 next-use 感知驱逐替代 LRU、并在用户说话时预加载可能需要的 KV 以隐藏 reload 延迟。基于 vLLM-Omni,在两个 Omni-LM 与混合负载上把 P90 音频 TTFP 平均降 1.55×(至多 2.21×),完成请求吞吐平均升 1.15×(至多 1.56×),把大部分 KV reload 移出下一轮关键路径
系统性刻画 Intel TDX + NVIDIA GPU-CC 机密计算下 CVM–GPU 桥被串行化的性能规律,并给出可迁移的运行时/加载器/KV 恢复策略;同时首次公开 B300 机密多 GPU NVSwitch 租户能力
在固定 KV-cache 显存预算下研究异构 prefill/decode 长度的离线 LLM 服务调度:证明问题 NP-hard、FCFS/最短输出优先/总长度优先均有无界近似比;提出 Sorted-F 算法——用 F-metric(平均输出长度 / 批大小)平衡批并发与下游解码成本,证明常数因子近似比 ≤48;配三种 Phase-1 求解器(精确 DP、局部交换、分位贪心)与 LP 引导 / receding-horizon 变体。真实混合负载上相对 FCFS 提速 4.87×、相对 MC-SF 提速 2.09×,与 LP 下界差距仅 1.03-1.09×
面向 prefill-decode 分离式 LLM 服务的 GPU 友好、无损 KV cache 传输压缩器。核心洞见:BF16 KV 激活的冗余集中在指数字段(指数熵仅 2.89-3.59 bit,而 BF16 指数占 8 bit),Top-16 高频指数即覆盖 ≥99.3%。SplitZip 用定长 4-bit 码编码高频指数(两码打包一字节),罕见指数走稀疏 escape 流(位置+原值),符号-尾数原样保留——比特级无损。离线校准 Top-16 码本消除在线直方图;规整稠密路径 + 稀疏 escape 修正使编解码在 GPU 上无分支高效。真实 BF16 激活上达 613.3 GB/s 压缩、2181.8 GB/s 解压(超越所有已测无损压缩器);端到端 BF16 KV 传输加速 1.32×、TTFT 1.30×、请求吞吐 1.23×;同法扩展 FP8 在 E5M2 上再压 1.14×
首个面向解耦式 LLM 服务的服务感知自适应 KV 缓存压缩框架,通过统一压缩策略空间 + 贝叶斯剖析引擎 + 服务感知在线控制器,PD 分离场景 JCT 加速最高 9.13x,KV 解耦场景 TTFT 降低最高 32.8x
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速
将位置无关 KV 复用(PIC)的恢复粒度从「token 级」提升到「注意力头级」——离线将每个 (layer, head) 分类为 global(12-15%,复用时重算)/ local(85-88%,滑窗内原样复用),配合 token 选择性稀疏 FFN 攻克短上下文 FFN 瓶颈;再以 SegPagedAttention 按 (layer, head) 分页物化头级稀疏、走 FlashAttention 快路避开 attn_mask 4.9-7.6× 惩罚。8×H800 上 TTFT 加速 1.6-3.54×(DeepSeek-V4 达 5.16×)、并发会话 4.7-7.8×、prefill FLOPs 降 67-79.5%,精度媲美稠密
首个在运行时于专家并行(EP)与张量并行(TP)间无缝切换、不重启引擎、不丢弃在途请求的 MoE 服务系统。核心洞见:EP 与 TP 是同一模型的两种布局而非两个模型,切换只改变「哪个 rank 拥有哪一片」,唯一成本是搬运换主字节,NVLink 使其在两次 decode step 间完成。用统一内存管理器保持 CUDA graph 跨切换有效、融合直传 kernel、双控制平面同时驻留。8×H200 服务 Qwen3-235B-A22B,RL rollout 超越 1.16-1.25×,每次切换 215-434ms,仅 2.4% 显存开销
首个面向扩散语言模型(DLM)的集群级服务系统。DLM 每步并行解掩多个 token,比自回归模型吞吐高 1.75×,但引入置信度阈值这一「速度-质量」旋钮与 TP 度「时延-吞吐」权衡。DiLaServe 以「去噪步」为调度粒度,用 SLO 感知阈值调整 + 自适应负载控制动态选阈、轻量梯度提升 Step Predictor 在线预测剩余步数、按最低步时延调度并支持步级迁移、两阶段 ILP 定期重构集群 TP 配置,并把近似 KV 缓存的 cache/recompute 步异构成本纳入调度。基于 vLLM+Ray 实现(9500 行),真实 trace 上 SLO 达成率 +30.2pp、时延 -46%、质量仅降 0.09;多基准最高 +56.6pp SLO、精度仅降 0.9%
PRR 推理运行时,通过 EMA 预测器+增量修复内核将动态稀疏注意力的选择-注意力依赖瓶颈降低 30%+
xLLM 是面向企业级大规模服务的 LLM 推理框架,采用解耦服务-引擎架构,通过动态 PD 分离、EPD 分离和多层流水线优化,吞吐量达到 MindIE 的 1.7x 和 vLLM-Ascend 的 2.2x
通过Reference Sliding Window Attention实现恒定KV缓存,支持单次前向传播解析数十页文档
通过 PagedAttention 算法实现高效 KV cache 内存管理,构建 vLLM 高吞吐量 LLM 服务系统
面向 Kimi 的 KVCache 中心化解耦架构,通过分离 Prefill 和 Decode 集群实现 525% 吞吐量提升
FlowKV 提出低成本低延迟的 KV Cache 传输方案和负载感知调度器,实现分离式 LLM 推理框架的 96% 传输延迟降低
CXL-Enabled KV-Cache Management Beyond GPU Limits
提出基于 CXL 共享内存的机架级 KV Cache 系统 TraCT,消除 RDMA 网络跳数,实现 GPU-CXL 直接 DMA 传输,TTFT 降低 9.8x,吞吐量提升 1.6x
提出 CPU-GPU 混合注意力框架 HybridGen,通过注意力 logit 并行化、反馈调度器和语义感知 KV Cache 映射,实现长上下文 LLM 推理的高效协同计算
通过架构感知大小调整、六层内存层次和贝叶斯重用预测,实现 KV Cache 的预测性多层内存管理
从生产实践角度重新审视KV缓存压缩技术,揭示吞吐量、响应长度和负样本三个被忽视的关键维度
基于时间步嵌入感知的缓存策略加速视频扩散模型推理
RTPurbo: 将全注意力 LLM 转化为稀疏模型,仅需数百步训练
A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
分离prefill和decoding阶段的KV缓存压缩框架,解决长文本生成中的heavy hitter偏移问题
梯形KV缓存模式,实现长上下文LLM推理的高效内存管理与连续生成
首个面向企业级LLM推理的开源高效KV缓存层,支持跨查询复用和PD分离架构
阿里巴巴高性能LLM推理引擎,服务超1亿用户的大规模部署
面向LLM多智能体工作流的高效前缀缓存管理框架,通过Agent Step Graph和工作流感知驱逐策略实现最高2.19倍加速
首个将FlashAttention与量化算法结合的注意力加速方案,实现1.8倍延迟加速和2.37倍吞吐量提升
面向推理模型的冗余感知KV缓存压缩
软件定义的多路径内存访问系统,打破LLM服务中的主机-GPU带宽瓶颈
面向MoE模型的弹性推理框架,将故障影响限制在单个worker级别,实现160-213×的停顿减少
解耦敏感度与重要性:面向推理的KV缓存压缩框架
优化树结构LLM推理的注意力内核和运行时
面向CXL Pod的分布式内存数据库,使用CXL内存原子操作同步跨主机并发访问
KV-Cache-centric memory management system for efficient embodied planning with static-dynamic memory construction, multi-hop recomputation, and layer-balanced loading
DVM:基于字节码虚拟机的动态张量计算方法
通过非对称深度哈希加速长上下文LLM推理
面向KV缓存的免调优非对称量化
高效的KV缓存压缩框架,实现近无损生成推理
面向百万级LLM推理的空间压缩KV缓存
面向网络密集型LLM推理的服务效率优化
通过集体KV缓存共享扩展多智能体LLM服务
LLM推理中KV缓存管理策略的比较表征
基于语义聚类的高效KV缓存管理
使SSD支持的KV缓存在长上下文LLM服务中实用化
端到端学习头部预算和token选择的LLM KV缓存驱逐
重新定义长上下文LLM推理中的KV缓存驱逐问题
基于全局保留门的KV缓存驱逐方法,可改善长上下文推理性能
面向大规模 LLM 训练和推理的统一细粒度模拟器
面向 2-bit KV 缓存量化的离线谱协方差感知旋转方法
LLM 服务越来越多地被 decode attention 主导,这是一个 memory-bound 操作,因为需要从全局内存加载大量的 KV cache。
标准 Transformer 注意力机制的二次复杂度在长上下文场景下成为瓶颈。虽然线性注意力方法(如 Mamba2、Gated DeltaNet)可以降低计算复杂度,但它们在表达能力和实际性能上通常不如全注意力机制。
通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理
X-MoE是一种新型MoE训练系统,通过无填充训练管道、冗余绕过分发和序列分片MoE块等技术,在AMD GPU上实现DeepSeek风格MoE的高效可扩展训练
通过稳定性准则统一逐步和逐token稀疏决策的扩散模型加速框架
首个面向晶圆级加速器(Cerebras WSE-2,85 万核)的 LLM 推理系统。提出 PLMR 设备模型刻画晶圆级硬件特征,配合细粒度二维并行、Shift 式 KV 缓存管理,以及 PLMR 合规的 MeshGEMM(两跳传输)与 MeshGEMV(K-tree allreduce),相比多卡 A100 SGLang 端到端提速 10–20×、能效 2–2.5×。
云原生LLM推理基础设施框架,通过协同设计实现高密度LoRA管理、分布式KV缓存和异构GPU调度
大语言模型服务动态调度系统,支持KV缓存迁移与跨实例负载均衡