Topology-Aware Data Movement for Disaggregated GPU Inference
TopKV — 拓扑感知的KV缓存传输编排器,利用GPU互连层次结构将KV缓存传输延迟降低3-18倍
5 posts tagged with "disaggregated-inference"
TopKV — 拓扑感知的KV缓存传输编排器,利用GPU互连层次结构将KV缓存传输延迟降低3-18倍
首个将张量生命周期管理从计算栈中解耦的分布式服务层,通过 Artifact/Operation/Plan/Signal 四抽象实现 TaaS 范式,集成 vLLM/SGLang 后权重物化加速 60×、KV 缓存共享 TTFT 降低 87.5%
Cost-Efficient Remote KV-Cache Tier Using CXL-Hybrid Memory for Scalable LLM Serving
FlowKV 提出低成本低延迟的 KV Cache 传输方案和负载感知调度器,实现分离式 LLM 推理框架的 96% 传输延迟降低
提出基于 CXL 共享内存的机架级 KV Cache 系统 TraCT,消除 RDMA 网络跳数,实现 GPU-CXL 直接 DMA 传输,TTFT 降低 9.8x,吞吐量提升 1.6x