Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning
Prism 通过 GPU 内存气球技术实现多 LLM 共享服务,统一时间共享和空间共享,SLO 达标率下支持 2.3-3.5x 更多请求,已在 10K+ GPU 生产环境部署
5 posts tagged with "memory-management"
Prism 通过 GPU 内存气球技术实现多 LLM 共享服务,统一时间共享和空间共享,SLO 达标率下支持 2.3-3.5x 更多请求,已在 10K+ GPU 生产环境部署
通过 PagedAttention 算法实现高效 KV cache 内存管理,构建 vLLM 高吞吐量 LLM 服务系统
CXL-Enabled KV-Cache Management Beyond GPU Limits
提出 CPU-GPU 混合注意力框架 HybridGen,通过注意力 logit 并行化、反馈调度器和语义感知 KV Cache 映射,实现长上下文 LLM 推理的高效协同计算
通过架构感知大小调整、六层内存层次和贝叶斯重用预测,实现 KV Cache 的预测性多层内存管理