June 29, 2026 Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning Prism 通过 GPU 内存气球技术实现多 LLM 共享服务,统一时间共享和空间共享,SLO 达标率下支持 2.3-3.5x 更多请求,已在 10K+ GPU 生产环境部署 llm-serving inference-serving gpu-sharing memory-management multi-model-serving