July 23, 2026 HyMCache A KV Cache Framework for Multi-Turn LLM Serving with CXL-Hybrid Memory llm-serving kv-cache cxl-memory memory-tiering remote-caching pd-disaggregation rdma
June 29, 2026 xLLM Technical Report xLLM 是面向企业级大规模服务的 LLM 推理框架,采用解耦服务-引擎架构,通过动态 PD 分离、EPD 分离和多层流水线优化,吞吐量达到 MindIE 的 1.7x 和 vLLM-Ascend 的 2.2x llm-serving inference-engine pd-disaggregation kv-cache speculative-decoding