June 17, 2026 Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving 从生产实践角度重新审视KV缓存压缩技术,揭示吞吐量、响应长度和负样本三个被忽视的关键维度 kv-cache inference-serving quantization sparsity system-optimization benchmark