June 24, 2026 Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference 通过架构感知大小调整、六层内存层次和贝叶斯重用预测,实现 KV Cache 的预测性多层内存管理 kv-cache memory-management gpu-inference multi-tier-memory bayesian-prediction attention-architecture mla cxl distributed-inference