February 22, 2025 AIBrix: Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure 云原生LLM推理基础设施框架,通过协同设计实现高密度LoRA管理、分布式KV缓存和异构GPU调度 inference-serving distributed-inference kv-cache lora autoscaling kubernetes system-optimization