June 24, 2026 HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing 提出 CPU-GPU 混合注意力框架 HybridGen,通过注意力 logit 并行化、反馈调度器和语义感知 KV Cache 映射,实现长上下文 LLM 推理的高效协同计算 llm-inference kv-cache cpu-gpu-hybrid memory-management cxl attention-parallelism long-context