A Photonic-CXL Memory Appliance for Scalable KV Cache Management in LLM Inference
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
13 posts tagged with "disaggregation"
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
CXL-Hybrid Memory-based remote KV-cache tier for scalable multi-turn LLM serving
Adrenaline提出注意力分离与卸载机制,将解码阶段的注意力计算卸载到预填充实例,解决PD分离导致的资源利用率低下问题,最高提升1.68×推理吞吐。
首个面向解耦式 LLM 服务的服务感知自适应 KV 缓存压缩框架,通过统一压缩策略空间 + 贝叶斯剖析引擎 + 服务感知在线控制器,PD 分离场景 JCT 加速最高 9.13x,KV 解耦场景 TTFT 降低最高 32.8x
首个面向企业级LLM推理的开源高效KV缓存层,支持跨查询复用和PD分离架构
系统感知的KV缓存优化综述,从时间、空间、结构三个维度系统梳理LLM推理中的KV缓存管理技术
阿里巴巴高性能LLM推理引擎,服务超1亿用户的大规模部署
通过动态模型重分片实现高吞吐量LLM推理
面向多模态大模型的EPD阶段解耦推理系统,在昇腾NPU上实现57-69%吞吐量提升
通过核心注意力分解实现高效长上下文语言模型训练
GLM-5 模型技术报告,探索从 Vibe Coding 到 Agentic Engineering 的演进。
UniPrefill 提出通用的长上下文 Prefill 加速框架。
用于可扩展百万Token推理的上下文并行技术