Bole: Efficient Tree Speculation for Hybrid-Attention Language Models
内核-运行时协同设计:通过闭式树验证、值域分块GPU核和因子化推测状态,将混合注意力LLM的树投机解码吞吐量提升至自回归解码的4.72×
173 posts tagged with "llm-inference"
内核-运行时协同设计:通过闭式树验证、值域分块GPU核和因子化推测状态,将混合注意力LLM的树投机解码吞吐量提升至自回归解码的4.72×
SmartGen 解决自托管 LLM 推理中 P/D 分离架构的网络瓶颈问题,通过三种 KV 缓存传输路径(Profile-based Proactive、Parallel On-demand、Speculative Transfer)实现无缝分离推理
ResKV 将固定 KV 预算划分为精确主缓存和紧凑残差缓存,通过共享 softmax 重建被丢弃 token 的注意力贡献,显著提升长上下文推理效率
Resource-Fair Scheduling 将 LLM 推理中的 batching 外部性形式化为资源公平问题,提出 LJF 和 ISJL 两种公平调度算法,并建立利润分解理论将吞吐量与线性定价下的运营成本对齐
BF16下KV缓存的增量构建与一次性prefill虽然token相同但产生不同轨迹;FP32消除分歧;双向K/V缓存移植使所有分歧轨迹跟随donor
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
CXL-Hybrid Memory-based remote KV-cache tier for scalable multi-turn LLM serving
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
A selective KV recomputation method using attention-norm criteria from query to context tokens to identify information-flow-critical tokens for long-context inference
A novel fused Indexer-TopK kernel that exploits the curse of dimensionality to accelerate sparse attention in long-context LLM inference, achieving up to 3.38x speedup on B200.
面向AI加速器的LLM Token阶段优化框架FastTPS,包括全局KV缓存管理、序列维度扁平化、Fusion MLP等技术
一种基于 EMA 预测器和在线 Softmax 增量修复的投机注意力运行时,打破 DSA 中 selection-to-attention 的关键路径依赖
基于 Johnson-Lindenstrauss 引理的旋转二进制量化 KV Cache 框架,通过高吞吐 binary-INT4 算术实现无偏代理分数估计,支持自适应 Top-p 检索,在长上下文推理中实现 2.16× 端到端加速且精度几乎无损
作为预训练长上下文 Transformer 的即插即用分层路由算法,保留原始注意力投影,仅通过查询-键内容路由选择历史 token 进行精确 token 级注意力计算
面向同步 Agentic RL 的 workload-aware rollout 系统,通过 model-free speculative decoding (SuffixDecoding) 和 cache-aware scheduling 联合优化解码与调度
基于 Wasserstein DRO 的鲁棒 KV Cache 管理框架,联合优化 GPU 并行配置、缓存预留、请求路由和前缀缓存
快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention
面向 LLM 推理的 HBF(高带宽闪存)与 HBM GPU 软硬件协同设计:通过架构级 SRAM 缓存/预取、专用数据布局与异构存储管理层,将 HBF 的容量优势转化为吞吐与能效。
针对大规模 MoE LLM 推理中数据移动瓶颈的首次全面 profiling 分析,提取六大系统级洞察并在未来晶圆级 GPU 架构上验证
基于分层 Top-p 剪枝的自适应注意力稀疏框架,加速长上下文 LLM 推理
训练无关的通用稀疏注意力,加速所有模型推理(语言、图像、视频生成)
首个 FP4 微缩放注意力推理加速与 INT8 可训练注意力探索
基于 FP8 Matmul + FP16 累加器指令进一步加速 SageAttention2 的注意力量化内核实现,在保持精度的同时取得相对 FlashAttention 最高 3.9× 加速。
基于分层 Top-p 的稀疏注意力框架,通过聚类级估计 + Token 级自适应分配优化长上下文 LLM 推理
TriRoute — 单一轻量控制器联合决策注意力分辨率、FFN 专家选择与 KV-Cache 位宽,端到端可训练,单一预算旋钮扫出 Pareto 前沿,缓解跨轴路由坍缩级联
Frequency-guided and hardware-aware KV Cache reuse system achieving 3.72x-4.86x TTFT speedup and 3.93x-6.21x higher throughput via selective recomputation of semantic-critical tokens
An analytical performance model (LIMINAL) that abstracts application requirements and hardware capabilities to systematically explore LLM inference performance limits across current, near-future, and hypothetical hardware
面向大规模视频扩散 Transformer(DiT)的稀疏注意力加速框架。核心洞见:生成质量并非由稀疏率本身决定,而取决于稀疏掩码与全注意力 tile 级几何结构的对齐程度。Veda 把 tile 选择建模为对全注意力的显式重建问题:(1) 蒸馏式 tile 打分——用轻量估计器从全注意力 backbone 蒸馏 tile 级分数,配合 TripPool(Avg/Max/Min 三元统计)与逐头 MLP 投影降低估计误差,训练时对 backbone 特征做 stop-gradient 解耦掩码学习与特征学习;(2) 逐头 tiling 搜索(Head-aware Tiling)——为每层每头分配 (p_t,p_h,p_w) 分块配置以最小化稀疏输出与全注意力输出的 Frobenius 误差;(3) 硬件高效 tile-skipping kernel(ThunderKittens/Hopper TMA+Warp Specialization,达 FA3 80% MFU)。在 Waver-T2V-12B 720P 10 秒视频上取得 5.1× 端到端、10.5× 自注意力加速,注意力开销从 92% 降至 50%,且序列越长收益越大。
PSA提出渐进式稀疏注意力机制,通过阈值驱动的自适应KV块选择替代固定top-k策略,结合流水线迭代执行和统一内存管理,在保证精度的同时最大化推理吞吐。
Adrenaline提出注意力分离与卸载机制,将解码阶段的注意力计算卸载到预填充实例,解决PD分离导致的资源利用率低下问题,最高提升1.68×推理吞吐。
TaiChi提出一种统一的LLM推理服务系统,通过混合模式推理和延迟迁移调度策略,在任意TTFT和TPOT SLO组合下实现最优goodput。
面向 PD 分离式 LLM 服务的负载感知 Prefill 偏转调度器 Kairos:让 decode 节点以 chunked-prefill 方式代跑 prefill,消除跨节点 KV 传输,P95 TTFT 最高降低 81%。
ProServe 将多优先级 LLM 服务形式化为服务增益最大化问题,提出 Token-level Deadline-aware Gain (TDG);引擎层 SlideBatching 用滑动 urgent/normal 边界结合密度与截止时间排序,服务层 GoRouting 做增益导向、感知能力的分发,跨四个开源数据集与工业追踪相对 SOTA 系统增益提升最多 35%、SLO 达成率提升最多 52%。
PASTE 通过 Pattern Tuple 抽象从历史执行中挖掘控制流与数据依赖,基于风险感知的机会式调度在 LLM 生成阶段就投机执行未来工具调用;跨深度研究、编码、科学 agent 工作负载将端到端任务完成时间平均降低 43.5%,工具延迟降低 1.8×,验证空闲达 10×。
RouterWise 首次将多模型 LLM 路由与 GPU 资源分配联合建模,通过对偶价格公式化的分数最大化路由 + setup 特化的延迟分析模型,搜索可行的 tensor 并行/GPU 线程份额组合,在满足延迟 SLO 前提下最大化输出质量。实验表明同一 GPU 集群下不同 setup 的可达质量差异高达 87%,证明资源分配是路由性能的关键决定因素。
RateQuant用率失真理论把KV cache按注意力头分配bit宽度:假设量化MSE满足$D(b)=\alpha\beta^{-b}$,用reverse waterfilling闭式求最优分配,并识别distortion model mismatch这一失效模式——不同量化器$\beta$从3.6到5.3变化,套错模型比uniform更差。校准per-quantizer $\beta$并对K/V单独分配预算后,Qwen3-8B在KIVI 2.5bit的PPL从49.3降到14.9(−70%),QuaRot改善6.6 PPL;全流程校准仅1.6秒,推理零开销。
首次系统性研究GPU上LLM推理引擎的软件老化现象。以三种部署栈(vLLM standalone/Triton+vLLM/PyTorch+HF)在NVIDIA L40S上做6×36小时=216小时压力测试,结合Mann-Kendall/Theil-Sen统计流水线,发现所有部署均存在统计显著的进程私有内存泄漏,泄漏率跨约两个数量级(1.8→157 KB/h),且最脏配置为Triton包裹的旧V0引擎。
将 LLM 连续批处理下的 KV-Cache 内存增长建模为离散动力系统,证明同质负载下无驱逐平衡点不稳定,最坏极限环吞吐损失可达 50%;异质负载在共素解码长度下才能稳定;给出速率限制准入与请求混合两种消驱逐策略。
Tropical 在 disaggregated LLM 服务基础上引入 SLO-aware 多路复用:Multiplexing Toggle 用 slack 检测把短 prefill 借道 decode worker 执行、长 prefill 走独占 prefill worker,兼得低排队与低干扰。在 Mooncake 真实 trace 上 SLO 内可服务请求提升 2.02×,P90 TTFT 相比 DistServe 优化 9×,P90 TPOT 相比 vLLM 优化 2.33×。
首个针对真实编码 Agent(Claude Code)负载的系统研究:会话闭环、上下文持续膨胀、工具触发主导;CacheWise 在 vLLM 上以约 2500 行代码扩展前缀感知调度 + 基于工具元数据的预测式 KVCache 驱逐,评测中 KV 驱逐减少 2–2.6×,session 完成时间最高降低 3.5×,token goodput 提升 1.64–2×。
针对分布式 LLM 服务中 worker 故障同时丢失 KV cache 与服务容量的问题,提出以负载感知协调决策来做故障恢复的 LUMEN。三大机制:负载感知 KV checkpointing(用 $h(r)=\arg\min_w(q_w+\lambda p_w(r))$ 把 checkpoint 分散到低负载 worker)、局部性感知恢复调度(先按 checkpoint holder 路由再按 average-based 规则重平衡)、投机辅助渐进恢复(在恢复 worker 上加载 draft model,通过 fused batch 单次前向验证辅助最拥堵的存活 worker)。SGLang 原型上,Qwen3-32B/14B 相比 Stop-and-Restart 降低 TTFT 44.4%/29.6%、recovery time 50.0%/64.1%;大规模模拟中在 64 worker、25% 故障率下仍有 46.8-51.2% TTFT 降幅。
针对异构 LLM 服务栈的两层调度割裂(router 忽略实例负载,load balancer 忽略质量)问题,将模型路由与负载均衡融合为对具体模型实例的在线赋值。对每批请求求解 quality-latency-cost 三维单纯形加权得分:batched MiniLM+KNN 一次估算 prompt 内在的 quality/output-length,per-tier XGBoost TPOT + dead-reckoning 在线估计延迟,按 LPT 顺序贪心分派。在 13 实例 28 GPU 异构集群、四种模型规模上,单套栈只调权重就能横跨 quality-cost-throughput 前沿;平衡预设在 2.8 s 端到端延迟与 30 req/s 下领先增强版 BEST-Route 2.6-4.1×,最高质量 DeepEval 0.419(+0.013 优于最强基线)。
针对第三方共享加速器基础设施上的模型外泄威胁(如 Hermes 通过被动 PCIe 观测无损重建 DNN、TunnelS 通过驱动级访问以高吞吐外泄 HBM),提出软件层内存混淆框架 CloakLM。结合 PCIe 流量整形、层间/层内权重乱序与物理 HBM 页面重映射三种机制,让授权执行保持有效虚拟内存布局且开销可忽略,而未授权观察者看到的是碎片化、语义不连贯的状态。集成于 vLLM 与 PyTorch,与机密计算互补,在 LLaMA/Qwen 分布式推理上实现接近原生的性能同时大幅提高对 PCIe 窃听与 HBM dump 攻击的抵抗力。
面向异构 spot GPU 集群的低成本 LLM 服务系统。用 roofline 模型解析式估算性能,动态规划联合优化节点配置、并行策略与层分配以最大化异构 GPU 吞吐;结合输出保持的请求迁移与共享 tensor store 并发初始化,将替换节点的准备与在服请求重叠以最小化迁移停机。在 AWS L4/A10G/L40S 异构集群上,Llama-3.1-70B 与 Qwen3-32B 相比 SOTA 基线吞吐分别提升 1.42× 与 1.35×,相比 on-demand 实例在离线/在线服务分别节省 31.9% 与 31.2% 成本。
FlashRT 提出 execution-state capsule:把整个 forward 用 CUDA Graph 静态缓冲区捕获,再把已提交边界处的 KV / 循环 / 卷积 / MTP / 元数据整个 buffer set 作为可 freeze/restore/fork/rollback 的显式对象。相较 vLLM 冷路径,同 hybrid LLM 单流 TTFT 从 200/365/723ms 降到 51/53/54ms,相较 vLLM APC 也快 1.4–2.8×;16k prefix 时相较自身 cold 加速 27×,restore/snapshot 亚毫秒完成,KV-only 恢复的 97.9% token 会发散,证明 hybrid recurrent 状态必须整体 snapshot。
首个交互感知(interaction-aware)的实时 Omni-LM 服务系统:把播放进度、语音活动、barge-in 事件暴露给调度与 KV 管理。调度器用 U0/U1/U2 三级紧急度优先 first-audio 与近欠载会话、限制超前播放前沿的生成;KV 管理器用 next-use 感知驱逐替代 LRU、并在用户说话时预加载可能需要的 KV 以隐藏 reload 延迟。基于 vLLM-Omni,在两个 Omni-LM 与混合负载上把 P90 音频 TTFP 平均降 1.55×(至多 2.21×),完成请求吞吐平均升 1.15×(至多 1.56×),把大部分 KV reload 移出下一轮关键路径
系统性刻画 Intel TDX + NVIDIA GPU-CC 机密计算下 CVM–GPU 桥被串行化的性能规律,并给出可迁移的运行时/加载器/KV 恢复策略;同时首次公开 B300 机密多 GPU NVSwitch 租户能力
SharQ提出FP4量化与N:M稀疏协同的免训练推理方案:在线抽取outlier主导的稀疏骨干做sparse FP4 GEMM,再用dense FP4 GEMM对稀疏路径的量化+掩码误差做残差补偿,两路径共享单份FP4权重与path-specific scale视图。Llama-3.1-8B/Qwen2.5-7B/Qwen3-30B-A3B/Qwen3-VL-8B上恢复43–63%的NVFP4-FP16精度差,RTX 5090延迟对FP16降2.2–2.4×、对FP8吞吐提升1.2–1.4×,Wan2.2-T2V加SageAttention最高1.58×。
CAT-Q首次以纯PTQ路线量化LLM到1.58bit三元权重,无需QAT。两个核心模块:Learnable Modulation用可学习因子$(\delta_\mu,\delta_\alpha,\delta_\Delta)$调制预训练权重分布与三元阈值,Softened Ternarization用tanh-based smooth transition函数从identity渐变到hard ternarization。仅512校准样本、8卡A100 8–60小时即可把1.7B–235B模型三元化,性能超越用100B tokens训练的BitNet 1.58-bit v1/v2,训练token量减少约10^5倍。
在固定 KV-cache 显存预算下研究异构 prefill/decode 长度的离线 LLM 服务调度:证明问题 NP-hard、FCFS/最短输出优先/总长度优先均有无界近似比;提出 Sorted-F 算法——用 F-metric(平均输出长度 / 批大小)平衡批并发与下游解码成本,证明常数因子近似比 ≤48;配三种 Phase-1 求解器(精确 DP、局部交换、分位贪心)与 LP 引导 / receding-horizon 变体。真实混合负载上相对 FCFS 提速 4.87×、相对 MC-SF 提速 2.09×,与 LP 下界差距仅 1.03-1.09×
面向 prefill-decode 分离式 LLM 服务的 GPU 友好、无损 KV cache 传输压缩器。核心洞见:BF16 KV 激活的冗余集中在指数字段(指数熵仅 2.89-3.59 bit,而 BF16 指数占 8 bit),Top-16 高频指数即覆盖 ≥99.3%。SplitZip 用定长 4-bit 码编码高频指数(两码打包一字节),罕见指数走稀疏 escape 流(位置+原值),符号-尾数原样保留——比特级无损。离线校准 Top-16 码本消除在线直方图;规整稠密路径 + 稀疏 escape 修正使编解码在 GPU 上无分支高效。真实 BF16 激活上达 613.3 GB/s 压缩、2181.8 GB/s 解压(超越所有已测无损压缩器);端到端 BF16 KV 传输加速 1.32×、TTFT 1.30×、请求吞吐 1.23×;同法扩展 FP8 在 E5M2 上再压 1.14×
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
首个在运行时于专家并行(EP)与张量并行(TP)间无缝切换、不重启引擎、不丢弃在途请求的 MoE 服务系统。核心洞见:EP 与 TP 是同一模型的两种布局而非两个模型,切换只改变「哪个 rank 拥有哪一片」,唯一成本是搬运换主字节,NVLink 使其在两次 decode step 间完成。用统一内存管理器保持 CUDA graph 跨切换有效、融合直传 kernel、双控制平面同时驻留。8×H200 服务 Qwen3-235B-A22B,RL rollout 超越 1.16-1.25×,每次切换 215-434ms,仅 2.4% 显存开销
首个面向扩散语言模型(DLM)的集群级服务系统。DLM 每步并行解掩多个 token,比自回归模型吞吐高 1.75×,但引入置信度阈值这一「速度-质量」旋钮与 TP 度「时延-吞吐」权衡。DiLaServe 以「去噪步」为调度粒度,用 SLO 感知阈值调整 + 自适应负载控制动态选阈、轻量梯度提升 Step Predictor 在线预测剩余步数、按最低步时延调度并支持步级迁移、两阶段 ILP 定期重构集群 TP 配置,并把近似 KV 缓存的 cache/recompute 步异构成本纳入调度。基于 vLLM+Ray 实现(9500 行),真实 trace 上 SLO 达成率 +30.2pp、时延 -46%、质量仅降 0.09;多基准最高 +56.6pp SLO、精度仅降 0.9%
DSpark 结合半自回归生成和置信度调度验证,统一高吞吐并行生成与自适应负载感知验证,在 DeepSeek-V4 生产系统中实现 60%-85% 生成加速
CXL-Enabled KV-Cache Management Beyond GPU Limits
提出 CPU-GPU 混合注意力框架 HybridGen,通过注意力 logit 并行化、反馈调度器和语义感知 KV Cache 映射,实现长上下文 LLM 推理的高效协同计算
使用自适应专家选择路由扩展扩散 Transformer
改进极低比特 LLM 量化的缩放定律
高效扩散模型综述:算法级、系统级和框架视角
面向 SLO 的微秒级 GPU 抢占调度系统
基于可学习 token 稀疏化的 DiT 加速框架
RTPurbo: 将全注意力 LLM 转化为稀疏模型,仅需数百步训练
通过多 token 预测训练提升 LLM 性能和推理速度
使用模型并行训练数十亿参数语言模型
神经语言模型的缩放定律:模型大小、数据集大小和计算量与损失之间的幂律关系
微软AI从零构建的35B/1T MoE推理模型,AIME 2025达97%,SWE-Bench Pro达52.8%
基于机器学习的 NVIDIA Ada Lovelace GEMM 性能和能耗分析
FP8 量化对数据中心 LLM 推理 TCO 的影响分析
面向最优每 FLOP 和每参数精度的 MoE 架构设计
基于非结构化稀疏性的高效大语言模型推理加速框架,通过 Load-as-Sparse and Compute-as-Dense 方法在 Tensor Core 上实现高效 SpMM
一种无需训练的结构化推理加速框架,用于加速扩散式视觉-语言-动作模型
A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
一种通过组感知上下文学习加速同步 LLM 强化学习 Rollout 的系统
ServiceNow Research 开源的大语言模型分布式训练库,基于 PyTorch 和 Triton 构建,支持 3D 并行、ZeRO、MoE 等特性
NVIDIA Jetson平台优化的本地大语言模型推理框架,支持量化、多模态、语音、向量数据库和RAG
通过低秩Key缓存和CPU卸载Value缓存实现高吞吐量长上下文LLM推理
覆盖分布式RL、RLHF系统、环境加速、采样优化、通信优化、内存优化等方向
大规模MoE模型的高效推理框架,实现26倍吞吐量提升和4-bit量化
基于查找表的超低精度CNN推理加速方法,2-bit实现比QNNPACK INT8快1.74倍
W4A8量化方法,通过自适应平滑和Hessian补偿实现高质量4-bit权重量化,同时加速预填充和解码
硬件高效的W4A8 GEMM内核,实现2.90倍加速和4.94倍系统级加速
8B参数高效多模态大语言模型,通过统一3D-Resampler、文档知识统一学习范式和混合强化学习实现性能与效率的平衡
多模型LLM调度的实证研究,分析CPU-GPU卸载和抢占的性能影响,为下一代调度系统提供设计指导
通过流水线并行实现高准确率零气泡推测解码,突破传统多token预测的结构限制
一种低比特量化方法,通过混合精度、细粒度分组量化和动态量化实现高效LLM推理
系统梳理Sparse Attention在LLM推理中的技术演进、核心方法与工程实践
免训练扩散模型加速框架,利用U-Net高层特征的时间冗余实现缓存复用
面向扩散Transformer的层缓存加速方法,通过可微分路由器学习最优缓存策略
从 Llama 3-8B 高效上循环训练 MoE 模型
分离prefill和decoding阶段的KV缓存压缩框架,解决长文本生成中的heavy hitter偏移问题
基于KV缓存管理的LLM加速综述,系统梳理Token级、模型级和系统级三层优化策略
基于分块软匹配的在线KV缓存聚类框架,实现80%内存节省和3.19倍解码加速
面向单个消费级GPU的高效长上下文LLM推理系统,通过自适应分层KV管理实现3.46倍加速
梯形KV缓存模式,实现长上下文LLM推理的高效内存管理与连续生成
全栈开源框架,将T2V/TI2V基础模型转换为相机可控的少步自回归视频世界模型
系统感知的KV缓存优化综述,从时间、空间、结构三个维度系统梳理LLM推理中的KV缓存管理技术
基于3D并行的大规模Early-Exit LLM训练与推理框架
面向长上下文LLM服务的分层上下文缓存框架
阿里巴巴高性能LLM推理引擎,服务超1亿用户的大规模部署
面向LLM多智能体工作流的高效前缀缓存管理框架,通过Agent Step Graph和工作流感知驱逐策略实现最高2.19倍加速
全方向校准的LLM量化技术,通过LWC和LET实现PTQ效率与QAT性能的统一
面向推理最优的MoE大语言模型扩展律研究
通过细粒度专家卸载优化MoE大模型服务的延迟-内存权衡
通过灵活高效的卸载打破内存约束实现设备端LLM推理
通过动态模型重分片实现高吞吐量LLM推理
基于模块级批处理的单GPU高吞吐量MoE推理系统
细粒度MoE模型推理优化分析,探索专家跳过和专家剪枝的效率与性能权衡
面向推理模型的冗余感知KV缓存压缩
自强制训练范式解决自回归视频扩散模型的暴露偏差问题,实现单GPU 17FPS实时视频生成
面向生成式推荐的高效推理系统,通过xAttention/xBeam/xSchedule三层优化实现3.49倍吞吐量提升
软件定义的多路径内存访问系统,打破LLM服务中的主机-GPU带宽瓶颈
面向解耦专家并行的细粒度任务调度框架,实现MoE推理吞吐量提升1.61×
面向MoE模型的弹性推理框架,将故障影响限制在单个worker级别,实现160-213×的停顿减少
通过自辅助推测解码实现高效MoE推理,最高4.30×吞吐量提升
通过量化填充、专家内存池和层感知调度实现无回退的高效MoE推理,相比MoE-Infinity加速2.86倍
解耦敏感度与重要性:面向推理的KV缓存压缩框架
优化树结构LLM推理的注意力内核和运行时
利用CPU计算实现灵活的LLM推理
串行性能优化的系统方法论,包含三个原则和八种方法
首个在公平比较下超越全注意力的混合线性注意力架构,通过KDA实现75% KV缓存减少和6倍解码吞吐量提升
KV-Cache-centric memory management system for efficient embodied planning with static-dynamic memory construction, multi-hop recomputation, and layer-balanced loading
MineDraft:批量并行推测解码框架
通过非对称深度哈希加速长上下文LLM推理
通过推测流水线执行实现高效解码
面向KV缓存的免调优非对称量化
高效的KV缓存压缩框架,实现近无损生成推理
面向百万级LLM推理的空间压缩KV缓存
基于GPU虚拟内存管理的高效LLM推理张量结构
面向大语言模型的混合精度自回归并行推理
通过自蒸馏提升多token预测的接受率和推理效率
基于语义聚类的高效KV缓存管理
使SSD支持的KV缓存在长上下文LLM服务中实用化
通用长上下文预填充加速框架,支持混合架构和连续批处理
端到端学习头部预算和token选择的LLM KV缓存驱逐
重新定义长上下文LLM推理中的KV缓存驱逐问题
基于全局保留门的KV缓存驱逐方法,可改善长上下文推理性能
面向大规模 LLM 训练和推理的统一细粒度模拟器
面向 2-bit KV 缓存量化的离线谱协方差感知旋转方法
前沿语言模型的 RL 后训练越来越多地被自回归 rollout 生成所瓶颈,使得 rollout 加速成为核心系统挑战。
MoE 模型推理优化技术综述,分析问题与挑战,总结最新研究进展。
UniPrefill 提出通用的长上下文 Prefill 加速框架。
大语言模型长上下文推理优化技术综述,涵盖 KV Cache 压缩、注意力优化等。
OdysseyLLM 提出可部署的大语言模型量化加速方案。
TriForce 提出层次化推测解码方法,实现长序列生成的无损加速。
低比特大语言模型综述:基础、系统和算法。
大语言模型(LLM)的自回归推理存在高延迟问题。投机解码(Speculative Decoding)通过使用轻量级草稿模型提出多个token进行批量验证来缓解这一瓶颈。然而,投机解码的采用受到以下限制:
自回归解码因其顺序性而受到瓶颈限制。投机解码(Speculative Decoding, SD)已成为加速推理的标准方法,通过使用快速草稿模型预测慢速目标模型即将生成的 token,然后通过一次目标模型前向传播并行验证。
LLM 服务越来越多地被 decode attention 主导,这是一个 memory-bound 操作,因为需要从全局内存加载大量的 KV cache。
通过强化学习增强视觉-语言-动作框架,实现四足机器人的显式推理和连续控制
通过解耦视觉稀疏性,在预填充和解码阶段分别进行查询无关剪枝和查询感知检索,实现高效VLM推理
全面综述人体运动生成技术,涵盖视觉、文本、音频三种模态,200+论文,10+子任务
通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理
X-MoE是一种新型MoE训练系统,通过无填充训练管道、冗余绕过分发和序列分片MoE块等技术,在AMD GPU上实现DeepSeek风格MoE的高效可扩展训练
Llama 3 405B 模型在 16K H100 GPU 上的四维并行训练系统设计,涵盖灵活流水线并行、上下文并行、大规模调试方法及硬件建议
用于可扩展百万Token推理的上下文并行技术
首个面向晶圆级加速器(Cerebras WSE-2,85 万核)的 LLM 推理系统。提出 PLMR 设备模型刻画晶圆级硬件特征,配合细粒度二维并行、Shift 式 KV 缓存管理,以及 PLMR 合规的 MeshGEMM(两跳传输)与 MeshGEMV(K-tree allreduce),相比多卡 A100 SGLang 端到端提速 10–20×、能效 2–2.5×。
通过异步KV缓存预取技术加速LLM推理吞吐量,减少内存访问延迟。
现代大语言模型(LLM)的自回归生成特性使其推理速度慢且成本高昂。投机解码(Speculative Sampling)已被证明是解决此问题的有效方案。EAGLE 系列方法通过在特征级进行自回归,复用目标模型的顶层特征,取得了比传统投机解码更好的效果。
大语言模型(LLM)处理长上下文的能力对 LLM agents 和长推理任务等新兴应用至关重要,这些应用现在可以处理扩展到数百万 token 的上下文窗口。在这些高要求的长上下文场景中,标准自回归解码的高推理延迟成为一个显著的瓶颈。
LServe通过统一稀疏注意力机制实现高效长序列LLM服务,优化KV缓存管理和注意力计算。
DiLoCo 等分布式优化方法将更新分为两部分:
在现代大语言模型(LLM)推理引擎中,改善首 token 延迟(Time-to-First-Token, TTFT)是一个至关重要的目标。优化 TTFT 可以直接提高最大 QPS,并满足许多关键应用的需求。
Apple提出的高效视觉语言模型,通过新型混合视觉编码器FastViTHD实现85×更快的首token延迟,同时保持竞争性准确率
Marconi为混合架构LLM提出高效前缀缓存机制,支持注意力层和非注意力层的统一缓存管理。
大语言模型服务动态调度系统,支持KV缓存迁移与跨实例负载均衡
LeanAttention提出硬件感知的可扩展注意力机制,优化Transformer解码阶段的注意力计算效率。
多层级张量程序超级优化器,通过统一搜索空间生成高效注意力内核
QServe提出W4A8KV4量化与系统协同设计,通过QoQ算法和QServe推理库实现LLM服务吞吐量提升2.36倍,成本降低3倍。
EAGLE 系列是针对大语言模型(LLM)推理加速的投机解码(Speculative Decoding)方法,由 Yuhui Li 等人提出。该系列从特征级自回归、动态草稿树到训练时测试,逐步提升了投机解码的速度和效率。
分布式低通信语言模型训练方法,通过内层优化器减少跨设备通信
大型自回归模型(如 Transformer)的推理速度很慢——解码 K 个 token 需要 K 次串行运行模型。这成为了部署大型语言模型的主要瓶颈。
通过非马尔可夫扩散过程实现 10-50× 加速采样的扩散模型