Full Stack Optimization of Transformer Inference: a Survey
Transformer 推理全栈优化综述,涵盖硬件设计、软件优化、调度策略和神经架构搜索
49 posts tagged with "pruning"
Transformer 推理全栈优化综述,涵盖硬件设计、软件优化、调度策略和神经架构搜索
使用稀疏 MoE 扩展扩散 Transformer 到 16.5B 参数
从权重稀疏到激活稀疏:DiT 模型的 N:M 半结构化稀疏加速
发现MoE大语言模型中的超级专家:少量关键专家对模型性能的决定性影响
AMD MI300A 上 FP8 矩阵核心、异步执行和结构化稀疏的执行特征分析
通过知识蒸馏和模态自适应剪枝压缩视觉语言模型
基于非结构化稀疏性的高效大语言模型推理加速框架,通过 Load-as-Sparse and Compute-as-Dense 方法在 Tensor Core 上实现高效 SpMM
首个免训练、即插即用的VLA推理加速框架,通过动作复用和视觉token剪枝实现55.7% FLOPs降低和36.0%延迟降低
一种无需训练的结构化推理加速框架,用于加速扩散式视觉-语言-动作模型
LLM 智能体强化学习综述:从被动序列生成器到自主决策智能体
通过组合权重稀疏性和数据稀疏性提升 MoE 计算效率
SparseVLM 和 SparseVLM+ 的完整技术分析,涵盖文本引导的视觉Token稀疏化方法、注意力重力校正、优先头选择等核心创新
高保真仿真就绪3D内容生成系统,支持场景布局、部件分解和铰接生成
基于softmax阈值的动态块稀疏注意力,无需训练和预计算,同时加速预填充和解码阶段
系统梳理Sparse Attention在LLM推理中的技术演进、核心方法与工程实践
首个Vision Transformer算法-加速器协同设计框架,通过固定稀疏注意力模式和自编码器实现高效加速
从 Llama 3-8B 高效上循环训练 MoE 模型
基于分块软匹配的在线KV缓存聚类框架,实现80%内存节省和3.19倍解码加速
基于3D并行的大规模Early-Exit LLM训练与推理框架
利用时空稀疏性加速视频扩散Transformer推理,实现2.28×/2.33×端到端加速
通过反斜线评分实现高效块稀疏注意力,加速长上下文推理高达13.5倍
面向内存受限GPU的即时MoE推理系统,通过混合压缩和稀疏预测实现48.7×加速
利用软激活稀疏性和低秩分解的LLM压缩方法
动态模块级专家剪枝框架,实现LoRA-MoE微调参数减少43%且精度不降
面向设备端LLM的动态分层稀疏注意力长上下文建模
GPU上稀疏矩阵乘法的设计原则
通过动态稀疏注意力加速长上下文LLM预填充
HashAttention:语义稀疏性实现更快推理
KVTuner:敏感度感知的层级混合精度 KV 缓存量化
硬件对齐且可原生训练的稀疏注意力机制
受 LLM 启发的序列优先点击率预测建模范式
面向异步GPU架构的稀疏矩阵乘法加速
Agentic RL 正在重塑 LLM 后训练,但端到端训练时间被计算密集的多轮 rollout 主导,占总时间的 70% 以上。关键挑战:
NSA 提出原生可训练稀疏注意力机制,实现高效长上下文推理。
VSA 提出可训练稀疏注意力机制,加速视频扩散模型推理。
UniPrefill 提出通用的长上下文 Prefill 加速框架。
Routing-Free MoE 提出无需路由的混合专家模型架构。
分布式 RL 后训练大语言模型面临两个通信瓶颈:
基于稀疏混合专家的自适应计算实时目标检测框架,通过动态路由实现按场景复杂度分配计算资源。
OmniSparse提出训练感知的细粒度稀疏注意力机制,优化长视频多模态大语言模型的推理效率。
长上下文建模能力已成为下一代大语言模型(LLM)的关键能力。许多新兴应用(如长文档理解、仓库级代码分析、自主 Agent 系统、长链推理)需要LLM 处理跨越数十万到数百万 token 的序列。
通过解耦视觉稀疏性,在预填充和解码阶段分别进行查询无关剪枝和查询感知检索,实现高效VLM推理
通过稳定性准则统一逐步和逐token稀疏决策的扩散模型加速框架
LServe通过统一稀疏注意力机制实现高效长序列LLM服务,优化KV缓存管理和注意力计算。
通过剪枝感知预训练实现架构无关的高效边缘语言模型,首次将LLM压缩提升到预训练阶段
通过可学习的 AttnGate 门控机制和自蒸馏训练,直接从 LLM 学习块级注意力稀疏性,128K 序列下实现 7.3× 内核加速。
SampleAttention通过自适应结构化稀疏注意力实现长上下文LLM推理的近无损加速,显著降低首token延迟。
多层级张量程序超级优化器,通过统一搜索空间生成高效注意力内核
在结构化稀疏加速器上实现非结构化稀疏加速,通过TASD方法弥合软硬件稀疏模式不匹配的鸿沟。