SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration
使用 INT8 量化注意力计算 + K 平滑 + FP16 累加器的即插即用推理加速方法
36 posts tagged with "attention-mechanism"
使用 INT8 量化注意力计算 + K 平滑 + FP16 累加器的即插即用推理加速方法
使用 INT4 线程级量化和 FP8 矩阵乘加速注意力计算,配合 Q+K 平滑与两级累加策略保持精度
将稀疏注意力与线性注意力融合的 trainable attention 方法,用于加速 DiT 视频生成模型
字节跳动提出的首个基于潜空间扩散模型(LDM)的高效文生视频框架。通过在低维潜空间建模视频分布、复用文生图模型的 2D 卷积权重、引入帧级轻量 adaptor 与有向时序注意力,MagicVideo 在单卡上生成 256×256 视频,FLOPs 较 VDM 减少约 64×。
Tangram 利用「Head-wise 保留量存在输入无关的两级结构」的观察,把非均匀 KV 压缩静态化:Budget Reservation 在调度时固定每头预算、Ragged Paging 用同预算 head 组成独立 page 表消除碎片、AOT Load Balancing 预算 CTA 划分。作为 vLLM drop-in 层,在五个模型 SCBench 上匹配原精度同时端到端吞吐相较 Full-KV 最高提升 2.6×。
首个全面评估 LLM 效率技术的大规模基准测试,涵盖架构预训练、微调和量化推理
通过Reference Sliding Window Attention实现恒定KV缓存,支持单次前向传播解析数十页文档
引入注意力机制的神经机器翻译,突破固定长度向量瓶颈
实时交互式长视频生成框架
实时自回归长视频扩散生成技术
实时交互式运动控制视频生成
面向高质量实时交互式视频生成的自回归扩散蒸馏正确方法
通过跨模态上下文学习改进联合音视频生成
面向快速视频生成的自洽分布匹配与缓存感知训练框架
NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真
一种通过组感知上下文学习加速同步 LLM 强化学习 Rollout 的系统
通过组合权重稀疏性和数据稀疏性提升 MoE 计算效率
通过稀疏性诱导提升 LLM 后训练剪枝精度
SparseVLM 和 SparseVLM+ 的完整技术分析,涵盖文本引导的视觉Token稀疏化方法、注意力重力校正、优先头选择等核心创新
本文提出EaaS,一种将MoE模块解耦为独立无状态服务的新型服务系统,实现细粒度资源扩展和固有容错能力,在模拟硬件故障下吞吐量下降不超过2%,并可节省高达37.5%的计算资源。
A lightweight bridging paradigm that enables SOTA-level VLA performance with only 0.5B parameters, without robotic data pre-training
突破十亿参数通用机器学习原子间势函数的训练壁垒
Matrix-3D 提出从单张图像生成全方位可探索 3D 世界的统一框架。
USP 提出统一序列并行方法,用于长上下文生成式 AI 模型。
OmniQuant 提出全方位校准的大语言模型量化方法。
NVIDIA提出基于Megatron Core的可扩展MoE模型训练方法,支持大规模混合专家模型的高效分布式训练。
自回归解码因其顺序性而受到瓶颈限制。投机解码(Speculative Decoding, SD)已成为加速推理的标准方法,通过使用快速草稿模型预测慢速目标模型即将生成的 token,然后通过一次目标模型前向传播并行验证。
首个基于掩码生成Transformer的图像编辑框架,通过注意力注入和区域保持采样实现6倍加速编辑
ShaLa提出多模态共享潜空间建模方法,实现文本、图像等多模态信息的统一表示学习。
通过注意力图块化和一致性蒸馏实现视频扩散Transformer 7.4-7.8倍加速推理
大规模语言模型(LLM)训练通常分布 across 大量加速器以减少训练时间。由于内部状态和参数梯度需要在每个梯度步骤中交换,所有设备需要使用低延迟高带宽通信链路 co-locate。
提出MPMD流水线并行训练方法,通过JAX/XLA编译器优化实现大规模深度学习训练的高效扩展。
Marconi为混合架构LLM提出高效前缀缓存机制,支持注意力层和非注意力层的统一缓存管理。
PipeFill利用流水线并行训练中的气泡时间执行额外计算任务,提升GPU利用率。
首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。
序列建模的一个核心目标是设计一个单一的、有原则的模型,能够处理跨模态和任务的序列数据,特别是长程依赖(LRDs)。然而,传统模型包括 RNNs、CNNs 和 Transformers 的专门变体仍然难以扩展到 10000 步以上的超长序列。