NVIDIA Nemotron 3: Efficient and Open Intelligence
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
59 posts tagged with "quantization"
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
基于 FP8 Matmul + FP16 累加器指令进一步加速 SageAttention2 的注意力量化内核实现,在保持精度的同时取得相对 FlashAttention 最高 3.9× 加速。
TriRoute — 单一轻量控制器联合决策注意力分辨率、FFN 专家选择与 KV-Cache 位宽,端到端可训练,单一预算旋钮扫出 Pareto 前沿,缓解跨轴路由坍缩级联
用微基准测试解剖 NVIDIA Blackwell 消费级 GPU(GeForce RTX 5080, GB203)架构,并与上一代 Hopper(H100 PCIe, GH100)逐子系统对比——涵盖统一 INT32/FP32 核、精简 FP64、第五代张量核心(FP4/FP6)、内存层次(L1/L2/global)与真实负载(D-GEMM、Transformer 推理)功耗。
CGO 2026 预印本 arXiv 2604.07857。Cornell + NVIDIA 团队(与 Tawa 同作者群)。这是一篇综述论文,系统梳理了 Agentic AI(感知-推理-行动闭环智能体)的能耗挑战与优化方法。核心贡献:① 提出**能量核算框架**,将 Agentic AI 能耗拆解为**计算能量**(FLOPs + 内存访问,DRAM 访问 ~640 pJ vs 算术 <1 pJ)和**通信能量**(token 传输、中间结果交换、多智能体同步)两大瓶颈;② 建立**统一分类学**,四大支柱:模型简化(量化/剪枝/蒸馏/稀疏 MoE/动作简化)、计算控制(token 长度控制/早退/层跳过/解码简化/工作负载调度)、输入与注意力优化(token 剪枝/稀疏注意力/KV 缓存复用)、硬件感知推理(精度调度/DVFS/内存 I/O 优化);③ 探讨**跨层协同设计**:跨层优化变量(传输-推理耦合/移动感知调度/模型-信道自适应)、用户-边缘-云协作(分割推理/自适应卸载/协作缓存)、通信-推理联合设计(语义通信/RAG 通信/能量感知调度);④ 识别五大开放挑战:不确定性量化自适应推理、跨模态/跨智能体协作能效、绿色 AI 与性能权衡、联邦绿色学习、碳感知智能体、6G 原生 Agentic AI、能量收集自维持系统。
NVIDIA Blackwell GPU 架构的综合技术综述——涵盖第五代张量核心(tcgen05、FP4/FP6)、张量内存 TMEM、硬件解压引擎 DE、重构内存层次(L1/L2/HBM3e/GDDR7)、双芯 B200 互连,以及与 Hopper/H200 的微基准对比与调优策略。综合自 Jarmusch et al. 两篇微基准论文。
Michael Brenndoerfer《GPU Architecture:Memory Hierarchy, CUDA and Tensor Cores》全文中文翻译。从第一性原理讲解 GPU 内存层次与带宽阶梯、CUDA 核心与 SM/warp/SIMT 执行模型、张量核心 WMMA 与混合精度、Roofline 模型、GPU 规格解读、消费级 vs 数据中心 GPU,以及内存/带宽/精度/功耗四大实际约束,附 PyTorch 代码示例。
End-to-end TPU migration for Gemma 4 31B: 1.61× faster training at 2.12× lower cost, with 66% higher long-context inference throughput
A quantitative analysis of FP8 E4M3 attention P-casting revealing P-collapse under attention sink and characterizing S=256 as the optimal static scaling factor
RateQuant用率失真理论把KV cache按注意力头分配bit宽度:假设量化MSE满足$D(b)=\alpha\beta^{-b}$,用reverse waterfilling闭式求最优分配,并识别distortion model mismatch这一失效模式——不同量化器$\beta$从3.6到5.3变化,套错模型比uniform更差。校准per-quantizer $\beta$并对K/V单独分配预算后,Qwen3-8B在KIVI 2.5bit的PPL从49.3降到14.9(−70%),QuaRot改善6.6 PPL;全流程校准仅1.6秒,推理零开销。
SharQ提出FP4量化与N:M稀疏协同的免训练推理方案:在线抽取outlier主导的稀疏骨干做sparse FP4 GEMM,再用dense FP4 GEMM对稀疏路径的量化+掩码误差做残差补偿,两路径共享单份FP4权重与path-specific scale视图。Llama-3.1-8B/Qwen2.5-7B/Qwen3-30B-A3B/Qwen3-VL-8B上恢复43–63%的NVFP4-FP16精度差,RTX 5090延迟对FP16降2.2–2.4×、对FP8吞吐提升1.2–1.4×,Wan2.2-T2V加SageAttention最高1.58×。
CAT-Q首次以纯PTQ路线量化LLM到1.58bit三元权重,无需QAT。两个核心模块:Learnable Modulation用可学习因子$(\delta_\mu,\delta_\alpha,\delta_\Delta)$调制预训练权重分布与三元阈值,Softened Ternarization用tanh-based smooth transition函数从identity渐变到hard ternarization。仅512校准样本、8卡A100 8–60小时即可把1.7B–235B模型三元化,性能超越用100B tokens训练的BitNet 1.58-bit v1/v2,训练token量减少约10^5倍。
面向ICME 2026 W4A4量化挑战赛的Wan2.2-I2V-A14B视频扩散模型4bit权重/4bit激活推理方案。将LLM量化领域的SmoothQuant逐通道平滑与MixQ稀疏离群列拆分迁移到视频扩散FFN,并叠加块级HiF4权重打包与双分支GEMM。在VBench I2V上各项指标相对FP16降幅控制在2–3.5%,运动平滑度反而提升+0.4%,全面优于原生HiFloat4基线(后者跌约5%)。
首个面向解耦式 LLM 服务的服务感知自适应 KV 缓存压缩框架,通过统一压缩策略空间 + 贝叶斯剖析引擎 + 服务感知在线控制器,PD 分离场景 JCT 加速最高 9.13x,KV 解耦场景 TTFT 降低最高 32.8x
首个全面评估 LLM 效率技术的大规模基准测试,涵盖架构预训练、微调和量化推理
Transformer 推理全栈优化综述,涵盖硬件设计、软件优化、调度策略和神经架构搜索
从生产实践角度重新审视KV缓存压缩技术,揭示吞吐量、响应长度和负样本三个被忽视的关键维度
改进极低比特 LLM 量化的缩放定律
利用异步性和低精度实现快速准确的注意力机制
基于 PCA 旋转的 DiT 4-bit 后训练量化框架
FP8 量化对数据中心 LLM 推理 TCO 的影响分析
在华为 Ascend NPU 上使用 FP16 单元模拟 FP32 GEMM 的精度恢复方法
实时交互式长视频生成框架
NVFP4 量化精度提升的自适应块缩放方法
NVIDIA Jetson平台优化的本地大语言模型推理框架,支持量化、多模态、语音、向量数据库和RAG
通过平滑激活离群值实现LLM的W8A8量化,支持高达530B参数模型的无损量化
基于查找表的超低精度CNN推理加速方法,2-bit实现比QNNPACK INT8快1.74倍
W4A8量化方法,通过自适应平滑和Hessian补偿实现高质量4-bit权重量化,同时加速预填充和解码
基于微缩放和自动缩放的高效FP8 LLM训练方法,实现34%吞吐量提升
统一FP8精度流的强化学习训练框架,实现16%端到端加速
一种低比特量化方法,通过混合精度、细粒度分组量化和动态量化实现高效LLM推理
全方向校准的LLM量化技术,通过LWC和LET实现PTQ效率与QAT性能的统一
首个将FlashAttention与量化算法结合的注意力加速方案,实现1.8倍延迟加速和2.37倍吞吐量提升
使用What-if分析理解大模型训练中的Straggler问题
面向内存受限GPU的即时MoE推理系统,通过混合压缩和稀疏预测实现48.7×加速
面向自动张量化程序优化的编译器抽象,通过Block抽象实现硬件张量计算原语的自动利用
KV-Cache-centric memory management system for efficient embodied planning with static-dynamic memory construction, multi-hop recomputation, and layer-balanced loading
FP8 大语言模型训练
高效生成式大语言模型服务综述:从算法到系统
面向KV缓存的免调优非对称量化
高效的KV缓存压缩框架,实现近无损生成推理
面向大语言模型的混合精度自回归并行推理
通过压缩优化器状态和激活实现高效FP8训练
DeepSeek-V3: 671B 参数 MoE 语言模型技术报告
KVTuner:敏感度感知的层级混合精度 KV 缓存量化
面向大规模 LLM 训练和推理的统一细粒度模拟器
面向 2-bit KV 缓存量化的离线谱协方差感知旋转方法
大语言模型长上下文推理优化技术综述,涵盖 KV Cache 压缩、注意力优化等。
OdysseyLLM 提出可部署的大语言模型量化加速方案。
TriForce 提出层次化推测解码方法,实现长序列生成的无损加速。
低比特大语言模型综述:基础、系统和算法。
OmniQuant 提出全方位校准的大语言模型量化方法。
NVIDIA提出基于Megatron Core的可扩展MoE模型训练方法,支持大规模混合专家模型的高效分布式训练。
自适应专家调度与内存协调的MoE推理运行时系统,通过动态步长预测和缓存感知路由消除99.9%等待延迟。
针对资源受限环境的低延迟视觉语言模型推理流水线
大规模语言模型(LLM)训练通常分布 across 大量加速器以减少训练时间。由于内部状态和参数梯度需要在每个梯度步骤中交换,所有设备需要使用低延迟高带宽通信链路 co-locate。
通过动态输入剪枝和缓存感知掩码实现高效LLM推理,降低计算和内存开销。
QServe提出W4A8KV4量化与系统协同设计,通过QoQ算法和QServe推理库实现LLM服务吞吐量提升2.36倍,成本降低3倍。