Back to blog

NVIDIA Nemotron 3: Efficient and Open Intelligence

NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文

NVIDIA Nemotron 3: Efficient and Open Intelligence

一、论文概述

项目内容
标题NVIDIA Nemotron 3: Efficient and Open Intelligence
作者NVIDIA(团队)
机构NVIDIA Corporation
论文arXiv:2512.20856
发布2025-12-24
许可开源(模型权重、训练数据、软件均开源)

二、核心思想

问题定义

构建面向 agentic AI 应用的高准确率、高效率开源大模型。当前主流大模型面临的核心矛盾:追求更高准确率往往牺牲推理吞吐量,而追求效率则损失模型质量。Nemotron 3 的目标是在 accuracy-throughput 前沿取得突破,同时支持高达 1M token 的长上下文和多环境 RL 后训练。

解决方案概述

Nemotron 3 系列(Nano、Super、Ultra)采用混合 Mamba-Transformer MoE 架构,通过以下核心技术组合实现高效训练与推理:

  1. Hybrid MoE:以 Mamba-2 层替代大部分自注意力层,降低 KV Cache 开销,实现 3.3× 吞吐提升
  2. LatentMoE:将专家路由维度压缩至 latent space,节省的通信和内存开销用于增加专家数量和 top-K,提升准确率
  3. MTP(Multi-Token Prediction):为 Super/Ultra 添加 MTP 层,加速推理并提升模型质量(+2.4% 平均准确率)
  4. NVFP4 训练:全精度 NVFP4 预训练(最多 25T tokens),重量化但保持 BF16/MXFP8 关键层
  5. 多环境 RL 后训练:数学/代码/SWE/搜索/工具使用/长上下文等多环境同时训练
  6. 推理时推理预算控制:用户可指定思考 token 预算,模型自适应截断

Hybrid MoE 架构


三、技术架构

Hybrid Mamba-Transformer MoE 架构

准确率-吞吐量对比

核心设计:Mamba-2 层在生成阶段仅需维护固定大小的状态(不增长),而自注意力层需要维护随序列长度线性增长的 KV Cache。Nemotron 3 用 Mamba-2 层替换了大部分自注意力层,仅保留少数注意力层用于全局信息路由。

架构权衡:

  • MoE 层:稀疏参数缩放,给定计算预算下更高准确率
  • 注意力层:高保真全对全信息路由(少数关键层)
  • Mamba-2 层:固定推理时计算和内存的序列建模

以 Nemotron Nano 30B-A3B 为例,相比 Qwen3-30B-A3B 实现 3.3× 更高吞吐(8k 输入 / 16k 输出),且在 RULER 1M token 长上下文任务上达到 SOTA。

LatentMoE 架构

LatentMoE 对比 LatentMoE 对比

LatentMoE 的核心设计:将 token embedding 从隐藏维度 dd 投影到更小的 latent 维度 ℓ\ell(ℓ<d\ell < d),在 latent space 中进行专家路由和计算,再投影回 dd。

关键缩放公式:

N′=N⋅d/ℓ,K′=K⋅d/ℓ(1)N' = N \cdot d/\ell, \qquad K' = K \cdot d/\ell \tag{1}

其中 NN 为总专家数,KK 为 top-K 活跃专家数。以 Nemotron 3 为例:d=4096d = 4096,ℓ=1024\ell = 1024,d/ℓ=4d/\ell = 4,因此 N′=512N' = 512(vs 128),K′=22K' = 22(vs 6)。

保留在原始维度 dd 的非路由计算:MoE 路由门(gating network)、共享专家计算、非专家层。

NVFP4 训练

NVFP4 格式特性:

  • 细粒度(16 元素)micro-block scaling
  • E4M3 格式 block scaling factors
  • 第二级 FP32 global scale
  • E2M1 element format

训练配方(关键层精度保留):

  • NVFP4:主体权重、激活、梯度
  • BF16:QKV 投影、注意力投影、LatentMoE latent 投影、MTP 层(位于网络末端)
  • MXFP8:Mamba 输出投影(NVFP4 量化时高达 40% flush to zero)

Figure 4 显示:保留敏感层在高精度下,NVFP4 与 BF16 的相对 loss 差 < 1%(Nano A3B),更大模型(A8B)< 0.6%。

NVFP4 vs BF16 Loss Gap

长上下文(1M tokens)

  • 不使用 RoPE:Mamba 层提供隐式位置信息,注意力层也不依赖 RoPE,避免 OOD RoPE 问题
  • CPT 阶段:512k 序列长度持续预训练
  • SFT 阶段:256k 序列长度
  • RL 阶段:多环境包含长上下文环境(32k token 输入)
  • 合成数据:长程检索、多跳推理、多文档信息聚合

Figure 6 显示 Nemotron 3 Nano base 在 1M token 代码数据上的累积平均 NLL 随序列长度下降,表明模型有效利用了长上下文。

1M Token NLL

多环境 RL 后训练

同时训练的 RL 环境:数学/科学推理、竞技编程、指令遵循、软件工程、搜索、对话、通用 agentic 工具使用、长上下文等。

关键发现:同时训练优于分阶段训练——更稳定、更少 reward hacking、整体表现更好。

系统设计:

  • 异步 RL 架构(解耦训练和推理)
  • 利用 MTP 加速 rollout 生成
  • GRPO + masked importance sampling(处理训练/rollout 策略差异)
  • 开源:NeMo-RL + NeMo-Gym(Apache 2.0)

多环境 RL 训练

推理时推理预算控制

用户可指定最大思考 token 数,模型到达预算后自动附加 </think> token 并继续生成。Figure 8 展示了准确率-效率权衡曲线,提供细粒度控制。

推理预算控制权衡


四、核心创新

创新点说明实验依据
Hybrid Mamba-Transformer MoE以 Mamba-2 层替换大部分自注意力层,仅保留少量注意力层用于全局路由3.3× 吞吐提升(vs Qwen3-30B-A3B),RULER 1M token SOTA
LatentMoE将专家路由维度压缩至 latent space,节省的通信/内存用于扩大专家数量和 top-KTable 1:相同 active/total params 下,所有任务均超越 Standard MoE(MMLU-Pro +4.57pt,Code +3.19pt)
MTP 集成Super/Ultra 集成 MTP 层,同时提升推理效率和模型质量Table 2:8B MoE 基准上平均 +2.4% 准确率,MTP 第一二 token 接受率 ~97%
  • Figure 4:Nano <1% 相对 loss 差;Figure 5:下游任务轨迹与 BF16 一致 | 多环境 RL 同时训练 | 所有 RL 环境在一次训练中同时优化,优于分阶段训练 | Figure 7:多任务基准在 RL 过程中稳步提升 | | 推理预算控制 | 用户可指定思考 token 预算,模型自适应截断生成 | Figure 8:提供细粒度准确率-效率权衡 |

五、代码实现分析

开源资源

架构实现要点

  • MoE 路由:LatentMoE 在 latent space (ℓ=1024\ell=1024) 进行,非路由计算(gating、shared expert)保持在 d=4096d=4096
  • MTP 模块:轻量级 MTP 头,位于网络末端,保持 BF16 精度
  • NVFP4 GEMM:基于 cuBLAS 后端(Transformer Engine),支持 fprop/dgrad/wgrad
  • RL 训练:GRPO 算法 + masked importance sampling,异步 rollout 生成

六、实验结果

Table 1: LatentMoE vs Standard MoE 准确率对比

模型MMLU-ProMMLUCodeMathCommonsense
Standard MoE (8.09B active / 72.6B total)48.3070.1051.9578.3281.73
LatentMoE (8.02B active / 72.8B total)52.8772.1155.1480.1982.10

两个模型均 8B active / ~73B total params,训练 1T tokens。LatentMoE 在所有任务上均超越 Standard MoE。

Table 2: MTP 消融(8B active Transformer MoE 基准)

任务BaselineBaseline + MTP提升
MMLU (5-shot)70.0671.26+1.20
MMLU-Pro (5-shot CoT EM)45.0547.84+2.79
MBPP-Sanitized (3-shot)65.5866.89+1.31
ARC-Challenge (25-shot)86.4388.05+1.62
WinoGrande (0-shot)74.5975.45+0.86
RACE (0-shot)84.0285.36+1.34
GSM8K (8-shot)82.4984.46+1.97

Table 3: RULER 长上下文评分(MoE hybrid vs Dense hybrid)

模型128k256k512k1M
Nemotron-Nano-12B-v2-Base (Dense Hybrid)85.1379.8575.1223.43
Nemotron-3-Nano-30B-A3B-Base (MoE Hybrid)74.4871.6766.0254.19

MoE hybrid 在 1M token 场景下展现出优雅的降阶(graceful degradation),而 dense hybrid 出现急剧下降。

NVFP4 训练结果

  • Nano A3B:NVFP4 vs BF16 相对 loss 差 < 1%
  • 更大 A8B 模型:相对 loss 差 < 0.6%
  • Figure 5 显示 NVFP4 训练的下游任务评估轨迹与 BF16 一致

七、相关工作

MoE 架构

  • DeepSeek-V3:使用标准 MoE + MTP
  • Nemotron-H:之前的混合 Mamba-Transformer 工作
  • SWAN:Transformer 的长上下文替代方案(RoPE-free)

量化训练

  • NVFP4 Pretraining (NVIDIA 2025c):模拟 NVFP4 数值(quantize-dequantize around BF16 GEMM)
  • Scaling Law for Quantization-Aware Training (Chen et al. 2025):量化诱导的 loss gap 随模型规模减小

长上下文

  • RULER (Hsieh et al. 2024):真实上下文长度评估基准
  • Mamba-2 (Dao & Gu 2024):结构化状态空间模型,固定推理内存

RL 后训练

  • GRPO (Shao et al. 2024):DeepSeekMath 提出的 RL 算法
  • Speculative Decoding (Leviathan et al. 2023):MTP 加速推理的基础

八、总结

核心贡献

  1. Nemotron 3 系列模型:Nano(已发布)、Super/Ultra(即将发布),混合 Mamba-Transformer MoE 架构
  2. LatentMoE:硬件感知的专家设计,通过 latent space 路由实现准确率提升而不增加推理成本
  3. NVFP4 全精度预训练:在 Mamba-MoE 架构上首次实现 NVFP4 预训练(最多 25T tokens),使用 native NVFP4 GEMM
  4. MTP 集成:Super/Ultra 的 MTP 层,~97% 第一二 token 接受率,同时提升推理效率和模型质量
  5. 多环境 RL 同时训练:证明同时训练优于分阶段训练,NeMo-RL/NeMo-Gym 开源
  6. 1M token 上下文支持:无 RoPE 设计,优雅的长上下文外推能力

技术影响

Nemotron 3 将高效架构(Mamba-2 + MoE + LatentMoE)与先进训练技术(NVFP4 + MTP + 多环境 RL)结合,为 agentic AI 应用提供了兼具高准确率和推理效率的开源基础模型。完整开源(权重、数据、软件)使其成为研究和生产部署的重要参考。

局限性

  • Super 和 Ultra 模型尚未发布(仅 Nano 随本文发布)
  • 本文是 white paper 性质,详细 benchmark 在 Nemotron Nano 3 技术报告中
  • NVFP4 训练需要 NVIDIA GB300 等支持 FP4 的硬件才能获得 3× 吞吐优势

九、参考资源