Back to blog

Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models

面向延迟最优的混合小语言模型,通过深度-宽度优化、算子搜索和权重归一化实现SOTA效率

Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models

一、论文概述

项目内容
标题Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models
作者Yonggan Fu, Xin Dong, Shizhe Diao, Matthijs Van keirsbilck, Hanrong Ye, Wonmin Byeon, Yashaswi Karnati, Lucas Liebenwein, Hannah Zhang, Nikolaus Binder, Maksim Khadkevich, Alexander Keller, Jan Kautz, Yingyan (Celine) Lin, Pavlo Molchanov
机构NVIDIA, Georgia Institute of Technology
论文arXiv:2511.18890
发布2025-11-24
主题cs.CL (Computation and Language)
模型Nemotron-Flash-1B/3B

二、核心思想

问题定义

小语言模型 (SLM) 的高效部署对延迟敏感的现实应用至关重要。现有工作主要关注减少参数量来实现参数效率,但参数效率不一定能转化为成比例的实际设备加速。

核心问题:

  1. 深-窄模型是否在延迟-精度权衡上最优?
  2. 哪些高效注意力算子最适合SLM?
  3. 如何系统性地训练延迟最优的SLM?

核心观察

关键发现:

  • 深-窄模型虽然参数高效,但延迟-精度权衡次优
  • 存在最优深度-宽度比,取决于目标延迟预算
  • DeltaNet和Gated DeltaNet是线性注意力的有力候选
  • 权重归一化可有效提升收敛和下游精度

解决方案概述

Nemotron-Flash:延迟最优的混合SLM家族。

三大创新:

  1. 深度-宽度优化:增强缩放定律确定最优比例
  2. 进化搜索:自动发现混合注意力算子组合
  3. 权重归一化:约束权重范数提升有效学习率

三、技术架构

整体框架

Teaser结果

Figure 1: Nemotron-Flash显著推进了SLM的精度-效率前沿。

深度-宽度探索

核心问题:深-窄 vs 宽-浅,哪个更适合延迟优化?

实验设置:

  • 训练一系列Llama模型,深度设置:6/12/18/24/30层
  • 每个深度设置变化隐藏大小
  • 在100B tokens上训练

关键发现:

观察说明
观察1深-窄模型在参数-精度权衡上更优,但收益逐渐饱和
观察2在延迟-精度权衡上,深-窄不一定最优
观察3存在最优深度,取决于延迟预算

示例:延迟预算3秒时,深度12的模型优于深度24的模型。

增强缩放定律

标准缩放定律:

L(P,N)=L0+C1⋅P−α+C2⋅N−γ\mathcal{L}(P, N) = \mathcal{L}_0 + C_1 \cdot P^{-\alpha} + C_2 \cdot N^{-\gamma}

增强缩放定律(引入深度D和宽度W):

L(D,W,N)=L0+C1⋅(aDα⋅bWβ)−γ+C2⋅N−δ\mathcal{L}(D, W, N) = \mathcal{L}_0 + C_1 \cdot (aD^{\alpha} \cdot bW^{\beta})^{-\gamma} + C_2 \cdot N^{-\delta}

实际应用:

  1. 在目标延迟约束下,profile一系列深度-宽度配置
  2. 选择满足延迟约束且损失最低的配置

算子探索

探索的算子:

算子特点
Mamba选择性状态空间模型
Mamba2改进版Mamba
GLA门控线性注意力
DeltaNet增量规则线性注意力
Gated DeltaNet门控版DeltaNet
RWKV7线性注意力变体
SWA滑动窗口注意力

关键发现:

算子探索

Figure 4: 算子探索结果。

Table 1: 算子组合探索(500M参数)

算子1算子2Wiki PPL ↓CR Acc ↑
Mamba2-24.3647.72%
Attention-24.4448.02%
DeltaNet-23.8747.83%
DeltaNetMamba223.3748.03%
Gated DeltaNetMamba223.3748.03%

关键发现:

  • DeltaNet和Gated DeltaNet是PPL-延迟前沿的最佳候选
  • 与Mamba2配对通常效果更好
  • 纯DeltaNet优于纯Attention

进化搜索框架

搜索空间:

  • 候选算子:DeltaNet, Attention, Mamba2
  • 三阶段策略:早/中/晚阶段各一种构建块
  • 每阶段可搜索:算子类型、比例、FFN数量

搜索算法:

  • 使用老化进化搜索 (Aging Evolution Search)
  • 短训练PPL作为搜索代理:利用架构排名早期稳定的特性
  • 每个架构训练10B tokens(约2小时,32×A100)

搜索结果:

Table 2: 不同效率指标搜索的架构

搜索指标参数量Wiki PPLCR Acc架构
解码延迟837M20.7051.04%[d,f,m2,f,a,f,m2,f,d,…]
参数量497M23.0649.23%[m2,f,a,f,a,f,d,m2,f,…]

Table 3: 搜索架构 vs 基线(相同延迟)

模型参数量Wiki PPL ↓CR Acc ↑
SWA616M23.3348.72%
GLA862M22.6748.43%
DeltaNet852M20.9050.38%
Mamba2+FFN889M21.4350.04%
Searched (Ours)837M20.7051.04%

权重归一化

动机:训练后的权重矩阵存在非平滑性,某些维度权重幅度过大。

方法:将模型权重投影到单位范数球上。

效果:

Table 4: 权重归一化效果(1B模型)

模型设置Wiki PPL ↓CR Acc ↑
Llama 1Bw/o wnorm18.6753.81%
w/ wnorm18.0354.85%
DeltaNet 1Bw/o wnorm18.8653.46%
w/ wnorm18.1954.39%
Mamba2 1Bw/o wnorm18.4453.30%
w/ wnorm17.8854.71%

关键发现:

  • 一致性提升CR精度 +1.20%
  • 平均降低PPL 0.66

Meta Tokens

作用:缓解注意力沉降现象,为线性注意力提供学习到的缓存初始化。

Table 5: Meta Tokens效果

模型Meta TokenWiki PPL ↓CR Acc ↑
Mamba2-48L-1Bw/o19.0451.71%
w/18.9852.33%
DeltaNet-48L-1Bw/o19.6052.12%
w/19.4752.46%

四、实验结果

Nemotron-Flash模型配置

Table 11: Nemotron-Flash配置

模型参数量深度构建块全注意力层
Nemotron-Flash-1B0.96B12Block-1 + Block-22层
Nemotron-Flash-3B2.7B18Block-1 + Block-23层

构建块:

  • Block-1: DeltaNet-FFN-Mamba2-FFN
  • Block-2: Attention-FFN-Mamba2-FFN

主要结果

Table 6: 与SOTA SLMs对比

模型参数延迟(s)↓吞吐(tok/s)↑MMLUCRMathCodingRecallAvg
Qwen3-0.6B0.6B27.5516052.4448.9136.8824.3262.9244.11
Nemotron-Flash-1B0.96B14.45728944.6354.4634.8637.9167.1149.63
Qwen3-1.7B1.7B36.2015762.4657.2153.7143.7666.4255.47
Qwen2.5-3B3B49.4045965.5658.8853.8349.4673.0358.96
Nemotron-Flash-3B2.7B28.71293961.1961.0257.6253.3373.2560.98

关键结果:

  • Nemotron-Flash-1B: 比Qwen3-0.6B精度+5.5%,延迟**1.9×降低,吞吐46×**提升
  • Nemotron-Flash-3B: 比Qwen2.5-3B精度+2.0%,延迟**1.7×降低,吞吐6.4×**提升
  • 在常识推理、数学、编码、召回任务上达到最高精度

指令微调结果

Table 7: Nemotron-Flash-3B-Instruct

模型参数延迟(s)↓吞吐(tok/s)↑MMLUGPQAGSM8KIFEvalAvg
Qwen2.5-1.5B1.5B34.5068759.7330.1356.0346.7848.17
Qwen3-1.7B1.7B36.2015760.1828.3464.8831.2946.17
Nemotron-Flash-3B2.7B28.71293960.3429.5469.4552.0352.84

关键结果:

  • 平均精度**+4.7%**
  • 吞吐**4.3×/18.7×**高于Qwen2.5-1.5B/Qwen3-1.7B

注意力配置消融

Table 8: Nemotron-Flash-3B注意力配置

配置延迟(s)↓吞吐(tok/s)↑MMLUCRMathCodingRecallAvg
3FA28.71293961.1961.0257.6253.3373.2560.98
2FA+1SWA28.06373761.0260.9358.5651.8273.3760.69
1FA+2SWA27.95465761.1960.9457.8852.4073.7760.84

关键发现:

  • 1FA+2SWA配置:吞吐提升1.6×,精度几乎不变
  • 仅需2-3个全注意力层即可保持召回性能

与nGPT对比

Table 12: 权重归一化 vs nGPT

方法Wiki PPL ↓CR Acc ↑
Baseline18.4453.30%
Weight Norm (Ours)17.8854.71%
nGPT17.7154.29%

关键发现:

  • 权重归一化是nGPT的简化高效变体
  • 关键在于权重归一化本身,而非激活归一化

五、核心创新

创新点说明效果
深度-宽度优化增强缩放定律确定最优比例避免深-窄陷阱
进化搜索框架自动发现混合算子组合PPL降低0.74,CR+1.21%
短训练代理利用排名早期稳定特性搜索效率提升50×
权重归一化投影到单位范数球CR+1.20%,PPL-0.66
Meta Tokens缓解注意力沉降CR+0.62%
混合架构DeltaNet+Mamba2+Attention兼顾效率和召回

六、与相关方法对比

方法特点Nemotron-Flash优势
MobileLLM深-窄设计延迟优化更佳
MiniCPM参数效率真实设备加速更显著
Qwen3全注意力更低延迟,更高吞吐
Llama3.2标准架构混合架构更高效
nGPT球面归一化更简单,同等效果

七、局限性

  1. 长上下文限制:滑动窗口注意力限制了超长上下文能力
  2. 搜索成本:进化搜索需要大量GPU时间
  3. 硬件依赖:延迟测量依赖特定硬件和优化内核
  4. 全注意力层:仍需少量全注意力层保证召回

八、总结

核心贡献

  1. 延迟优化范式:从参数优化转向延迟优化
  2. 系统性方法论:深度-宽度、算子选择、训练策略三位一体
  3. 进化搜索:自动发现最优混合架构
  4. 权重归一化:简单有效的训练增强
  5. SOTA性能:Nemotron-Flash家族在延迟-精度权衡上领先

性能总结

模型参数延迟吞吐平均精度
Nemotron-Flash-1B0.96B14.45s7289 tok/s49.63%
Nemotron-Flash-3B2.7B28.71s2939 tok/s60.98%
Nemotron-Flash-3B-Instruct2.7B28.71s2939 tok/s52.84%

技术影响

Nemotron-Flash展示了延迟优先的SLM设计范式:

  • 参数效率 ≠ 延迟效率:深-窄不一定最优
  • 混合架构潜力:DeltaNet+Mamba2+Attention互补
  • 搜索自动化:进化搜索可高效探索设计空间
  • 训练增强:权重归一化简单有效

九、参考资源