Back to blog

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

SharQ提出FP4量化与N:M稀疏协同的免训练推理方案:在线抽取outlier主导的稀疏骨干做sparse FP4 GEMM,再用dense FP4 GEMM对稀疏路径的量化+掩码误差做残差补偿,两路径共享单份FP4权重与path-specific scale视图。Llama-3.1-8B/Qwen2.5-7B/Qwen3-30B-A3B/Qwen3-VL-8B上恢复43–63%的NVFP4-FP16精度差,RTX 5090延迟对FP16降2.2–2.4×、对FP8吞吐提升1.2–1.4×,Wan2.2-T2V加SageAttention最高1.58×。

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

一、论文概述

项目内容
arXiv ID2606.26587
标题SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference
作者Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Huaqing Zheng, Xindian Ma, Peng Zhang
提交日期2026-06-25
学科分类cs.LG, cs.AI
硬件NVIDIA Blackwell / RTX 5090(NVFP4 + 4:8 in-pairs sparsity)
集成vLLM

二、核心思想

问题定义:块级 FP4 格式(NVFP4/MXFP4/HiF4)与 N:M 半结构化稀疏都已经进入 Tensor Core 硬件路径。同时组合两者做 LLM 激活压缩仍很难:

  1. 激活里存在输入相关的离群值,会主导 FP4 block scale、把 4bit 有效精度吃光;
  2. 直接套 N:M 掩码会丢弃中等幅值,把 sparsification loss 和 quantization error 耦合到一条路径上。

前人 outlier 处理路径(LLM.int8/SmoothQuant/AWQ/QuaRot/SpinQuant)虽有效但引入额外存储、异构数据流或额外 kernel,与 FP4 单 kernel 数据流不相容。

解决方案:SharQ 是免训练的推理方法,做在线 sparse–dense 分解:

  1. 生成输入自适应的 N:M 掩码 → outlier 主导的稀疏骨干;
  2. 骨干量化到 FP4;
  3. 定义残差 = 原激活 − 量化后骨干(不是未量化骨干),把 mask 丢失 + 骨干量化误差合并进单个残差;
  4. Sparse FP4 GEMM 处理骨干 + Dense FP4 GEMM 处理残差 → 求和。两路径共享一份 FP4 权重 payload,只用 path-specific scale views 区分;mask 生成、残差构造、layer norm 融进一个 fused preparation kernel。

图1 SharQ方法总览

三、技术架构/方法

3.1 前提与优化目标

对线性层 Y=XW\mathbf{Y}=\mathbf{X}\mathbf{W}(X∈RT×K\mathbf{X}\in\mathbb{R}^{T\times K}, W∈RK×D\mathbf{W}\in\mathbb{R}^{K\times D}),寻找

min⁡Y^∈H∥Y−Y^∥F2\min_{\widehat{\mathbf{Y}}\in\mathcal{H}}\|\mathbf{Y}-\widehat{\mathbf{Y}}\|_F^2

其中 H\mathcal{H} 由目标 FP4 格式 + N:M sparsity + 硬件 GEMM 决定。组内对称量化 sG=max⁡i∣xi∣/αBs_\mathcal{G}=\max_i|x_i|/\alpha_\mathcal{B},NVFP4 是 FP4 值 + 本地 block scale + 二次全局 scale。

3.2 稀疏骨干

对每个 local block 选幅度 top-kk(或 target N:M 模式所需 entries)构成掩码:

Xsp=M(X)⊙X,M(X)∈SN:M\mathbf{X}_{\mathrm{sp}} = \mathbf{M}(\mathbf{X})\odot\mathbf{X},\quad \mathbf{M}(\mathbf{X})\in\mathcal{S}_{N:M}

NVFP4 用 4:8 in-pairs sparsity,HiF4 用 2:4 sparsity。掩码在线从当前激活计算,无需离线学固定 mask。

3.3 稠密残差(关键设计)

设 Qsp,Dsp\mathcal{Q}_{\mathrm{sp}}, \mathcal{D}_{\mathrm{sp}} 为稀疏路径的量化/去量化算子,稀疏路径实际表示的激活是:

X~sp=Dsp(Qsp(Xsp))\widetilde{\mathbf{X}}_{\mathrm{sp}} = \mathcal{D}_{\mathrm{sp}}(\mathcal{Q}_{\mathrm{sp}}(\mathbf{X}_{\mathrm{sp}}))

残差相对量化后骨干(不是未量化骨干)定义:

R=X−X~sp=(X−Xsp)+(Xsp−X~sp)\mathbf{R} = \mathbf{X} - \widetilde{\mathbf{X}}_{\mathrm{sp}} = (\mathbf{X}-\mathbf{X}_{\mathrm{sp}}) + (\mathbf{X}_{\mathrm{sp}}-\widetilde{\mathbf{X}}_{\mathrm{sp}})

这样 R\mathbf{R} 同时携带 mask 掉的信息 + 保留的 outlier 的 4bit 量化误差,把两类误差捏成一个残差重建问题。

3.4 双路径 GEMM 输出

Y^SharQ=GEMMsp(Qsp(Xsp),Qw,sp(W))+GEMMdn(Qdn(R),Qw,dn(W))\widehat{\mathbf{Y}}_{\mathrm{SharQ}} = \mathrm{GEMM}_{\mathrm{sp}}(\mathcal{Q}_{\mathrm{sp}}(\mathbf{X}_{\mathrm{sp}}),\mathcal{Q}_{w,\mathrm{sp}}(\mathbf{W})) + \mathrm{GEMM}_{\mathrm{dn}}(\mathcal{Q}_{\mathrm{dn}}(\mathbf{R}),\mathcal{Q}_{w,\mathrm{dn}}(\mathbf{W}))

第一项走 Blackwell 硬件加速的 N:M 稀疏 FP4;第二项走 dense FP4 补偿。

3.5 Kernel 设计

图2 SharQ Kernel dataflow

  • Fused activation preparation:RMSNorm/PTS + pair-topk 4:8 in-pairs 掩码 + 稀疏压缩 + dense 残差构造,全部融入单一 preparation kernel,抵消掉动态 mask 生成本可能吃掉的 sparse compute 收益。
  • Shared FP4 weight payload:两路径共享同一份 FP4 权重体,只用不同 scale view(sparse 组32 scale / dense 组16 scale duplicated),避免双份权重存储。
  • Residual accumulation:dense 分支直接 accumulate 进 sparse 分支输出,无需 materialize 第二完整分支。

3.6 理论分析

  • Outlier 隔离改善量化友好度:稀疏骨干把 outlier 拉走后,dense 残差的 block scale 不再被 outlier 主导,dynamic range 更集中,更适合低 bit FP4;
  • 误差合并:X−(X~sp+R~)=R−R~\mathbf{X}-(\widetilde{\mathbf{X}}_{\mathrm{sp}}+\widetilde{\mathbf{R}}) = \mathbf{R}-\widetilde{\mathbf{R}},输出扰动满足 ∥XWˉ−(X~sp+R~)Wˉ∥F≤∥R−R~∥F∥Wˉ∥2\|\mathbf{X}\bar{\mathbf{W}}-(\widetilde{\mathbf{X}}_{\mathrm{sp}}+\widetilde{\mathbf{R}})\bar{\mathbf{W}}\|_F \le \|\mathbf{R}-\widetilde{\mathbf{R}}\|_F\|\bar{\mathbf{W}}\|_2。SharQ 关键角色不是让稀疏路径独自逼近全部激活,而是让残差路径联合吸收两类误差。

四、核心创新

创新点说明
Online sparse–dense decomposition用输入自适应 N:M mask 抽取 outlier-dominated 骨干,训练/校准/微调全免
残差 = 原激活 − 量化后骨干把 mask-induced loss 与 sparse-path quant error 合并为单一残差
共享 FP4 权重 + path-specific scale views两条路径同一权重 payload,避免存储翻倍
Fused preparation kernelRMSNorm/PTS + mask + 压缩 + 残差 融合到一个 op
格式无关NVFP4 / HiF4 / MXFP4 全通用(分别配对 4:8 / 2:4 / 2:4 sparsity)

五、实验结果

5.1 语言与多模态精度

Table 1(zero-shot + WikiText2):

ModelMethodAvg (5 tasks)WikiText2↓MMLU
Llama-3.1-8BFP1672.506.2565.24
NVFP470.326.9461.93
SharQ71.556.7363.76
Qwen2.5-7BFP1670.946.8574.16
NVFP469.437.2972.06
SharQ70.387.1572.83
Qwen3-30B-A3BFP1670.078.7079.64
NVFP468.409.1277.72
SharQ69.178.9678.79
  • Llama-3.1-8B:恢复约 56% NVFP4→FP16 平均精度 gap;MMLU +1.83 pp;
  • Qwen2.5-7B:恢复约 63%;
  • Qwen3-30B-A3B(MoE):SharQ 也对专家线性层生效,Avg +0.77 pp。
  • 总恢复率 43–63%,跨模型稳定。

Table 2(Qwen3-VL-8B 五个 VQA 基准):NVFP4 相对 FP16 掉 −1.40 pp → SharQ 恢复到 −0.80 pp(≈43% gap);TextVQA 恢复率 52%,POPE 涨 0.47 pp。

5.2 端到端服务效率

vLLM + RTX 5090,Llama-3.1-8B,batch=4,seqlen 256–2048:

图3 端到端服务效率

  • 相对 FP16 延迟降 55–60%(seqlen 256: 2.85s → 1.17s = 2.4×;seqlen 2048: 24.88s → 11.11s = 2.2×)
  • 相对 FP16 总吞吐 1.8–2.4×
  • 相对 FP8 总吞吐 1.2–1.4×(seqlen 2048: 4491 vs 3146 tok/s = 1.43×)

Table 3(Wan2.2-T2V-A14B 4×RTX 5090):

Method480P720P
FP16223.41s717.88s
SharQ182.21s (1.23×)648.04s (1.11×)
SharQ+SageAttention141.63s (1.58×)457.88s (1.57×)

5.3 消融

FP4 格式泛化(Qwen3-30B-A3B):SharQ 对 NVFP4/HiF4/MXFP4 均有增益。MXFP4 最弱(幂次2 scale + 大组),SharQ 让 WikiText2 从 9.70 降到 9.19(−0.51),HellaSwag +1.36pp、Lambada +2.84pp、WinoGrande +1.82pp、BoolQ +0.80pp。

Sparse/Dense 路径组合(Table 5, NVFP4, Llama-3.1-8B):

组合WikiText2↓MMLU
Sparse only82.9525.78
Dense+Dense6.6363.61
Sparse+Sparse6.9561.93
SharQ (Sparse+Dense residual)6.7363.76

只用 sparse 灾难性失败(信息全丢),Sparse+Sparse 与 NVFP4 baseline 打平,SharQ 稀疏骨干 + dense 残差匹敌纯 dense 双路径但保留稀疏加速,验证不对称分解是关键。

Kernel 延迟拆解:

图4 prefill延迟拆解

  • SharQ 单一 fused kernel 取代原来分离的 Quantize + RMSNorm;
  • Sparse NVFP4 GEMM 延迟 = dense NVFP4 的 0.66–0.72×;
  • FP8 延迟基本是 dense NVFP4 的 ~2×。

六、总结

核心贡献

  1. 将 FP4 量化与 N:M 半结构化稀疏协同用作推理原语,免训练、免校准、免模型专用调参;
  2. 相对量化后骨干定义残差是理论关键,把 sparsification 和 quantization 两类误差合并为单一残差;
  3. 共享 FP4 权重 + path-specific scale views + fused preparation kernel 让方案在真实硬件(Blackwell RTX 5090)跑得动;
  4. 语言 / MoE / VLM / 视频扩散全场景验证。

技术影响

  • 展示 FP4 + N:M sparsity 硬件路径的第一条”可组合、精度好”实践;
  • 定义了一种输入自适应 outlier 提取的推理时压缩范式,与 SmoothQuant/AWQ 等离线离群处理正交;
  • 与 SageAttention 等 attention 优化组合 1.57–1.58× 视频生成加速,展示了与其他 kernel 优化的可叠加性。

局限性

  • 需要硬件支持 N:M 稀疏 Tensor Core(当前只在 Blackwell 上评估);
  • 对 attention kernel 无直接优化(720P 视频生成加速 1.11× 反映了 attention 占比问题);
  • 免训练场景下 gap 恢复上限约 63%,若允许 QAT 或校准可能进一步压缩。

七、参考资源

  • 论文原文:https://arxiv.org/abs/2606.26587
  • HTML 版本:https://arxiv.org/html/2606.26587v1
  • 代码:论文注明 GitHub 仓库(见 abs 页 “code is available at this https URL”)
  • 相关工作:NVFP4 (NVIDIA 2024)、MXFP4 (OCP Microscaling)、HiF4 (Luo et al. 2026)、SmoothQuant、AWQ、QuaRot、SpinQuant、vLLM、SageAttention