Back to blog

CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

CAT-Q首次以纯PTQ路线量化LLM到1.58bit三元权重,无需QAT。两个核心模块:Learnable Modulation用可学习因子$(\delta_\mu,\delta_\alpha,\delta_\Delta)$调制预训练权重分布与三元阈值,Softened Ternarization用tanh-based smooth transition函数从identity渐变到hard ternarization。仅512校准样本、8卡A100 8–60小时即可把1.7B–235B模型三元化,性能超越用100B tokens训练的BitNet 1.58-bit v1/v2,训练token量减少约10^5倍。

CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

一、论文概述

项目内容
arXiv ID2606.26650
标题CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
作者Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao
提交日期2026-06-25
学科分类cs.CL, cs.AI
模型规模1.7B → 235B(Qwen3、Llama2、Qwen3-30B-A3B、Ring-flash-2.0 100B-A6.1B、Qwen3-235B-A22B)
校准512 samples, seq len 2048(C4)

二、核心思想

问题定义:Ternary(1.58-bit)量化把权重映射到 {−1,0,+1}\{-1,0,+1\},10× 内存压缩且用整数加减替代 FP 乘法。现有最强 ternary LLM 方法(BitNet 1.58-bit v1/v2、TriLM、Tequila)均走 QAT 路线,需要100B+ tokens 训练,成本极高且模型规模有限。而现代 PTQ 方法(AWQ/GPTQ/OmniQuant/QuaRot/FlatQuant/SliderQuant)在 W2 及以下会崩溃。

解决方案:CAT-Q 是纯 PTQ 三元量化,只用 512 calibration samples(约 1M tokens,比 BitNet 减少 ~10^5×)就能三元化 1.7B–235B LLM。两个核心组件从优化视角耦合:

  1. Learnable Modulation (LM):以 (δμ,δα,δΔ)(\delta_\mu, \delta_\alpha, \delta_\Delta) 三个可学习因子调制预训练权重的均值/尺度/三元阈值,让 W 分布对 ternarization “不敏感”;
  2. Softened Ternarization (ST):用可微 smooth transition 函数 f(W;s,Δ)f(W;s,\Delta),随校准 epoch tt 逐步把 identity mapping 变成 hard ternarization,避免直接跳跃到非可微硬阈函数导致的收敛问题。

外层用 Sliding-Layer Ternarization Optimization(借鉴 SliderQuant)做多层联合输出重建。

图1 CAT-Q学习流程与硬件友好权重重建

三、技术架构/方法

3.1 Preliminary

线性层三元量化目标:

arg⁡min⁡α,T∥W−αT∥22\arg\min_{\alpha,\mathbf{T}} \|\mathbf{W} - \alpha\mathbf{T}\|_2^2

Ti=Q(Wi;Δ)={1Wi>Δ0∣Wi∣≤Δ−1Wi<−ΔT_i = Q(W_i;\Delta) = \begin{cases}1 & W_i>\Delta\\ 0 & |W_i|\le\Delta\\ -1 & W_i<-\Delta\end{cases}

TWN 静态近似:α=1∣IΔ∣∑i∈IΔ∣Wi∣\alpha = \frac{1}{|I_\Delta|}\sum_{i\in I_\Delta}|W_i|,Δ=0.7/n∑∣Wi∣\Delta = 0.7/n \sum |W_i|。BitNet 系列的 absmean:α=1n∑∣Wi∣\alpha=\frac{1}{n}\sum|W_i|, Δ=α/2\Delta=\alpha/2。

3.2 Learnable Modulation

作者发现直接把 α,Δ\alpha, \Delta 变成 learnable 参数只比静态略好,因为未处理预训练权重分布与三元化的错位。LM 给权重做可学习线性变换:

W^=W−μα,μ=μ0+δμα0,α=δαα0\hat{\mathbf{W}} = \frac{\mathbf{W}-\mu}{\alpha},\quad \mu=\mu_0+\delta_\mu\alpha_0,\quad \alpha=\delta_\alpha\alpha_0

其中 μ0=1n∑Wi\mu_0=\frac{1}{n}\sum W_i、α0=1n∑∣Wi−μ0∣\alpha_0=\frac{1}{n}\sum|W_i-\mu_0| 为静态初值;δμ,δα,δΔ\delta_\mu, \delta_\alpha, \delta_\Delta 是可学习标量因子。Δ=δΔΔ0\Delta = \delta_\Delta \Delta_0。三个因子分别调制均值、尺度、阈值,让权重分布向三元友好方向搬动。图 2 显示 LM(绿点)显著优于静态近似(蓝)与直接学习 α,Δ\alpha,\Delta(橙)。

图2 LM 权重重建误差对比

3.3 Softened Ternarization

Smooth transition 函数:

f(W;s,Δ)=tanh⁡(s(W−Δ))+tanh⁡(s(W+Δ))2tanh⁡(s)f(W;s,\Delta) = \frac{\tanh(s(W-\Delta))+\tanh(s(W+\Delta))}{2\tanh(s)}

性质:

  • s→0s\to 0:identity mapping;
  • ss 增大:output 曲线越尖锐;s=4.95s=4.95 时输出已缩到 [−1,1][-1,1];s→∞s\to\infty:等价 hard ternarization。

耦合 LM 后:

Ti={Wit=0f(W^i;tγs0,δΔΔ0)0<t≤γQ(W^i;δΔΔ0)γ<t≤1T_i = \begin{cases}W_i & t=0\\ f(\hat{W}_i;\tfrac{t}{\gamma}s_0,\delta_\Delta\Delta_0) & 0<t\le\gamma\\ Q(\hat{W}_i;\delta_\Delta\Delta_0) & \gamma<t\le 1\end{cases}

默认 s0=30s_0=30,校准 epoch m=60m=60,γ=0.8\gamma=0.8(即 80% epoch 用可微阶段,20% 用硬阶段收敛)。

图3 Softened ternarization 两阶段 图A transition 函数随 s 变化

3.4 Sliding-Layer Ternarization Optimization

不做每层单独重建,而是滑动窗口内 ll 层联合优化输出:

arg⁡min⁡A,T∥F(W,X)−F(A⋅T,X)∥22\arg\min_{\mathcal{A},\mathcal{T}} \|\mathcal{F}(\mathcal{W}, \mathbf{X}) - \mathcal{F}(\mathcal{A}\cdot\mathcal{T}, \mathbf{X})\|_2^2

F\mathcal{F} 是窗口输出特征,让邻层相互 aware,缓解误差累积。窗口尺寸沿用 SliderQuant 默认。

四、核心创新

创新点说明
PTQ 三元量化范式首个可直接适配任意架构/尺寸 LLM 的 PTQ 三元方案,跳过昂贵 QAT
Learnable Modulation用 (δμ,δα,δΔ)(\delta_\mu,\delta_\alpha,\delta_\Delta) 三因子调整均值/尺度/阈值,把 W 分布搬到三元友好域
Softened Ternarizationtanh-based smooth transition + 两阶段(可微→硬)relay 保证 PTQ 无 QAT 的稳定收敛
Sliding-window 输出重建借 SliderQuant 框架把多层联合优化引入三元化
极小校准成本512 样本 × 60 epoch;8×A100 8–60 h 即可量化 14B–235B

五、实验结果

5.1 主结果(W1.58 三元,A16/A8)

10 个模型 × 5 个 zero-shot benchmark(PIQA, ARC-e, ARC-c, HS, WG),部分节选:

ModelMethodAvgPPL 掉幅
Qwen3-8BW16A1671.57—
+ CAT-Q W1.58A1661.76−9.81
Qwen3-32BW16A1676.43
+ CAT-Q W1.58A1671.19−5.24
Llama2-70BW16A1676.53
+ CAT-Q W1.58A1672.72−3.81
Qwen3-30B-A3B (MoE)W16A1672.64
+ CAT-Q W1.58A1662.55−10.09
Ring-flash-2.0 100B-A6.1BW16A1674.88
+ CAT-Q W1.58A1664.68−10.20
Qwen3-235B-A22BW16A1679.59
+ CAT-Q W1.58A1669.09−10.50

模型越大,退化越小;MoE 模型比同规模 dense 更敏感。首次证明可将 235B PTQ 三元化,8×A100-80GB × 60h。

5.2 与 QAT 系列对比(W1.58A16)

Model#TokensAvg
BitNetV1-1.3B100B48.28
TriLM-1.5B300B50.20
Qwen3-1.7B + CAT-Q1M51.01
BitNetV1-3.9B100B54.16
TriLM-3.9B300B56.55
TequilaLLM-3B10B57.60
Qwen3-4B + CAT-Q1M57.06
Qwen3-4B + CAT-Q (2M cal)2M58.80
BitNetV1-7B100B57.42
TernaryLLM-8B + KD1T60.04
Qwen3-8B + CAT-Q1M61.76

在同规模区间 CAT-Q 全部超越 BitNet v1/v2 与 TriLM,且训练 token 少约 5 个数量级(1M vs 100B–1T)。

W1.58A8 上同样击败 BitNetV2 家族(Qwen3-8B + CAT-Q W1.58A8:Avg 60.96 vs BitNetV2-7B 57.63)。

5.3 与近 1.58bit PTQ 对比(Llama2)

MethodBitsLlama2-7B AvgLlama2-70B Avg
AWQW2A1635.82—
GPTQW2A1641.5534.38
OmniQuantW2A1646.9854.87
PB-LLMW1*A1637.59—
BiLLMW1*A1641.68—
DB-LLMW1*A1655.1265.82
SliderQuantW2A1655.3871.08
CAT-QW1.58A1657.6972.72

在更低 bit width 下击败所有 W2/W1 PTQ 基线*。

5.4 消融

  • LM 各因子 + ST:从静态 → 逐步加 δμ,δα,δΔ\delta_\mu, \delta_\alpha, \delta_\Delta → 加 ST,性能逐级上升;LM+ST 联合最佳。
  • γ\gamma 选择:γ∈[0.8,0.9]\gamma\in[0.8,0.9] 稳定最优;γ=1\gamma=1(不做硬阶段)明显掉;γ≥0.5\gamma\ge 0.5 都 robust。
  • 估计策略对比(Qwen3-4B / Llama2-7B):SA(静态近似)40.16 / 45.37;DL(直接学 α,Δ\alpha,\Delta)46.94 / 50.23;LM 57.06 / 57.69。
  • 含 μ\mu vs 不含 μ\mu:细微差异,默认不含 μ\mu 稍好。
  • learnable 阈值 vs 手工 Δ∈{0.125,…,2.0}\Delta\in\{0.125,\dots,2.0\}:learnable 全面胜出。

六、总结

核心贡献

  1. 首个可扩展到 235B 的 PTQ 三元 LLM 量化方案;
  2. LM + ST 从优化耦合视角处理”分布敏感 + 非可微”两大障碍;
  3. 用 SliderQuant 风格 sliding-window 输出重建加强层间协同;
  4. 训练成本相对 QAT 家族 减少 ~10^5×,14B–235B 8 卡 8–60h 即可完成。

技术影响

  • 让 1.58bit LLM 部署脱离 QAT 依赖,pretrained checkpoint 可直接压缩;
  • 展示 PTQ 在 W1.58 上超越 QAT 的可能路径(在小模型区间);
  • 与 SliderQuant 等多层重建框架天然兼容,可作为通用 PTQ backbone。

局限性

  • 小模型(1.7B/4B)退化仍相对明显(Qwen3-1.7B 平均掉 10 pp);
  • MoE 模型(Qwen3-30B-A3B 等)比同规模 dense 更敏感,需专家路由感知的额外设计;
  • 校准 epoch 数 60 仍需相当 GPU 时间(235B 60h),未做速度优化;
  • 未在数学/代码等挑战性任务全面评估(附录做了 pilot)。

七、参考资源