Back to blog

W4A4 Quantization for Inference on Wan2.2-I2V-A14B

面向ICME 2026 W4A4量化挑战赛的Wan2.2-I2V-A14B视频扩散模型4bit权重/4bit激活推理方案。将LLM量化领域的SmoothQuant逐通道平滑与MixQ稀疏离群列拆分迁移到视频扩散FFN,并叠加块级HiF4权重打包与双分支GEMM。在VBench I2V上各项指标相对FP16降幅控制在2–3.5%,运动平滑度反而提升+0.4%,全面优于原生HiFloat4基线(后者跌约5%)。

W4A4 Quantization for Inference on Wan2.2-I2V-A14B (ICME 2026 Challenge)

一、论文概述

项目内容
arXiv ID2606.29337
标题W4A4 Quantization for Inference on Wan2.2-I2V-A14B
作者Yidong Chen, Chengyu Shi, Jiahao Liu
提交日期2026-06-28
学科分类cs.CV, cs.DC
比赛ICME 2026 Low-Bit-width Large-Model Quantization Challenge, Sub-Challenge 1
目标模型Wan-AI/Wan2.2-I2V-A14B(图生视频 diffusion transformer)
数值格式HiFloat4 (HiF4) / MXFP4
代码https://github.com/shch-y/icme

二、核心思想

问题定义:ICME 2026 挑战赛 Sub-Challenge 1 要求将 Wan2.2-I2V-A14B 的线性层同时量化到 4bit 权重和 4bit 激活(W4A4),配合 HiF4/MXFP4 数值格式,尽可能保留 OpenS2V-5M / VBench I2V 感知质量。允许保留的 FP16 Transformer block 数上限:MXFP4 ≤5、HiF4 ≤2。目标分辨率 720×1280×61 帧。

直接对 video diffusion transformer 做 W4A4 rounding 的痛点与 LLM 一致:FFN 激活重尾离群通道 —— 少数通道幅值远大于分布主体,膨胀 per-tensor scale 并把 4bit SNR 打崩。

解决方案:作者把 LLM 量化两条正交经验搬到 Wan2.2:

  1. SmoothQuant:以逐通道正因子 ss 将激活离群幅度迁移到权重侧(数学等价的 fold),大幅收缩 activation range;
  2. MixQ:把少量重尾列拆到 FP16 高精度分支,其余走 W4A4 主路径;
  3. 块级 HiF4 权重打包:32×32 tiles 或 128×1 K-major 条带,随 outlier 分布给权重分组做细粒度 scale。

三者构成 offline calibration → SmoothQuant fold → MixQ 列拆 → block HiF4 打包 → dual-branch GEMM 的端到端 pipeline。

图1 端到端W4A4推理流水线

三、技术架构/方法

3.1 观察:Wan2.2 FFN 激活重尾

高噪 block_00.ffn.0 的校准统计显示:activation 列 max > 6.0,而 weight 列 max < 0.6;|x| 直方图在 |x|>1.5 处仍有明显尾部。这些尾部在 per-tensor 或粗粒度 per-channel W4A4 下直接决定 quantizer step,把绝大多数小幅通道压到少数 bin 里。

图2 block_00 FFN激活权重统计

3.2 SmoothQuant 逐通道平滑

对线性层 Y=XWY=XW,引入正因子向量 s∈Rdins\in\mathbb{R}^{d_{\mathrm{in}}}:

Y=(X⊘s)(s⊙W)Y = (X\oslash s)(s\odot W)

校准时收集激活/权重逐通道幅度,取

sj=act_scalejαweight_scalej 1−α,α∈(0,1)s_j = \frac{\text{act\_scale}_j^{\alpha}}{\text{weight\_scale}_j^{\,1-\alpha}},\qquad \alpha\in(0,1)

α\alpha 越大,越多动态范围被推入 WW。FFN up-projection 上作者取 α∈[0.5,0.7]\alpha\in[0.5, 0.7]。ss 会在离线阶段 folded 进 master 权重,推理时激活先除以 ss 再走 HiF4 quantize。

图3 SmoothQuant folding 图4 逐通道max迁移前后

3.3 MixQ 列拆 + 双分支 GEMM

对 X∈RT×dinX\in\mathbb{R}^{T\times d_{\mathrm{in}}} 计算逐列打分:

scorej=max⁡t∣xt,j∣\text{score}_j = \max_t|x_{t,j}|

选 top-kk 列构成静态离群集合 O\mathcal{O},J={1,…,din}∖O\mathcal{J}=\{1,\dots,d_{\mathrm{in}}\}\setminus\mathcal{O}。层输出:

Y=X:,J WJ,:(q)+X:,O WO,:(hp)Y = X_{:,\mathcal{J}}\,W^{(q)}_{\mathcal{J},:} + X_{:,\mathcal{O}}\,W^{(hp)}_{\mathcal{O},:}

其中 (⋅)(q)(\cdot)^{(q)} 走 HiF4/MXFP4 W4A4,(⋅)(hp)(\cdot)^{(hp)} 走 FP16/BF16。与原 MixQ 不同:视频扩散 token 是时空 token,作者放弃 MixQ 的在线预测,改用静态 O\mathcal{O},每层保存稀疏索引列表,kk 保持极小以满足 challenge 高精度预算。

图5 MixQ 工作流 图7 每列打分排序

3.4 块级 HiF4 权重打包

在 fold 与列抽取之后,剩余权重按 block-wise scale 打包:评估 32×32 tiles 与 128×1 K-major stripe。前者对局部离群 tile SNR 更好,后者匹配 GEMM 内存序。每 block 的指数与 4bit payload 并列存储。

图8 块级打包布局

3.5 设计理由

  • SmoothQuant 是全局线性再平衡,能拉低多数通道尾部但无法根除最重尾;
  • MixQ 是选择性保护,只在 fold 后剩余的重尾列上花高精度预算;
  • 先 smoothing 再 splitting,可让高精度分支 ∣O∣|\mathcal{O}| 更小,kk 保持在挑战赛”允许的高精度预算”内;
  • 深层 block(如 block_29.ffn.2)尾部结构相似但幅度略降,同一 recipe 通用(图6)。

图6 block_29 FFN 尾部结构

四、核心创新

创新点说明
LLM→视频扩散的 W4A4 recipe 迁移首次系统地把 SmoothQuant + MixQ 组合用到 Wan2.2 视频 DiT FFN
静态离群列用 OpenS2V-5M 校准得到的 static top-kk 列取代 MixQ 的在线预测,减少推理调度复杂度、便于挑战赛审计
双分支 GEMM 与 block HiF4 融合主路径 W4A4 + 窄路径 FP16 + 32×32 / 128×1 tile 权重打包
Layer-wise α\alpha 与 kk建议深/浅层用不同 α\alpha 与 kk 以进一步缩小 gap

五、实验结果

VBench I2V 指标(相对 FP16 的百分比变化)

MethodAestheticI2V subj.ImagingMotionSubj. cons.
FP16 baseline0.54450.96260.70860.97300.9199
Native HiFloat40.5173 (−5.0%)0.9145 (−5.0%)0.6732 (−5.0%)0.9243 (−5.0%)0.8739 (−5.0%)
Ours (W4A4)0.5274 (−3.1%)0.9375 (−2.6%)0.6936 (−2.1%)0.9769 (+0.4%)0.8875 (−3.5%)
  • Native HiFloat4 各项均掉约 5%;
  • 本文 W4A4 pipeline 在四项指标上把 gap 收窄到 2–3.5%;
  • Motion smoothness 反超 FP16 +0.4%,说明”结构化混合精度 + smoothing”对视频扩散 FFN 优于均匀 4bit rounding;
  • 剩余 gap 集中在 aesthetic / subject consistency,作者认为源于 4bit activations 对精细外观细节的截断。

定性讨论

  • 单用 SmoothQuant 无法处理最重尾的 outlier 列;
  • 单用 MixQ 需要更多高精度列,可能超挑战赛预算;
  • 联合使用可让 ∣O∣|\mathcal{O}| 保持很小同时把 activation range 收进 4bit 可表示区间;
  • 尾部结构在深层持续存在,共享 recipe 有效。

六、总结

核心贡献

  • 将 SmoothQuant + MixQ + block HiF4 打包组合迁移到视频扩散 W4A4 推理;
  • 在 Wan2.2-I2V-A14B 上全部 VBench I2V 指标击败原生 HiFloat4 基线,与 FP16 差距压缩到几个百分点内;
  • 提供可审计的确定性推理图(静态 O\mathcal{O}、离线 fold),便于 challenge 复现。

技术影响

  • 证明 LLM 量化经验(激活离群列 + 平滑)可有效迁移到时空扩散 transformer;
  • 双分支 GEMM 为 HiF4/MXFP4 硬件路径提供了可落地的 outlier 处理模板;
  • Layer-wise 参数调整(α\alpha, kk)与 MXFP4 5-层 FP16 允许量结合是明确的下一步。

局限性

  • 未探索把 MixQ 的 token-locality 在线预测扩展到 spatio-temporal 扩散 token;
  • 未在 720P 之外分辨率或多模型上验证;
  • 校准依赖 OpenS2V-5M 抽样,未做校准数据鲁棒性研究;
  • 挑战赛报告,模型/评测受限于赛制。

七、参考资源