Back to blog

SADA: Stability-guided Adaptive Diffusion Acceleration

通过稳定性准则统一逐步和逐token稀疏决策的扩散模型加速框架

SADA: Stability-guided Adaptive Diffusion Acceleration

一、论文概述

项目内容
标题SADA: Stability-guided Adaptive Diffusion Acceleration
作者Ting Jiang, Yixiao Wang, Hancheng Ye, Zishan Shao, Jingwei Sun, Jingyang Zhang, Zekai Chen, Jianyi Zhang, Yiran Chen, Hai Li
机构Duke University
论文https://arxiv.org/abs/2507.17135
代码https://github.com/Ting-Justin-Jiang/sada-icml
发布2025-07-23
会议ICML 2025

二、核心思想

问题定义

扩散模型在生成任务中取得了显著成功,但由于其迭代采样过程和二次注意力成本,存在高昂的计算开销。现有的无训练加速策略虽然能有效减少采样时间,但与原始基线相比表现出较低的保真度(faithfulness)。

保真度差距的根本原因:

  1. 轨迹变异性:不同 prompt 对应不同的去噪轨迹(denoising trajectory),固定或预搜索的稀疏模式无法适应这种变异性
  2. ODE 忽略:现有方法未考虑底层 ODE 公式化及其数值解法,未能利用求解器提供的精确梯度信息

解决方案概述

SADA(Stability-guided Adaptive Diffusion Acceleration) 提出了一种新范式,通过单一稳定性准则(stability criterion)统一步骤级(step-wise)和 token 级(token-wise)稀疏决策,加速基于 ODE 的生成模型(Diffusion 和 Flow-matching)采样:

  • 针对问题 (a):SADA 基于采样轨迹自适应分配稀疏度
  • 针对问题 (b):SADA 引入利用数值 ODE 求解器精确梯度信息的原理性近似方案

三、技术架构

核心公式

扩散 ODE 公式化:

扩散模型通过反向常微分方程(ODE)进行采样,将噪声分布传输到数据分布:

dxtdt=ft(xt)−gt2∇xtlog⁡pt(xt)\frac{dx_t}{dt} = f_t(x_t) - g_t^2 \nabla_{x_t} \log p_t(x_t)

其中 ftf_t 和 gtg_t 由预训练架构定义,∇xtlog⁡pt(xt)\nabla_{x_t} \log p_t(x_t) 是 score function。

轨迹梯度:

SADA 利用 ODE 求解器计算的精确轨迹梯度:

yt=dxtdty_t = \frac{dx_t}{dt}

这是数值 ODE 求解器在每步计算中已有的信息,无需额外计算。

稳定性准则(Stability Criterion):

核心创新——稳定性准则定义为 yty_t 的二阶差分:

Stability(t)=∥yt+Δt−2yt+yt−Δt∥\text{Stability}(t) = \|y_{t+\Delta t} - 2y_t + y_{t-\Delta t}\|

该准则衡量去噪轨迹的局部动力学:

  • 返回 True(高稳定性/低变化):应用步骤级缓存辅助剪枝(step-wise cache-assisted pruning)
  • 返回 False(低稳定性/高变化):应用 token 级缓存辅助剪枝(token-wise cache-assisted pruning)

步骤级近似方案:

两种互补的近似方案:

  1. 单步近似(Step-wise):直接利用当前步骤的梯度信息估计 x^0t\hat{x}_0^t
  2. 多步近似(Multistep-wise):利用多个历史步骤的梯度信息进行更精确的估计

Token 级剪枝:

当稳定性准则返回 False 时,SADA 在注意力层输入处应用 token 级剪枝:

  • 基于稳定性准则在 token 级别生成”掩码”
  • 剪枝不重要的 token,减少注意力计算量
  • 利用缓存的 token 信息进行近似

整体框架

SADA 的工作流程:

  1. 对每个去噪步骤,计算轨迹梯度 yty_t 及其二阶差分
  2. 根据稳定性准则判断:
    • 稳定:跳过当前噪声预测步骤,使用缓存结果(步骤级稀疏)
    • 不稳定:执行当前步骤,但剪枝不重要的 token(token 级稀疏)
  3. 利用 ODE 求解器的精确梯度信息进行有原则的近似

四、核心创新

创新点说明理论/实验依据
统一稳定性准则通过单一准则统一步骤级和 token 级稀疏决策二阶差分衡量轨迹局部动力学
自适应稀疏分配基于采样轨迹动态分配稀疏度,而非固定模式不同 prompt 需要不同的加速策略
ODE 求解器集成利用数值 ODE 求解器的精确梯度信息无需额外计算,复用已有信息
原理性近似有原则的近似方案保证误差有界数学证明保证保真度
训练无关完全无需训练或微调即插即用,跨模型/任务通用

五、实验结果

基准测试

MS-COCO 2017 评估结果:

模型调度器方法PSNR↑LPIPS↓FID↓加速比
SD-2DPM++DeepCache17.700.2717.831.43×
SD-2DPM++AdaptiveDiffusion24.300.1004.351.45×
SD-2DPM++SADA26.340.0944.021.80×
SD-2EulerDeepCache18.900.2397.401.45×
SD-2EulerAdaptiveDiffusion21.900.1737.581.89×
SD-2EulerSADA26.250.1004.261.81×
SDXLDPM++DeepCache21.300.2558.481.74×
SDXLDPM++AdaptiveDiffusion26.100.1254.591.65×
SDXLDPM++SADA29.360.0843.511.86×
SDXLEulerDeepCache22.000.2237.362.16×
SDXLEulerAdaptiveDiffusion24.330.1686.112.01×
SDXLEulerSADA28.970.0933.761.85×
FluxFlow-matchingTeaCache19.140.2164.892.00×
FluxFlow-matchingSADA29.440.0601.952.02×

关键结果:

  • SADA 在所有模型和调度器上均达到 ≥1.8× 加速
  • LPIPS ≤ 0.10,FID ≤ 4.5,最小保真度损失
  • 在 Flux 上实现 2.02× 加速,LPIPS 仅 0.060

消融实验

少步采样消融:

模型调度器步数PSNR↑LPIPS↓FID↓加速比
SD-2DPM++5026.340.0944.021.80×
SD-2DPM++2528.150.0733.131.48×
SD-2DPM++1529.840.0723.051.24×
  • SADA 在不同推理步数下均表现稳定
  • 更少步数下保真度反而更高(符合少步采样特性)

下游任务和跨模态

ControlNet 加速:

  • 直接应用于 SD-1.5-based ControlNet(canny edges)
  • 无需任何微调或架构修改
  • 实现 ~1.41× 加速,保持条件输出保真度

MusicLDM 音频生成:

  • 加速 MusicLDM ~1.81×
  • 频谱图 LPIPS 保持在 0.020 以下
  • 证明 SADA 可推广到音频模态

六、相关工作

扩散模型加速

方法类别代表方法局限性
高级求解器DPM-Solver++, EDM减少步数但不减少每步计算
特征缓存DeepCache固定缓存模式,不适应轨迹变化
Token 剪枝ToMe, Token Merging预搜索或固定模式,保真度低
自适应方法AdaptiveDiffusion仅步骤级或 token 级,未统一
SADA本文统一两级稀疏,自适应+ODE 集成

核心区别

SADA 与现有方法的关键区别:

  1. 统一框架:首次统一步骤级和 token 级稀疏决策
  2. 自适应性:基于实时轨迹动态调整,非固定模式
  3. ODE 感知:利用求解器梯度信息,有数学保证
  4. 跨模态通用:图像、音频、条件生成均适用

七、总结

核心贡献

  1. 引入 SADA:首个利用稳定性准则自适应采样去噪过程的无训练框架
  2. 统一稀疏决策:通过单一稳定性准则统一步骤级和 token 级加速
  3. ODE 求解器集成:利用数值 ODE 求解器的精确梯度信息进行原理性近似
  4. 广泛验证:在 SD-2、SDXL、Flux 上实现 ≥1.8× 加速,LPIPS ≤ 0.10
  5. 跨模态通用:无缝应用于 ControlNet、MusicLDM 等下游任务

技术影响

  • 实用价值:即插即用的加速方案,可直接部署于生产环境
  • 理论贡献:将 ODE 稳定性分析引入扩散模型加速
  • 方法论启示:为多粒度稀疏决策提供统一框架

局限性

  • 主要在图像生成模型上验证,视频生成的适用性待探索
  • 稳定性准则的阈值可能需要针对不同模型调优
  • 在极低步数(如 15 步)下加速比较低(1.24×)

八、参考资源