SADA: Stability-guided Adaptive Diffusion Acceleration
通过稳定性准则统一逐步和逐token稀疏决策的扩散模型加速框架
SADA: Stability-guided Adaptive Diffusion Acceleration
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | SADA: Stability-guided Adaptive Diffusion Acceleration |
| 作者 | Ting Jiang, Yixiao Wang, Hancheng Ye, Zishan Shao, Jingwei Sun, Jingyang Zhang, Zekai Chen, Jianyi Zhang, Yiran Chen, Hai Li |
| 机构 | Duke University |
| 论文 | https://arxiv.org/abs/2507.17135 |
| 代码 | https://github.com/Ting-Justin-Jiang/sada-icml |
| 发布 | 2025-07-23 |
| 会议 | ICML 2025 |
二、核心思想
问题定义
扩散模型在生成任务中取得了显著成功,但由于其迭代采样过程和二次注意力成本,存在高昂的计算开销。现有的无训练加速策略虽然能有效减少采样时间,但与原始基线相比表现出较低的保真度(faithfulness)。
保真度差距的根本原因:
- 轨迹变异性:不同 prompt 对应不同的去噪轨迹(denoising trajectory),固定或预搜索的稀疏模式无法适应这种变异性
- ODE 忽略:现有方法未考虑底层 ODE 公式化及其数值解法,未能利用求解器提供的精确梯度信息
解决方案概述
SADA(Stability-guided Adaptive Diffusion Acceleration) 提出了一种新范式,通过单一稳定性准则(stability criterion)统一步骤级(step-wise)和 token 级(token-wise)稀疏决策,加速基于 ODE 的生成模型(Diffusion 和 Flow-matching)采样:
- 针对问题 (a):SADA 基于采样轨迹自适应分配稀疏度
- 针对问题 (b):SADA 引入利用数值 ODE 求解器精确梯度信息的原理性近似方案
三、技术架构
核心公式
扩散 ODE 公式化:
扩散模型通过反向常微分方程(ODE)进行采样,将噪声分布传输到数据分布:
其中 和 由预训练架构定义, 是 score function。
轨迹梯度:
SADA 利用 ODE 求解器计算的精确轨迹梯度:
这是数值 ODE 求解器在每步计算中已有的信息,无需额外计算。
稳定性准则(Stability Criterion):
核心创新——稳定性准则定义为 的二阶差分:
该准则衡量去噪轨迹的局部动力学:
- 返回 True(高稳定性/低变化):应用步骤级缓存辅助剪枝(step-wise cache-assisted pruning)
- 返回 False(低稳定性/高变化):应用 token 级缓存辅助剪枝(token-wise cache-assisted pruning)
步骤级近似方案:
两种互补的近似方案:
- 单步近似(Step-wise):直接利用当前步骤的梯度信息估计
- 多步近似(Multistep-wise):利用多个历史步骤的梯度信息进行更精确的估计
Token 级剪枝:
当稳定性准则返回 False 时,SADA 在注意力层输入处应用 token 级剪枝:
- 基于稳定性准则在 token 级别生成”掩码”
- 剪枝不重要的 token,减少注意力计算量
- 利用缓存的 token 信息进行近似
整体框架
SADA 的工作流程:
- 对每个去噪步骤,计算轨迹梯度 及其二阶差分
- 根据稳定性准则判断:
- 稳定:跳过当前噪声预测步骤,使用缓存结果(步骤级稀疏)
- 不稳定:执行当前步骤,但剪枝不重要的 token(token 级稀疏)
- 利用 ODE 求解器的精确梯度信息进行有原则的近似
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| 统一稳定性准则 | 通过单一准则统一步骤级和 token 级稀疏决策 | 二阶差分衡量轨迹局部动力学 |
| 自适应稀疏分配 | 基于采样轨迹动态分配稀疏度,而非固定模式 | 不同 prompt 需要不同的加速策略 |
| ODE 求解器集成 | 利用数值 ODE 求解器的精确梯度信息 | 无需额外计算,复用已有信息 |
| 原理性近似 | 有原则的近似方案保证误差有界 | 数学证明保证保真度 |
| 训练无关 | 完全无需训练或微调 | 即插即用,跨模型/任务通用 |
五、实验结果
基准测试
MS-COCO 2017 评估结果:
| 模型 | 调度器 | 方法 | PSNR↑ | LPIPS↓ | FID↓ | 加速比 |
|---|---|---|---|---|---|---|
| SD-2 | DPM++ | DeepCache | 17.70 | 0.271 | 7.83 | 1.43× |
| SD-2 | DPM++ | AdaptiveDiffusion | 24.30 | 0.100 | 4.35 | 1.45× |
| SD-2 | DPM++ | SADA | 26.34 | 0.094 | 4.02 | 1.80× |
| SD-2 | Euler | DeepCache | 18.90 | 0.239 | 7.40 | 1.45× |
| SD-2 | Euler | AdaptiveDiffusion | 21.90 | 0.173 | 7.58 | 1.89× |
| SD-2 | Euler | SADA | 26.25 | 0.100 | 4.26 | 1.81× |
| SDXL | DPM++ | DeepCache | 21.30 | 0.255 | 8.48 | 1.74× |
| SDXL | DPM++ | AdaptiveDiffusion | 26.10 | 0.125 | 4.59 | 1.65× |
| SDXL | DPM++ | SADA | 29.36 | 0.084 | 3.51 | 1.86× |
| SDXL | Euler | DeepCache | 22.00 | 0.223 | 7.36 | 2.16× |
| SDXL | Euler | AdaptiveDiffusion | 24.33 | 0.168 | 6.11 | 2.01× |
| SDXL | Euler | SADA | 28.97 | 0.093 | 3.76 | 1.85× |
| Flux | Flow-matching | TeaCache | 19.14 | 0.216 | 4.89 | 2.00× |
| Flux | Flow-matching | SADA | 29.44 | 0.060 | 1.95 | 2.02× |
关键结果:
- SADA 在所有模型和调度器上均达到 ≥1.8× 加速
- LPIPS ≤ 0.10,FID ≤ 4.5,最小保真度损失
- 在 Flux 上实现 2.02× 加速,LPIPS 仅 0.060
消融实验
少步采样消融:
| 模型 | 调度器 | 步数 | PSNR↑ | LPIPS↓ | FID↓ | 加速比 |
|---|---|---|---|---|---|---|
| SD-2 | DPM++ | 50 | 26.34 | 0.094 | 4.02 | 1.80× |
| SD-2 | DPM++ | 25 | 28.15 | 0.073 | 3.13 | 1.48× |
| SD-2 | DPM++ | 15 | 29.84 | 0.072 | 3.05 | 1.24× |
- SADA 在不同推理步数下均表现稳定
- 更少步数下保真度反而更高(符合少步采样特性)
下游任务和跨模态
ControlNet 加速:
- 直接应用于 SD-1.5-based ControlNet(canny edges)
- 无需任何微调或架构修改
- 实现 ~1.41× 加速,保持条件输出保真度
MusicLDM 音频生成:
- 加速 MusicLDM ~1.81×
- 频谱图 LPIPS 保持在 0.020 以下
- 证明 SADA 可推广到音频模态
六、相关工作
扩散模型加速
| 方法类别 | 代表方法 | 局限性 |
|---|---|---|
| 高级求解器 | DPM-Solver++, EDM | 减少步数但不减少每步计算 |
| 特征缓存 | DeepCache | 固定缓存模式,不适应轨迹变化 |
| Token 剪枝 | ToMe, Token Merging | 预搜索或固定模式,保真度低 |
| 自适应方法 | AdaptiveDiffusion | 仅步骤级或 token 级,未统一 |
| SADA | 本文 | 统一两级稀疏,自适应+ODE 集成 |
核心区别
SADA 与现有方法的关键区别:
- 统一框架:首次统一步骤级和 token 级稀疏决策
- 自适应性:基于实时轨迹动态调整,非固定模式
- ODE 感知:利用求解器梯度信息,有数学保证
- 跨模态通用:图像、音频、条件生成均适用
七、总结
核心贡献
- 引入 SADA:首个利用稳定性准则自适应采样去噪过程的无训练框架
- 统一稀疏决策:通过单一稳定性准则统一步骤级和 token 级加速
- ODE 求解器集成:利用数值 ODE 求解器的精确梯度信息进行原理性近似
- 广泛验证:在 SD-2、SDXL、Flux 上实现 ≥1.8× 加速,LPIPS ≤ 0.10
- 跨模态通用:无缝应用于 ControlNet、MusicLDM 等下游任务
技术影响
- 实用价值:即插即用的加速方案,可直接部署于生产环境
- 理论贡献:将 ODE 稳定性分析引入扩散模型加速
- 方法论启示:为多粒度稀疏决策提供统一框架
局限性
- 主要在图像生成模型上验证,视频生成的适用性待探索
- 稳定性准则的阈值可能需要针对不同模型调优
- 在极低步数(如 15 步)下加速比较低(1.24×)
八、参考资源
- 论文: https://arxiv.org/abs/2507.17135
- 代码: https://github.com/Ting-Justin-Jiang/sada-icml
- 相关工作:
- DeepCache: 特征缓存加速
- AdaptiveDiffusion: 自适应扩散加速
- TeaCache: 时间步嵌入感知缓存