Back to blog

Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment

PostDiff:免训练扩散模型压缩框架,通过混合分辨率去噪和混合模块缓存降低单步推理成本

Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment

一、论文概述

项目内容
标题Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
作者Zhenbang Du, Yonggan Fu, Lifu Wang, Jiayi Qian, Xiao Luo, Yingyan (Celine) Lin
论文arXiv:2508.06160
发布2025-08-08
主题cs.CV (Computer Vision and Pattern Recognition)

二、核心思想

问题定义

扩散模型在生成任务中表现出色,但其高计算需求限制了在资源受限平台上的部署。本文研究一个关键问题:

在后训练(post-training)设置下(不进行微调),减少去噪步数 vs 降低单步推理成本,哪种策略更有效?

解决方案概述

PostDiff是一个免训练的扩散模型压缩框架,从两个维度降低预训练扩散模型的单步推理成本:

  1. 输入级:混合分辨率去噪(Mixed-Resolution Denoising)

    • 早期去噪步使用低分辨率,后期切换到高分辨率
    • 利用低频分量主导早期去噪步的观察
    • 实现精度和效率的双赢
  2. 模块级:混合模块缓存(Hybrid Module Caching)

    • 结合DeepCache和交叉注意力缓存
    • 跨步复用特征图,减少冗余计算

核心发现

  • 降低单步推理成本通常比减少去噪步数更有效,能在保持高生成质量的同时提升效率
  • PostDiff推进了SOTA扩散模型的精度-效率前沿

三、技术架构

整体框架图

PostDiff框架概述

Figure 1: 将PostDiff应用于SOTA扩散模型,“-PD”表示由PostDiff交付的模型。

混合分辨率去噪

混合分辨率去噪

Figure 2: 混合分辨率去噪策略示意图。

核心公式

标准去噪过程:

给定形状为 (W,H,3)(W,H,3) 的图像,从形状为 (w,h,4)(w,h,4) 的高斯噪声 xTx_T 开始:

xt−1=αˉt−1x^0+1−αˉt−1ϵθ(xt,t)x_{t-1} = \sqrt{\bar{\alpha}_{t-1}} \hat{x}_0 + \sqrt{1 - \bar{\alpha}_{t-1}} \epsilon_\theta(x_t, t)

其中 ϵθ\epsilon_\theta 是预测噪声的模型,{αt}\{\alpha_t\} 是控制前向噪声添加过程的系数。

混合分辨率去噪:

引入低分辨率潜在表示 xTlx_T^l,形状为 (βw,βh)(\beta w, \beta h),其中 0<β<10 < \beta < 1 是分辨率缩放超参数。

  1. 在低分辨率下执行前 ss 步去噪: xt−1l=Denoise(xtl,t),t=T,T−1,…,T−s+1x_{t-1}^l = \text{Denoise}(x_t^l, t), \quad t = T, T-1, \ldots, T-s+1

  2. 上采样到全分辨率: xT−sf=Upsample(xT−sl)+ϵx_{T-s}^f = \text{Upsample}(x_{T-s}^l) + \epsilon

  3. 在全分辨率下执行剩余去噪步。

交叉注意力缓存策略:

四种设计选择:

  • Ave: CAcache=12(CAtc+CAt∅)CA_{\text{cache}} = \frac{1}{2}(CA_t^c + CA_t^\emptyset)
  • Cond: CAcache=CAtcCA_{\text{cache}} = CA_t^c
  • Uncond: CAcache=CAt∅CA_{\text{cache}} = CA_t^\emptyset
  • CFG: CAcache=CAt∅+w(CAtc−CAt∅)CA_{\text{cache}} = CA_t^\emptyset + w(CA_t^c - CA_t^\emptyset)

动机分析

动机分析

Figure 3: 从profiling和前人工作中得到的模块级冗余动机。

关键观察:

  • 低频分量主导早期去噪步(语义规划阶段)
  • 高频细节在后期逐步添加(保真度提升阶段)
  • 低分辨率在早期步骤中可增强低频分量并提升最终输出质量

可视化分析

可视化分析

Figure 4: 低分辨率去噪如何有助于提升最终性能的可视化。

四、实验结果

Fewer Steps vs Cheaper Per-Step

Fewer vs Cheaper

Figure 5: 减少去噪步数 vs 降低单步推理成本的FID-FLOPs权衡。

关键发现:

  1. 完整的PostDiff框架(结合两种技术)在所有FLOPs范围内实现最佳FID-FLOPs权衡
  2. 在输入和模块级别利用冗余可获得更好的FID-FLOPs权衡
  3. 降低单步推理成本比减少去噪步数更有效

SOTA模型评估

Table 2: PostDiff在SOTA扩散模型上的结果

模型步数MixCacheFID ↓Clip Score ↑FLOPs (T) ↓延迟 (s) ↓
SD V1.5820.6030.4112.1681.298
1617.7430.7624.3362.377
2018.4230.8030.4202.930
20✓15.6930.7819.0351.945
20✓✓16.6530.2511.1291.139
LCM423.5528.643.0420.523
822.9628.726.0840.825
8✓21.0128.923.8070.666
8✓✓22.7628.583.6860.651

关键结果:

  • SD V1.5: 延迟从2.930s降至1.139s(2.57倍加速),FID从18.42改善至16.65
  • LCM: 延迟从0.825s降至0.651s(1.27倍加速)

与其他压缩方法对比

Table 3: SD V1.5上的基准对比

方法FID ↓Clip Score ↑延迟 (s) ↓
Original18.4230.802.930
DeepCache17.7930.751.737
TGATE19.5129.551.992
ToDo18.2830.752.520
ToMe17.4330.552.730
Faster Diffusion17.9030.402.005
CA-ToMe20.4930.412.112
PostDiff16.6530.251.139

Table 4: PixArt-α上的基准对比

方法FID ↓Clip Score ↑延迟 (s) ↓
Original29.1630.411.752
TGATE29.5429.591.275
DiTFastAttn45.4630.131.103
DuCa28.0830.121.724
PostDiff25.4430.231.382

缓存策略消融

Table 1: 不同缓存策略的消融研究

设置FLOPs (T) ↓FID ↓Clip Score ↑
Original30.42018.4230.80
Original w/o CFG15.21031.9825.52
DC17.78717.7930.75
DC+CA (5, Ave)11.61018.7728.40
DC+CA (10, Cond)-21.2630.11

关键发现:

  • 完全放弃CFG会导致严重质量下降
  • Cond策略在保持质量的同时有效减少计算

超参数消融

Table 5: k和m的消融研究

设置FID ↓Clip Score ↑延迟 (s) ↓
Original18.4230.802.93
k=216.6530.251.14
k=326.9627.680.97
k=439.2226.160.94
m=0.7516.6530.251.14
m=0.916.4930.061.26

关键发现:

  • k=2(缓存间隔)是最佳选择
  • m=0.75(CFG放弃步数比例)在质量和效率间取得最佳平衡

SOTA评估结果

SOTA评估

Figure 6: 在SOTA扩散模型上的评估结果。

Ablation Profile

Ablation Profile

Figure 7: 消融实验的profiling分析。

分辨率缩放影响

分辨率缩放

Figure 8: 不同分辨率缩放参数β的影响。

校准集效果

校准集

Figure 9: 小型校准集的有效性。

与前人工作对比

对比

Figure 11: 与前人工作的详细对比。

混合模块缓存

混合缓存

Figure 10: 混合模块缓存策略示意图。

五、核心创新

创新点说明理论/实验依据
混合分辨率去噪早期低分辨率、后期高分辨率的二元策略低频分量主导早期步骤的观察
混合模块缓存结合DeepCache和交叉注意力缓存跨步特征图相似性验证
CFG-aware缓存条件/无条件注意力的选择性缓存消融实验验证Cond策略最优
后训练框架免训练,无需微调即插即用,快速部署
关键洞察降低单步成本 > 减少步数FID-FLOPs权衡实验验证

六、相关工作对比

方法特点PostDiff优势
DeepCache模块级缓存同时利用输入级和模块级冗余
TGATE早期步缓存更灵活的缓存策略
ToMe/ToDoToken合并/丢弃结合分辨率优化
Faster Diffusion步长优化免训练,更通用
DiTFastAttn注意力优化更好的质量保持
DuCa双缓存更全面的框架

七、总结

核心贡献

  1. 首次研究关键问题:在后训练设置下,减少去噪步数 vs 降低单步推理成本哪个更有效
  2. PostDiff框架:免训练的扩散模型压缩框架,结合输入级和模块级优化
  3. 混合分辨率去噪:利用早期低分辨率去噪增强低频分量的策略
  4. 混合模块缓存:结合DeepCache和交叉注意力缓存的优化方案
  5. 关键洞察:降低单步推理成本通常比减少去噪步数更有效

性能总结

指标SD V1.5LCMPixArt-α
延迟降低2.57倍1.27倍1.27倍
FID改善18.42→16.6522.96→22.7629.16→25.44
训练需求免训练免训练免训练

技术影响

PostDiff展示了后训练扩散模型优化的重要性:

  • 输入级冗余:分辨率是一个有效的优化维度
  • 模块级冗余:跨步特征复用可显著减少计算
  • 免训练方法:在实际部署中更具优势
  • 关键洞察:指导未来的高效扩散模型部署策略

实际部署建议

场景推荐策略
资源受限混合分辨率去噪 + 模块缓存
高质量需求保持最大步数 + PostDiff
快速部署免训练后训练压缩
多模型适配小型校准集确定最优超参数

八、参考资源