Back to blog

Efficient Diffusion Models: A Survey

高效扩散模型综述:算法级、系统级和框架视角

Efficient Diffusion Models: A Survey

一、论文概述

项目内容
标题Efficient Diffusion Models: A Survey
作者Hui Shen, Jingxuan Zhang, Boning Xiong, Rui Hu, Shoufa Chen, Zhongwei Wan, Xin Wang, Yu Zhang, Zixuan Gong, Guangyin Bao, Chaofan Tao, Yongfeng Huang, Ye Yuan, Mi Zhang
机构OSU, Indiana University, Fudan University, HKU, Tongji University, CUHK, PKU
论文arXiv:2502.06805
代码GitHub
发布2025年2月3日
许可arXiv 非独占分发许可

二、核心思想

综述目标

扩散模型在图像、视频、音频等生成任务中表现出色,但其多步去噪过程需要大量计算资源和生成时间。本综述从三个视角系统梳理高效扩散模型研究:

分类体系

Efficient Diffusion Models
├── Algorithm-Level (§3)
│   ├── Efficient Training (§3.1)
│   │   ├── Latent Space (潜空间)
│   │   ├── Loss Formulation (损失函数)
│   │   │   ├── Score Matching
│   │   │   └── Rectified Flow
│   │   └── Training Tricks (训练技巧)
│   │       ├── Data-Dependent Adaptive Priors
│   │       ├── Extra Loss Supervision
│   │       └── Noise Schedule
│   ├── Efficient Fine-Tuning (§3.2)
│   │   ├── LoRA
│   │   ├── Adapter
│   │   └── ControlNet
│   ├── Efficient Sampling (§3.3)
│   │   ├── Efficient Solver (SDE/ODE)
│   │   ├── Sampling Scheduling
│   │   │   ├── Parallel Sampling
│   │   │   └── Timestep Schedule
│   │   ├── Truncated Sampling
│   │   │   ├── Early Exit
│   │   │   └── Retrieval-Based Diffusion
│   │   └── Knowledge Distillation
│   │       ├── Vector Field Distillation
│   │       └── Generator Distillation
│   └── Compression (§3.4)
│       ├── Quantization (PTQ/QAT)
│       └── Pruning
├── System-Level (§4)
│   ├── Hardware-Software Co-Design
│   ├── Parallel Computing
│   └── Caching Technique
└── Frameworks (§5)

三、技术架构

整体分类图

分类体系

Figure 1: 高效扩散模型文献分类体系。

核心公式

DDPM 前向过程

q(xt∣xt−1)=N(xt;1−βtxt−1,βtI)q(x_t|x_{t-1}) = \mathcal{N}(x_t; \sqrt{1-\beta_t}x_{t-1}, \beta_t I)

DDPM 反向过程

pθ(xt−1∣xt)=N(xt−1;μθ(xt,t),Σθ(xt,t))p_\theta(x_{t-1}|x_t) = \mathcal{N}(x_{t-1}; \mu_\theta(x_t, t), \Sigma_\theta(x_t, t))

Score Matching

∇xtlog⁡q(xt)≈sθ(xt,t)\nabla_{x_t} \log q(x_t) \approx s_\theta(x_t, t)

Flow Matching

dxdt=vθ(x,t),x0∼N(0,I),x1∼pdata\frac{dx}{dt} = v_\theta(x, t), \quad x_0 \sim \mathcal{N}(0, I), \quad x_1 \sim p_{data}

前向/反向 SDE 过程

SDE 过程

Figure 2: 前向 SDE 过程和反向 SDE 过程概览。

四、算法级效率优化

4.1 高效训练

高效训练技术

Figure 3: 扩散模型高效训练技术总结。

潜空间方法

方法说明优势
LDM (Stable Diffusion)在潜空间而非像素空间训练计算量减少 4-8×
Video LDM视频潜空间扩散时空一致性

损失函数优化

Rectified Flow

Figure 4: Rectified Flow 示意图。

方法说明优势
Score Matching估计数据分布的梯度避免计算归一化常数
Rectified Flow直线路径连接噪声和数据减少采样步数
Consistency Models单步生成极大加速推理

训练技巧

自适应先验

Figure 5: 不同模态的数据依赖自适应先验。

技巧说明
Data-Dependent Adaptive Priors根据数据特性调整扩散先验
Extra Loss Supervision添加辅助损失加速收敛
Noise Schedule优化噪声调度策略

噪声调度优化

噪声调度

Figure 7: 两类噪声调度策略。

4.2 高效微调

高效微调技术

Figure 8: 扩散模型高效微调技术总结。

LoRA

LoRA

Figure 9: LoRA 重参数化方法,仅训练参数 A 和 B。

方法参数量说明
LoRA~0.1%低秩分解
LoRA-FA更少冻结 A 矩阵
LCM-LoRA~0.1%一致性模型 LoRA

Adapter

Adapter

Figure 11: Adapter 模块架构。

方法说明
T2I-Adapter细粒度控制
IP-Adapter图像提示适配

ControlNet

ControlNet

Figure 13: ControlNet 架构。

方法说明
ControlNet条件控制网络
ControlNet++改进版本

4.3 高效采样

高效采样技术

Figure 14: 扩散模型高效采样技术总结。

高效求解器

求解器类型采样步数
DDIMODE10-50
DPM-SolverODE10-20
DPM-Solver++ODE10-20
UniPCODE5-10

采样调度

时间步调度

Figure 15: 时间步调度优化过程。

方法说明
Timestep Schedule优化采样时间步选择
Parallel Sampling并行采样加速

截断采样

Early Exit

Figure 17: 时间依赖的退出调度,采样过程中跳过更多 block。

方法说明
Early Exit动态跳过部分层
Retrieval-Based检索辅助生成

知识蒸馏

知识蒸馏

Figure 19: 知识蒸馏示意图。

渐进蒸馏

Figure 20: 渐进蒸馏,将采样器压缩为更少步骤。

方法说明加速
Progressive Distillation步数减半迭代蒸馏2-4×
Guided DistillationCFG 蒸馏2×
Score Distillation分数蒸馏-
Consistency Distillation一致性蒸馏单步生成

4.4 模型压缩

压缩技术

Figure 22: 扩散模型压缩技术总结。

量化

量化

Figure 23: PTQ 场景和 Q-Diffusion 的区别。

方法类型说明
Q-DiffusionPTQ后训练量化
PTQ4DMPTQ扩散模型专用 PTQ
QATQAT量化感知训练

剪枝

剪枝

Figure 24: 剪枝评估算子重要性。

方法说明
Structured Pruning结构化剪枝
Unstructured Pruning非结构化剪枝
PD-Pruner扩散模型专用剪枝

五、系统级效率优化

系统级技术

Figure 25: 系统级效率优化技术总结。

5.1 软硬件协同设计

方法说明
HybridSA混合稀疏注意力架构
FlashAttention高效注意力实现
TensorRT推理优化

5.2 并行计算

并行计算

Figure 27: 扩散模型并行计算示意图。

策略说明
Data Parallelism数据并行
Model Parallelism模型并行
Pipeline Parallelism流水线并行
DistriFusion分布式并行推理

5.3 缓存技术

方法说明
DeepCacheUNet 特征缓存
TeaCache时间步嵌入感知缓存
PAB金字塔注意力广播
FasterCacheCFG 冗余优化

六、框架

框架特点支持模型
DiffusersHuggingFace 官方SD, FLUX, DiT
xDiTDiT 推理优化DiT, FLUX, HunyuanVideo
Onediff一键优化多种扩散模型
FastDiff快速推理DDPM, DDIM
ColossalAI大规模训练Stable Diffusion

七、应用场景

应用代表模型说明
图像生成SD, DALL-E, Midjourney文本到图像
视频生成Sora, CogVideo, Wan文本到视频
文本生成Diffusion-LM离散扩散
音频生成DiffWave, WaveGrad语音合成
3D 生成DreamFusion, Magic3D3D 内容创建

八、相关工作

相关综述与本文关系
Diffusion Models: A Comprehensive Survey通用扩散模型综述
A Survey on Generative Diffusion Models生成扩散模型综述
Efficient Diffusion Training训练效率专题
本文首个全面覆盖高效扩散模型的综述

九、总结

核心贡献

  1. 系统分类: 从算法级、系统级和框架三个视角系统梳理高效扩散模型
  2. 全面覆盖: 涵盖训练、微调、采样、压缩、系统优化等各个方面
  3. 最新进展: 包含 2024-2025 年最新研究成果
  4. 开源资源: GitHub 仓库持续维护论文列表

未来方向

方向说明
长视频生成效率更长视频的高效生成
多模态统一效率跨模态统一高效架构
边缘部署移动端/边缘设备部署
训练-推理协同训练和推理效率联合优化

局限性

  • 综述性质,无新方法提出
  • 部分最新工作可能未覆盖
  • 缺乏统一的基准测试对比

十、参考资源

十一、关键图片索引

图片说明文件名
Figure 1分类体系x1.png
Figure 2前向/反向 SDE 过程x2.png
Figure 3高效训练技术总结x3.png
Figure 4Rectified Flowx4.png
Figure 5自适应先验x5.png
Figure 6Leapfrog 扩散模型x6.png
Figure 7噪声调度策略x7.png
Figure 8高效微调技术总结x8.png
Figure 9LoRA 重参数化x6.png
Figure 10LCM-LoRAx7.png
Figure 11Adapter 架构x8.png
Figure 12IP-Adapterx9.png
Figure 13ControlNetx10.png
Figure 14高效采样技术总结x11.png
Figure 15时间步调度优化x11.png
Figure 16KLUB 采样调度x12.png
Figure 17Early Exitx13.png
Figure 18检索扩散模型x14.png
Figure 19知识蒸馏x15.png
Figure 20渐进蒸馏x16.png
Figure 21Score Distillationx17.png
Figure 22压缩技术总结x18.png
Figure 23Q-Diffusion 量化x18.png
Figure 24剪枝x19.png
Figure 25系统级技术总结x20.png
Figure 26HybridSAx20.png
Figure 27并行计算x21.png
Figure 28分布式推理架构x22.png