Back to blog

Denoising Diffusion Implicit Models (DDIM)

通过非马尔可夫扩散过程实现 10-50× 加速采样的扩散模型

Denoising Diffusion Implicit Models (DDIM)

一、论文概述

项目内容
标题Denoising Diffusion Implicit Models (DDIM)
作者Jiaming Song, Chenlin Meng, Stefano Ermon
机构Stanford University
论文https://arxiv.org/abs/2010.02502
代码https://github.com/ermongroup/ddim
发布2020-10-06 (v1), 2022-10-05 (v4)
引用5000+ (高影响力论文)

二、核心思想

问题定义

去噪扩散概率模型 (DDPM) 已实现高质量图像生成,但需要模拟马尔可夫链进行大量步骤才能产生样本,采样速度极慢(通常需要数百到上千步)。

核心洞察

DDPM 的训练目标不仅限于马尔可夫扩散过程。作者发现可以构造一类非马尔可夫扩散过程,它们产生相同的训练目标,但其反向过程可以更快地采样。

解决方案概述

DDIM (Denoising Diffusion Implicit Models) 是一类更高效的迭代隐式概率模型:

  1. 相同的训练过程:与 DDPM 完全相同的训练目标,无需重新训练
  2. 非马尔可夫反向过程:构造非马尔可夫扩散过程,反向过程确定性
  3. 大幅加速:实证显示比 DDPM 快 10× 到 50×
  4. 质量-计算权衡:可以灵活权衡计算量和样本质量
  5. 语义插值:可以在潜在空间中进行语义有意义的图像插值

三、技术架构

DDPM 回顾

前向扩散过程(马尔可夫):

q(x1:T∣x0)=∏t=1Tq(xt∣xt−1)q(x_{1:T} | x_0) = \prod_{t=1}^{T} q(x_t | x_{t-1})

q(xt∣xt−1)=N(xt;1−βtxt−1,βtI)q(x_t | x_{t-1}) = \mathcal{N}(x_t; \sqrt{1-\beta_t} x_{t-1}, \beta_t \mathbf{I})

反向生成过程(马尔可夫):

pθ(x0:T)=p(xT)∏t=1Tpθ(xt−1∣xt)p_\theta(x_{0:T}) = p(x_T) \prod_{t=1}^{T} p_\theta(x_{t-1} | x_t)

训练目标(简化版):

Lsimple=Et,x0,ϵ[∥ϵ−ϵθ(xt,t)∥2]\mathcal{L}_{\text{simple}} = \mathbb{E}_{t, x_0, \epsilon} \left[ \| \epsilon - \epsilon_\theta(x_t, t) \|^2 \right]

其中 xt=αˉtx0+1−αˉtϵx_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1-\bar{\alpha}_t} \epsilon

DDIM 的关键创新

非马尔可夫前向过程:

DDIM 构造一族非马尔可夫前向分布 qσ(x1:T∣x0)q_\sigma(x_{1:T} | x_0),满足:

  • 边缘分布 qσ(xt∣x0)q_\sigma(x_t | x_0) 与 DDPM 相同
  • 但 qσ(xt∣xt−1,x0)q_\sigma(x_t | x_{t-1}, x_0) 不再是高斯分布

确定性反向过程:

当 σ=0\sigma = 0 时,反向过程变为完全确定性:

xt−1=αˉt−1(xt−1−αˉtϵθ(xt,t)αˉt)⏟"predicted x0"+1−αˉt−1−σt2⋅ϵθ(xt,t)+σtϵtx_{t-1} = \sqrt{\bar{\alpha}_{t-1}} \underbrace{\left( \frac{x_t - \sqrt{1-\bar{\alpha}_t} \epsilon_\theta(x_t, t)}{\sqrt{\bar{\alpha}_t}} \right)}_{\text{"predicted } x_0 \text{"}} + \sqrt{1-\bar{\alpha}_{t-1} - \sigma_t^2} \cdot \epsilon_\theta(x_t, t) + \sigma_t \epsilon_t

关键公式:

xt−1=αˉt−1x^0+1−αˉt−1−σt2⋅ϵθ(xt,t)+σtϵtx_{t-1} = \sqrt{\bar{\alpha}_{t-1}} \hat{x}_0 + \sqrt{1-\bar{\alpha}_{t-1} - \sigma_t^2} \cdot \epsilon_\theta(x_t, t) + \sigma_t \epsilon_t

其中:

  • x^0=xt−1−αˉtϵθ(xt,t)αˉt\hat{x}_0 = \frac{x_t - \sqrt{1-\bar{\alpha}_t} \epsilon_\theta(x_t, t)}{\sqrt{\bar{\alpha}_t}} 是对 x0x_0 的预测
  • σt\sigma_t 控制随机性程度
  • ϵt∼N(0,I)\epsilon_t \sim \mathcal{N}(0, \mathbf{I}) 是随机噪声

σt\sigma_t 的选择:

σt=1−αˉt−11−αˉt⋅1−αˉt/αˉt−11\sigma_t = \sqrt{\frac{1-\bar{\alpha}_{t-1}}{1-\bar{\alpha}_t}} \cdot \sqrt{\frac{1-\bar{\alpha}_t/\bar{\alpha}_{t-1}}{1}}

当 σt=0\sigma_t = 0 时,过程完全确定性(DDIM)。 当 σt\sigma_t 取上式时,等价于 DDPM。

加速采样

关键洞察:DDIM 的确定性性质允许跳过时间步。

传统 DDPM 需要按顺序遍历 T,T−1,...,1T, T-1, ..., 1 所有步骤。 DDIM 只需要选择一个子序列 τ=[τ1,τ2,...,τS]\tau = [\tau_1, \tau_2, ..., \tau_S],其中 S≪TS \ll T。

加速比:T/ST/S,例如从 1000 步减少到 50 步 = 20× 加速。

语义插值

由于 DDIM 的确定性反向过程,从相同初始噪声 xTx_T 出发总是生成相同的图像。这使得:

  1. 球面线性插值 (Slerp):在 xTx_T 空间中对两个噪声向量进行插值
  2. 语义有意义:插值结果在语义上平滑过渡
  3. 潜在空间操作:类似于 GAN 的潜在空间操作

四、核心创新

创新点说明理论/实验依据
非马尔可夫扩散过程构造与 DDPM 相同训练目标的非马尔可夫过程数学证明训练目标等价
确定性采样σ=0\sigma=0 时反向过程完全确定性从相同 xTx_T 总是生成相同图像
子序列采样跳过时间步实现加速1000 步 → 50 步 = 20× 加速
质量-计算权衡灵活选择采样步数更少步数 = 更快但质量略降
潜在空间插值确定性性质使语义插值成为可能Slerp 在 xTx_T 空间
兼容性与 DDPM 完全相同的训练过程无需重新训练

五、实验结果

采样加速

CIFAR-10 结果:

  • DDPM (1000 步):FID ≈ 3.17
  • DDIM (50 步):FID ≈ 4.67(20× 加速)
  • DDIM (100 步):FID ≈ 4.16(10× 加速)

LSUN 结果:

  • DDIM 在 50-100 步内生成高质量样本
  • 比 DDPM 快 10× 到 50×

质量-计算权衡

  • 采样步数越少,速度越快,但质量略有下降
  • 存在一个”甜蜜点”(通常 50-100 步),速度和质量的最佳平衡
  • 即使在极少步数(如 20 步)下,仍能生成有意义的样本

语义插值

  • 在 xTx_T 空间进行球面线性插值
  • 生成的图像在语义上平滑过渡
  • 类似于 StyleGAN 的潜在空间操作

与 DDPM 的对比

特性DDPMDDIM
训练过程马尔可夫扩散相同(非马尔可夫)
采样过程随机确定性(σ=0\sigma=0)
采样步数100050-100
采样速度慢快 10-50×
潜在插值不支持支持
样本多样性高略低(确定性)

六、相关工作

方法关系
DDPM前驱工作,DDIM 与之共享训练目标
Score-based models理论联系,DDIM 可从 score-based 视角理解
Flow-based models确定性采样与 flow 模型有相似之处
GANDDIM 的潜在空间操作类似于 GAN
DPM-Solver后续工作,进一步加速扩散模型采样

七、总结

核心贡献

  1. 理论创新:证明存在与 DDPM 相同训练目标的非马尔可夫扩散过程
  2. 确定性采样:构造完全确定性的反向生成过程
  3. 大幅加速:比 DDPM 快 10-50×,开创了扩散模型加速研究
  4. 灵活权衡:质量-计算权衡的灵活控制
  5. 潜在空间操作:使扩散模型具备类似 GAN 的潜在空间操作能力

技术影响

  • 奠基性工作:DDIM 是扩散模型加速的基础性工作
  • 广泛应用:几乎所有后续扩散模型加速方法都基于或对比 DDIM
  • Stable Diffusion:DDIM 是 Stable Diffusion 的默认采样器之一
  • 理论启发:非马尔可夫扩散过程的理论框架启发了大量后续工作

局限性

  • 确定性采样可能降低样本多样性
  • 极少步数下质量下降明显
  • 后续方法(如 DPM-Solver、UniPC)进一步提升了加速效果

八、参考资源