Back to blog

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

MrFlow achieves 10x+ training-free acceleration for flow-matching diffusion models via a four-stage low-to-high resolution pipeline

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

一、论文概述

项目内容
标题Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
作者Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin
机构(作者机构未在摘要页明确列出,代码见 GitHub)
论文https://arxiv.org/abs/2607.01642
代码https://github.com/Xingyu-Zheng/MrFlow
发布2026-07-02 (v1)
许可Non-exclusive distributable license

二、核心思想

问题定义

现代扩散模型(如 Qwen-Image-20B)在 A100 上生成 1024×1024 图像需要约 4747 秒(50-100 步 NFE)。现有加速方法各有局限:

  • 时间步蒸馏(如 SenseFlow, Pi-Flow):将 50-100 步降至 1-4 步,但需要训练
  • 特征缓存(如 Teacache, DB-Taylor):跨时间步复用特征,加速有限(<4×)
  • 多分辨率方法(如 LSSGen, RALU, SPEED):无需训练即可实现 >5× 加速,但在潜空间上采样并通过上采样生成高分辨率图像,导致明显的模糊或伪影

解决方案概述

本文提出 MrFlow(Multi-Resolution Flow Matching)——一种无需训练的多分辨率加速策略,专为预训练流匹配(flow-matching)模型设计。MrFlow 采用分阶段低分辨率到高分辨率的流水线:

  1. 快速 LR 结构生成:在低分辨率下用少量步骤生成主要结构
  2. 像素空间超分辨率:用轻量级预训练 GAN 模型(Real-ESRGAN)进行上采样
  3. 低频噪声注入:注入弱噪声以启用高频重采样,使高分辨率流先验能够校正/重采样高频细节
  4. HR 细节精炼:在高分辨率下进行一步细节精炼

在 FLUX.1-dev 和 Qwen-Image 上的定量和定性结果表明,MrFlow 利用二次方 token 减少和减少的步骤需求实现了 10× 端到端加速,同时保持 OneIG 质量差距在 1% 以内,显著超越了其他无需训练的加速策略。MrFlow 还可以直接与预训练的时间步蒸馏策略组合,实现高达 25× 的生成加速。

三、技术架构

整体框架图

框架总览

MrFlow 的四阶段流水线:

┌────────────────────────────────────────────────────────────────┐
│                     MrFlow Staged Pipeline                      │
├────────────────────────────────────────────────────────────────┤
│                                                                 │
│  Stage 1: Low-Resolution Structure Generation                   │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  z_1^LR ~ N(0,I)  (in LR latent space)                  │   │
│  │  ↓ Flow Matching ODE sampling (K_L = 12 steps)          │   │
│  │  ↓ VAE Decoder                                          │   │
│  │  → x_LR (clean LR image, e.g. 512×512)                  │   │
│  └─────────────────────────────────────────────────────────┘   │
│                    ↓                                            │
│  Stage 2: Pixel-Space Super-Resolution                          │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  x_SR = GAN-SR(x_LR)  (Real-ESRGAN, ×2 upscaling)      │   │
│  │  → x_SR preserves LR structure + adds HF details        │   │
│  └─────────────────────────────────────────────────────────┘   │
│                    ↓                                            │
│  Stage 3: Low-Strength Noise Injection                          │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  z_0^SR = VAE_Encode(x_SR)                               │   │
│  │  z_t^HR = (1 - σ_t) · z_0^SR + σ_t · ε                  │   │
│  │  where σ_t ∈ [0.1, 0.15]                                 │   │
│  │  → Weakens SR artifacts, keeps LR structure at high SNR  │   │
│  └─────────────────────────────────────────────────────────┘   │
│                    ↓                                            │
│  Stage 4: High-Resolution Detail Refinement                     │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  z_t^HR → Flow Map (1 step, same velocity net)          │   │
│  │  ↓ VAE Decoder                                          │   │
│  │  → x_HR (final image, e.g. 1024×1024)                   │   │
│  └─────────────────────────────────────────────────────────┘   │
│                                                                 │
└────────────────────────────────────────────────────────────────┘

核心公式

Stage 3 噪声注入公式:

ztHR=(1−σt)⋅z0SR+σt⋅ϵz_t^{\text{HR}} = (1 - \sigma_t) \cdot z_0^{\text{SR}} + \sigma_t \cdot \epsilon

其中 σt∈[0.1,0.15]\sigma_t \in [0.1, 0.15] 为低强度噪声系数。

噪声强度下界推导:

σt≥λhf1+λhf\sigma_t \geq \frac{\sqrt{\lambda_{\text{hf}}}}{1 + \sqrt{\lambda_{\text{hf}}}}

其中 λhf\lambda_{\text{hf}} 为干净数据的高频功率,可通过可测的高频分量计算得到。

加速来源:

  1. 二次方 token 减少:每边分辨率减半 → token 数量减少 4× → 每步加速 ~4×
  2. 更少步骤:LR 主导结构,收敛所需时间步更少(通常 12 步 vs 50 步)

模型组件

组件说明关键参数
Flow Matching 采样器使用预训练的 flow-matching 模型(FLUX.1-dev, Qwen-Image)LR 步数 K_L = 12-20, HR 步数 K_H = 1
VAE Encoder/DecoderStable Diffusion 风格的编解码器潜空间分辨率 512×512 / 1024×1024
GAN-based SRReal-ESRGAN(选择原因:GAN 先验产生更真实的高频细节)×2 上采样
噪声注入模块低强度高斯噪声σ_t ∈ [0.1, 0.15]

关键设计选择

为什么选择像素空间 SR 而非潜空间上采样?

现有方法(LSSGen, RALU, SPEED)在潜空间中进行上采样和选择性区域修改,导致模糊或伪影。MrFlow 改为在像素空间进行超分辨率,然后重新编码回潜空间,避免了潜空间上采样的结构失真。

为什么选择 Real-ESRGAN 而非插值或其他 SR 模型?

SR 方法加速比Geneval 得分备注
双线性插值10.7×0.87速度快但质量较低
Real-ESRGAN (GAN)10.3×0.86最佳质量/效率权衡
SwinIR (L2 监督)4.67×—模型计算太慢
OSEDiff9.45×—备选方案

Real-ESRGAN 的 GAN 先验比 L2 监督模型(如 SwinIR)产生更真实的高频细节,且计算开销远低于 SwinIR。

四、核心创新

创新点说明理论/实验依据
四阶段分阶段采样将扩散生成解耦为结构生成(SR)+高频重采样两步结构-细节解耦:LR 负责全局结构,HR 负责局部细节
像素空间超分辨率避免潜空间上采样的模糊/伪影Real-ESRGAN 在质量和速度间取得最佳平衡
低频噪声注入降低高频信噪比,使去噪器可以重采样/校正高频细节理论下界推导 + CLIP 相似度验证(1 步 vs 5 步仅 0.9974 vs 0.9999)
单步 HR 精炼利用接近干净的端点和平坦的速度场,只需 1 步欧拉离散化误差极小
正交组合蒸馏可与时间步蒸馏策略直接组合最高 25× 加速

五、代码实现分析

GitHub: https://github.com/Xingyu-Zheng/MrFlow

MrFlow 的核心实现思路:

  • 复用预训练的 flow-matching 模型(无需修改权重)
  • 在采样流程中插入 Real-ESRGAN 上采样和噪声注入步骤
  • 无需训练或运行时动态识别

与现有加速方法的正交性: MrFlow 不依赖于模型微调或训练,因此可以与需要训练的方法(如时间步蒸馏)组合使用,实现加速效果的复合叠加。

六、实验结果

基准测试

训练-free 加速方法对比(FLUX.1-dev):

方法加速比Geneval 得分
MrFlow (20,1)5.78×0.65
MrFlow (12,1)8.25×0.63
LSSGen3.93×—
Teacache崩溃于 >8×—
DB-Taylor崩溃于 >8×—
RALU明显退化—
Native (80 steps)1×—

训练-free 加速方法对比(Qwen-Image):

方法加速比GenevalOneIG-En
MrFlow (20,1)×26.98×0.870.54
MrFlow (12,1)×210.3×0.860.52
SPEED急剧下降——
Native (50×2 steps)1×——

与训练依赖方法对比

方法是否需要训练加速比Geneval
MrFlow (12,1)否8.25×0.63
SenseFlow (4-step)是11.1×—
Pi-Flow (4-step)是——
LSSGen (需训练)是3.93×—

MrFlow 在无需训练的前提下,性能接近需要训练的蒸馏方法。

消融实验

SR 方法选择(Qwen-Image, MrFlow (12,1)×2):

方法加速比Geneval
双线性插值10.7×0.87
Real-ESRGAN10.3×0.86
SwinIR4.67×—
OSEDiff9.45×—

HR 步数配置(Figure 4):

  • K_H = 1 步默认配置已足够
  • CLIP 相似度:1 步 (s=0.1) = 0.9974 vs 5 步 = 0.9999,差异可忽略

扩展模型结果:

  • FLUX.2 Klein 变体(4B, 8B):一致获得 7-8× 加速
  • Z-Image 和 Z-Image-Turbo:MrFlow 保持有效加速

质量-速度权衡曲线

质量-速度权衡

MrFlow 在高加速比区域(>8×)明显优于其他训练-free 方法,后者在此区域普遍出现质量崩溃。

运行时分解

运行时分解

Native Qwen-Image 的 50×2 步 vs MrFlow 的 12+1 步,MrFlow 在各阶段的总运行时间大幅降低。

七、相关工作

  • LSSGen / RALU / SPEED:多分辨率生成策略,>5× 加速但存在模糊/伪影问题
  • ToMA / Teacache / DB-Taylor:特征缓存方法,加速有限(<4×)
  • SenseFlow / Pi-Flow:时间步蒸馏方法,需要训练但可达 11× 加速
  • FlashAttention:类似的思想——通过算法修改而非更多步骤来加速

八、总结

核心贡献

  1. MrFlow 框架:首个针对 flow-matching 模型的无需训练多分辨率加速策略
  2. 四阶段分阶段采样流水线:LR 结构生成 → 像素空间 SR → 低频噪声注入 → 单步 HR 精炼
  3. 理论分析:噪声强度下界推导、单步充分性证明、结构-细节解耦分析
  4. 实证结果:FLUX.1-dev 上 8.25×、Qwen-Image 上 10.3× 加速,质量损失 <1%
  5. 可扩展性:与时间步蒸馏正交组合,最高 25× 加速;适用于 FLUX.2、Z-Image 等多个模型

技术影响

  • 无需训练:直接应用于任何预训练的 flow-matching 模型,无需微调
  • 即插即用:只需替换采样流程中的上采样和噪声注入步骤
  • 正交组合:可与蒸馏、特征缓存等方法叠加使用

局限性

  • 当前仅针对 flow-matching 模型(未测试传统 DDPM)
  • GAN-based SR 可能在某些风格上引入过度锐化
  • 对于极端加速需求(>20×),仍需结合蒸馏方法

九、参考资源

关键图片索引

图片说明文件名
Figure 2MrFlow 框架总览framework-overview.png
Figure 1定性对比(MrFlow vs 其他方法)qualitative-comparison.png
Figure 3不同 SR 方法对比sr-methods.png
Figure 5质量-速度权衡曲线tradeoff-curve.png
Figure 6运行时分解runtime-breakdown.png