Back to blog

Qwen-Image-2.0-RL Technical Report

面向 Qwen-Image-2.0 扩散模型的 RLHF + On-Policy Distillation 后训练管线。用 VLM 微调 + 逐点评分 + CoT 构建 T2I(对齐/美学/人像)与编辑(指令遵循/人脸ID)复合奖励;基于 Flow-GRPO 引入混合 CFG(仅 rollout 用 CFG)、组内奖励范围过滤、每类权重校准、高噪声时间步采样;最后用 OPD 通过轨迹级速度匹配(W2 上界)把 T2I 与编辑双教师合并为单学生。Qwen-Image-Bench 57.84(+2.61),T2I Elo 1193(+78),编辑 Elo 1349(+93)。

Qwen-Image-2.0-RL Technical Report

本文基于 MinerU 从 PDF 提取的全文(arXiv 未提供 HTML 版本)撰写,含完整公式与图表。

一、论文概述

项目内容
标题Qwen-Image-2.0-RL Technical Report
作者Yixian Xu*, Kaiyuan Gao*, Yuxiang Chen* 等 28 人,Chenfei Wu†(通讯)
机构Qwen Team(https://qwen.ai)
提交时间2026-06-25
arXiv2606.27608
分类cs.CV / cs.LG
基础模型Qwen-Image-2.0(flow matching 扩散模型,同时支持 T2I 与图像编辑)

二、核心思想

问题定义:预训练扩散模型(尤其同时具备 T2I 与图像编辑的多任务模型)在视觉质量、指令遵循、人像保真度上仍不完全匹配人类偏好;单一奖励难以覆盖多任务,而在混合数据上联合做 RL(Mix-RL)会因任务目标相互竞争产生「跷跷板效应」,得到次优折中。

解决方案:Qwen-Image-2.0-RL 提出一条三段式后训练管线(见 Figure 1):

  1. 复合奖励系统:VLM 微调 + 逐点评分(pointwise)+ CoT,T2I 覆盖对齐/美学/人像三维,编辑覆盖指令遵循 + 人脸 ID(后者用模型级 embedding 打分器)。
  2. 可扩展 GRPO RL:基于 Flow-GRPO,引入混合 CFG(仅 rollout 用 CFG)、异步奖励管线、多奖励加权优势、高噪声时间步采样、组内奖励范围过滤、每类奖励权重校准。
  3. On-Policy Distillation (OPD):分别训练 T2I 与编辑两个专家教师,再通过轨迹级速度匹配把双教师蒸馏为单一部署学生,从理论上由 2-Wasserstein 距离上界 推导得到。

训练管线总览

三、背景与基础公式

3.1 Flow-GRPO(本文 RL 的基座)

将多步去噪轨迹建模为 MDP。给定 prompt cc,策略 πθ\pi_\theta 生成一组 GG 张图 {x0(1),…,x0(G)}\{x_0^{(1)},\dots,x_0^{(G)}\},奖励模型 R(x0,c)R(x_0,c) 打分。组内归一化优势:

A(x0(i),c)=R(x0(i),c)−μcσc(4)A(x_0^{(i)},c) = \frac{R(x_0^{(i)},c) - \mu_c}{\sigma_c} \tag{4}

flow matching 用确定性 ODE 生成,难以直接套 GRPO,Flow-GRPO 改用等价随机采样器:

dxt=[vθ(xt,t)+σt22t(xt+(1−t)vθ(xt,t))]dt+σt dwt(5)\mathrm{d}x_t = \left[v_\theta(x_t,t) + \frac{\sigma_t^2}{2t}\big(x_t + (1-t)v_\theta(x_t,t)\big)\right]\mathrm{d}t + \sigma_t\,\mathrm{d}w_t \tag{5}

Euler-Maruyama 离散化后转移密度为高斯,可算重要性比 rt(i)(θ)r_t^{(i)}(\theta),再用裁剪代理目标:

LFlow-GRPO(θ)=−E 1G∑i=1G1T∑t=0T−1[min⁡(rt(i)A, r^t(i)A)](6)\mathcal{L}_{\text{Flow-GRPO}}(\theta) = -\mathbb{E}\,\frac{1}{G}\sum_{i=1}^{G}\frac{1}{T}\sum_{t=0}^{T-1}\Big[\min\big(r_t^{(i)}A,\ \hat r_t^{(i)}A\big)\Big] \tag{6}

其中 r^t(i)=clip(rt(i),1−ϵ,1+ϵ)\hat r_t^{(i)} = \mathrm{clip}(r_t^{(i)}, 1-\epsilon, 1+\epsilon)。(论文也讨论了 DiffusionNFT 的前向过程构造,Eqn. 7–9,作为对比。)

四、奖励建模(§3)

4.1 Pointwise vs Pairwise(关键消融)

  • Pairwise:Bradley-Terry 排序损失
Lpair=−∑(xw,xl,c)log⁡σ(Rϕ(xw,c)−Rϕ(xl,c))(10)\mathcal{L}_{\text{pair}} = -\sum_{(x_w,x_l,c)}\log\sigma\big(R_\phi(x_w,c)-R_\phi(x_l,c)\big) \tag{10}
  • Pointwise:对绝对分 yy 做回归
Lpoint=∑(x,c,y)(Rϕ(x,c)−y)2(11)\mathcal{L}_{\text{point}} = \sum_{(x,c,y)}\big(R_\phi(x,c)-y\big)^2 \tag{11}
  • 实现上 VLM 输出离散分数集 S={1,2,3,4,5}\mathcal{S}=\{1,2,3,4,5\} 的 token,奖励取期望:
Rϕ(x,c)=∑s∈Ss⋅pϕ(s∣x,c)(12)R_\phi(x,c) = \sum_{s\in\mathcal{S}} s\cdot p_\phi(s\mid x,c) \tag{12}

结论:在同评价维度、同数据池、只变标注格式的对照下,pointwise 训练出的奖励模型在 RL 后产出图像质量更高、纹理更细、伪影更少(Figure 2)。原因是绝对分提供”有多好”的校准信号,而 pairwise 只给”哪个更好”。因此全系统默认采用 pointwise。

Pointwise vs Pairwise 奖励对比

4.2 T2I 奖励(分层设计,均微调 Qwen 系 VLM)

  1. 图文对齐奖励(最基础):优先级 = 物体存在/计数 > 属性(颜色/尺寸/形状/材质) > 空间关系 > 动作/姿态;违反高优先级项直接封顶低分。
  2. 美学奖励:在对齐达标后叠加,优化纹理保真。
  3. 人像奖励:专门优化面部吸引力、皮肤/头发细粒度真实感。

4.3 编辑奖励

  • 指令遵循奖励:VLM 接收 (源图, 指令, 输出图) 三元组,把指令分解为核心/非核心要求,评估 (1) 核心编辑是否完成、(2) 非核心要求、(3) 整体视觉一致性。
  • 人脸身份一致性奖励:VLM 对细微身份漂移不敏感,故引入独立的模型级 embedding 人脸打分器做精确 ID 保留信号。

五、训练框架(§4)

5.1 混合 CFG 策略(核心 trick)

系统对比三种 CFG 用法(Figure 3):

策略结果
rollout + training 都用 CFG训练不稳定,图像最终崩溃
两阶段都不用 CFG奖励上升但逐渐丢失风格化能力与世界知识(认不出名人、失去特定风格)
仅 rollout 用 CFG(本文采用)训练稳定 + 保留预训练全部生成能力

采用「仅 rollout 用 CFG」:CFG 引导的 rollout 产出结构连贯、奖励可靠的候选,而 CFG-free 的训练目标避免联合优化条件/无条件分支的困难,梯度稳定且降低计算量。

三种 CFG 策略对比

5.2 异步奖励管线

奖励模型作为远程 API 服务独立部署。生成一批图后由后台线程异步提交到远程 VLM 端点,奖励延迟被 GPU 推理计算掩盖,从而可扩展到多个奖励模型而不线性增加训练时间。

5.3 多奖励加权优势

A(x0(i),c)=∑k=1Kwk⋅Rk(x0(i),c)−μkσk,∑kwk=1(13)A(x_0^{(i)},c) = \sum_{k=1}^{K} w_k\cdot\frac{R_k(x_0^{(i)},c)-\mu_k}{\sigma_k},\quad \sum_k w_k = 1 \tag{13}

每组 per-prompt-group 归一化是关键:使复合奖励对各奖励模型的绝对尺度差异不变,防止某一维因数值范围大而主导优势信号。

5.4 任务专用优化

  • 时间步采样:rollout 用 40 步 ODE,但只在**高噪声时间步(t→1t\to1)**子集上加 RL 训练信号——高噪声步主导全局结构/语义布局,是更稳健的优化目标,可减缓 reward hacking(否则几个迭代内就退化)。
  • Prompt curation:基模型对每个候选 prompt 做 GG 次 rollout,算组内奖励极差(max−min),只保留极差超阈值者。整组同高/同低分的 prompt 梯度信号弱,丢弃以集中算力。
  • Per-category 奖励校准:把 prompt 分成 portrait/landscape/typography/general 等类别,各配类别专属权重向量(人像题加大人像奖励权重、排版题加大对齐权重),避免收敛到单一主导风格。

5.5 On-Policy Distillation(§4.3)

目标:把任务专用的 T2I / 编辑教师合并为单一部署学生 vθv_\theta(初始化自基模型)。学生用 NN 步反向 ODE 生成,保存自身完整轨迹 {xt0,…,xtN}\{x_{t_0},\dots,x_{t_N}\},在自己轨迹的每点匹配对应任务教师 vθ⋆v_{\theta^\star} 的速度场:

LOPD=Ec,x[1:N]∼πθ(⋅∣c)[∑n=1N∥vθ(xtn,tn,c)−vθ⋆(xtn,tn,c)∥2](14)\mathcal{L}_{\text{OPD}} = \mathbb{E}_{c,x_{[1:N]}\sim\pi_\theta(\cdot\mid c)}\left[\sum_{n=1}^{N}\big\|v_\theta(x_{t_n},t_n,c) - v_{\theta^\star}(x_{t_n},t_n,c)\big\|^2\right] \tag{14}

多教师蒸馏:维护 T2I 教师与编辑教师两个,按当前样本任务类型选择教师;仅激活教师载入 GPU,非激活教师 offload 到 CPU,从而多大教师而不线性增显存。教师做速度预测时用 CFG,学生不用;OPD 后再把 CFG 集成回学生。

理论依据(附录 A):以 2-Wasserstein 距离为分布度量,W2W_2 直接算需解最优传输不可行。借助 Benton et al. (2023) 定理,在光滑流 + 教师速度场 Lipschitz 假设下:

W2(p0θ,p0θ⋆)≤(∫01Ext∼ptθ∥vθ−vθ⋆∥2 dt)1/2⋅exp⁡(∫01Lt dt)(17)W_2(p_0^\theta,p_0^{\theta^\star}) \le \left(\int_0^1 \mathbb{E}_{x_t\sim p_t^\theta}\|v_\theta - v_{\theta^\star}\|^2\,\mathrm{d}t\right)^{1/2}\cdot\exp\left(\int_0^1 L_t\,\mathrm{d}t\right) \tag{17}

指数因子只依赖教师网络的 Lipschitz 常数、与训练目标无关,故最小化 W2W_2 上界等价于最小化轨迹级速度匹配目标(Eqn. 18→离散化为 Eqn. 14/19)。

六、核心创新

创新点描述
Pointwise + CoT 奖励逐点绝对打分(Eqn. 11-12)比 pairwise 排序更稳、可解释,实证 RL 后画质更优
任务专用复合奖励T2I 拆对齐/美学/人像三层,编辑拆指令 + 模型级人脸 ID embedding 打分
混合 CFG(仅 rollout)抑制 reward hacking 与预训练能力流失,兼顾稳定性与算力
高噪声步采样 + 组内极差过滤 + 每类校准三项 GRPO 稳定化 / 数据高效化技巧
轨迹级速度匹配 OPD由 W2W_2 上界推导,多任务教师合一学生,避免 Mix-RL 的跨任务目标冲突

七、实验结果(§5)

7.1 Qwen-Image-Bench(Table 1,[0,100],Q-Judger 评审,130K+ 人工标注)

模型QualityAestheticsAlignmentReal-world FidelityCreative Gen.Overall
Qwen-Image-2.0-Base52.2957.1057.6447.5458.2255.23
Qwen-Image-2.0-RL54.3958.6759.2851.8364.9457.84
Δ+2.10+1.57+1.64+4.29+6.72+2.61
  • 五维全面提升,Creative Generation +6.72、Real-world Fidelity +4.29 增幅最大。
  • 对照强基线(部分节选):GPT Image 2 = 64.69、Nano Banana 2.0 = 59.82、Seedream 5.0 = 57.22、FLUX 2 Max = 55.33。RL 后 Qwen-Image-2.0-RL(57.84) 超过 Seedream 5.0 但仍低于 Nano Banana / GPT Image 1.5 等最强闭源模型。

7.2 人类偏好 Arena(Figure 4,Elo)

Arena基线RL 后Δ
文生图 T2I11151193+78
图像编辑12561349+93
  • 8 个子类全线提升;T2I 中 3D Modeling +93、Photorealism +91 增幅最大(结构一致性与细节提升)。

Elo 各类别分布 Elo 分组对比

7.3 OPD vs Mix-RL(关键消融,Figure 5/6)

三方对比:Base → Mix-RL → Qwen-Image-2.0-RL(OPD)。

  • Mix-RL 已比 Base 提升(纹理/构图/真实感),证明奖励套件有效;
  • 但 OPD 始终优于 Mix-RL:细节更锐、prompt 遵循更准、美学更好;
  • 编辑任务上 OPD 在人脸身份保留与复杂指令遵循上明显胜出,而 Mix-RL 仍有身份漂移/编辑不完整。→ 验证「分解训练 + 蒸馏合并」优于「联合多奖励 RL」。

T2I 三模型定性对比 人像编辑对比

八、相关工作

  • 扩散 RL:Flow-GRPO(GRPO→flow matching)、GRPO-Guard(regulated clipping 抑过优化)、AWM、DiffusionNFT(前向过程构造)。本文在其上引入面向 Qwen-Image-2.0 的混合 CFG。
  • 扩散奖励模型:CLIP → ImageReward / PickScore / HPSv2 / HPSv3(BT 回归)→ UnifiedReward / RewardDance(token 概率打分 + CoT)。
  • On-Policy Distillation:GKD(LLM 起源);并行工作 Flow-OPD、DiffusionOPD 把 OPD 扩到 flow matching(证明高斯转移核 KL 退化为速度场 MSE),但只合并单奖励 T2I 教师。本文差异:按任务类型专门化教师(T2I + 编辑),并从 W2W_2 上界推导目标。

九、总结

核心贡献

  1. 面向 T2I + TI2I 的 VLM 复合奖励系统(结构化评分 rubric,pointwise + CoT)。
  2. 适配 flow matching 的 GRPO 框架:混合 CFG + 异步奖励管线 + 高噪声步采样 + 组内极差过滤 + 每类校准。
  3. 由 W2W_2 上界推导的 OPD,把任务专用 RL 教师合一为部署模型,消除推理期奖励模型依赖,且超过 Mix-RL。

技术影响

  • 为扩散/流匹配模型 RLHF 提供工业级可复现配方。
  • OPD 的「多任务教师→单学生」思路可迁移到更广的多模态生成合并场景。

局限性

  • 相比 GPT Image 2 / Nano Banana 等最强闭源模型仍有差距(57.84 vs 64.69)。
  • 奖励模型基于 VLM,天花板受限于 VLM 自身评价能力与偏差。
  • 评估以 Qwen-Image-Bench + Elo Arena 为主,缺 GenEval / T2I-CompBench 等公开基准直接对比。

十、参考资源

  • arXiv 论文:https://arxiv.org/abs/2606.27608
  • 官网:https://qwen.ai
  • 图片索引:figures/2606.27608-qwen-image-2-rl/README.md
  • 相关工作:Flow-GRPO, DiffusionNFT, GRPO-Guard, ImageReward, HPSv2/v3, UnifiedReward, RewardDance, GKD, Flow-OPD, DiffusionOPD