Back to blog

Qwen-Image Technical Report

Qwen 图像生成基础模型技术报告

Qwen-Image Technical Report

一、论文概述

项目内容
标题Qwen-Image Technical Report
作者Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin 等 39 人(Qwen 团队)
论文arXiv:2508.02324
代码GitHub: QwenLM/Qwen-Image
发布2025年8月4日

二、核心思想

问题定义

图像生成模型面临两大关键挑战:

挑战 1:复杂文本渲染

  • 现有模型在图像中渲染文本时经常出现错误(拼写错误、字符缺失)
  • 对于非字母语言(如中文)的支持尤其困难
  • 段落级文本渲染几乎无法实现

挑战 2:图像编辑一致性

  • 传统编辑方法难以同时保持语义一致性和视觉保真度
  • 编辑后的图像容易出现内容偏移或细节丢失

解决方案概述

本文提出 Qwen-Image,Qwen 系列中的图像生成基础模型:

  1. 复杂文本渲染:设计全面的数据管线 + 渐进式训练策略
  2. 图像编辑一致性:改进的多任务训练范式 + 双编码机制
  3. 多语言支持:特别针对中文等表意文字进行优化

关键创新

创新点说明效果
7 阶段数据管线收集、过滤、标注、合成、平衡高质量训练数据
渐进式训练策略从非文本到文本,从简单到复杂逐步提升文本渲染能力
MSRoPE 位置编码多尺度可扩展位置编码支持多种分辨率
双编码机制Qwen2.5-VL + VAE 分别编码语义一致性 + 视觉保真度
DPO + GRPO双重强化学习策略提升生成质量

三、技术架构

模型架构概览

Qwen-Image 架构概览

Qwen-Image 由三个核心组件组成:

1. 多模态大语言模型 (MLLM)

  • 基础模型:Qwen2.5-VL-3B/7B(预训练语言模型)
  • 输入:文本 prompt + 图像 token
  • 输出:中间层隐藏状态作为 MMDiT 的条件
  • 特殊 token:
    • <image_start> / <image_end>:图像 token 边界
    • <|image_pad|>:填充 token

2. 变分自编码器 (VAE)

VAE 重建可视化

  • 架构:基于 FLUX 的共享编码器
  • 压缩率:空间 8×8,时间 4×
  • 训练数据:混合文本/非文本文档图像
  • 特点:专为文本渲染优化,保留小文本和细粒度细节

3. 多模态扩散 Transformer (MMDiT)

  • 架构:双流(文本流 + 图像流)全注意力 Transformer
  • 层数:38 层
  • 隐藏维度:4,096
  • 注意力头:28/28(Q/K/V)
  • 图像分辨率:支持多种分辨率(576-1328)

MSRoPE 位置编码

不同位置编码策略对比

传统问题:ScalingROPE 假设图像为正方形,导致非正方形图像的纵横比信息丢失。

MSRoPE 解决方案:

  • 将图像视为 2D 网格(m × n)
  • 沿高度和宽度方向分别应用缩放
  • 保持纵横比信息,支持任意分辨率

训练配置

组件参数
MLLMQwen2.5-VL-3B/7B
VAE24 层,C=192
MMDiT38 层,D=4096,28 heads
总参数量3B / 7B

四、数据管线

7 阶段数据处理

数据过滤流程

Stage 1:初始策划数据

  • 从网络和内部来源收集图像
  • 多级去重(感知哈希 + LSH + MinHash + 文本嵌入)
  • 基于规则的过滤

Stage 2:图像质量增强

  • 旋转过滤器:去除方向异常图像
  • 多样性过滤器:移除重复模式
  • 美学过滤器:低质量图像
  • 图像质量过滤器:水印、文本、噪声检测

Stage 3:文本-图像对齐改进

  • CLIPScore 过滤
  • Qwen2.5-VL 重新标注
  • 支持中英文双语描述

Stage 4:文本渲染增强

  • 识别图像中的文本区域
  • OCR 准确性验证
  • 低质量文本图像过滤

Stage 5:高分辨率精炼

  • 逐步提升分辨率至 1328 像素
  • 放大伪影检测
  • 美学评分过滤

Stage 6:类别平衡和肖像增强

  • 关键词驱动的过采样
  • 肖像增强(表情、照明、构图合成)

Stage 7:平衡多尺度训练

  • 基于 WeTokenNet 的采样策略
  • 支持文本/非文本图像平衡
  • 渐进式分辨率提升

数据集组成

数据收集概览

类别占比说明
自然~40%风景、动物、植物等
设计~20%图形、插图、海报等
人物~27%肖像、人体姿态等
合成~3%3D 渲染、AI 生成等

数据合成

方法说明
纯渲染无背景的文本图像
组合渲染文本 + 背景图像合成
复杂渲染完整场景中的文本渲染

五、训练策略

预训练

渐进式训练策略:

阶段分辨率数据目标
初始256-576非文本图像基础视觉表示
中期576-1024文本图像文本渲染能力
后期1024-1328高质量数据细节和质量

关键设计:

  • 激活检查点:节省内存
  • 梯度累积:5 步
  • 梯度裁剪:1.0
  • 优化器:AdamW (β₁=0.9, β₂=0.95)
  • 学习率:cosine 调度

后训练

监督微调 (SFT)

  • 分层组织的语义类别数据集
  • 精细的人工标注
  • 重点提升真实性和细节

强化学习 (RL)

双重 RL 策略:

1. Direct Preference Optimization (DPO)

  • 构建偏好对(chosen/rejected)
  • 基于人工标注的偏好数据
  • 目标:提升人类偏好对齐

2. Group Relative Policy Optimization (GRPO)

  • 组内相对奖励标准化
  • 无需单独的 Critic 网络
  • 公式:

LGRPO=Ex,y∗∼p(⋅∣x)[∑tmin⁡(πθ(at∣st)πold(at∣st)A^t,clip(πθ(at∣st)πold(at∣st),1−ϵ,1+ϵ)A^t)]\mathcal{L}_{\text{GRPO}} = \mathbb{E}_{x,y^*\sim p(\cdot|x)} \left[ \sum_{t} \min\left( \frac{\pi_\theta(a_t|s_t)}{\pi_{\text{old}}(a_t|s_t)} \hat{A}_t, \text{clip}\left(\frac{\pi_\theta(a_t|s_t)}{\pi_{\text{old}}(a_t|s_t)}, 1-\epsilon, 1+\epsilon\right) \hat{A}_t \right) \right]

六、实验结果

对象编辑对比

对象编辑对比

DPG-Bench 评估

模型GlobalEntityAttributeRelationOverall
SD 1.574.6372.2375.3971.8063.18
Playground v2.585.0982.4386.4385.6183.50
FLUX.1-dev84.0882.4384.5386.5082.58
Seedream 3.084.5583.4383.4486.5183.60
GPT Image 1 (High)90.7391.2089.2690.4686.54
Qwen-Image91.3291.5692.0294.3192.73

关键发现:

  • Global 一致性: 91.32(最高)
  • Entity 一致性: 91.56(最高)
  • Attribute 一致性: 92.02(最高)
  • Relation 一致性: 94.31(最高)
  • Overall: 88.32(第二,仅次于 GPT Image 1)

GenEval 评估

模型单对象双对象计数颜色位置属性Overall
Show-o0.950.800.680.490.420.570.53
Emu3-Gen0.980.800.720.690.440.590.56
FLUX.1-dev0.990.950.810.790.280.750.66
Janus-Pro-7B0.970.960.860.760.700.840.81
GPT Image 11.000.990.870.860.860.970.94
Qwen-Image1.000.980.840.840.890.950.91

关键发现:

  • 位置理解: 0.89(最高)
  • 属性理解: 0.95(第二)
  • Overall: 0.91(第二,仅次于 GPT Image 1)

文本渲染能力

英文文本渲染(Figure 18-19):

英文文本渲染对比

  • 段落级文本准确渲染
  • 多位置文本一致性
  • 接近 GPT Image 1 的质量

中文文本渲染(Figure 20-21):

中文文本渲染对比

  • 唯一能准确渲染长中文文本的模型
  • 多对象文本一致性
  • 复杂场景中的文本保持

图像编辑能力

图像编辑任务概览

  • 风格迁移
  • 文本编辑
  • 背景更改
  • 对象添加/删除/替换
  • 姿态操作
  • 漫画生成

七、与现有方法对比

方法类型文本渲染图像编辑多语言开源
Stable Diffusion扩散模型一般基础英文✓
FLUX.1扩散模型良好良好英文✓
Seedream 3.0扩散模型良好良好中英文×
GPT Image 1闭源模型优秀优秀多语言×
Qwen-Image扩散模型优秀优秀中英文✓

独特优势:

  • 中文文本渲染最强:唯一能准确渲染长中文文本的开源模型
  • 全面能力:文本渲染 + 图像编辑 + 多语言支持
  • 开源可用:代码和模型权重公开

八、相关工作

方向代表工作与 Qwen-Image 的关系
文本到图像Stable Diffusion, FLUX基础架构
文本渲染GlyphFLUX, TextCtrl文本渲染技术
图像编辑InstructPix2Pix, IP2P编辑任务
多模态 LLMQwen2.5-VL语义理解基础
扩散 TransformerMMDiT, DiT核心架构

九、总结

核心贡献

  1. 复杂文本渲染:首个能准确渲染段落级中文文本的开源模型
  2. 7 阶段数据管线:从收集到平衡的完整数据处理流程
  3. 渐进式训练策略:从非文本到文本,从简单到复杂
  4. MSRoPE 位置编码:支持多种分辨率,保持纵横比
  5. 双编码机制:Qwen2.5-VL + VAE,语义一致性 + 视觉保真度
  6. DPO + GRPO:双重强化学习提升生成质量
  7. SOTA 性能:DPG-Bench 91.32,GenEval 0.91

技术影响

  • 为中文文本图像生成树立了新标杆
  • 开源模型中综合能力最强
  • 渐进式训练策略可推广到其他生成任务
  • 数据管线设计为大规模图像生成提供了参考

局限性

  • 模型较大(3B/7B),推理资源需求高
  • 高分辨率生成速度较慢
  • 某些极端复杂场景仍有提升空间
  • 代码开源但完整训练流程未公开

十、参考资源

  • 论文: arXiv:2508.02324
  • 代码: GitHub: QwenLM/Qwen-Image
  • 关键引用:
    • Qwen2.5-VL — 语义理解基础
    • FLUX.1 — VAE 架构
    • MMDiT — 扩散 Transformer
    • DPO — 偏好优化
    • GRPO — 组相对策略优化

分析日期: 2026-06-05