Back to blog

Qwen-Image-2.0: 全能图像生成基础模型

Qwen-Image-2.0 全能图像生成基础模型,支持文本到图像生成和图像编辑。

Qwen-Image-2.0: 全能图像生成基础模型

一、论文概述

项目内容
标题Qwen-Image-2.0 Technical Report
作者Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang 等53位作者
机构阿里巴巴 (Alibaba) / 通义千问团队
论文https://arxiv.org/abs/2605.10730
发布2026年5月11日
许可未明确
领域图像生成、扩散模型、多模态、文本渲染

二、核心思想

问题定义

尽管近期取得进展,现有图像生成模型在以下方面仍存在挑战:

  1. 超长文本渲染:难以生成包含大量文字的图像
  2. 多语言排版:非拉丁语言(如中文)的文本保真度不足
  3. 高分辨率写实:细节、纹理和光照的真实感有限
  4. 指令跟随:复杂提示的可靠遵循能力不足
  5. 高效部署:文本密集和构图复杂场景下的效率问题

解决方案概述

Qwen-Image-2.0是一个全能图像生成基础模型,在单一框架内统一高保真生成和精准编辑:

核心架构:将Qwen3-VL作为条件编码器,与多模态扩散Transformer (MMDiT) 结合进行联合条件-目标建模。

关键创新:

  1. Qwen3-VL条件编码:利用强大的视觉语言模型理解复杂指令
  2. MMDiT联合建模:统一生成和编辑任务
  3. 大规模数据整理:定制化的数据流水线
  4. 多阶段训练:渐进式能力构建

核心能力

能力说明
文本密集生成支持高达1K token指令,生成幻灯片、海报、信息图、漫画等
多语言排版显著提升多语言文本保真度和排版质量
写实生成更丰富的细节、更真实的纹理、连贯的光照
复杂指令跨多种风格更可靠地遵循复杂提示
精准编辑统一框架内的精确图像编辑

三、技术架构

整体框架

┌─────────────────────────────────────────────────────────────────┐
│                    Qwen-Image-2.0 架构                           │
│                                                                  │
│  ┌──────────────────────────────────────────────────────────┐   │
│  │ 条件编码器: Qwen3-VL                                      │   │
│  │ - 强大的视觉语言理解能力                                   │   │
│  │ - 支持高达1K token的复杂指令                               │   │
│  │ - 多模态条件融合                                          │   │
│  └──────────────────────────────────────────────────────────┘   │
│                          │                                       │
│                          ▼                                       │
│  ┌──────────────────────────────────────────────────────────┐   │
│  │ 多模态扩散Transformer (MMDiT)                              │   │
│  │ - 联合条件-目标建模                                        │   │
│  │ - 统一生成和编辑                                          │   │
│  │ - 高分辨率输出                                            │   │
│  └──────────────────────────────────────────────────────────┘   │
│                          │                                       │
│                          ▼                                       │
│  ┌──────────────────────────────────────────────────────────┐   │
│  │ 多阶段训练流水线                                           │   │
│  │ - 大规模数据整理                                          │   │
│  │ - 渐进式能力构建                                          │   │
│  │ - 文本渲染优化                                            │   │
│  └──────────────────────────────────────────────────────────┘   │
└─────────────────────────────────────────────────────────────────┘
         │
         ▼
    生成/编辑输出

模型组件

组件说明关键特性
Qwen3-VL条件编码器视觉语言理解、复杂指令解析
MMDiT扩散Transformer联合条件-目标建模、统一生成编辑
数据流水线大规模数据整理高质量训练数据筛选
训练流程多阶段训练渐进式能力构建

与前代模型对比

特性Qwen-ImageQwen-Image-EditQwen-Image-2.0
基础能力20B MMDiT基于Qwen-ImageQwen3-VL + MMDiT
条件编码-Qwen2.5-VLQwen3-VL
文本渲染中英文精准文本编辑超长文本、多语言
编辑能力基础编辑语义+外观编辑统一框架
指令长度--高达1K tokens
应用场景通用生成专注编辑全能型

四、核心创新

创新点说明效果
Qwen3-VL条件编码利用最新VL模型作为条件编码器强大的多模态理解和指令跟随
MMDiT联合建模统一条件和目标的扩散建模生成和编辑的无缝集成
超长文本支持支持1K token指令幻灯片、海报、信息图等复杂内容
多语言排版显著提升多语言文本保真度中英文等多语言高质量渲染
写实增强更丰富的细节和纹理真实感光照和材质表现

五、应用场景

文本密集内容

应用类型示例
幻灯片企业级PPT、技术分享、信息展示
海报电影海报、活动宣传、产品推广
信息图数据可视化、流程图、知识图谱
漫画多格漫画、插画故事、角色设计
文档手写文档、书法作品、书籍封面

写实生成

应用类型特点
人物摄影丰富细节、真实纹理
风景摄影连贯光照、自然色彩
产品摄影材质表现、光影效果
建筑摄影空间感、透视准确

图像编辑

编辑类型说明
语义编辑IP创作、物体旋转、风格转换
外观编辑元素添加/删除/修改、局部保持
文本编辑中英文本精准编辑、字体保持
链式编辑多步骤渐进式修正

六、相关工作

Qwen图像生成系列发展

版本时间特点关键技术
Qwen-Image2025年8月20B MMDiT基础模型复杂文本渲染、精准编辑
Qwen-Image-Edit2025年8月专注编辑Qwen2.5-VL语义控制、VAE外观控制
Qwen-Image-2.02026年5月全能型升级Qwen3-VL + MMDiT、统一框架

Qwen-Image技术特点回顾

文本渲染能力:

  • 中英文高保真渲染
  • 多行布局、段落级语义
  • 细粒度细节控制
  • 自动布局排版

编辑能力:

  • 语义编辑:IP一致性、视角变换、风格迁移
  • 外观编辑:元素增删、局部修改、反射生成
  • 文本编辑:字体保持、精准定位
  • 链式编辑:多步骤渐进修正

七、实验结果

人类评估

根据论文摘要,Qwen-Image-2.0在广泛的人类评估中:

评估维度对比对象结果
生成质量Qwen-Image系列显著优于
编辑质量Qwen-Image系列显著优于
文本渲染现有模型显著提升
多语言排版现有模型显著提升
写实生成现有模型显著提升
指令跟随现有模型显著提升

Qwen-Image基准表现回顾

基于Qwen-Image的公开基准结果:

基准类别基准名称表现
通用生成GenEvalSOTA
通用生成DPGSOTA
通用生成OneIG-BenchSOTA
图像编辑GEditSOTA
图像编辑ImgEditSOTA
图像编辑GSOSOTA
文本渲染LongText-Bench大幅领先
文本渲染ChineseWord大幅领先
文本渲染TextCraft大幅领先

八、总结

核心贡献

  1. 全能架构:Qwen3-VL + MMDiT统一框架,同时支持生成和编辑
  2. 超长文本:支持1K token指令,生成复杂文本密集内容
  3. 多语言增强:显著提升多语言文本保真度和排版质量
  4. 写实提升:更丰富的细节、更真实的纹理和连贯光照
  5. 指令增强:更可靠地遵循复杂、多样化的提示

技术影响

  • 范式统一:在单一框架内统一生成和编辑能力
  • 条件编码升级:从Qwen2.5-VL到Qwen3-VL的跃升
  • 应用场景扩展:从通用生成扩展到专业内容创作
  • 文本渲染突破:解决超长文本和多语言排版难题

局限性

  1. 模型规模:具体参数量未公开
  2. 开源状态:截至论文发布时未明确是否开源
  3. 评估细节:具体基准分数待论文全文公开
  4. 部署效率:具体推理速度和资源需求未详述

未来方向

  1. 更大规模:进一步扩展模型参数和能力
  2. 更多模态:扩展到视频、3D等模态生成
  3. 更高效部署:优化推理效率和部署成本
  4. 社区共建:与开源社区共同推动生成式AI发展

九、参考资源