Back to blog

HunyuanImage 3.0 Technical Report

腾讯混元原生多模态模型:在自回归框架内统一多模态理解与生成,80B MoE(激活 13B),当前最大最强开源图像生成模型

HunyuanImage 3.0 Technical Report:统一理解与生成的原生多模态 MoE 大模型

一、论文概述

项目内容
标题HunyuanImage 3.0 Technical Report
作者Tencent Hunyuan Foundation Model Team(腾讯混元基础模型团队)
机构腾讯(Tencent Hunyuan)
论文https://arxiv.org/abs/2509.23951
发布2025-09-28(v1),2026-06-26(v3)
主题Computer Vision and Pattern Recognition (cs.CV)
基座Hunyuan-A13B(MoE LLM,80B 总参 / 13B 激活)
代码/权重开源(当前仅发布文生图能力)

HunyuanImage 3.0 是一个原生多模态(native multimodal)模型,在单一自回归框架内统一多模态理解与生成。它以预训练 MoE LLM(Hunyuan-A13B)为基座,扩展视觉编码器 + VAE,采用类 Transfusion/JanusFlow 的方式将扩散式图像建模嵌入 LLM。总参数超 80B,每 token 激活 13B,是迄今最大、最强的开源图像生成模型。

多比例文生图样本

Figure 1:HunyuanImage 3.0 的多宽高比文生图样本,展示强大的 prompt 遵循能力。

二、核心思想

问题定义

现有统一多模态模型常将视觉特征按任务分离(理解用 vision encoder 特征、生成用 VAE 特征),需在理解与生成两条流水线间切换,难以支持交错对话、生成、编辑的连续交互。同时,纯 DiT 路线缺乏 LLM 的推理与语义理解能力。

解决方案概述

以预训练 MoE LLM 为骨干,将图像理解与生成统一到自回归下一 token 预测 + 扩散图像建模的单一序列中:

  • 双编码器策略:拼接 VAE 潜特征与 vision encoder 特征,实现理解与生成共用同一序列表示;
  • 原生 CoT(Chain-of-Thought):借助 LLM 框架,模型可自主”思考”——从解读 prompt、到中间概念精炼与改写、再到合成图像;
  • 渐进式预训练 + 激进后训练:四阶段渐进预训练 + SFT/DPO/MixGRPO/SRPO/ReDA 多阶段后训练;
  • 高效基建:支持 80B 级大规模训练/推理,并通过蒸馏(MeanFlow,NFE 降至 4-8)与剪枝(TMP,80B→20B)实现单张 RTX 4090(24GB)部署。

三、技术架构

模型整体架构

Figure 3:HunyuanImage 3.0 整体框架——LLM 骨干 + vision encoder + VAE,双编码器进入统一序列。

3.1 基座与骨干

  • 骨干:Hunyuan-A13B,decoder-only LLM,80B 总参;MoE 配置 64 个专家、每 token 激活 8 个 + 1 个共享 MLP,约 13B 激活参数;
  • 文本 tokenizer:Hunyuan Tokenizer,扩展自定义特殊 token 以支持图像生成/理解;
  • 图像理解:LLM 基于 vision encoder + VAE 联合特征做自回归下一 token 预测生成回复;
  • 图像生成:在 VAE 图像特征上做扩散式图像建模,方式同 Transfusion / JanusFlow 嵌入 LLM。

3.2 VAE 与双编码器

  • VAE:内部 VAE,将像素投影到 32 维潜空间、16× 下采样。相比 DiT 路线常用的 “8× VAE + 2× patchify”,单个 16× 下采样 VAE 更简单有效,图像质量更优;
  • 双编码器:对条件图像输入,拼接 VAE 潜特征与 vision encoder 特征,形成统一多模态表示,同时支持生成与理解——区别于以往按任务分离视觉特征的统一模型,可在连续上下文中完成交错文本对话、图像生成、图像理解与图像编辑;
  • 两个投影器:VAE 特征经时间步调制的残差块投影,vision encoder 特征经两层 MLP 变换;额外注入时间步嵌入以增强扩散条件。

3.3 广义因果注意力(Generalized Causal Attention)

两种注意力实现

Figure 4:两种注意力实现方式。

融合 LLM 的因果注意力与 DiT 的全注意力:

  • 文本 token:仅注意序列中在前的多模态 token(保持自回归特性);
  • 图像 token:可注意所有在前的多模态 token,以及同一图像段内所有后续图像 token(利用全注意力捕获全局空间依赖)。

3.4 广义 2D RoPE(向后兼容)

1D RoPE vs 广义 2D RoPE

Figure 5:1D RoPE 与广义 2D RoPE 对比。文本 token 位置与 2D RoPE 完全一致——直觉上是把 1D 图像位置 reshape 为 2D 并置于两段文本之间。

对 1D 文本位置 nn 与频率 {θ0,θ1,… }\{\theta_0,\theta_1,\dots\},标准 RoPE 为:

[cos⁡(nθ0),cos⁡(nθ1),…,sin⁡(nθ0),sin⁡(nθ1),… ][\cos(n\theta_0),\cos(n\theta_1),\dots,\sin(n\theta_0),\sin(n\theta_1),\dots]

推广到 2D 坐标 (x,y)(x,y),各向异性地解释同一嵌入结构:

[cos⁡(xθ0),cos⁡(yθ1),…,sin⁡(xθ0),sin⁡(yθ1),… ][\cos(x\theta_0),\cos(y\theta_1),\dots,\sin(x\theta_0),\sin(y\theta_1),\dots]

图像 token(从 1D reshape 为 2D)用此广义 2D 编码;文本 token 保留标准 1D RoPE(可视为对角位置的 2D RoPE)。关键:无图像 token 时编码退化为精确的 1D RoPE,从而完全保留预训练 LLM 的语言能力。

3.5 自动图像尺寸/比例预测

DiT 通常需用户指定尺寸/比例。本模型引入自动模式:扩展词表加入两组特殊 token——{<img_size_256>, <img_size_512>, <img_size_768>, …}(分辨率锚点)与 {<img_ratio_0>…<img_ratio_32>}(1:4 到 4:1 宽高比)。模型可根据上下文预测合适尺寸/比例 token,也支持用户显式提示(如 “3:4”、“vertical”),再据此为图像 token 施加 2D RoPE。

四、原生 Chain-of-Thought

本模型的一个关键贡献是为图像生成引出自动化 CoT 推理,通过在小规模专门数据上微调激活。模型可自主执行完整流程:解读输入 prompt → 中间”思考”阶段(概念精炼与改写)→ 合成目标图像。构造了两类训练数据:

  1. T2T(Text-to-Text)推理数据:增强逻辑推理;
  2. T2TI(Text-to-Text-to-Image)推理数据:显式建模从抽象概念到视觉呈现的完整工作流。

推理部分的 token 同样通过自回归下一 token 预测建模。

五、模型训练

5.1 数据

  • 从 100 亿+ 原始图像出发,三阶段过滤保留 <45%;embedding 聚类去重再去掉约 0.5%;补充知识增强、文本相关、风格化、平面设计等专门数据,最终约 50 亿张高质量图像;
  • 图像描述(Captioning)流水线:见 Figure 2。

图像描述流水线

Figure 2:图像描述(Captioning)流水线。

5.2 四阶段渐进预训练

数据由粗到细过滤,VAE 分辨率逐步提高,ViT 固定 512px:

阶段VAE 分辨率锚点ViT 分辨率训练部分任务
I256px512pxTransformer(ViT 冻结)T2I, LM, MMU
II256px512pxViT + aligner(Transformer 冻结)MMU
III512px512pxViT + TransformerT2I, LM, MMU, INTL
IV1024px512pxViT + TransformerT2I, LM, MMU, INTL, CoT
  • 阶段 I:Transformer 骨干训练(ViT 冻结),256px 大 batch,同时优化 T2I/LM/MMU,对齐文图潜表示;
  • 阶段 II:冻结骨干,仅微调 ViT + aligner(MMU 数据),增强视觉理解;
  • 阶段 III:ViT 与 Transformer 联合训练(>512px),引入交错文图数据(图像编辑、图生图);
  • 阶段 IV:高分辨率子集(短边≥1024px),引入 CoT 推理数据,推理 token 也用自回归建模;
  • 指令微调:预训练后针对 T2I 做指令微调,T2I/LM/CoT 数据用指令模板联合优化。

5.3 激进后训练(多阶段)

阶段方法作用
SFT高质量人工标注数据(风景/人像/OCR + 编辑数据),多阶段递进高保真提升指令遵循
DPO两阶段:先稳采样/编辑一致性,再精炼视觉真实感抑制结构失真与合成伪影
MixGRPO扩展 GRPO 到 flow 模型的混合 ODE-SDE 采样在线 RL提升文图对齐、真实感、美学
SRPO梯度引导在线 RL,注入噪声先验单步去噪,优化去噪轨迹初始区间缓解过饱和、光色不协调、皮肤质感差
ReDA(自研)Reward Distribution Alignment:最小化与高奖励先验的散度,任务特定投影器 + 基于 transition 的目标提升身份一致性与真实感

5.4 蒸馏与剪枝

  • 蒸馏:扩展 MeanFlow 蒸馏 80B 模型,引入轨迹分布对齐,将 NFE 降至 4-8 步仍保持竞争力;
  • 剪枝:TMP(Tree-structured Mixed-policy Pruning)——启发式剪枝 + 分层局部混合策略蒸馏,将 80B 压缩到 20B(-75%),配合内存优化可部署于单张 24GB RTX 4090。

六、实验结果

6.1 SSAE(结构化语义对齐评测)

针对 T2I-CompBench/GenEval 的局限(prompt 单一、CLIP 指标与人类判断脱节),提出 SSAE:收集 500 个多样 prompt,用 LLM 结构化语义点解析器抽取 3500 个关键点,归入 12 个细粒度字段;再用带 CoT 的 MLLM 对生成图做 0-1 匹配打分,计算 Mean Image Accuracy 与 Global Accuracy。

SSAE 评测

Figure 6:SSAE 评测结果——HunyuanImage 3.0 在所有细粒度字段上与领先模型持平。

6.2 GSB(Good/Same/Bad 人类评测)

1000 条平衡 prompt,每模型单次推理不 cherry-pick,100+ 专业评测者。

GSB 评测

Figure 7:GSB 评测结果。

  • 相对 HunyuanImage 2.1(此前最强开源)相对胜率 +14.10%,确立为最强开源文生图模型;
  • 相对 Seedream 4.0 / Nano Banana / GPT-Image 相对胜率 +1.17% / +2.64% / +5.00%——开源模型达到与领先闭源商业模型相当的水平。

6.3 专家激活分析(发现)

专家激活分析

Figure 8:左:专家的图像 token 偏好热图(越深越专于图像 token);右:各层图/文激活专家分布的 KL 散度——层越深散度越大,专家跨模态分化越明显。

随机选 1000 prompt 做文生图统计发现:专家逐渐专门化于各自模态,层越深图/文专家激活分布 KL 散度越大。说明 MoE 可通过将不同模态职责分散给专门专家来增强多模态建模。

七、总结

核心贡献

  1. 原生多模态统一框架:以 MoE LLM 为基座,在单一自回归序列内统一多模态理解与生成(类 Transfusion 嵌入扩散);
  2. 双编码器统一表示:拼接 VAE + vision encoder 特征,支持交错对话/生成/理解/编辑,无需切换流水线;
  3. 原生 CoT 图像生成:T2T + T2TI 数据激活自动化”思考-改写-生成”流程;
  4. 关键架构设计:16× 下采样 VAE、广义因果注意力、向后兼容的广义 2D RoPE、自动尺寸/比例 token;
  5. 系统训练与部署:四阶段渐进预训练 + SFT/DPO/MixGRPO/SRPO/ReDA 后训练;MeanFlow 蒸馏(NFE 4-8)+ TMP 剪枝(80B→20B,单卡 4090 部署);
  6. 最大开源图像生成模型:80B/13B-激活 MoE,GSB 上超越 HunyuanImage 2.1 并媲美 GPT-Image、Nano Banana 等闭源模型。

技术影响

HunyuanImage 3.0 验证了”以强 LLM 为基座、原生统一理解与生成”路线的可行性与优越性,将 CoT 推理引入图像生成,并开源了迄今最大的图像生成模型,为多模态生态提供了 SOTA 基础模型。

局限性

  • 当前仅发布文生图能力,图生图(编辑/ID 保持)训练进行中;
  • 80B 规模部署成本高(虽经蒸馏+剪枝可降至单卡 4090);
  • SSAE/GSB 为自研评测,与既有公开基准的横向可比性有待社区验证。

八、参考资源