Back to blog

JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation

统一多模态基础模型,融合空间增强 MLLM 与 MMDiT,实现理解/生成/编辑一体化,支持空间推理

JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation

一、论文概述

项目内容
标题JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
作者Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang 等
机构京东探索研究院 (JD AI Research)
论文arXiv:2605.04128
代码github.com/jd-opensource/JoyAI-Image
发布2026-05-05 (v1), 2026-05-20 (v2)
许可arXiv 非独占分发许可

二、核心思想

问题定义

当前统一多模态模型面临两大核心挑战:

  1. 理解-生成交互弱:视觉理解未充分利用来指导生成和编辑,生成变换也很少为感知和推理提供反馈
  2. 缺乏空间智能:现有模型缺乏对物理世界的强空间理解能力,无法处理物体布局、相对几何、相机视角等空间属性

核心需求:构建一个真正理解 3D 空间结构的统一视觉基础模型,实现理解、生成、编辑的双向增强。

解决方案概述

JoyAI-Image 提出了一个空间增强的统一多模态框架,核心创新包括:

  1. 空间增强 MLLM:基于 Qwen3-VL-8B 构建,通过 OpenSpatial 引擎和 3M 数据增强空间推理能力
  2. 统一 MMDiT 架构:16B 参数的多模态扩散 Transformer,同时处理理解和生成
  3. Thinking with Novel Views (TwNV):利用生成的新视角增强空间推理,形成理解-生成-推理闭环

三、技术架构

整体框架图

JoyAI-Image架构

JoyAI-Image 的架构遵循三阶段流程:

JoyAI-Image Architecture
├── Stage 1: Multimodal Understanding (MLLM)
│   ├── Input: Image + Text
│   ├── Base: Qwen3-VL-8B-Instruct
│   ├── Enhancement: OpenSpatial (3M QA pairs)
│   └── Output: Semantic representations
├── Stage 2: Latent Encoding (VAE)
│   ├── Model: Wan-2.1-VAE
│   ├── Type: Causal 3D convolutions
│   └── Output: Compact latent representations
└── Stage 3: Conditional Generation (MMDiT)
    ├── Parameters: 16B
    ├── Architecture: Dual-stream diffusion
    ├── Input: MLLM priors + Noise
    └── Output: Generated/Edited images

核心组件

组件说明关键参数
MLLM空间增强的多模态大语言模型Qwen3-VL-8B, OpenSpatial-3M 数据
VAE潜在编码器Wan-2.1-VAE, 因果 3D 卷积
MMDiT多模态扩散 Transformer16B 参数, 40 层, 4096 维
OpenSpatial空间数据引擎3M QA pairs, 5 类空间能力

MMDiT 超参数

参数值参数值
Input/Output Dim16Attention Heads32
Patch Size1×2×2Modulation TypeWanX
Number of Layers40Position EmbeddingMRoPE
Hidden Dim4096RoPE Base θ10,000
Text Hidden Dim4096RoPE Dim List[16, 56, 56]

核心公式

Flow Matching 目标函数:

L=Et,z0,z1,y[∥fθ(zt,y,t)−(z1−z0)∥2]\mathcal{L} = \mathbb{E}_{t, z_0, z_1, y} \left[ \| f_\theta(z_t, y, t) - (z_1 - z_0) \|^2 \right]

其中:

  • z1z_1:图像潜在表示(通过 WanVAE 编码)
  • z0∼N(0,I)z_0 \sim \mathcal{N}(0, I):高斯噪声
  • zt=tz1+(1−t)z0z_t = t z_1 + (1-t) z_0:线性插值
  • yy:文本条件

空间理解训练目标:

L=LSFT+λ⋅LKL\mathcal{L} = \mathcal{L}_{\text{SFT}} + \lambda \cdot \mathcal{L}_{\text{KL}}

其中 LKL\mathcal{L}_{\text{KL}} 是层平均 KL 散度,仅应用于通用数据集以保留预训练能力。

OpenSpatial 数据引擎

OpenSpatial引擎

OpenSpatial 是一个自动化数据合成引擎,核心特点:

  • 3D 升级机制:将网络视频转换为高保真 3D 训练数据
  • 5 类空间能力:空间测量 (SM)、空间关系 (SR)、相机感知 (CP)、多视图一致性 (MC)、场景感知推理 (SAR)
  • 19 个子任务:覆盖完整的空间理解能力谱

OpenSpatial数据集

OpenSpatial-3M 数据集:300 万条空间理解样本,来源于:

  • 3D 室内扫描(ScanNet, Matterport3D, ARKitScenes, ScanNet++, Hypersim)
  • 网络视频的 3D 升级
  • 合成渲染数据

空间理解训练

训练策略:

  • 基于 Qwen3-VL-8B-Instruct 全参数微调
  • 动态序列打包:减少 padding 浪费
  • 解耦学习率:视觉编码器较小更新率
  • 在线知识蒸馏:保留预训练能力

三层评估体系:

  • Level 1: 2D 语义感知(MMBench, MMStar, OCRB, MathVista)
  • Level 2: 3D 空间理解(BLINK, CV-3D, 3DSR, MMSI, RealWorldQA)
  • Level 3: 4D 时空推理(VSI-Bench, AllAnglesBench)

图像生成

文本渲染

数据处理流程:

  1. 数据过滤:多阶段质量过滤,逐步提高准入阈值
  2. 图像描述:多级文本描述生成
  3. 分布重平衡:基于语义分类纠正长尾分布偏差
  4. 人工标注:细粒度质量标准
  5. 多视图生成:百万级 Blender 渲染多视图语料

预训练阶段:

  • 低分辨率 (208P) → 中分辨率 (512P) → 高分辨率 (1024P)
  • 高分辨率阶段引入多视图数据支持空间编辑

图像编辑

JoyAI-Image-Edit:

  • 基于 MMDiT 架构
  • 融合文本条件、源图像条件、噪声潜在输入
  • 支持空间编辑:相机变换、几何变换

编辑数据分布:

  • 开域编辑:~50%
  • 空间编辑:~30%(相机、旋转、物体移动)
  • 专业编辑:~20%(文本渲染、IP 保持、局部修改)

Thinking with Novel Views (TwNV)

TwNV流程

TwNV 是本文的核心创新,形成理解-生成-推理闭环:

TwNV Pipeline:
Input Image I₀ + Spatial Question Q
    ↓
MLLM Planner → 6-DOF Camera Motion Instruction
    ↓
Synthesizer → Novel View I₁
    ↓
MLLM Reasoner → Answer over {I₀, I₁}

关键发现:

  • JoyAI-Image-Edit 作为 Synthesizer 时,相对提升 4.2%(使用 GPT-5 Reasoner)
  • 跨 Reasoner 泛化:对 Qwen3-VL-32B 提升 7.8%

四、核心创新

创新点说明理论/实验依据
OpenSpatial 引擎自动化 3D 空间数据合成,从网络视频生成训练数据3M QA pairs, 19 子任务
空间增强 MLLM通过专用数据和训练增强空间推理能力三层评估体系
统一 MMDiT16B 参数同时处理理解和生成表 1 超参数
TwNV 范式利用生成新视角增强空间推理,形成闭环表 14 提升 4.2-7.8%
双语长文本渲染英文和中文长文本生成均达 0.963LongText-Bench 结果

五、实验结果

空间理解评估

三层评估结果(部分关键指标):

基准测试LevelJoyAI-Image对比模型
MMBenchL1竞争力SOTA
MMStarL1竞争力SOTA
BLINKL2竞争力SOTA
3DSRL2竞争力SOTA
VSI-BenchL3竞争力SOTA
AllAnglesBenchL3竞争力SOTA

图像生成评估

LongText-Bench 结果:

模型ENZH
JoyAI-Image0.9630.963
对比模型0.8xx0.8xx

关键发现:

  • 双语长文本渲染均达 0.963,超越现有方法
  • 英文和中文性能一致,无语言差距

图像编辑评估

GEdit 基准:

  • 指令遵循:强
  • 语义一致性:强
  • 内容保持:强

SpatialEdit-Bench:

  • 物体中心操作:强
  • 相机视角控制:强

人类评估:JoyAI-Image-Edit 在多个编辑维度上超越竞争模型

Thinking with Novel Views 评估

EditorOrient.Loc.Multi-Obj.Overall相对提升
None (w/o NV)63.680.960.568.8-
Qwen-Image-Edit61.877.861.567.4-2.0%
Nano Banana Pro60.983.063.669.5+1.0%
JoyAI-Image-Edit65.382.666.271.7+4.2%

六、消融实验

空间训练消融

  • OpenSpatial-3M 数据显著提升空间理解能力
  • 知识蒸馏保留预训练能力
  • 解耦学习率优化训练稳定性

编辑数据消融

  • 空间编辑数据占比 ~30% 提升几何变换能力
  • 开域编辑数据保持通用编辑能力
  • 专业编辑数据处理长尾场景

七、相关工作

工作关系差异
Qwen-Image基础 MLLMJoyAI-Image 增强空间能力
FLUX扩散模型JoyAI-Image 统一理解-生成
InstructPix2Pix编辑模型JoyAI-Image 支持空间编辑
ScanNet3D 数据JoyAI-Image 从 2D 视频合成 3D 数据

八、总结

核心贡献

  1. OpenSpatial 引擎:自动化 3D 空间数据合成,从网络视频生成 3M 训练数据
  2. 空间增强 MLLM:通过专用数据和训练增强空间推理能力
  3. 统一 MMDiT 架构:16B 参数同时处理理解和生成
  4. TwNV 范式:利用生成新视角增强空间推理,形成理解-生成-推理闭环
  5. 双语长文本渲染:英文和中文均达 0.963
  6. 开源:提供代码和模型检查点

技术影响

  • 空间智能:为统一视觉模型注入空间理解能力
  • 闭环推理:理解-生成-推理的双向增强
  • 下游应用:视觉-语言-动作系统、机器人、世界模型
  • 多模态统一:推动从通用能力到空间智能的演进

局限性

  • 计算成本:16B MMDiT 需要大量计算资源
  • 3D 数据依赖:OpenSpatial 引擎依赖 3D 扫描数据
  • 编辑质量:复杂场景编辑仍有提升空间
  • 推理速度:扩散模型生成速度较慢

九、参考资源