Back to blog

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and

腾讯混元多模态3D世界模型:统一生成与重建

一、论文概述

项目内容
标题HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
作者Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang 等40+人
机构腾讯混元 (Tencent Hunyuan)
论文https://arxiv.org/abs/2604.14268
代码https://github.com/Tencent-Hunyuan/HY-World-2.0
主页https://3d-models.hunyuan.tencent.com/world/
发布2026-04-15
类别cs.CV (计算机视觉)

核心亮点

  • 首个开源系统性多模态世界模型:统一3D世界生成与重建
  • 四阶段流水线:全景生成 → 轨迹规划 → 世界扩展 → 世界合成
  • 多模态输入:文本、单视角图像、多视角图像、视频
  • 3DGS输出:生成高保真、可导航的3D高斯溅射场景
  • 与闭源模型Marble竞争力相当:开源方案中SOTA
  • 完全开源:所有模型权重、代码和技术细节

二、核心思想

问题定义

3D世界建模当前处于分裂状态:

  • 生成方法:从文本或单视角图像合成可探索场景,但难以保持严格重建精度
  • 重建方法:从多视角图像/视频恢复精确3D结构,但缺乏生成先验来幻觉未见区域
  • 闭源先驱(如Marble)已展示统一能力,但开源社区缺乏全面的多模态基础世界模型

解决方案概述

HY-World 2.0提出统一生成与重建的多模态世界模型:

  1. 稀疏输入(文本/单图)→ 世界生成:合成高保真、可导航的3DGS场景
  2. 密集输入(多视角/视频)→ 世界重建:恢复几何一致的精确3D结构
  3. 四阶段流水线:全景生成 → 轨迹规划 → 世界扩展 → 世界合成
  4. 每个组件全面升级:HY-Pano 2.0、WorldNav、WorldStereo 2.0、WorldMirror 2.0、WorldLens

应用示例

Figure 1: HY-World 2.0的多样化应用。框架统一了世界生成(从文本或单图合成3D世界)和世界重建(从多视角输入恢复3D表示),支持机器人仿真、游戏开发和环境建图等应用。

三、技术架构

3.1 整体框架

架构图

Figure 2: HY-World 2.0架构。四阶段流程:(1) 全景生成初始化世界,(2) 轨迹规划推导探索相机路径,(3) 记忆驱动的世界扩展,(4) 世界合成构建最终3DGS资产。

四阶段流水线:

阶段组件功能输入输出
Stage IHY-Pano 2.0全景生成文本/单图360°全景图
Stage IIWorldNav轨迹规划全景图多样化相机轨迹
Stage IIIWorldStereo 2.0世界扩展全景+轨迹多视角关键帧
Stage IVWorldMirror 2.0 + 3DGS世界合成多视角图像3DGS场景

3.2 Stage I: 全景生成 (HY-Pano 2.0)

全景生成

Figure 3: HY-Pano 2.0全景生成架构。左图展示流水线,右图展示圆形填充(潜在空间)和像素混合(像素空间)实现无缝全景生成。

核心创新:

  1. 隐式自适应映射:摒弃依赖显式相机内参的几何翘曲,采用Multi-Modal Diffusion Transformer (MMDiT)在统一潜在空间中学习透视到等距柱状投影(ERP)的变换
  2. 无缝边界处理:
    • 潜在空间圆形填充:在去噪过程中强制周期边界条件
    • 像素空间线性混合:沿等距柱状边缘平滑360°环绕过渡
  3. 数据策略:混合真实世界全景 + Unreal Engine合成数据,严格过滤低质量样本

数据组成:

  • 真实世界高分辨率全景:提供真实光照、复杂纹理和自然结构先验
  • 合成环境(UE渲染):提供精确几何标签和多样化场景配置

3.3 Stage II: 轨迹规划 (WorldNav)

轨迹模式

Figure 5: WorldNav规划的五种轨迹模式。

场景解析:

  1. 全景点云构建:基于MoGe2优化框架,从42个透视子视图对齐单目深度图(默认12→42采样密度)
  2. 语义解析:Qwen3-VL识别关键空间地标和障碍物,SAM3生成2D语义掩码
  3. 导航网格(NavMesh):使用Recast Navigation构建可遍历区域

Table 1: WorldNav轨迹详情

常规环绕重建感知漫游航拍总计
最大数量95103835
附着物体×✓✓×––
迭代式××✓××–

五种轨迹模式:

  1. 常规轨迹(Regular):均匀细分全景为3个120° FoV透视视图,轨道目标为中心点,俯仰+45°,方位偏移±120°
  2. 环绕轨迹(Surrounding):围绕最重要物体环绕,轨道半径自适应调整
  3. 重建感知轨迹(Recon-Aware):针对全景网格中拉伸和尖锐面(未充分观测区域),迭代轨道
  4. 漫游轨迹(Wandering):模拟自主智能体探索,目标为NavMesh中最远可达点
  5. 航拍轨迹(Aerial):俯仰+60°方位旋转,提供鸟瞰视角

3.4 Stage III: 世界扩展 (WorldStereo 2.0)

训练阶段

Figure 6: WorldStereo 2.0的三个训练阶段:渐进式实现相机控制、基于记忆的一致性和快速推理。

WorldStereo流水线

Figure 7: WorldStereo 2.0流水线。(a) 主Video DiT分支通过检索增强的空间立体记忆(SSM++)提升细粒度一致性。(b) 相机控制分支由全景点云引导,作为全局几何记忆(GGM)确保精确相机轨迹跟随。

Table 2: 不同视频生成方案对比

原生VDM自回归(AR)WorldStereo 2.0
感受野双向自回归双向
轨迹长度/数量长/单个长/单个中等/多个
一致性机制全局注意力隐式状态GGM + SSM++
关键帧空间Video-VAEVideo-VAEKeyframe-VAE

核心创新:

(1) Keyframe-VAE

Keyframe-VAE

Figure 9: Keyframe-VAE vs 标准Video-VAE。Video-VAE执行时空压缩,Keyframe-VAE仅执行空间压缩以更好保留高频细节并减少运动模糊和几何畸变。

  • 问题:标准Video-VAE的时空压缩导致快速相机运动时严重的质量退化(运动模糊、几何畸变)
  • 方案:Keyframe-VAE对每个关键帧独立应用因果填充图像编码,仅空间压缩无时间压缩
  • 优势:关键帧采样间隔增大以保持相同视角覆盖,同时实现更高保真度

(2) 全局几何记忆 (GGM)

  • 使用扩展点云渲染视频作为全局3D先验
  • 全景点云P^pan覆盖360°视角信息
  • 精细微调使VDM严格遵循3D表示(而非仅作软相机引导)
  • 鲁棒增强策略防止过拟合

(3) 空间立体记忆 (SSM++)

  • 离散检索参考视图,与对应目标视图空间拼接
  • 检索-目标对内约束注意力感受野
  • 修改RoPE:目标帧与检索视图沿水平轴拼接(宽度2W),检索视图继承配对目标帧的时间索引
  • 数据构建:时间错位检索(现有数据)和多轨迹检索(合成数据)

(4) 三阶段训练

阶段目标冻结层
Domain-Adaptation相机控制 + 关键帧空间交叉注意力+FFN
Middle-TrainingGGM + SSM++ 记忆机制部分DiT
Post-Train模型蒸馏加速推理—

3.5 Stage IV: 世界合成

WorldMirror 2.0

WorldMirror架构

Figure 12: WorldMirror 2.0架构。统一前馈模型,接受多视角图像及可选几何先验(相机位姿、内参、深度图),通过共享Transformer骨干和任务特定DPT解码头同时预测密集点云、深度图、表面法线、相机参数和3DGS。

WorldMirror 2.0改进:

改进项说明
归一化RoPE跨分辨率一致性>0.95,将位置外推转为内插
数据改进扩展训练数据规模和多样性
推理效率Token/帧序列并行、BF16、FSDP
训练策略改进的优化目标和课程学习
深度对齐将WorldMirror深度与全景点云对齐

3DGS优化

  • 定制增强:加强生成视图上的3DGS训练
  • 弥合3D重建与生成世界建模的差距
  • WorldLens渲染平台:灵活引擎无关架构、自动IBL光照、高效碰撞检测

3.6 推理流水线时间

Table 10: 推理时间分解(NVIDIA H20 GPU)

阶段全景轨迹规划世界扩展重建对齐3DGS总计
时间(秒)15s182s286s102s127s712s

四、核心创新总结

创新点说明效果
统一生成与重建首个开源系统性统一3D世界生成与重建的多模态模型填补开源社区空白
Keyframe-VAE仅空间压缩的潜在空间,无时间压缩消除运动模糊和几何畸变
GGM + SSM++全局几何记忆 + 空间立体记忆双机制跨轨迹帧一致性
归一化RoPE跨分辨率位置编码归一化一致性>0.95,支持多分辨率推理
WorldNav5种启发式轨迹模式,35条轨迹最大化视角覆盖+碰撞避免
HY-Pano 2.0隐式自适应映射+无缝边界处理无需相机内参的全景生成
深度对齐WorldMirror深度与全景点云对齐消除尺度模糊

五、实验结果

5.1 世界生成(从文本/单图)

整体结果

Figure 21: 整体世界生成流水线结果。每场景两行:上行依次为生成全景、对齐点云、溅射全局概览、提取粗网格;下行展示不同视角的渲染新视图。

点云和3DGS对比

Figure 20: 与video2world的点云和3DGS对比。两种方法均在WorldStereo 2.0生成的300张图像内评估。

5.2 与Marble对比

Marble对比1

Figure 23: 使用相同全景输入与Marble对比。HY-World 2.0在输入条件保真度、纹理清晰度和跨视角几何一致性方面更优。

Marble对比2

Figure 24: 使用相同输入图像与Marble对比。HY-World 2.0更好地遵循输入视图,同时在3DGS中实现相当质量和更优完整性。

5.3 世界重建(从多视角/视频)

Table 11: 点图重建(7-Scenes, NRGBD, DTU)

方法7-Scenes Acc.↓7-Scenes Comp.↓NRGBD Acc.↓NRGBD Comp.↓DTU Acc.↓DTU Comp.↓
Fast3R0.0960.1450.1350.1633.3402.929
CUT3R0.0940.1010.1040.0794.7423.400
VGGT0.0460.0570.0510.0661.3381.896
π³0.0480.0720.0260.0281.1981.849
WorldMirror 2.0 (M+all)0.0130.0170.0130.0130.6900.876

Table 12: 相机位姿和深度估计(RealEstate10K)

方法AUC@30↑RTA@30↑AbsRel↓δ<1.25↑
Fast3R61.6881.860.3530.666
CUT3R81.4795.100.2600.704
VGGT77.6293.130.2560.789
π³85.9095.620.1510.805
WorldMirror 2.0 (H)86.8995.340.1620.815

新视图合成(RealEstate10K + DL3DV)

方法PSNR↑SSIM↑LPIPS↓
FLARE15.840.5450.500
AnySplat18.570.6260.255
WorldMirror 1.0 (M)21.340.7090.181
WorldMirror 2.0———

Table 13: 表面法线估计(ScanNet, NYUv2, iBims-1)

方法ScanNet mean↓NYUv2 mean↓iBims-1 mean↓
Omnidata v216.217.218.2
DSine16.216.417.1
StableNormal16.018.517.9
WorldMirror 2.0 (M)12.313.914.2

5.4 WorldMirror 1.0 vs 2.0

WorldMirror对比

Figure 25: WorldMirror 1.0和2.0的视觉对比。WorldMirror 2.0产生更精确的法线,具有更细的结构细节和更一致的多视角点云。

5.5 推理效率

Table 14: WorldMirror 2.0推理效率(518×378分辨率)

配置GPU数32视图 Mem/Time64视图 Mem/Time128视图 Mem/Time256视图 Mem/Time
Baseline (FP32)124.95GB/2.45s38.56GB/6.27s59.26GB/18.00sOOM
+ BF16115.10GB/2.11s25.06GB/5.65s41.73GB/16.96s75.05GB/56.96s
+ SP+BF16415.81GB/0.96s26.44GB/2.21s44.47GB/5.65s80.54GB/17.69s
+ SP+BF16+FSDP414.04GB/0.93s24.67GB/2.20s42.71GB/5.60s78.78GB/17.52s

六、与现有方法对比

方法生成重建输入模态开源3DGS特点
HY-World 1.0✓×文本/单图✓✓离线3D生成
HY-World 1.5✓×视频✓×在线视频生成
Marble✓✓多模态×✓闭源商业
video2world✓×视频✓×视频到世界
HY-World 2.0✓✓多模态✓✓统一生成与重建

七、WorldLens渲染平台

WorldLens是一个高性能3DGS渲染平台,特性包括:

  • 灵活引擎无关架构:支持不同渲染后端
  • 自动IBL光照:基于图像的光照自动设置
  • 高效碰撞检测:支持物理交互
  • 训练-渲染协同设计:优化训练和渲染的一致性
  • 角色支持:可在3D世界中放置虚拟角色
  • 交互式探索:实时导航复杂几何结构(楼梯、室内布局)

交互探索

Figure 22: 在生成的3D世界中交互探索。用户可控制虚拟代理导航复杂几何结构,具有实时碰撞检测和物理可信反馈。

八、总结

核心贡献

  1. 首个开源系统性多模态世界模型:统一3D世界生成与重建
  2. 四阶段流水线:全景生成→轨迹规划→世界扩展→世界合成,每个组件全面升级
  3. Keyframe-VAE:仅空间压缩的潜在空间,消除Video-VAE的时空压缩伪影
  4. GGM + SSM++双记忆机制:全局几何一致性 + 局部细粒度细节
  5. 归一化RoPE:跨分辨率位置编码,支持多分辨率推理
  6. WorldNav轨迹规划:5种启发式模式,35条轨迹最大化覆盖
  7. WorldMirror 2.0:统一前馈3D重建,同时预测点云/深度/法线/相机/3DGS
  8. WorldLens渲染平台:交互式3D世界探索

技术影响

  • 开源3D世界建模:为开源社区提供与闭源商业模型竞争力相当的方案
  • 生成与重建统一:打破3D世界建模的分裂状态
  • 多模态基础模型:支持文本、单图、多视角、视频等多种输入
  • 下游应用:机器人仿真、游戏开发、环境建图、VR/AR

局限性

  1. 推理时间:完整流水线约712秒(~12分钟),实时应用仍有挑战
  2. 计算资源:WorldMirror 2.0在256视图高分辨率下需要多GPU
  3. 全景质量依赖:后续阶段质量受限于Stage I全景生成的保真度
  4. 动态场景:主要针对静态场景,动态物体处理未充分探索
  5. 大规模场景:超大场景(如城市级别)的可扩展性待验证

九、参考资源