HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and
腾讯混元多模态3D世界模型:统一生成与重建
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds |
| 作者 | Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang 等40+人 |
| 机构 | 腾讯混元 (Tencent Hunyuan) |
| 论文 | https://arxiv.org/abs/2604.14268 |
| 代码 | https://github.com/Tencent-Hunyuan/HY-World-2.0 |
| 主页 | https://3d-models.hunyuan.tencent.com/world/ |
| 发布 | 2026-04-15 |
| 类别 | cs.CV (计算机视觉) |
核心亮点
- 首个开源系统性多模态世界模型:统一3D世界生成与重建
- 四阶段流水线:全景生成 → 轨迹规划 → 世界扩展 → 世界合成
- 多模态输入:文本、单视角图像、多视角图像、视频
- 3DGS输出:生成高保真、可导航的3D高斯溅射场景
- 与闭源模型Marble竞争力相当:开源方案中SOTA
- 完全开源:所有模型权重、代码和技术细节
二、核心思想
问题定义
3D世界建模当前处于分裂状态:
- 生成方法:从文本或单视角图像合成可探索场景,但难以保持严格重建精度
- 重建方法:从多视角图像/视频恢复精确3D结构,但缺乏生成先验来幻觉未见区域
- 闭源先驱(如Marble)已展示统一能力,但开源社区缺乏全面的多模态基础世界模型
解决方案概述
HY-World 2.0提出统一生成与重建的多模态世界模型:
- 稀疏输入(文本/单图)→ 世界生成:合成高保真、可导航的3DGS场景
- 密集输入(多视角/视频)→ 世界重建:恢复几何一致的精确3D结构
- 四阶段流水线:全景生成 → 轨迹规划 → 世界扩展 → 世界合成
- 每个组件全面升级:HY-Pano 2.0、WorldNav、WorldStereo 2.0、WorldMirror 2.0、WorldLens

Figure 1: HY-World 2.0的多样化应用。框架统一了世界生成(从文本或单图合成3D世界)和世界重建(从多视角输入恢复3D表示),支持机器人仿真、游戏开发和环境建图等应用。
三、技术架构
3.1 整体框架

Figure 2: HY-World 2.0架构。四阶段流程:(1) 全景生成初始化世界,(2) 轨迹规划推导探索相机路径,(3) 记忆驱动的世界扩展,(4) 世界合成构建最终3DGS资产。
四阶段流水线:
| 阶段 | 组件 | 功能 | 输入 | 输出 |
|---|---|---|---|---|
| Stage I | HY-Pano 2.0 | 全景生成 | 文本/单图 | 360°全景图 |
| Stage II | WorldNav | 轨迹规划 | 全景图 | 多样化相机轨迹 |
| Stage III | WorldStereo 2.0 | 世界扩展 | 全景+轨迹 | 多视角关键帧 |
| Stage IV | WorldMirror 2.0 + 3DGS | 世界合成 | 多视角图像 | 3DGS场景 |
3.2 Stage I: 全景生成 (HY-Pano 2.0)

Figure 3: HY-Pano 2.0全景生成架构。左图展示流水线,右图展示圆形填充(潜在空间)和像素混合(像素空间)实现无缝全景生成。
核心创新:
- 隐式自适应映射:摒弃依赖显式相机内参的几何翘曲,采用Multi-Modal Diffusion Transformer (MMDiT)在统一潜在空间中学习透视到等距柱状投影(ERP)的变换
- 无缝边界处理:
- 潜在空间圆形填充:在去噪过程中强制周期边界条件
- 像素空间线性混合:沿等距柱状边缘平滑360°环绕过渡
- 数据策略:混合真实世界全景 + Unreal Engine合成数据,严格过滤低质量样本
数据组成:
- 真实世界高分辨率全景:提供真实光照、复杂纹理和自然结构先验
- 合成环境(UE渲染):提供精确几何标签和多样化场景配置
3.3 Stage II: 轨迹规划 (WorldNav)

Figure 5: WorldNav规划的五种轨迹模式。
场景解析:
- 全景点云构建:基于MoGe2优化框架,从42个透视子视图对齐单目深度图(默认12→42采样密度)
- 语义解析:Qwen3-VL识别关键空间地标和障碍物,SAM3生成2D语义掩码
- 导航网格(NavMesh):使用Recast Navigation构建可遍历区域
Table 1: WorldNav轨迹详情
| 常规 | 环绕 | 重建感知 | 漫游 | 航拍 | 总计 | |
|---|---|---|---|---|---|---|
| 最大数量 | 9 | 5 | 10 | 3 | 8 | 35 |
| 附着物体 | × | ✓ | ✓ | × | – | – |
| 迭代式 | × | × | ✓ | × | × | – |
五种轨迹模式:
- 常规轨迹(Regular):均匀细分全景为3个120° FoV透视视图,轨道目标为中心点,俯仰+45°,方位偏移±120°
- 环绕轨迹(Surrounding):围绕最重要物体环绕,轨道半径自适应调整
- 重建感知轨迹(Recon-Aware):针对全景网格中拉伸和尖锐面(未充分观测区域),迭代轨道
- 漫游轨迹(Wandering):模拟自主智能体探索,目标为NavMesh中最远可达点
- 航拍轨迹(Aerial):俯仰+60°方位旋转,提供鸟瞰视角
3.4 Stage III: 世界扩展 (WorldStereo 2.0)

Figure 6: WorldStereo 2.0的三个训练阶段:渐进式实现相机控制、基于记忆的一致性和快速推理。

Figure 7: WorldStereo 2.0流水线。(a) 主Video DiT分支通过检索增强的空间立体记忆(SSM++)提升细粒度一致性。(b) 相机控制分支由全景点云引导,作为全局几何记忆(GGM)确保精确相机轨迹跟随。
Table 2: 不同视频生成方案对比
| 原生VDM | 自回归(AR) | WorldStereo 2.0 | |
|---|---|---|---|
| 感受野 | 双向 | 自回归 | 双向 |
| 轨迹长度/数量 | 长/单个 | 长/单个 | 中等/多个 |
| 一致性机制 | 全局注意力 | 隐式状态 | GGM + SSM++ |
| 关键帧空间 | Video-VAE | Video-VAE | Keyframe-VAE |
核心创新:
(1) Keyframe-VAE

Figure 9: Keyframe-VAE vs 标准Video-VAE。Video-VAE执行时空压缩,Keyframe-VAE仅执行空间压缩以更好保留高频细节并减少运动模糊和几何畸变。
- 问题:标准Video-VAE的时空压缩导致快速相机运动时严重的质量退化(运动模糊、几何畸变)
- 方案:Keyframe-VAE对每个关键帧独立应用因果填充图像编码,仅空间压缩无时间压缩
- 优势:关键帧采样间隔增大以保持相同视角覆盖,同时实现更高保真度
(2) 全局几何记忆 (GGM)
- 使用扩展点云渲染视频作为全局3D先验
- 全景点云P^pan覆盖360°视角信息
- 精细微调使VDM严格遵循3D表示(而非仅作软相机引导)
- 鲁棒增强策略防止过拟合
(3) 空间立体记忆 (SSM++)
- 离散检索参考视图,与对应目标视图空间拼接
- 检索-目标对内约束注意力感受野
- 修改RoPE:目标帧与检索视图沿水平轴拼接(宽度2W),检索视图继承配对目标帧的时间索引
- 数据构建:时间错位检索(现有数据)和多轨迹检索(合成数据)
(4) 三阶段训练
| 阶段 | 目标 | 冻结层 |
|---|---|---|
| Domain-Adaptation | 相机控制 + 关键帧空间 | 交叉注意力+FFN |
| Middle-Training | GGM + SSM++ 记忆机制 | 部分DiT |
| Post-Train | 模型蒸馏加速推理 | — |
3.5 Stage IV: 世界合成
WorldMirror 2.0

Figure 12: WorldMirror 2.0架构。统一前馈模型,接受多视角图像及可选几何先验(相机位姿、内参、深度图),通过共享Transformer骨干和任务特定DPT解码头同时预测密集点云、深度图、表面法线、相机参数和3DGS。
WorldMirror 2.0改进:
| 改进项 | 说明 |
|---|---|
| 归一化RoPE | 跨分辨率一致性>0.95,将位置外推转为内插 |
| 数据改进 | 扩展训练数据规模和多样性 |
| 推理效率 | Token/帧序列并行、BF16、FSDP |
| 训练策略 | 改进的优化目标和课程学习 |
| 深度对齐 | 将WorldMirror深度与全景点云对齐 |
3DGS优化
- 定制增强:加强生成视图上的3DGS训练
- 弥合3D重建与生成世界建模的差距
- WorldLens渲染平台:灵活引擎无关架构、自动IBL光照、高效碰撞检测
3.6 推理流水线时间
Table 10: 推理时间分解(NVIDIA H20 GPU)
| 阶段 | 全景 | 轨迹规划 | 世界扩展 | 重建对齐 | 3DGS | 总计 |
|---|---|---|---|---|---|---|
| 时间(秒) | 15s | 182s | 286s | 102s | 127s | 712s |
四、核心创新总结
| 创新点 | 说明 | 效果 |
|---|---|---|
| 统一生成与重建 | 首个开源系统性统一3D世界生成与重建的多模态模型 | 填补开源社区空白 |
| Keyframe-VAE | 仅空间压缩的潜在空间,无时间压缩 | 消除运动模糊和几何畸变 |
| GGM + SSM++ | 全局几何记忆 + 空间立体记忆双机制 | 跨轨迹帧一致性 |
| 归一化RoPE | 跨分辨率位置编码归一化 | 一致性>0.95,支持多分辨率推理 |
| WorldNav | 5种启发式轨迹模式,35条轨迹 | 最大化视角覆盖+碰撞避免 |
| HY-Pano 2.0 | 隐式自适应映射+无缝边界处理 | 无需相机内参的全景生成 |
| 深度对齐 | WorldMirror深度与全景点云对齐 | 消除尺度模糊 |
五、实验结果
5.1 世界生成(从文本/单图)

Figure 21: 整体世界生成流水线结果。每场景两行:上行依次为生成全景、对齐点云、溅射全局概览、提取粗网格;下行展示不同视角的渲染新视图。

Figure 20: 与video2world的点云和3DGS对比。两种方法均在WorldStereo 2.0生成的300张图像内评估。
5.2 与Marble对比

Figure 23: 使用相同全景输入与Marble对比。HY-World 2.0在输入条件保真度、纹理清晰度和跨视角几何一致性方面更优。

Figure 24: 使用相同输入图像与Marble对比。HY-World 2.0更好地遵循输入视图,同时在3DGS中实现相当质量和更优完整性。
5.3 世界重建(从多视角/视频)
Table 11: 点图重建(7-Scenes, NRGBD, DTU)
| 方法 | 7-Scenes Acc.↓ | 7-Scenes Comp.↓ | NRGBD Acc.↓ | NRGBD Comp.↓ | DTU Acc.↓ | DTU Comp.↓ |
|---|---|---|---|---|---|---|
| Fast3R | 0.096 | 0.145 | 0.135 | 0.163 | 3.340 | 2.929 |
| CUT3R | 0.094 | 0.101 | 0.104 | 0.079 | 4.742 | 3.400 |
| VGGT | 0.046 | 0.057 | 0.051 | 0.066 | 1.338 | 1.896 |
| π³ | 0.048 | 0.072 | 0.026 | 0.028 | 1.198 | 1.849 |
| WorldMirror 2.0 (M+all) | 0.013 | 0.017 | 0.013 | 0.013 | 0.690 | 0.876 |
Table 12: 相机位姿和深度估计(RealEstate10K)
| 方法 | AUC@30↑ | RTA@30↑ | AbsRel↓ | δ<1.25↑ |
|---|---|---|---|---|
| Fast3R | 61.68 | 81.86 | 0.353 | 0.666 |
| CUT3R | 81.47 | 95.10 | 0.260 | 0.704 |
| VGGT | 77.62 | 93.13 | 0.256 | 0.789 |
| π³ | 85.90 | 95.62 | 0.151 | 0.805 |
| WorldMirror 2.0 (H) | 86.89 | 95.34 | 0.162 | 0.815 |
新视图合成(RealEstate10K + DL3DV)
| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|
| FLARE | 15.84 | 0.545 | 0.500 |
| AnySplat | 18.57 | 0.626 | 0.255 |
| WorldMirror 1.0 (M) | 21.34 | 0.709 | 0.181 |
| WorldMirror 2.0 | — | — | — |
Table 13: 表面法线估计(ScanNet, NYUv2, iBims-1)
| 方法 | ScanNet mean↓ | NYUv2 mean↓ | iBims-1 mean↓ |
|---|---|---|---|
| Omnidata v2 | 16.2 | 17.2 | 18.2 |
| DSine | 16.2 | 16.4 | 17.1 |
| StableNormal | 16.0 | 18.5 | 17.9 |
| WorldMirror 2.0 (M) | 12.3 | 13.9 | 14.2 |
5.4 WorldMirror 1.0 vs 2.0

Figure 25: WorldMirror 1.0和2.0的视觉对比。WorldMirror 2.0产生更精确的法线,具有更细的结构细节和更一致的多视角点云。
5.5 推理效率
Table 14: WorldMirror 2.0推理效率(518×378分辨率)
| 配置 | GPU数 | 32视图 Mem/Time | 64视图 Mem/Time | 128视图 Mem/Time | 256视图 Mem/Time |
|---|---|---|---|---|---|
| Baseline (FP32) | 1 | 24.95GB/2.45s | 38.56GB/6.27s | 59.26GB/18.00s | OOM |
| + BF16 | 1 | 15.10GB/2.11s | 25.06GB/5.65s | 41.73GB/16.96s | 75.05GB/56.96s |
| + SP+BF16 | 4 | 15.81GB/0.96s | 26.44GB/2.21s | 44.47GB/5.65s | 80.54GB/17.69s |
| + SP+BF16+FSDP | 4 | 14.04GB/0.93s | 24.67GB/2.20s | 42.71GB/5.60s | 78.78GB/17.52s |
六、与现有方法对比
| 方法 | 生成 | 重建 | 输入模态 | 开源 | 3DGS | 特点 |
|---|---|---|---|---|---|---|
| HY-World 1.0 | ✓ | × | 文本/单图 | ✓ | ✓ | 离线3D生成 |
| HY-World 1.5 | ✓ | × | 视频 | ✓ | × | 在线视频生成 |
| Marble | ✓ | ✓ | 多模态 | × | ✓ | 闭源商业 |
| video2world | ✓ | × | 视频 | ✓ | × | 视频到世界 |
| HY-World 2.0 | ✓ | ✓ | 多模态 | ✓ | ✓ | 统一生成与重建 |
七、WorldLens渲染平台
WorldLens是一个高性能3DGS渲染平台,特性包括:
- 灵活引擎无关架构:支持不同渲染后端
- 自动IBL光照:基于图像的光照自动设置
- 高效碰撞检测:支持物理交互
- 训练-渲染协同设计:优化训练和渲染的一致性
- 角色支持:可在3D世界中放置虚拟角色
- 交互式探索:实时导航复杂几何结构(楼梯、室内布局)

Figure 22: 在生成的3D世界中交互探索。用户可控制虚拟代理导航复杂几何结构,具有实时碰撞检测和物理可信反馈。
八、总结
核心贡献
- 首个开源系统性多模态世界模型:统一3D世界生成与重建
- 四阶段流水线:全景生成→轨迹规划→世界扩展→世界合成,每个组件全面升级
- Keyframe-VAE:仅空间压缩的潜在空间,消除Video-VAE的时空压缩伪影
- GGM + SSM++双记忆机制:全局几何一致性 + 局部细粒度细节
- 归一化RoPE:跨分辨率位置编码,支持多分辨率推理
- WorldNav轨迹规划:5种启发式模式,35条轨迹最大化覆盖
- WorldMirror 2.0:统一前馈3D重建,同时预测点云/深度/法线/相机/3DGS
- WorldLens渲染平台:交互式3D世界探索
技术影响
- 开源3D世界建模:为开源社区提供与闭源商业模型竞争力相当的方案
- 生成与重建统一:打破3D世界建模的分裂状态
- 多模态基础模型:支持文本、单图、多视角、视频等多种输入
- 下游应用:机器人仿真、游戏开发、环境建图、VR/AR
局限性
- 推理时间:完整流水线约712秒(~12分钟),实时应用仍有挑战
- 计算资源:WorldMirror 2.0在256视图高分辨率下需要多GPU
- 全景质量依赖:后续阶段质量受限于Stage I全景生成的保真度
- 动态场景:主要针对静态场景,动态物体处理未充分探索
- 大规模场景:超大场景(如城市级别)的可扩展性待验证
九、参考资源
- 论文: https://arxiv.org/abs/2604.14268
- 代码: https://github.com/Tencent-Hunyuan/HY-World-2.0
- 主页: https://3d-models.hunyuan.tencent.com/world/
- HY-World 1.0: 前代离线3D世界生成
- HY-World 1.5: 前代在线视频世界生成
- Marble: 闭源竞品(可比较)