Back to blog

Matrix-Game: Interactive World Foundation Model

首个17B参数的交互式世界基础模型,通过两阶段训练(无标签预训练+动作标注训练)实现Minecraft可控制视频生成,支持键盘/鼠标动作控制

Matrix-Game: Interactive World Foundation Model

一、论文概述

项目内容
标题Matrix-Game: Interactive World Foundation Model
作者Yifan Zhang, Chunli Peng, Boyang Wang, Puyi Wang, Qingcheng Zhu, Fei Kang, Biao Jiang, Zedong Gao, Eric Li, Yang Liu, Yahui Zhou
机构Skywork AI
论文https://arxiv.org/abs/2506.18701
代码https://github.com/SkyworkAI/Matrix-Game
项目页https://matrix-game-homepage.github.io
发布2025-06-24
许可未明确标注

二、核心思想

问题定义

交互式世界模型面临三大核心挑战:

  1. 训练数据稀缺:带动作标注的交互式视频数据集极其稀缺且标注成本高昂
  2. 物理动态建模困难:世界模型需要生成视觉一致的视频,同时准确响应结构化控制信号(键盘/鼠标)
  3. 缺乏统一评估基准:现有基准(如VBench、WorldScore)主要评估文本到视频生成,无法有效评估动作条件下的图像到世界生成

解决方案概述

Matrix-Game 是首个17B参数的交互式世界基础模型,专注于可控制游戏世界生成。核心创新:

  • Matrix-Game-MC数据集:2,700小时无标签Minecraft游戏视频 + 1,000+小时高质量动作标注视频
  • 两阶段训练流程:无标签预训练(游戏世界理解)→ 动作标注训练(交互式视频生成)
  • 图像到世界生成范式:以单张参考图像为条件,结合运动上下文和用户动作生成视频
  • GameWorld Score基准:统一评估视觉质量、时间质量、动作可控性和物理规则理解

Figure 1: Matrix-Game在不同Minecraft场景中的可控制世界生成结果

三、技术架构

整体框架

Figure 4: 交互式图像到世界生成范式概览

Matrix-Game采用图像到世界生成范式,在3D Causal VAE构建的时空压缩潜在空间中训练。参考图像通过视觉编码器处理作为主要条件输入,结合高斯噪声和用户动作,由Diffusion Transformer生成潜在表示,再通过3D VAE解码器解码为视频序列。

自回归生成

为支持长时间视频生成,Matrix-Game采用自回归策略:每个生成片段的最后k=5帧作为运动条件用于生成下一个片段。运动帧的潜在表示与噪声潜在表示沿通道维度拼接,并连接二进制掩码指示哪些帧包含有效运动信息。

抗误差累积策略:

  • 训练时以0.2概率对运动帧和参考图像添加高斯噪声
  • 以0.25概率对运动帧应用Classifier-Free Guidance(替换为无条件信号)

动作控制模块

Figure 6: DiT块细节

控制信号分为两类:

  • 键盘动作(离散编码):上、下、左、右、跳跃、攻击
  • 鼠标动作(连续标量):俯仰角变化

连续鼠标动作与输入潜在表示拼接后通过MLP处理,再经时间自注意力整合;离散键盘动作通过交叉注意力整合到扩散过程中。训练时以0.1概率对动作信号应用CFG。

模型架构细节

组件说明关键参数
3D Causal VAE时空压缩编码器/解码器空间压缩8倍,时间压缩4倍
MMDiT多模态Diffusion Transformer双流+单流混合架构
Visual Encoder参考图像编码器视觉特征提取
Control Module动作控制模块键盘交叉注意力 + 鼠标自注意力
自回归策略片段间衔接最后5帧作为运动条件

训练流程

Stage 1:无标签预训练(游戏世界理解)

  • 初始化:HunyuanVideo I2V预训练权重
  • 架构修改:将文本分支替换为图像分支,不包含动作控制模块
  • 数据:2,700小时720p Minecraft无标签视频
  • 训练设置:多样化帧数(17/33/65帧)和宽高比(16:9, 4:3, 21:9)
  • 精炼阶段:从相同数据集中筛选870小时高质量视频(稳定相机运动、干净UI、视觉清晰)

Stage 2:动作标注训练(交互式世界生成)

  • 架构:集成动作控制模块到MMDiT
  • 模型规模:17B参数
  • 数据:1,200小时720p 33帧动作标注视频(Minecraft + Unreal Engine)
  • 平衡数据集:8个Minecraft生物群系 + Unreal Engine程序化数据,约1,200小时65帧视频
  • 训练设置:固定720p分辨率,早阶段使用33帧,后阶段使用65帧

Matrix-Game-MC数据集

无标签数据收集:

  • 来源:MineDojo数据集,约6,000小时原始游戏录像
  • 场景分割:TransNet V2检测场景转换 + FFmpeg分割
  • 去除每段首尾4帧(避免渐变/不稳定相机伪影)

三级过滤流水线:

Figure 3: 数据过滤流水线

阶段过滤器说明
Stage 1视频质量过滤DOVER评估,按类型特定阈值
Stage 1美学过滤LAION预测器,自适应阈值
Stage 2菜单状态过滤IDM检测无玩家输入帧
Stage 2字幕过滤CRAFT文本检测,移除水印/横幅
Stage 2人脸过滤DeepFace检测,移除主播面部
Stage 3运动过滤GM-Flow光流,过滤过少/过多运动
Stage 3相机运动过滤IDM估计,过滤过度俯仰/偏航

标注数据创建:

  • 探索代理:MineRL平台 + 课程引导VPT代理,16Hz采样
  • Unreal程序化模拟:城市/沙漠/森林环境,精确动作标注
  • 14个Minecraft生物群系:森林、针叶林、沼泽、海洋、台地、高山、热带草原、平原、海滩、丛林、河流、沙漠、蘑菇岛、冰原

四、核心创新

创新点说明优势
图像到世界范式纯视觉条件,无文本偏置避免语言先验过拟合
两阶段训练无标签预训练 + 动作标注训练世界理解 → 交互生成
17B参数规模大规模模型容量更强的物理规则理解
自回归生成片段间运动帧衔接长时间连贯生成
动作控制模块键盘交叉注意力 + 鼠标自注意力精细粒度控制
GameWorld Score8维度统一基准全面评估世界模型

五、代码实现分析

项目结构

Matrix-Game/
├── README.md
├── matrix-game-homepage/      # 项目主页
├── models/                    # 模型权重
├── configs/                   # 配置文件
├── data/                      # 数据处理脚本
└── evaluation/                # GameWorld Score基准

模型规格

规格值
参数量17B
最大分辨率720p
帧率16 FPS
最大帧数65帧(约4秒)
支持动作键盘(6种)+ 鼠标(8方向)
推理步数50步(Flow Matching)
CFG比例6
训练策略FSDP + bf16混合精度

六、实验结果

GameWorld Score基准

Figure 7: GameWorld Score基准对比

模型图像质量↑美学↑时间一致性↑运动平滑↑键盘准确率↑鼠标准确率↑物体一致性↑场景一致性↑
Oasis0.650.480.940.980.770.560.560.86
MineWorld0.690.470.950.980.860.640.510.92
Matrix-Game0.720.490.970.980.950.950.760.93

Matrix-Game在所有8个维度上均达到最优,特别是在动作可控性(键盘95%、鼠标95%)和物理一致性(物体76%、场景93%)方面显著超越基线。

人工评估

Figure 8: 双盲人工评估结果

维度OasisMineWorldMatrix-Game
总体质量0.4%3.3%96.3%
可控性0.6%5.7%93.8%
视觉质量0.4%1.4%98.2%
时间一致性0.4%10.0%89.6%

双盲人工评估中,Matrix-Game在所有四个维度上获得压倒性优势(89.6%-98.2%胜率)。

动作可控性详细对比

模型前进后退左右跳跃攻击相机↑相机↓相机←相机→相机↖相机↗相机↙相机↘
Oasis0.850.780.800.790.770.890.660.550.330.350.560.530.450.51
MineWorld0.860.800.870.880.820.870.460.450.530.540.660.770.870.96
Matrix-Game0.990.910.920.960.880.950.910.980.890.900.920.970.980.98

Matrix-Game在所有动作类型上均达到88%以上准确率,前进(99%)、右(96%)、跳跃(88%)表现尤为突出。鼠标控制方面,所有方向均达到89%以上。

定性结果

Figure 12: 鼠标移动命令控制

Figure 13: 键盘动作控制

Figure 14: 复杂动作控制

Figure 15: Unreal Engine场景生成

七、相关工作

视频扩散模型

  • Sora:OpenAI视频生成模型
  • HunyuanVideo:腾讯视频生成模型
  • Wan:大规模视频生成模型
  • CogVideoX:专家Transformer视频扩散模型

可控视频生成

  • Direct-a-Video:相机运动控制(偏航/俯仰/缩放)
  • CameraCtrl:轨迹级相机引导
  • MotionCtrl:统一运动控制器
  • WorldMem:记忆引导的世界模型

游戏视频生成

  • OASIS:基于扩散的游戏世界模拟
  • MineWorld:Minecraft世界模型
  • GameGenX:游戏视频生成与可控性
  • Genie/Genie 2:可玩环境基础模型
  • GameFactory:生成式交互视频创建新游戏

Matrix-Game的差异化

  • 最大规模:17B参数,超越所有现有开源Minecraft世界模型
  • 最全面数据:2,700小时无标签 + 1,000+小时标注数据
  • 最强可控性:键盘95%、鼠标95%准确率
  • 统一基准:GameWorld Score 8维度评估

八、总结

核心贡献

  1. Matrix-Game-MC数据集:首个大规模Minecraft交互式视频数据集,包含2,700小时无标签数据和1,000+小时高质量动作标注数据
  2. 17B参数世界模型:首个如此规模的交互式世界基础模型,支持键盘/鼠标精细控制
  3. 两阶段训练流程:无标签预训练学习世界知识 → 动作标注训练实现交互生成
  4. GameWorld Score基准:统一评估视觉质量、时间质量、动作可控性和物理规则理解的8维度基准

技术影响

  • 交互式世界模型范式:证明大规模模型可以同时理解物理规则和响应精细控制
  • 游戏AI新方向:为游戏引擎、具身智能、自动驾驶提供新的世界模拟方法
  • 数据工程示范:三级过滤流水线为游戏视频数据处理提供可复用方案
  • 评估标准化:GameWorld Score为社区提供统一的评估框架

局限性

  1. 场景限制:当前仅支持Minecraft和Unreal Engine场景,泛化到其他游戏/真实世界有待验证
  2. 分辨率限制:最高支持720p,未探索更高分辨率生成
  3. 时间长度限制:单次生成最多65帧(约4秒),长时间生成依赖自回归拼接
  4. 动作空间有限:仅支持6种键盘动作和8方向鼠标控制,复杂交互(如放置方块、合成物品)未覆盖
  5. 训练资源需求:17B模型需要大量GPU资源进行训练和推理

九、参考资源

论文

相关工作

  • OASIS: 基于扩散的游戏世界模拟
  • MineWorld: Minecraft世界模型
  • HunyuanVideo: 腾讯视频生成模型(预训练权重来源)
  • GameFactory: 生成式交互视频
  • Genie 2: 可玩环境基础模型
  • GameWorld Score: 统一评估基准