Matrix-Game: Interactive World Foundation Model
首个17B参数的交互式世界基础模型,通过两阶段训练(无标签预训练+动作标注训练)实现Minecraft可控制视频生成,支持键盘/鼠标动作控制
Matrix-Game: Interactive World Foundation Model
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | Matrix-Game: Interactive World Foundation Model |
| 作者 | Yifan Zhang, Chunli Peng, Boyang Wang, Puyi Wang, Qingcheng Zhu, Fei Kang, Biao Jiang, Zedong Gao, Eric Li, Yang Liu, Yahui Zhou |
| 机构 | Skywork AI |
| 论文 | https://arxiv.org/abs/2506.18701 |
| 代码 | https://github.com/SkyworkAI/Matrix-Game |
| 项目页 | https://matrix-game-homepage.github.io |
| 发布 | 2025-06-24 |
| 许可 | 未明确标注 |
二、核心思想
问题定义
交互式世界模型面临三大核心挑战:
- 训练数据稀缺:带动作标注的交互式视频数据集极其稀缺且标注成本高昂
- 物理动态建模困难:世界模型需要生成视觉一致的视频,同时准确响应结构化控制信号(键盘/鼠标)
- 缺乏统一评估基准:现有基准(如VBench、WorldScore)主要评估文本到视频生成,无法有效评估动作条件下的图像到世界生成
解决方案概述
Matrix-Game 是首个17B参数的交互式世界基础模型,专注于可控制游戏世界生成。核心创新:
- Matrix-Game-MC数据集:2,700小时无标签Minecraft游戏视频 + 1,000+小时高质量动作标注视频
- 两阶段训练流程:无标签预训练(游戏世界理解)→ 动作标注训练(交互式视频生成)
- 图像到世界生成范式:以单张参考图像为条件,结合运动上下文和用户动作生成视频
- GameWorld Score基准:统一评估视觉质量、时间质量、动作可控性和物理规则理解

三、技术架构
整体框架

Matrix-Game采用图像到世界生成范式,在3D Causal VAE构建的时空压缩潜在空间中训练。参考图像通过视觉编码器处理作为主要条件输入,结合高斯噪声和用户动作,由Diffusion Transformer生成潜在表示,再通过3D VAE解码器解码为视频序列。
自回归生成
为支持长时间视频生成,Matrix-Game采用自回归策略:每个生成片段的最后k=5帧作为运动条件用于生成下一个片段。运动帧的潜在表示与噪声潜在表示沿通道维度拼接,并连接二进制掩码指示哪些帧包含有效运动信息。
抗误差累积策略:
- 训练时以0.2概率对运动帧和参考图像添加高斯噪声
- 以0.25概率对运动帧应用Classifier-Free Guidance(替换为无条件信号)
动作控制模块

控制信号分为两类:
- 键盘动作(离散编码):上、下、左、右、跳跃、攻击
- 鼠标动作(连续标量):俯仰角变化
连续鼠标动作与输入潜在表示拼接后通过MLP处理,再经时间自注意力整合;离散键盘动作通过交叉注意力整合到扩散过程中。训练时以0.1概率对动作信号应用CFG。
模型架构细节
| 组件 | 说明 | 关键参数 |
|---|---|---|
| 3D Causal VAE | 时空压缩编码器/解码器 | 空间压缩8倍,时间压缩4倍 |
| MMDiT | 多模态Diffusion Transformer | 双流+单流混合架构 |
| Visual Encoder | 参考图像编码器 | 视觉特征提取 |
| Control Module | 动作控制模块 | 键盘交叉注意力 + 鼠标自注意力 |
| 自回归策略 | 片段间衔接 | 最后5帧作为运动条件 |
训练流程
Stage 1:无标签预训练(游戏世界理解)
- 初始化:HunyuanVideo I2V预训练权重
- 架构修改:将文本分支替换为图像分支,不包含动作控制模块
- 数据:2,700小时720p Minecraft无标签视频
- 训练设置:多样化帧数(17/33/65帧)和宽高比(16:9, 4:3, 21:9)
- 精炼阶段:从相同数据集中筛选870小时高质量视频(稳定相机运动、干净UI、视觉清晰)
Stage 2:动作标注训练(交互式世界生成)
- 架构:集成动作控制模块到MMDiT
- 模型规模:17B参数
- 数据:1,200小时720p 33帧动作标注视频(Minecraft + Unreal Engine)
- 平衡数据集:8个Minecraft生物群系 + Unreal Engine程序化数据,约1,200小时65帧视频
- 训练设置:固定720p分辨率,早阶段使用33帧,后阶段使用65帧
Matrix-Game-MC数据集
无标签数据收集:
- 来源:MineDojo数据集,约6,000小时原始游戏录像
- 场景分割:TransNet V2检测场景转换 + FFmpeg分割
- 去除每段首尾4帧(避免渐变/不稳定相机伪影)
三级过滤流水线:

| 阶段 | 过滤器 | 说明 |
|---|---|---|
| Stage 1 | 视频质量过滤 | DOVER评估,按类型特定阈值 |
| Stage 1 | 美学过滤 | LAION预测器,自适应阈值 |
| Stage 2 | 菜单状态过滤 | IDM检测无玩家输入帧 |
| Stage 2 | 字幕过滤 | CRAFT文本检测,移除水印/横幅 |
| Stage 2 | 人脸过滤 | DeepFace检测,移除主播面部 |
| Stage 3 | 运动过滤 | GM-Flow光流,过滤过少/过多运动 |
| Stage 3 | 相机运动过滤 | IDM估计,过滤过度俯仰/偏航 |
标注数据创建:
- 探索代理:MineRL平台 + 课程引导VPT代理,16Hz采样
- Unreal程序化模拟:城市/沙漠/森林环境,精确动作标注
- 14个Minecraft生物群系:森林、针叶林、沼泽、海洋、台地、高山、热带草原、平原、海滩、丛林、河流、沙漠、蘑菇岛、冰原
四、核心创新
| 创新点 | 说明 | 优势 |
|---|---|---|
| 图像到世界范式 | 纯视觉条件,无文本偏置 | 避免语言先验过拟合 |
| 两阶段训练 | 无标签预训练 + 动作标注训练 | 世界理解 → 交互生成 |
| 17B参数规模 | 大规模模型容量 | 更强的物理规则理解 |
| 自回归生成 | 片段间运动帧衔接 | 长时间连贯生成 |
| 动作控制模块 | 键盘交叉注意力 + 鼠标自注意力 | 精细粒度控制 |
| GameWorld Score | 8维度统一基准 | 全面评估世界模型 |
五、代码实现分析
项目结构
Matrix-Game/
├── README.md
├── matrix-game-homepage/ # 项目主页
├── models/ # 模型权重
├── configs/ # 配置文件
├── data/ # 数据处理脚本
└── evaluation/ # GameWorld Score基准
模型规格
| 规格 | 值 |
|---|---|
| 参数量 | 17B |
| 最大分辨率 | 720p |
| 帧率 | 16 FPS |
| 最大帧数 | 65帧(约4秒) |
| 支持动作 | 键盘(6种)+ 鼠标(8方向) |
| 推理步数 | 50步(Flow Matching) |
| CFG比例 | 6 |
| 训练策略 | FSDP + bf16混合精度 |
六、实验结果
GameWorld Score基准

| 模型 | 图像质量↑ | 美学↑ | 时间一致性↑ | 运动平滑↑ | 键盘准确率↑ | 鼠标准确率↑ | 物体一致性↑ | 场景一致性↑ |
|---|---|---|---|---|---|---|---|---|
| Oasis | 0.65 | 0.48 | 0.94 | 0.98 | 0.77 | 0.56 | 0.56 | 0.86 |
| MineWorld | 0.69 | 0.47 | 0.95 | 0.98 | 0.86 | 0.64 | 0.51 | 0.92 |
| Matrix-Game | 0.72 | 0.49 | 0.97 | 0.98 | 0.95 | 0.95 | 0.76 | 0.93 |
Matrix-Game在所有8个维度上均达到最优,特别是在动作可控性(键盘95%、鼠标95%)和物理一致性(物体76%、场景93%)方面显著超越基线。
人工评估

| 维度 | Oasis | MineWorld | Matrix-Game |
|---|---|---|---|
| 总体质量 | 0.4% | 3.3% | 96.3% |
| 可控性 | 0.6% | 5.7% | 93.8% |
| 视觉质量 | 0.4% | 1.4% | 98.2% |
| 时间一致性 | 0.4% | 10.0% | 89.6% |
双盲人工评估中,Matrix-Game在所有四个维度上获得压倒性优势(89.6%-98.2%胜率)。
动作可控性详细对比
| 模型 | 前进 | 后退 | 左 | 右 | 跳跃 | 攻击 | 相机↑ | 相机↓ | 相机← | 相机→ | 相机↖ | 相机↗ | 相机↙ | 相机↘ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Oasis | 0.85 | 0.78 | 0.80 | 0.79 | 0.77 | 0.89 | 0.66 | 0.55 | 0.33 | 0.35 | 0.56 | 0.53 | 0.45 | 0.51 |
| MineWorld | 0.86 | 0.80 | 0.87 | 0.88 | 0.82 | 0.87 | 0.46 | 0.45 | 0.53 | 0.54 | 0.66 | 0.77 | 0.87 | 0.96 |
| Matrix-Game | 0.99 | 0.91 | 0.92 | 0.96 | 0.88 | 0.95 | 0.91 | 0.98 | 0.89 | 0.90 | 0.92 | 0.97 | 0.98 | 0.98 |
Matrix-Game在所有动作类型上均达到88%以上准确率,前进(99%)、右(96%)、跳跃(88%)表现尤为突出。鼠标控制方面,所有方向均达到89%以上。
定性结果




七、相关工作
视频扩散模型
- Sora:OpenAI视频生成模型
- HunyuanVideo:腾讯视频生成模型
- Wan:大规模视频生成模型
- CogVideoX:专家Transformer视频扩散模型
可控视频生成
- Direct-a-Video:相机运动控制(偏航/俯仰/缩放)
- CameraCtrl:轨迹级相机引导
- MotionCtrl:统一运动控制器
- WorldMem:记忆引导的世界模型
游戏视频生成
- OASIS:基于扩散的游戏世界模拟
- MineWorld:Minecraft世界模型
- GameGenX:游戏视频生成与可控性
- Genie/Genie 2:可玩环境基础模型
- GameFactory:生成式交互视频创建新游戏
Matrix-Game的差异化
- 最大规模:17B参数,超越所有现有开源Minecraft世界模型
- 最全面数据:2,700小时无标签 + 1,000+小时标注数据
- 最强可控性:键盘95%、鼠标95%准确率
- 统一基准:GameWorld Score 8维度评估
八、总结
核心贡献
- Matrix-Game-MC数据集:首个大规模Minecraft交互式视频数据集,包含2,700小时无标签数据和1,000+小时高质量动作标注数据
- 17B参数世界模型:首个如此规模的交互式世界基础模型,支持键盘/鼠标精细控制
- 两阶段训练流程:无标签预训练学习世界知识 → 动作标注训练实现交互生成
- GameWorld Score基准:统一评估视觉质量、时间质量、动作可控性和物理规则理解的8维度基准
技术影响
- 交互式世界模型范式:证明大规模模型可以同时理解物理规则和响应精细控制
- 游戏AI新方向:为游戏引擎、具身智能、自动驾驶提供新的世界模拟方法
- 数据工程示范:三级过滤流水线为游戏视频数据处理提供可复用方案
- 评估标准化:GameWorld Score为社区提供统一的评估框架
局限性
- 场景限制:当前仅支持Minecraft和Unreal Engine场景,泛化到其他游戏/真实世界有待验证
- 分辨率限制:最高支持720p,未探索更高分辨率生成
- 时间长度限制:单次生成最多65帧(约4秒),长时间生成依赖自回归拼接
- 动作空间有限:仅支持6种键盘动作和8方向鼠标控制,复杂交互(如放置方块、合成物品)未覆盖
- 训练资源需求:17B模型需要大量GPU资源进行训练和推理
九、参考资源
论文
- 本文: https://arxiv.org/abs/2506.18701
- 代码: https://github.com/SkyworkAI/Matrix-Game
- 项目页: https://matrix-game-homepage.github.io
相关工作
- OASIS: 基于扩散的游戏世界模拟
- MineWorld: Minecraft世界模型
- HunyuanVideo: 腾讯视频生成模型(预训练权重来源)
- GameFactory: 生成式交互视频
- Genie 2: 可玩环境基础模型
- GameWorld Score: 统一评估基准