JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
A canvas-native creative agent harness for long-horizon multimodal creation, unifying project state, controlled runtime execution, and trajectory recording
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents |
| 作者 | Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li, Haonan Wang, Haitao Wu, Hengyu Liu, Jianghai Chen, Kaituo Feng, Kaixin Li, Shawn Chen, Shijue Huang, Sixiang Chen, Tsung-Yi Ho, Wenxuan Huang, Xiangyan Liu, Xiaomeng Hu, Xuanhua He, Yan Sun, Yunqing Zhao, Zhiqin Yang, Zehan Wang, Zhengyang Tang |
| 机构 | 待补充 |
| 论文 | arXiv:2607.23588 |
| 发布 | 2026-07-26 (cs.CV) |
| 代码 | LYL1015/JarvisHub |
| 项目 | https://www.jarvishub.site/ |
| 许可 | arXiv.org perpetual non-exclusive license |
二、核心思想

JarvisHub 通过对比现有创意系统(prompt-to-output 工具、chat-based 智能体、node-based 工作流工具、商业创意产品)与 JarvisHub 的画布原生架构,展示了画布作为统一工作空间的优势。
问题定义
真实创意工作涉及参考资料、草稿、备选方案、编辑、失败尝试、版本关系、工具动作、评估信号和人工反馈,这些共同构成 演化的项目状态(evolving project state)。现有系统要么丢弃中间上下文(prompt-to-output 工具),要么依赖线性对话(chat-based 智能体),要么要求手动指定的流程(node-based 工具)。关键问题不是如何调用更强的模型,而是如何为智能体提供一个可以在长时程工作流中持续读写、保持一致性的工作空间。
解决方案概述
JarvisHub 将画布定义为创意项目的共享对象:
- 智能体可读写:智能体可以检查项目上下文、调用工具、更新画布制品、纳入反馈
- 用户可检查:用户可以检查智能体读写的同一状态
- 状态显式持久化:提示、参考、候选、编辑、版本、依赖和反馈都表示为类型化的画布节点和链接
通过三层架构(画布状态层、协议桥、智能体运行时)实现画布操作的显式验证、可追溯和可恢复。
三、技术架构
3.1 整体框架图

JarvisHub 的三层架构:
- 画布状态层(Canvas State Layer):存储多模态制品、依赖、版本和用户选择
- 协议桥(Protocol Bridge):验证被授权的动作,控制画布读写
- 智能体运行时(Agent Runtime):规划、调用工具和技能、更新画布制品
核心能力包括:持久化项目状态、受控的画布操作、工具与媒体执行、反馈引导的修订、可追溯性和恢复。
3.2 核心公式
画布状态模型 (Canvas State Model):
其中:
- 是类型化的制品图(artifact graph)
- 是画布节点集合
- 是有向类型化关系(reference use、version lineage、generation dependency、grouping、workflow continuation)
- 存储可编辑内容和制品载荷
- 存储溯源、执行元数据和运行时状态
- 记录用户选择、编辑和反馈
- 存储空间位置和分组布局
节点表示 (Node Representation):
状态转移 (State Transition):
其中 是状态转移操作符, 是工具观察, 是反馈信号, 是修复或跟进决策。
动作空间 (Action Space):
轨迹形式化 (Trajectory Formalization):
3.3 模型组件
| 组件 | 说明 | 关键参数 |
|---|---|---|
| 画布状态层 | 存储多模态制品、依赖、版本和用户选择 | 节点类型 ,关系类型 |
| 协议桥 | 验证被授权的动作,控制画布读写 | 能力清单 ,执行授权 |
| 智能体运行时 | 规划、调用工具和技能、更新画布制品 | 动作空间 ,状态转移 |
| Skills | 可复用的创意流程 | 故事板、参考引导生成、设计到网页重建 |
| Memory | 跨轮次保留用户偏好和决策 | 项目偏好、先前决策、程序性知识 |
| Subagents | 处理独立子任务,支持并行探索 | 并行子任务、结果整合 |
3.4 五类工具族
| 工具族 | 运行时角色 | 代表操作 |
|---|---|---|
| Canvas tools | 更新项目状态 | 读取、创建、更新、连接、分组、选择和分支节点 |
| Generation tools | 产生画布制品 | 图像、视频、音频和组合媒体生成 |
| Native tools | 使用外部执行 | 浏览器、文件、代码、搜索、文档和演示操作 |
| Recovery tools | 检查和修复 | 结构化反馈、验证、检查点和局部修复 |
| MCP tools | 扩展外部服务 | MCP 提供的能力,受同样的清单-授权约束 |
3.5 智能体运行时循环

运行时将用户请求转换为协议检查的画布更新。每个轮次遵循以下流程:
- 运行时观察共享画布
- 根据当前清单和执行授权选择动作
- 调用相应能力(由技能、记忆、工具和子智能体支持)
- 将观察结果返回给协议桥
- 协议桥验证并提交到共享画布
- 用户检查、提供反馈并引导下一轮
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| 画布原生项目状态 | 首次将可编辑画布定义为创意智能体的统一工作空间、外部记忆和动作空间 | 支持多模态制品、依赖、版本和反馈的类型化表示 |
| 协议桥机制 | 通过能力清单和执行授权实现画布操作的显式验证和控制 | 使画布交互可审计而非隐藏在语言生成中 |
| 轨迹记录框架 | 完整记录从画布状态、可用能力、动作选择、工具观察到反馈信号和修复决策的全过程 | 为过程级评估和未来训练提供数据基础 |
| 开放框架设计 | 区别于商业封闭系统(Claude Design、Google Stitch、MiniMax Hub),JarvisHub 是开源的 | 支持研究和基准构建 |
五、代码实现分析
论文提供了开源实现:
- GitHub: LYL1015/JarvisHub
- 项目页面: https://www.jarvishub.site/
- 模型配置: GPT-5.5 作为主智能体后端,GPT Image 2 作为图像生成后端,Seedance 2.0 作为视频生成后端,Gemini 3.1 Pro 作为多模态评估后端
架构实现要点:
- 画布状态通过类型化节点和边实现,支持地址引用和依赖追踪
- 协议桥将智能体动作编码为检查过的工具调用或画布变异
- 运行时通过技能(skills)、记忆(memory)和子智能体(subagents)实现高层编排
- 轨迹捕获包含完整的状态转移证据,支持后续分析和训练数据构建
六、实验结果
6.1 实验设置
实验围绕三类长时程创意任务展开:
| 任务 | 定义和挑战 | 代表性输出 |
|---|---|---|
| 叙事媒体生成 | 将故事、剧本或场景简报转换为时间连贯的视觉或音视频序列 | 角色参考、场景设计、分镜、镜头计划、图像序列、视频片段 |
| 交互式网页开发 | 将设计目标、信息结构或交互需求转换为可运行的网页 | 静态页面、动态网站、着陆页、交互式原型 |
| 演示文稿生成 | 将主题、源文档、报告或沟通目标转换为连贯的多页演示文稿 | 演示文稿、学术报告、项目报告、商业计划 |
6.2 定性结果
叙事媒体生成:

- 工作区轨迹展示了任务简报、规划笔记、视觉参考、镜头候选、依赖链接和智能体进度
- 最终输出保持了角色一致性、场景提示和镜头间动作连续性(受 Mx-Shell 的 Zombie Sweeper 启发)
交互式网页开发:

- 工作区轨迹追踪了网页简报、视觉参考、布局草稿、实现制品、预览和修订状态
- 最终输出展示了一致的排版、图像放置、页面结构和视觉方向
演示文稿生成:

- 工作区轨迹记录了讲座内容、生成图表、幻灯片草稿、依赖链接、PowerPoint 预览和修订状态
- 最终输出展示了一致的布局、图表样式、强调色和幻灯片级组织
6.3 关键观察
- JarvisHub 能够支持 可检查且可复用 的智能体创意工作流
- 记录的轨迹为构建基准、评估长时程行为和训练未来创意智能体提供了有用数据
- 画布状态使智能体能够 跨步骤保持上下文,避免在临时对话历史中丢失中间决策
七、相关工作
| 系统类型 | 代表系统 | 局限性 |
|---|---|---|
| Prompt-to-output 工具 | ROMBACH 2022, Ramesh 2022, Saharia 2022, Yu 2022, Brooks 2023, Zhang 2023, Zhao 2024, Fu 2024, Hui 2024, Xiao 2024, Liu 2025, Wu 2025, Seedream 2025, Batifol 2025, Deng 2025, Xie 2025, Chen 2026 | 隐藏或丢弃中间决策、失败尝试、备选方案和修订历史 |
| Chat-based 创意智能体 | OpenAI GPT-Image, Google Gemini 3.1 Flash Image, ByteDance Seedream 5 Lite, Lin 2025 JarvisArt, Lin 2025 JarvisEvo, Chen 2025 PhotoArtAgent, Dutt 2025 MonetGPT | 主上下文是线性对话,难以表示空间布局、制品关系、版本分支和局部编辑目标 |
| Node-based 工作流工具 | Wu 2022 PromptChainer, Xu 2025 ComfyUICopilot, Xue 2025 ComfyBench, Xu 2025 ComfyUI-R1, Huang 2025 ComfyGPT, Mozannar 2025 Magentic, Kyaw 2025 NodeBased, Kyaw 2026 StoryNodes | 围绕手动指定的流程组织,而非智能体可检查的持续可编辑项目状态 |
| 商业创意产品 | Claude Design, Google Stitch, TapNow, LibTV, MiniMax Hub | 封闭架构,难以研究智能体如何表示上下文、选择工具、修订制品、从失败中恢复和保持一致性 |
八、总结
核心贡献
- 将长时程多模态创意形式化为可编辑项目图上的智能体过程
- 提出并实现了一个画布原生的创意智能体框架,统一了项目状态、受控运行时执行和轨迹记录
- 在叙事媒体生成、交互式网页开发和演示文稿生成等高价值长时程任务上进行了演示
技术影响
JarvisHub 为创意智能体的项目状态基准测试、过程级评估协议和训练数据飞轮提供了基础设施。轨迹记录包含了结构化示例(画布状态、智能体动作、工具观察、反馈信号、修复决策和最终结果),可用于训练未来创意智能体的规划、工具选择、多模态状态跟踪、局部修复和反馈引导修订。
局限性
- 实验为定性演示,而非完成的基准或排行榜
- JarvisHub 聚焦编排和项目状态管理,最终制品质量仍依赖外部模型和工具
- 协议桥使画布动作显式且可恢复,但不保证智能体创意决策的语义正确性
- 轨迹记录需要质量过滤、同意、匿名化和版权审查后才能用作研究数据
九、参考资源
- arXiv: https://arxiv.org/abs/2607.23588
- GitHub: https://github.com/LYL1015/JarvisHub
- 项目页面: https://www.jarvishub.site/
- GPT-5.5: OpenAI GPT-5.5
- GPT Image 2: OpenAI GPT Image 2
- Seedance 2.0: ByteDance Seedance 2.0
- Gemini 3.1 Pro: Google Gemini 3.1 Pro