Back to blog

Seed1.5-VL Technical Report

通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM

Seed1.5-VL Technical Report

一、论文概述

项目内容
标题Seed1.5-VL Technical Report
作者Dong Guo, Faming Wu, Feida Zhu, Fuxing Leng, Guang Shi, et al. (140+ authors)
机构ByteDance Seed
论文https://arxiv.org/abs/2505.07062
模型Volcano Engine Model ID: doubao-1-5-thinking-vision-pro-250428
发布2025年5月11日
许可未明确

二、核心思想

问题定义

当前视觉语言模型(VLMs)在通用性方面仍与人类水平存在差距,特别是在以下任务中:

  • 3D空间理解
  • 物体计数
  • 想象性视觉推理
  • 交互式游戏

这些局限性源于:

  1. 高质量视觉-语言标注数据稀缺:不像LLM有丰富的文本语料,VLM缺乏同等丰富多样的视觉-语言标注
  2. 多模态数据的异构性:增加了训练和推理的复杂性

解决方案概述

Seed1.5-VL通过以下关键创新解决这些问题:

  1. 紧凑高效架构:532M参数视觉编码器(Seed-ViT) + 20B活跃参数MoE LLM
  2. 多样化数据合成管道:针对OCR、视觉定位、计数、视频理解、长尾知识等关键能力
  3. 多阶段训练流程:ViT预训练 → VLM预训练(3阶段) → 后训练(SFT + RL)
  4. 训练基础设施创新:混合并行策略、视觉token重分布、并行感知数据加载

核心成果:在60个公共基准中的38个上达到SOTA性能,包括MMMU 77.9分。

三、技术架构

整体框架图

架构图

Seed1.5-VL由三个主要组件构成:

  1. SeedViT:编码图像和视频,原生支持动态分辨率,使用2D RoPE位置编码
  2. MLP Adapter:将视觉特征投影为多模态token,使用2×2平均池化
  3. Large Language Model:处理多模态输入的MoE架构LLM

视觉编码器 (Seed-ViT)

参数值
Patch size14
位置编码2D RoPE
Head dim64
Num heads20
Embed dim1280
MLP ratio4.0
Depth27
总参数532M

Seed-ViT预训练三阶段:

阶段方法数据关键特点
Stage 1MIM with 2D RoPE2.2B无标签图像使用EVA02-CLIP-E作为教师,75% mask率
Stage 2原生分辨率对比学习4.8B图文对SigLIP损失 + SuperClass损失
Stage 3全模态预训练65M视频-音频-文本MiCo框架,仅占4.8% token预算

视频编码

动态帧-分辨率采样策略:

  • 默认采样率:1 FPS
  • 详细时间信息任务:2 FPS
  • 视频计数/运动跟踪:5 FPS
  • 时间戳token:每帧前添加 [1.5 second]
  • 最大预算:81,920 tokens/视频
  • 分辨率层级:{640, 512, 384, 256, 160, 128} tokens/帧

核心公式

缩放定律分析:

L^∼BDβ\hat{L} \sim \frac{B}{D^{\beta}}

在log-log空间:

log⁡(L^)∼−alog⁡(D)+b\log(\hat{L}) \sim -a \log(D) + b

OCR数据缩放:

log⁡(L^ocr)≈−0.1817log⁡(D)−0.7011\log(\hat{L}_{\mathrm{ocr}}) \approx -0.1817 \log(D) - 0.7011

Grounding数据缩放:

log⁡(L^grounding)≈−0.0785log⁡(D)−0.0745\log(\hat{L}_{\mathrm{grounding}}) \approx -0.0785 \log(D) - 0.0745

下游任务性能预测(log-linear关系):

AccChartQA≈−0.0968log⁡(lossocr)+0.7139\mathrm{Acc}_{\mathrm{ChartQA}} \approx -0.0968 \log(\mathrm{loss}_{\mathrm{ocr}}) + 0.7139

AccInfoVQA≈−0.1488log⁡(lossocr)+0.5319\mathrm{Acc}_{\mathrm{InfoVQA}} \approx -0.1488 \log(\mathrm{loss}_{\mathrm{ocr}}) + 0.5319

训练流程

VLM预训练三阶段

阶段预算序列长度可训练组件Batch size最大学习率
Stage 016B32,768MLP adapter8.4M2.52×10⁻⁴
Stage 13T32,768全部71M5.22×10⁻⁵
Stage 2240B131,072全部71M5.22×10⁻⁶

关键设计决策:

  • Stage 0仅训练MLP adapter(冻结ViT和LLM)
  • Stage 1加入5%文本token保持语言能力
  • Stage 2增加视频、编码、3D数据,序列长度增至131K
  • 使用AdamW优化器,β₁=0.9, β₂=0.95, weight decay=0.1

后训练流程

后训练流程

后训练包含迭代更新:

  1. SFT阶段:约50,000高质量样本 + LongCoT数据
  2. RLHF阶段:
    • 人类标注偏好数据(5级评分系统)
    • 合成偏好数据(基于ground-truth的正确性排序)
    • VLM作为奖励模型(生成式分类器)
  3. RLVR阶段:可验证奖励的强化学习
  4. 混合RL:结合人类反馈和可验证奖励
  5. 迭代RFT:拒绝采样微调

关键创新:

  • 监督仅应用于最终生成输出,不监督chain-of-thought推理过程
  • 使用数据管道持续收集hard prompts用于RL和SFT

预训练数据

数据类别规模关键特点
通用图文对 & 知识3T tokens总计长尾分布平衡、VLM自动标注
OCR10亿+样本文档、场景文本、表格、图表、流程图
视觉定位 & 计数248M样本边界框、中心点、计数数据
3D空间理解3.2B tokens深度排序、绝对深度估计、3D定位
视频多类别通用理解、时间定位、流式数据
STEM1亿+练习数学、物理、化学、生物
GUI大规模UI-TARS数据,网页/应用/桌面

四、核心创新

创新点说明理论/实验依据
原生分辨率视觉编码Seed-ViT使用2D RoPE支持任意分辨率零样本分类82.5%准确率,与6B参数模型相当
动态帧-分辨率采样联合优化时间和空间维度最大81,920 tokens/视频,6级分辨率分配
多模态缩放定律发现训练损失与下游性能的log-linear关系可预测ChartQA、InfoVQA、RefCOCO性能
VLM作为奖励模型生成式分类器直接输出偏好指示token比Bradley-Terry模型更鲁棒
不监督CoT的RL仅对最终输出施加监督模型自然发展视觉CoT策略
混合并行策略针对非对称架构的并行优化解决ViT与LLM之间的计算不平衡
视觉token重分布平衡GPU工作负载提高训练吞吐量

五、实验结果

零样本分类(Seed-ViT)

模型参数ImageNet-1KImageNet-V2ImageNet-AImageNet-RObjectNet平均
OpenCLIP-G/141.8B80.473.669.392.873.076.5
DFN-5B-CLIP-H/14++632M84.378.379.694.978.081.4
Seed-ViT532M83.677.685.595.279.282.5
InternVL-C6B83.277.383.895.780.682.5
EVA-CLIP-18B17.5B83.877.987.395.782.283.6

公共视觉-语言基准

多模态推理

基准Seed1.5-VL (thinking)Gemini 2.5 ProOpenAI o1Claude 3.7GPT-4oQwen2.5-VL 72B
MMMU77.981.777.675.270.770.2
MMMU-Pro67.668.866.450.154.551.1
MathVision68.773.363.258.631.238.1
MathVista85.682.771.874.563.874.8
V*89.079.169.786.473.986.4
VLM are Blind92.184.357.069.050.469.0
VisuLogic35.031.029.024.826.328.0

文档与图表理解

基准Seed1.5-VL (thinking)Gemini 2.5 ProQwen2.5-VL 72B
TextVQA81.876.883.5
DocVQA96.994.096.4
InfographicVQA91.284.387.3
ChartQA89.183.389.5
OCRBench861866885

定位与计数

基准Seed1.5-VL (thinking)Gemini 2.5 ProQwen2.5-VL 72B
RefCOCO-avg91.374.690.3
CountBench93.791.093.6
FSC-147 ↓17.924.528.6
BLINK72.170.664.4
LVIS-MG72.563.8-

3D空间理解

基准Seed1.5-VL (thinking)Gemini 2.5 ProQwen2.5-VL 72B
DA-2K91.773.069.6
NYU-Depth V2 ↓13.627.535.5
All-Angles Bench58.653.455.7

视频基准

类别基准Seed1.5-VL (thinking)先前SOTA
短视频MotionBench68.462.8 (GLM-4V)
短视频TVBench63.662.6 (Gemini 2.5 Pro)
短视频TempCompass83.775.8 (Gemini 2.5 Pro)
长视频LongVideoBench74.066.7 (GPT-4o)
长视频MLVU82.181.2 (Gemini 2.5 Pro)
流式OVBench60.054.9 (PMB)
流式StreamBench72.868.7 (GPT-4o)
定位Charades-STA64.060.7 (SG-DETR)
定位TACoS49.642.4 (SG-DETR)

多模态Agent

GUI定位

基准Seed1.5-VLOpenAI CUAClaude 3.7UI-TARS 1.5
ScreenSpot-V295.287.987.694.2
ScreenSpot-Pro60.923.427.761.6

GUI Agent

基准Seed1.5-VLOpenAI CUAClaude 3.7UI-TARS 1.5
OSWorld36.738.128.042.5
WebVoyager87.287.084.184.8
Online-Mind2Web76.471.062.975.8
AndroidWorld62.1--64.2

游戏Agent(14个Poki游戏)

游戏Seed1.5-VLUI-TARS-1.5OpenAI CUAClaude 3.7
2048 (score)870.6721.3611.2800.0
Hex-Frvr (score)1414.01583.7651.6523.1
Wood-Blocks-3d (score)864.0213.318.10.0

缩放定律分析

OCR缩放曲线

训练损失与训练token数遵循幂律关系。OCR损失与ChartQA/InfoVQA性能呈log-linear关系,可用于预测下游任务性能。

内部基准

内部基准对比

Seed1.5-VL在内部基准上排名第二,在OOD、Agent、原子指令跟随类别中达到SOTA。主要弱项相对于顶级模型在知识、推理、代码方面,部分原因是20B活跃参数的模型规模限制。

六、训练基础设施

大规模预训练创新

  1. 混合并行策略:针对ViT与LLM之间的非对称架构优化
  2. 视觉token重分布:平衡GPU工作负载,解决视觉编码器与语言模型之间的计算不平衡
  3. 并行感知数据加载:最小化3D并行下的I/O瓶颈
  4. 容错机制:支持大规模训练的故障恢复

系统级优化

  • Kernel fusion
  • Selective activation checkpointing
  • Offloading
  • 通信优化(FLUX)

七、相关工作

模型规模与Seed1.5-VL的区别
GPT-4o未公开通用多模态,Seed1.5-VL在定位/计数/3D更强
Gemini 2.5 Pro未公开推理能力更强,Seed1.5-VL在Agent/游戏更强
Claude 3.7 Sonnet未公开Seed1.5-VL在GUI/游戏显著超越
Qwen2.5-VL 72B72B denseSeed1.5-VL用更少活跃参数(20B)达到可比性能
InternVL-2.5未公开视频理解能力接近
UI-TARS 1.5未公开GUI专项模型,Seed1.5-VL为通用模型

八、总结

核心贡献

  1. 紧凑高效架构:532M视觉编码器 + 20B活跃参数MoE LLM,在60个基准中38个达到SOTA
  2. 多样化数据合成:针对OCR、定位、计数、视频、STEM、GUI的专门数据管道
  3. 多阶段训练流程:ViT预训练(3阶段) → VLM预训练(3阶段) → 后训练(SFT+RL)
  4. 缩放定律发现:训练损失与下游性能的log-linear关系可用于性能预测
  5. Agent能力突破:在GUI控制和游戏任务中超越OpenAI CUA和Claude 3.7
  6. 训练基础设施:混合并行、视觉token重分布、并行感知数据加载

技术影响

  • 证明紧凑MoE架构可在多模态任务中达到SOTA
  • 发现多模态训练损失与下游性能的可预测关系
  • 在Agent任务中的突破为GUI自动化和游戏AI开辟新方向
  • 训练基础设施创新为大规模多模态训练提供实用方案

局限性

  • 细粒度视觉感知:不规则排列、相似颜色、遮挡物体的计数仍有困难
  • 复杂推理:Klotski拼图、简单迷宫等对人类简单但对模型困难
  • 组合搜索:需要程序化方法的推理任务仍是挑战
  • 3D空间推理:3D物体操作和投影推理仍需改进
  • 幻觉:视觉输入与语言先验冲突时仍会产生错误推理
  • 时间推理:连续动作时序判断能力有限
  • 模型规模:20B活跃参数限制了知识和推理能力,缩放定律显示未饱和

九、参考资源