Back to blog

MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing

解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析

MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing

一、论文概述

项目内容
标题MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
作者Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, … Conghui He
机构Shanghai AI Laboratory, OpenDataLab
论文arXiv:2509.22186
发布2025-09-26
主题cs.CV (Computer Vision)
代码GitHub - opendatalab/MinerU
模型MinerU2.5-2509-1.2B

二、核心思想

问题定义

文档解析是多模态理解的基础任务,支撑信息提取、RAG和智能文档分析等下游应用。与自然图像相比,文档图像具有更高分辨率、更密集内容和更复杂布局的特点。

现有方法的挑战:

方法类型代表问题
Pipeline方法Marker, MinerU工作流繁琐,错误累积
端到端VLMGOT, olmOCR高分辨率token冗余,计算开销大
多阶段VLMDolphin固定分辨率限制裁剪解析

核心观察

高分辨率文档解析的困境:

  • 裁剪方法:减少计算但牺牲语义一致性和布局信息
  • 原生分辨率方法:保留细节但token数量呈O(N2)\mathcal{O}(N^2)复杂度

解决方案概述

MinerU2.5:1.2B参数的解耦文档解析VLM。

核心创新:粗到细的两阶段解析策略,解耦全局布局分析和局部内容识别。

关键改进:

  1. 全面精细的布局分析(包含页眉页脚等)
  2. 公式解析突破(复杂长公式、中英混合公式)
  3. 表格解析鲁棒性增强(旋转、无框、部分边框表格)
  4. 高效推理(2.12 pages/s on A100)

三、技术架构

整体框架

框架概述

Figure 2: MinerU2.5框架示意图。

架构组件:

  1. 视觉编码器:675M NaViT(从Qwen2-VL初始化),支持动态分辨率,2D-RoPE
  2. Patch Merger:Pixel-unshuffle处理相邻2×2视觉token
  3. 语言模型:0.5B Qwen2-Instruct,M-RoPE位置编码

两阶段解析策略

Stage I:全局布局分析

输入:图像统一缩放至1036×1036缩略图

目标:高效识别结构化元素,控制计算成本

关键设计:

  • 固定缩略图尺寸确保稳定的计算量
  • 避免原生宽高比缩略图导致的分辨率波动
  • 预测四个关键属性:类别标签、边界框、旋转角度、阅读顺序

Stage II:局部内容识别

输入:根据布局裁剪的原生分辨率区域(上限2048×28×28像素)

目标:精细粒度解析,保留密集文本、复杂公式和表格的细节

优势:

  • 避免过小裁剪的细节丢失
  • 防止过大裁剪的冗余计算
  • 准确率和效率的鲁棒权衡

性能亮点

性能亮点

Figure 1: MinerU2.5在OmniDocBench上的性能亮点。

四、数据引擎

整体流程

数据引擎

Figure 3: 数据引擎概述。

三个核心阶段:

  1. 数据整理:大规模多样化文档池构建
  2. 自动化标注:高质量预训练数据生成
  3. IMIC策略:迭代挖掘难例进行微调

数据整理策略

维度方法
布局多样性页面级图像聚类选择
文档类型多样性元数据分层抽样
元素平衡初步检测模型确保类别平衡
语言平衡中英文文档数量可比

标注精炼流程

内容类型精炼方法
文本内容Qwen2.5-VL-72B-Instruct验证纠正
公式内容内部UniMERNet模型替换
表格内容内部高性能表格解析模型重新生成

IMIC策略

IMIC策略

Figure 7: IMIC(迭代推理一致性挖掘)策略示意图。

核心原理:如果模型已充分学习样本特征,多次随机采样推理应产生高度一致的输出。输出差异大的样本为”难例”,最有价值进行人工标注。

各任务一致性评估:

任务一致性指标
布局分析成对PageIoU
公式识别成对CDM
表格识别TEDS分数

五、技术创新

5.1 统一标签系统

设计原则:

  • 全面覆盖:包含页眉、页脚、页码等非正文元素
  • 精细粒度:图像细分为image/chart/chemical_structure
  • 语义区分:代码、算法、参考文献、列表独立分类

Table 4: 标签系统对比

类别MinerU2-pipelinePaddleOCRMinerU2.5
文本texttext, toc, abstracttext
标题titletitle, page_titletitle
代码✗codecode
算法✗✗algorithm
参考文献✗ref_text, ref_blockreference
列表✗✗list

5.2 PageIoU指标

PageIoU指标

Figure 4: PageIoU指标示意图。

问题:传统IoU阈值评估不适合文档布局(文本块边界模糊)。

PageIoU定义:页面级覆盖度量,测量预测布局与真注的空间一致性。

PageIoU=∣Pcover∩Gcover∣∣Pcover∪Gcover∣\text{PageIoU} = \frac{|P_{cover} \cap G_{cover}|}{|P_{cover} \cup G_{cover}|}

优势:与人类感知对齐,粗略覆盖0.78分,精确匹配0.97分。

5.3 ADR框架(原子分解与重组)

ADR框架

Figure 5: ADR框架示意图。

公式分类:

  • 原子公式:最小不可分语义单元,紧密2D拓扑(如单个分数、矩阵)
  • 复合公式:垂直排列的原子公式集合(如多行推导)

ADR流程:

  1. 初始布局分析,识别复合公式区域
  2. 分解为原子公式行
  3. 独立识别每个原子公式
  4. 重组为完整公式

优势:克服VLM处理长/多行公式时的结构幻觉问题。

5.4 OTSL表格识别

表格识别流程

Figure 6: 表格识别流程。

四阶段流程:

  1. 检测表格边界框和旋转角度
  2. 裁剪和旋转校正
  3. 使用OTSL(优化表格结构语言)识别
  4. 转换为目标格式

OTSL优势:

  • 比HTML更简洁的中间表示
  • 减少token冗余
  • 更好处理复杂长表格

六、实验结果

推理性能

Table 3: 推理性能对比

模型参数后端硬件Tokens/sPages/s
MinerU2-VLM0.9BSGLangA100 80G3091.232.84
dots.ocr3.0BvLLM-311.060.28
MonkeyOCR-pro-3B3.7B--520.160.47
MinerU2.51.2BvLLMRTX 40901875.821.70
A100 80G2337.252.12
H200 141G4938.314.47

关键结果:

  • 1.2B参数实现2.12 pages/s(A100)
  • 比3B+模型快4-8倍

OmniDocBench结果

Table 5: OmniDocBench全面评估

模型参数Overall↑TextEdit↓FormulaCDM↑TableTEDS↑ReadOrderEdit↓
MinerU2-pipeline-75.510.20976.5570.900.225
Qwen2.5-VL-72B72B87.020.09488.2782.150.102
Gemini-2.5 Pro-88.030.07585.8285.710.097
dots.ocr3B87.190.06989.1283.370.088
MonkeyOCR-pro-3B3.7B88.240.06289.9884.160.083
MinerU2.51.2B88.580.06090.4685.860.073

关键结果:

  • 1.2B参数超越72B通用VLM和3B+专用VLM
  • 文本编辑距离最低(0.060)
  • 公式CDM最高(90.46)
  • 表格TEDS最高(85.86)

文本解析详细结果

Table 6: 不同文档类型文本编辑距离

模型SlidesAcademicBookTextbookExamMagazineNewspaperNotesFinancial
GPT-4o0.10190.12030.12880.15990.19390.1420.62540.26110.3343
Gemini-2.5 Pro0.03260.01820.06940.16180.09370.01610.13470.11690.0169
Qwen2.5-VL-72B0.04220.08010.05860.11460.06810.09640.2380.12320.0264
MinerU2.50.01220.01200.01890.06500.04480.01610.10500.04620.0113

关键发现:MinerU2.5在所有9种文档类型上均达到最低编辑距离。

Ocean-OCR结果

Table 7: Ocean-OCR基准测试

模型英文Edit↓中文Edit↓英文F1↑中文F1↑
Gemini-2.5 Pro0.0800.2040.9220.927
Qwen2.5-VL-72B0.0930.1400.9230.940
Ocean-OCR0.0570.0620.9370.962
MinerU2.50.0450.0590.9440.964

关键结果:

  • 英文和中文均达到最低编辑距离
  • 中文解析能力显著提升

olmOCR-bench结果

Table 8: olmOCR-bench详细结果

模型OverallAROSMTAOSHFMCLTTBase
Qwen2.5-VL-72B64.872.251.167.338.673.668.349.198.3
olmOCR71.863.941.072.943.995.177.381.298.9
dots.ocr73.666.335.888.340.994.182.481.299.5
MinerU2.575.276.654.684.933.796.678.283.593.7

关键结果:

  • 总体准确率75.2%,超越所有基线
  • arXiv数学(76.6%)和旧扫描数学(54.6%)显著领先
  • 表格识别(84.9%)仅次于dots.ocr

布局分析性能

Table 9: 布局分析性能(OmniDocBench)

方法Textual F1↑Image F1↑Table F1↑Equation F1↑Full Page F1↑
DocLayout-YOLO96.594.798.493.894.1
PP-StructureV396.692.998.296.794.6
MinerU2.597.595.098.494.795.9

表格识别性能

Table 10: 表格识别TEDS分数

方法PubTabNet↑FinTabNet↑CC-OCR↑OCRBench v2↑
Qwen2.5-VL-72B84.3982.9081.2281.33
MiniCPM-V 4.580.3085.4168.4980.28
MinerU2.588.6487.9182.2283.88

关键结果:在大多数基准上达到SOTA。

训练配置

Table 1: 训练阶段和超参数

阶段数据样本数训练参数Epoch
Stage-0aImage Caption558KMLP Adaptor1
Stage-0bVQA665KAll1
Stage-1Layout & OCR6.9MAll2
Stage-2Layout & OCR (难例)630KAll3

七、核心创新

创新点说明效果
两阶段解耦布局分析+内容识别分离效率和准确性双赢
PageIoU指标页面级覆盖度量与人类感知对齐
ADR框架原子分解与重组复杂公式解析突破
OTSL表示优化表格结构语言复杂表格识别提升
IMIC策略迭代推理一致性挖掘高效难例挖掘
统一标签系统全面精细分类布局分析标准化

八、与相关方法对比

方法参数特点MinerU2.5优势
GPT-4o-通用VLM更高精度,更低成本
Gemini-2.5 Pro-通用VLM更高精度,开源可用
Qwen2.5-VL-72B72B通用VLM60×更小,更高精度
dots.ocr3B专用VLM2.5×更小,更高精度
MonkeyOCR3.7B多阶段VLM3×更小,更高精度
olmOCR7B专用VLM6×更小,更高精度

九、局限性

  1. 模型规模:1.2B参数仍有一定推理开销
  2. 旋转文档:极端旋转角度处理仍有挑战
  3. 手写文档:未专门优化手写体识别
  4. 多语言:主要验证中英文,其他语言效果待验证

十、总结

核心贡献

  1. 解耦架构:首次在VLM中实现布局分析和内容识别的有效解耦
  2. 两阶段策略:粗到细解析,效率和准确性双赢
  3. 数据引擎:系统化的高质量数据生成流程
  4. 技术创新:PageIoU、ADR、OTSL等多项创新
  5. SOTA性能:1.2B参数超越72B通用VLM

性能总结

指标数值对比
OmniDocBench Overall88.58vs Gemini-2.5 Pro 88.03
olmOCR-bench75.2vs dots.ocr 73.6
推理速度2.12 pages/svs dots.ocr 0.28 pages/s
参数量1.2Bvs Qwen2.5-VL-72B 72B

技术影响

MinerU2.5展示了专用小模型超越通用大模型的可能性:

  • 解耦设计:复杂任务分解为简单子任务
  • 数据质量:系统化数据引擎比模型规模更重要
  • 效率优先:实际部署中速度和成本是关键
  • 开源可用:推动文档解析技术普及

十一、参考资源