Back to blog

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

首个多视频理解评估基准,评估MLLM在跨视频感知和推理方面的8项核心能力

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

一、论文概述

项目内容
标题MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
作者Tianhao Peng, Haochen Wang, Yuanxing Zhang, Zekun Wang, Zili Wang, Gavin Chang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Steven Huang, Zhaoxiang Zhang, Jiaheng Liu
论文https://arxiv.org/abs/2511.07250
发布2025-11-10 (v1), 2025-11-13 (v2)
代码库https://github.com/NJU-LINK/MVU-Eval

二、核心思想

问题定义

现有视频理解基准的局限性:

问题说明
单视频输入仅评估单个视频理解能力
缺乏跨视频推理无法评估多视频信息整合能力
应用场景有限无法覆盖体育分析、自动驾驶等多视频场景

真实应用场景

场景说明
体育分析多角度摄像机分析比赛
自动驾驶多传感器信息融合
视频检索多个相关视频的摘要和理解
影视分析多场景、多角色的跨视频推理

解决方案概述

MVU-Eval 是首个综合性多视频理解评估基准:

  • 1,824个精心策划的QA对
  • 4,959个视频,来自多个领域
  • 8项核心能力,涵盖感知和推理两个层面
  • 真实场景对齐:体育、自动驾驶、电影等

Figure 1: MVU-Eval概述

三、技术架构

基准设计

两层评估协议:

多视频理解
├── 感知层(Perception)
│   ├── 物体识别(OR)
│   ├── 空间理解(SU)
│   ├── 计数(Counting)
│   └── 比较(Comparison)
│       ├── 替换(Replacement)
│       ├── 移除(Removal)
│       └── 添加(Addition)
└── 推理层(Reasoning)
    ├── 知识密集推理(KIR)
    ├── 上下文学习(ICL)
    ├── 检索增强生成(RAG)
    └── 时序推理(TR)

Figure 2: 八项核心能力

感知层任务

任务说明视频数量
物体识别(OR)跨视频识别和跟踪相同物体126
空间理解(SU)从互补角度建模空间布局179
计数(Counting)聚合异步视频中的瞬态物体227
比较(Comparison)跨视频特征区分和细粒度分析135

推理层任务

任务说明视频数量
知识密集推理(KIR)领域知识整合281
上下文学习(ICL)跨视频模式识别164
检索增强生成(RAG)基于多视频信息生成答案339
时序推理(TR)时间排序、定位和描述373

数据集统计

Figure 3: 每个问题的视频数量分布

统计项数值
总QA对数1,824
总视频数4,959
平均每个问题视频数4.7
最大视频数13
平均问题长度111 tokens
平均视频token长度51,013

答案分布:

  • 选项A: 25.5%
  • 选项B: 25.8%
  • 选项C: 22.7%
  • 选项D: 20.4%
  • 其他: 5.6%

Figure 4: 视频类别分布

视频来源分布:

  • 生活类
  • 人类动作
  • 电影/电视
  • 体育
  • 游戏
  • 动画
  • 自动驾驶
  • AIGC

四、核心创新

创新点说明优势
首个多视频基准评估跨视频理解和推理能力填补评估空白
8项核心能力感知+推理两层评估全面覆盖
真实场景对齐体育、自动驾驶等应用实用性强
大规模数据1,824 QA对,4,959视频统计显著性
开源评测框架提供标准化评估流程促进研究

五、实验结果

主要结果

闭源模型:

模型总体感知推理ORSUCountingKIRICLRAGTR
Gemini 2.5 Pro58.447.664.154.765.676.350.234.843.783.1
Gemini 1.5 Pro57.351.660.355.366.167.443.147.644.078.6
Gemini 2.0 Flash56.346.060.452.045.475.653.745.144.579.1
GPT-4o55.954.756.557.758.974.636.338.942.074.6

开源模型(>40B):

模型总体感知推理
Qwen2.5-VL-72B57.152.459.5
InternVL3-78B50.642.954.6
InternVL2.5-78B48.744.451.2
LLaVA-OneVision-72B44.631.751.4

开源模型(8B-40B):

模型总体感知推理
Qwen2.5-VL-32B55.648.459.3
InternVL3-38B48.446.049.8
InternVL2.5-38B44.537.348.1

开源模型(<8B):

模型总体感知推理
Qwen2.5-VL-7B51.950.852.5
VideoChat-Flash-7B48.548.448.5
VideoLLaMA3-7B47.548.446.8

关键发现

Figure 5: 模型缩放效应

  1. MVU-Eval非常具有挑战性

    • 最佳闭源模型(Gemini 2.5 Pro)仅达到58.4%
    • 远低于人类专家水平(93.6%)
  2. 不同子任务差异大

    • Gemini 2.5 Pro在计数和知识推理上优于Qwen2.5-72B-VL
    • 但Qwen2.5-72B-VL在RAG上(48.1%)优于Gemini 2.5 Pro(43.7%)
  3. 缩放效应保持

    • Qwen2.5-VL系列(3B/7B/32B/72B):更大模型性能更好
    • InternVL3系列(8B/38B):更大模型性能更好
  4. 小模型可能优于大模型

    • Qwen2.5-VL-3B优于LLaVA-OneVision-7B
    • 原因:更好的架构设计或更有效的数据策略

视觉信息有效性

VideoLLaMA3-7B在不同输入下的表现:

输入类型准确率变化
多视频47.5%-
单视频44.2%-3.3%
多图像42.8%-4.7%
文本描述38.5%-9.0%
无视频32.1%-15.4%

关键发现:

  • 视觉信息越多,性能越好
  • 证明MVU-Eval任务设计合理,与多视频上下文紧密相关

六、相关工作

单视频基准

基准视频数QA对数多视频
MVBench4,0004,000×
LongVideoBench3,7636,678×
Video-MME9002,700×
MLVU1,7303,102×
MVU-Eval4,9591,824✓

多模态评估

  • 图像理解:MMBench, MMMU等
  • 视频理解:Video-MME, LongVideoBench等
  • 多视频理解:MVU-Eval(首个)

七、总结

核心贡献

  1. 首个多视频理解基准:填补评估空白
  2. 8项核心能力:感知+推理全面覆盖
  3. 大规模数据:1,824 QA对,4,959视频
  4. 真实场景对齐:体育、自动驾驶等应用
  5. 标准化评测:开源评测框架

技术影响

  • 评估标准:为多视频理解提供统一评估框架
  • 模型改进:揭示当前模型的局限性和改进方向
  • 应用推动:促进体育分析、自动驾驶等领域的研究
  • 研究方向:指明多视频理解的未来研究重点

局限性

  1. 任务类型有限:8项能力可能未完全覆盖所有场景
  2. 视频来源:部分视频来源可能不够多样化
  3. 评估指标:仅使用准确率,可能不够全面
  4. 模型限制:部分模型输出格式不规范

八、参考资源

论文

相关基准

  • Video-MME: Fu et al., 2024
  • LongVideoBench: Wu et al., 2025
  • MVBench: Li et al., 2024
  • MLVU: Zhou et al., 2024

评估模型

  • Gemini 2.5 Pro: Google
  • GPT-4o: OpenAI
  • Qwen2.5-VL: Alibaba
  • InternVL3: Shanghai AI Lab