Back to blog

MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query

首个多语言多条件语义检索数据集,通过对比重建框架提升检索性能45.9%

MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query

论文信息: arXiv:2506.03144 [cs.CV] 4 Jun 2025

机构: ByteDance Inc.

数据集规模: 320,000 queries, 135,000 products, 5 languages, 7 categories


一、论文概述

1.1 研究背景

语义检索是现代应用的关键任务,但在多语言、多条件、多图像场景下仍存在不足。现有数据集局限于单一语言、单一图像或单一检索条件,无法充分利用视觉信息的表达能力。

核心挑战:

挑战说明
多条件查询实际检索涉及多个条件(如图案、颜色、风格)
多图像输入查询可能包含多个图像作为条件
多语言支持需要跨语言检索能力
视觉信息利用现有方法未充分利用图像信息

1.2 核心贡献

贡献说明
MERIT 数据集首个多语言多条件语义检索数据集
Coral 框架对比重建微调框架,提升检索性能 45.9%
局限性识别发现现有方法忽略条件元素的问题
跨基准验证在 8 个标准检索基准上验证泛化能力

1.3 一句话总结

MERIT 是首个多语言多条件语义检索数据集,包含 320,000 个查询和 135,000 个产品,通过 Coral 框架实现 45.9% 的性能提升。


二、核心思想

2.1 设计原则

┌─────────────────────────────────────────────────────────────────┐
│                    MERIT 设计原则                                │
├─────────────────────────────────────────────────────────────────┤
│  1. 多条件查询 (Multi-Condition Query)                          │
│     • 每个查询包含多个条件(文本+图像)                           │
│     • 条件包括图案、颜色、风格等                                 │
│     • 需要同时满足所有条件                                       │
│                                                                 │
│  2. 多语言支持 (Multilingual Support)                            │
│     • 支持 5 种语言(英语、马来语、印尼语、越南语、泰语)        │
│     • 跨语言检索能力                                            │
│     • 语言无关的语义理解                                        │
└─────────────────────────────────────────────────────────────────┘

2.2 关键技术问题

问题现有方案的局限MERIT 解决方案
条件元素忽略现有方法仅关注全局语义Coral 框架保留细粒度条件元素
视觉信息利用图像可被文本替代而不影响性能强调视觉信息的必要性
多图像处理现有 MLLM 丢失交错输入能力训练后序列输入性能提升 14.3%
数据集局限单一语言、单一图像、单一条件多语言、多图像、多条件数据集

三、MERIT 数据集

3.1 数据集概览

交错多条件检索示例 图 1:交错多条件语义检索示例。MERIT 支持首个具有复合多条件查询的多语言语义检索,查询交错文本描述和视觉参考。

统计项数量
总查询数320,000
两条件查询319,600
三条件查询300
四条件查询100
唯一属性数116
唯一属性值数2,594
产品数量135,000
支持语言5(英语、马来语、印尼语、越南语、泰语)
产品类别7

3.2 数据集对比

数据集对比 图 2:与现有数据集的对比。左:现有工作局限于单条件、单图像、单语言场景。右:我们的基准支持多语言语义检索,具有复合多条件查询。

特性现有数据集MERIT
语言单一语言5 种语言
图像单一图像多图像
条件单一条件多条件
视觉必要性可被文本替代不可替代

3.3 数据收集流程

数据收集流程 图 5:MERIT 数据标注流程。通过 4 个步骤的开放集去重和多轮过滤确保数据多样性和质量。

四步流程:

步骤说明
1. 高质量产品选择从 6 个东南亚国家选择热门产品,使用 GPT-4o 生成标题
2. 产品标注开放标注获取细粒度属性,属性界定后标注产品
3. 搜索查询组合三种采样方法:均匀采样、属性均匀采样、高相似度产品优先采样
4. 过滤与精炼自动过滤(规则+统计)+ 人工过滤(专家标注)

四、Coral 框架

4.1 框架概览

Coral 框架 图 8:Coral 概览。损失函数由三个组件组成:对比学习损失、视觉重建损失和掩码语言建模损失。

核心组件:

组件说明目标
对比学习损失InfoNCE Loss提取全局语义
视觉重建损失MSE Loss保留视觉条件元素
掩码语言建模损失MLM Loss保留文本条件元素

4.2 关键公式

对比学习损失 (InfoNCE Loss):

Lcl=−1N∑i=1Nlog⁡(exp⁡(qi⋅ki+τ)∑j=1Nexp⁡(qi⋅kjτ))\mathcal{L}_{cl} = -\frac{1}{N} \sum_{i=1}^{N} \log \left( \frac{\exp\left(\frac{q_i \cdot k_{i+}}{\tau}\right)}{\sum_{j=1}^{N} \exp\left(\frac{q_i \cdot k_j}{\tau}\right)} \right)

视觉重建损失 (MSE Loss):

Lmse=−1N∑i=1N∥E^−E∥22,where E^=Fθv[MASKv(E);heos]\mathcal{L}_{mse} = -\frac{1}{N} \sum_{i=1}^{N} \left\| \hat{E} - E \right\|_2^2, \text{where } \hat{E} = \mathcal{F}_{\theta}^{v}[\mathcal{MASK}_{v}(E); h_{eos}]

掩码语言建模损失:

Lmlm=−1N∑i=1Nlog⁡P(x^i∣X),where x^i=[Fθl[MASKl(E);heos]](i)\mathcal{L}_{mlm} = -\frac{1}{N} \sum_{i=1}^{N} \log P\left(\hat{x}_i \mid X\right), \text{where } \hat{x}_i = [\mathcal{F}_{\theta}^{l}[\mathcal{MASK}_{l}(E); h_{eos}]]_{(i)}

总体训练目标:

max⁡θ,θv,θlL=Lcl+λ1Lreg+λ2Lrec\max_{\theta, \theta_v, \theta_l} \mathcal{L} = \mathcal{L}_{cl} + \lambda_1 \mathcal{L}_{reg} + \lambda_2 \mathcal{L}_{rec}

4.3 技术亮点

1. 嵌入重建:

  • 掩码视觉和语言部分的注意力图
  • 重建原始嵌入以保留细粒度条件元素
  • 视觉重建和语言重建同时进行

2. 对比学习:

  • InfoNCE Loss 提取全局语义
  • 监督对比学习区分正负样本
  • 温度系数控制相似度分布

3. 多模态融合:

  • 交错图像-文本输入
  • 序列输入优于图像拼接
  • 保留更多图像信息

五、实验结果

5.1 主要结果

MERIT 基准性能:

方法类型R@1 (%)R@5 (%)R@10 (%)MRR (%)
Zero-Shot
InternVL2.5 (1B)Cat0.200.981.720.56
Qwen2.5-VL (3B)Cat0.050.270.400.14
Embedding MLLM
E5-V (8B)Avg3.107.549.905.03
LLaVE (2B)Cat5.8043.6253.5121.78
GME-Qwen2VL (22B)Cat8.4747.1356.1825.02
LamRA-Qwen2.5VL (7B)Cat12.0539.1348.0323.80
Coral (Ours)
Qwen2.5-VL + CoralSeq69.6889.2693.0878.33

关键发现:

  • 现有方法在 MERIT 上表现不佳,最佳 R@1 仅 12.05%
  • Coral 实现 45.9% 的性能提升
  • 序列输入优于图像拼接

5.2 消融实验

方法LoRA类型R@1 (%)R@5 (%)R@10 (%)MRR (%)
基线 (CL)✓Seq48.5273.1177.9359.48
+Vision✓Seq58.1883.1988.0269.13
+Language✓Seq58.3883.0188.2669.35
+Vision✗Seq59.4685.4690.8170.89
+Language✗Seq59.9886.0190.7271.22
Coral (Full)✗Seq69.6889.2693.0878.33

关键发现:

  • 嵌入重建显著提升性能
  • 多模态重建优于部分重建
  • 全参数微调优于 LoRA

5.3 跨基准验证

跨基准性能 图 9:我们的方法与其他方法在 8 个标准检索任务上的对比

关键发现:

  • 在 8 个标准检索基准上一致提升
  • VisDial 上提升 181%
  • 强大的泛化能力

5.4 视觉必要性测试

视觉必要性 图 6:(a) 视觉必要性测试,(b) 分布外场景

关键发现:

  • 在 FashionIQ 和 CIRR 上,图像被文本替代后性能无显著下降
  • 在 MERIT 上,移除图像导致性能下降 73.9%
  • 证明 MERIT 中图像和文本都不可或缺

六、核心创新

6.1 创新点总结

创新点说明理论/实验依据
首个多条件数据集320,000 查询,5 语言,7 类别数据集统计和基准对比
条件元素识别发现现有方法忽略条件元素错误分析和消融实验
Coral 框架对比重建保留细粒度条件45.9% 性能提升
交错输入发现序列输入优于图像拼接14.3% 性能提升

6.2 技术亮点

1. 数据集设计:

  • 开放属性标注增加多样性
  • 闭合产品标注提高精度
  • 三种采样算法增强丰富性

2. 错误分析:

  • 属性错误:无法提取特定属性
  • 视觉理解错误:误解视觉内容
  • 类别错误:产品类别识别错误

3. 框架创新:

  • 嵌入重建保留条件元素
  • 对比学习提取全局语义
  • 多模态融合提升性能

七、应用场景

7.1 电子商务检索

  • 多条件搜索:用户同时指定图案、颜色、风格等条件
  • 跨语言检索:支持多种语言的商品搜索
  • 视觉搜索:通过图像参考进行检索

7.2 内容推荐

  • 个性化推荐:基于多条件用户偏好
  • 跨模态推荐:结合文本和图像信息
  • 多语言推荐:支持多语言用户

7.3 信息检索

  • 多模态搜索:结合文本和图像查询
  • 条件过滤:精确匹配多个条件
  • 跨语言信息检索:多语言文档检索

八、相关工作

8.1 语义检索

方法特点局限性
CLIP视觉-语言对齐单一条件,单一图像
E5-V多模态嵌入未充分利用视觉信息
LLaVEMLLM 检索多条件性能有限

8.2 多模态学习

方法特点局限性
LLaVA视觉问答生成式模型不适合检索
Qwen2.5-VL多模态理解未针对检索优化
Coral对比重建本方法

九、总结

9.1 核心贡献

  1. MERIT 数据集:首个多语言多条件语义检索数据集
  2. Coral 框架:对比重建微调框架,提升 45.9%
  3. 局限性识别:发现现有方法忽略条件元素
  4. 跨基准验证:在 8 个标准检索基准上验证

9.2 技术影响

影响领域具体影响
语义检索推动多条件检索研究
多模态学习展示视觉信息的重要性
跨语言检索支持多语言检索场景
电子商务改进商品搜索体验

9.3 局限性

  • 数据集规模:320,000 查询仍有限
  • 语言覆盖:仅支持 5 种语言
  • 计算开销:全参数微调成本较高
  • 条件数量:主要支持 2-3 个条件

9.4 未来方向

  1. 数据集扩展:增加更多语言和条件
  2. 模型压缩:降低计算开销
  3. 实时检索:支持实时多条件检索
  4. 更多模态:扩展到音频、视频等模态

十、参考资源

10.1 论文链接

10.2 代码资源

10.3 关键图表

图表说明路径
图 1交错多条件检索示例figure-1-interleaved-retrieval.png
图 2数据集对比figure-2-dataset-comparison.png
图 5数据收集流程figure-5-data-pipeline.png
图 6视觉必要性测试figure-6-visual-necessity.png
图 8Coral 框架概览figure-8-coral-overview.png
图 9跨基准性能对比figure-9-retrieval-benchmarks.png

10.4 相关论文

论文作者年份关系
CLIPRadford et al.2021视觉-语言对齐基础
LLaVALiu et al.2024MLLM 架构
Qwen2.5-VLAlibaba2025多模态理解基线
E5-VMicrosoft2024多模态嵌入基线

10.5 关键技术术语

术语英文说明
语义检索Semantic Retrieval基于语义相似性的检索
多条件查询Multi-Condition Query包含多个条件的查询
对比学习Contrastive Learning区分正负样本的学习方法
嵌入重建Embedding Reconstruction重建嵌入以保留信息
交错输入Interleaved Input交错的图像-文本输入

分析完成时间:2026年6月17日 分析工具:Claude Code + agent-browser