论文

CORE: 通过 Reranker 蒸馏提升 MLLM Embedding 的组成性推理能力

CORE: 通过 Reranker 蒸馏提升 MLLM Embedding 的组成性推理能力

基于 MLLM 的 embedding 模型在组成性检索中仍存在局限,常常难以区分包含相同概念但属性-对象绑定不同的场景。然而,同样的骨干网络在用作交叉注意力 reranker 时却能解决此类区分,这促使我们将 reranker 的组成性判断蒸馏到 embedding 模型中。 我们提出 CORE,它合成跨越五个组成性匹配级别的候选列表,并引入 Rank-KL 目标,训练 embedding 模型复现 reranker 的细粒度排序。我们进一步引入分级评估协议,并在相同数据和调参预算下对比对比学习、成对 CoSENT 和列表式 Rank-KL。 比较表明,CoSENT 和 Rank-KL 均比对比学习更有效地利用多级监督,其中 Rank-KL 取得最强的整体性能。在三个组成性推理基准(COLA、SUGARCREPE++、NEGBENCH)上,CORE-RERANKER-8B 实现 82.7% 的总平均分,超过 Jina-Reranker 10.7 个百分点,而 CORE-EMBED-8B 在所有评估的 embedding 模型中取得最佳总平均分(0.666)。这些改进还迁移到 MCMR 基准,同时不牺牲在 COCO 和 Flickr30K 上的检索性能。

论文精读

TL;DR CORE 将跨注意力 reranker 的组合推理排序蒸馏进 embedding 模型,用合成多级候选与 Rank-KL 目标提升组合检索,不牺牲常规检索性能。

问题

问题背景

多模态检索系统越来越依赖 MLLM-based embedding models 将图像和文本映射到共享向量空间,但细粒度的 compositional reasoning(组合推理)仍然是当前关注的核心短板。业界对区分同一场景中不同 attribute–object binding 的需求日益增加。

现有方法局限

传统 contrastive learning 仅通过正负样本对进行训练,无法建模候选之间的多级匹配程度,导致模型难以区分“红色上衣配蓝色裤子”和“蓝色上衣配红色裤子”这类组合差异。pairwise CoSENT 虽引入排序监督,但只考虑两两相对关系,忽视了列表整体排序中的细粒度差异。此外,合成数据通常缺乏明确的 compositional mismatch 层级,难以提供足够的监督信号。

为什么这个问题难/重要

组合推理要求模型同时理解多个概念及其绑定关系,而不能仅依赖孤立特征。embedding 模型 推理高效,但表达能力有限;cross-attentive reranker 可以精确判断组合匹配,但计算成本高、无法大规模用于召回。如何将 reranker 的细粒度判断蒸馏到 embedding 模型中,同时不牺牲标准检索性能,是一个极具工程价值但尚未充分解决的难题。

行业类比

类似在电商视觉搜索中,用户查询“红裙蓝鞋”时,系统必须避免返回“蓝裙红鞋”的图片——这对 embedding 模型的 compositional binding 能力提出了直接挑战。

核心洞察

  • 同一 MLLM 骨干在 reranker 与 embedding 两种推理模式下呈现明显的组合推理差距,表明瓶颈主要来自 embedding 的训练目标与对齐方式,而非模型容量不足。CORE 利用这一观察设计蒸馏路径,将 reranker 的细粒度组合判断迁移到 embedding 模型,绕开了直接构造组合负样本或依赖昂贵人工标注的问题。与单纯改进对比学习数据或损失函数的同类工作相比,该方法直接复用教师模型已具备的排序能力,传递的信号更稠密、更贴近真实组合语义。
  • Rank-KL 作为 listwise 蒸馏目标,让 embedding 模型学习 reranker 对五个组合匹配级别的完整排序分布,比对比学习和成对 CoSENT 更能利用多级细粒度监督。论文在同等数据和训练预算下对比三种目标,发现 CoSENT 和 Rank-KL 均显著超越对比学习,而 Rank-KL 取得最强综合性能,在 COLA、SugarCrepe++、NegBench 上平均成绩突出,同时保持 COCO 和 Flickr30K 的标准检索指标不下降。这证明该目标能同时兼顾组合推理能力和通用检索质量,对实际部署中的多目标权衡提供了有效方案。

方法

输入

CORE 的输入为文本查询(query),并基于该 query 合成一组候选图像(或文本)列表,覆盖五个组合匹配级别(从完全匹配到属性-对象绑定完全错误)。

关键模块

  1. 组合候选合成:对每个 query,利用 MLLM 生成多个候选,包含相同概念不同绑定关系(如“红苹果” vs “绿苹果”),形成具有细粒度难度梯度的候选列表。自动质控后通过人工验证,确保候选间只在组合关系上存在差异。

  2. 跨注意力 reranker 教师:以原始 MLLM 为骨干构建 reranker,对候选列表进行打分,得到精确的排序。该 reranker 能较好地区分组合关系,但推理成本高(需逐对交叉注意力)。

  3. Rank-KL 蒸馏:将 reranker 的排序结果作为教师信号,训练 embedding 模型(学生)输出与教师排序分布匹配的相似度。具体地,学生模型输出候选与 query 的相似度分数,通过 Rank-KL 损失最小化学生排序分布与教师排序分布之间的 KL 散度,使学生在单向量检索模式下也能复现细粒度排序。

输出

训练后的 embedding 模型具备组合推理能力,可直接用于双塔检索,无需 reranker 二次排序。

与同类方法差异

相较于 contrastive learning(仅处理正负样本对)和 CoSENT(pairwise 排序),Rank-KL 作为 listwise 目标能同时利用候选列表中所有样本的排序关系,并从 reranker 蒸馏中学习到更丰富的组合监督信号。

实验

实验设计

CORE 使用合成候选列表覆盖五级组合匹配,并通过 Rank-KL 蒸馏将 reranker 的细粒度排序迁移到 embedding 模型。在同一数据和 tuning budget 下对比 contrastive learning、pairwise CoSENT 与 listwise Rank-KL。评估基准包括三个组合推理任务 COLA、SUGARCREPE++、NEGBENCH,并迁移到 MCMR,同时验证 COCO / Flickr30K 检索性能不下降。

关键发现

实验结果证明 pairwise 与 listwise 损失比 contrastive learning 更有效地利用多级监督:

  • CoSENT 和 Rank-KL 均优于对比学习,其中 Rank-KL 整体表现最强。
  • CORE-RERANKER-8B 在三个组合推理基准总平均达到 82.7%,比 Jina-Reranker 高 10.7 个点。
  • CORE-EMBED-8B 总平均 0.666,在所有评估的 embedding 模型中排名第一。

与基线的对比解读

对比学习仅用正负 pair,难以建模候选间细粒度排序;CoSENT 虽引入 pairwise 多级监督,但 listwise 的 Rank-KL 直接学习排序分布,更贴合 reranker 的输出。这验证了从 cross-attentive reranker 向 bi-encoder 做排序蒸馏的有效性。对工程而言,该路线可在保持 embedding 检索效率的同时,显著提升组合推理能力,适合先召回后重排的两阶段检索架构。

行业影响

落地场景

CORE 直接适用于需要精细化视觉语义匹配的产品与业务:

  • 电商搜索与推荐:商品图像中“红色条纹衬衫”与“蓝色条纹衬衫”的区分,以及跨模态查询“带白色鞋带的红色运动鞋”的精确召回。
  • 内容平台审核与检索:短视频 / 直播画面中的品牌标识、人物动作、场景绑定关系的自动识别与检索,减少误标。
  • 多模态知识库问答:企业文档 / 商品目录中“图表标题与数据系列”的对应关系查询,提升 RAG 管线的证据定位精度。

商业价值

  • 降低人工复核成本:组合错误(属性—物体误绑定)是视觉检索的常见失败模式,CORE 将 reranker 的细粒度排序能力蒸馏到 embedding 模型,使单阶段检索就能区分易混淆样本,减少后续人工校验或二次精排的资源投入。
  • 改善用户体验与转化率:在电商场景,更准确的组合检索可直接提升点击率与转化率;在内容平台,更精准的帧级检索可增强推荐相关性,降低用户跳出率。
  • 保持既有性能不退化:论文验证在 COCO / Flickr30K 上标准检索指标不掉点,因此部署无需担心通用能力回退,适合渐进式升级。

与现有产品 / 工作流的接口

  • 直接替换 embedding 模型:CORE-Embed-8B 可作为现有双塔检索的向量编码器,输出维度兼容主流向量库(如 Faiss、Milvus),无需改动召回架构。
  • 作为 reranker 增强精排:CORE-Reranker-8B 可集成到“召回 + 精排”的级联系统中,对 top-K 候选做组合一致性打分,与现有 cross-attentive reranker(如 Jina-Reranker)接口一致。
  • 多阶段渐进部署:先用 reranker 蒸馏数据离线微调 embedding 模型,再在线灰度替换,通过 A/B 测试验证组合检索收益,对工程侵入小。

具体 use case:

  1. 电商平台图像搜索:用户上传一张“黑色皮质手提包”图片,系统需要区分“棕色皮质手提包”与“黑色帆布手提包”。使用 CORE-Embed-8B 作为商品向量编码器,可显著减少错配召回,降低客服投诉与退货率。
  2. 企业数字资产管理系统:市场部检索“2025 年 Q3 蓝色折线图”时,传统 embedding 可能返回大量含“蓝色”或“折线图”但不匹配年份与图表的图片。CORE-Reranker-8B 在精排阶段重新打分,可保证多条件约束的精确命中,提升资产复用效率。

局限

  • **合成数据依赖 reranker 质量。** CORE 的核心是将 cross-attentive reranker 的排序判断蒸馏到 embedding 模型,但合成候选列表的质量完全取决于 reranker 的判别能力。尽管论文引入了自动质量控制与人工验证,验证规模有限,难以覆盖长尾概念组合与歧义场景。若 reranker 在特定属性-物体绑定上存在系统性偏差(例如对某些罕见属性不敏感),蒸馏过程会将这些错误信号固化到 embedding 模型中,导致组合推理能力提升不均衡。该方法本质上以 reranker 为教师,上限受限于教师模型的能力边界,且论文未充分分析教师模型错误对下游 embedding 的影响范围。
  • **评测基准与真实分布仍有差距。** 论文在 COLA、SUGARCREPE++、NEGBENCH 三个组合推理基准上验证,这三个基准主要覆盖属性-物体绑定、否定与替换等特定组合形式,对空间关系、数量、动作、逻辑连接等更复杂组合类型覆盖不足。即使 MCMR 迁移表现有提升,也局限在相似域内,缺少跨域、跨数据分布的系统评估。此外,COCO 和 Flickr30K 上的检索性能无损失,但这两个数据集本身组合多样性有限,不能完全证明方法在开放世界检索中的鲁棒性。
  • **训练管线复杂,计算与调参成本较高。** CORE 需要先训练或利用现成的 cross-attentive reranker,再构建五级组合匹配候选列表,并在 embedding 模型上优化 Rank-KL 损失。这一流程涉及多个阶段,包括数据合成、质量控制和超参数调整,部署成本显著高于普通对比学习。Rank-KL 对候选列表长度、负样本分布及温度系数等敏感,论文未详细讨论这些超参的稳健性。实验仅在 8B 参数 MLLM 骨干上验证,较小模型(如 2B/4B)能否保留同样的组合蒸馏收益仍未知。
论文Tingyu Song2026-09-03原文

相关内容