论文

Your Embedding Model is SMARTer Than You Think

Your Embedding Model is SMARTer Than You Think

多模态检索通常依赖单向量检索器,它将丰富的序列化令牌压缩为单一全局表示。尽管高效,但会丢失密集检索任务所需的关键细粒度局部证据。 为解决此问题,我们提出SMART框架,通过对比训练和延迟交互推理,解锁标准单向量模型中潜藏的多向量能力。我们首先证明,对池化嵌入的标准对比训练通过梯度流隐式塑造了前序隐藏状态的检索几何结构。在推理时直接对这些冻结的隐藏状态应用延迟交互,SMART作为一种即插即用升级,持续提升多模态性能,甚至在MMEB-V2上进一步改进了现有最佳模型。 此外,SMART在视觉文档检索中展现出优越性能:简单的轻量级后训练不仅节省时间和计算,还使单向量模型超越SoTA多向量方法。最终,SMART既提供了高效的推理增强,又为多模态检索提供了强大的微调技术。代码和权重已开源。

论文精读

TL;DR 无需额外训练,通过挖掘单向量模型隐藏状态的多向量潜力,以即插即用的后期交互显著提升多模态检索性能,甚至超越专用多向量模型。

问题

问题背景

多模态检索(multimodal retrieval)是跨文本、图像、视频等异构数据高效搜索的核心技术,广泛应用于搜索引擎、RAG 系统等,当前主流依赖 单向量检索器(single-vector retriever)进行大规模索引与相似度计算。

现有方法的局限

  • 单向量模型 通过均值池化或 [CLS] token 将整个序列压缩为一个全局向量,索引速度和内存开销极优,但会丢弃 token 级别的 局部证据,在需要细粒度匹配的任务(如视觉文档检索、视频时刻定位)中精度明显不足。
  • 多向量模型 保留所有 token 表示,通过 迟交互(late-interaction)计算 query-token 与 doc-token 的细粒度相似度,准确性更高,但通常需要从零开始训练,训练与索引成本高昂,且许多方法缺失全局总结向量,无法利用高效的粗筛管道。

这种精度与效率的权衡,导致实际部署时不得不在两者间妥协。

为何此问题重要且困难

技术挑战:

  • 单向量模型在标准对比训练中,梯度是否隐式地将局部信息编码到中间隐藏状态?此前缺乏明确的理论与实验支撑。
  • 如何在完全不修改预训练模型架构的情况下,将 frozen 的单向量模型即插即用地转化为多向量推理,同时保持甚至超越专用多向量方法的性能,是一个开放难题。

业界关注度: 多模态检索是 RAG、多模态搜索的基础组件,任何无额外训练即可提升检索精度的技术都能直接降低计算成本,加速产品迭代。SMART 证明,常规单向量模型通过巧妙的迟交互应用即可比拟甚至超越多向量模型,对工程实践具有直接指导意义。

行业类比

类似 双塔推荐模型 中,通过增加用户-物品交互特征提升精度但牺牲延迟;SMART 相当于在不改变双塔架构的前提下,利用现成 embedding 内部的细粒度交互能力,获得既快又准的检索体验,与推荐系统中的 特征交互蒸馏 有异曲同工之妙。

核心洞察

  • 单向量模型的隐藏状态蕴含着被标准对比学习训练所塑造的局部证据能力:标准对比损失虽然只在池化后的全局表征上施加监督,但梯度会反向传播到所有 token 的隐藏状态,隐式地使它们学习到有助于检索的局部特征。这揭示了为何冻结的隐藏状态可以直接用于多向量后期交互,无需专门的多向量训练。该发现打破了“多向量检索必须额外训练”的固有认知,说明了单向量模型事实上同时具备了局部与全局表征的潜力。
  • SMART 提出的推理时即插即用升级与轻量级后训练策略,为模型部署提供了极致的高效路径:通过直接利用冻结的隐藏状态进行 MaxSim 等后期交互计算,无需任何训练即可显著提升多模态检索性能;再通过轻量级 Adapter 或 LoRA 微调,能够进一步使其单向量模型在视觉文档检索等任务上超越最先进的多向量模型。这种分阶段优化范式,兼顾了零成本增强与低资源调优,大幅降低了从单向量迁移到多向量系统的工程和计算门槛。

方法

方法核心流程

SMART 方法从冻结的单向量多模态编码器(如 CLIP 或 SigLIP)出发,将其隐式多向量能力释放为高效的检索信号,整个流程可概括为“输入 → 隐藏状态提取 → 后期交互 → 相似度分数”四步。

关键模块拆解

1. 隐藏状态中的隐式检索几何

  • 标准单向量模型仅使用最后的池化嵌入作为全局表示,训练时对比损失仅作用于该池化向量。
  • SMART 通过梯度反传分析发现,池化嵌入的监督信号会通过梯度流反向塑造前面各层的隐藏状态,使其逐步获得细粒度的局部区分能力——即便这些隐藏状态从未被直接优化。

2. 直接后期交互(Direct Late-Interaction)

  • 推理时不再只取池化输出,而是冻结模型并提取所有 token 的隐藏状态(例如图像 patch 和文本 token 的序列)。
  • 对查询和文档的 token 序列执行 ColBERT 风格的 MaxSim 操作:对于查询的每个 token,计算其与文档所有 token 的最大余弦相似度,再对所有查询 token 求和,得出最终相关性分数。
  • 此过程完全即插即用,无需修改模型结构或重新训练,极大保持了推理效率。

3. 可选的轻量级后训练

  • 为进一步提升视觉文档等领域的性能,可加入极轻量的适配器层或使用 LoRA 微调部分参数。
  • 此时模型主体依然冻结,仅训练少量新增参数,使单向量模型在 Visual Document Retrieval 上超越专门训练的多向量模型(如 ColPali)。

与同类方法的差异:多向量方法(如 ColPali)通常需要从零开始联合训练编码器与交互,计算开销大且丢弃全局汇总能力;SMART 通过揭示隐式多向量几何,直接将任意现成单向量模型升级为多向量检索器,做到训练成本极低甚至无需训练,同时保留全局池化表示用于粗筛或混合评分。

实验

实验设计

SMART 通过 冻结的单向量模型 直接对中间隐藏状态做 Late Interaction,无需额外训练即可提升多模态检索性能。实验分为三个层次:

  1. 玩具基准验证:构造一个局部证据高度可控的合成任务,揭示对比训练确实会将局部信息隐式编码到非池化层的 hidden states 中。
  2. 即插即用评测:在 MMEB-V2 等多模态检索基准上,对现成的单向量模型直接应用 SMART,观察零成本升级效果。
  3. 轻量后训练:在冻结 backbone 上加 小型适配器LoRA 微调,进一步释放多向量潜力,尤其在 Visual Document Retrieval 任务上超越需要专用训练的多向量模型。

关键发现

  • 标准单向量对比学习通过梯度流,已经隐式地把细粒度证据分布在了各层 hidden states 中,但被池化操作丢弃。
  • 单纯在推理时引入 Late Interaction,能在不增加训练成本的情况下,持续提升多种模态的检索精度,甚至让现有最先进模型在 MMEB-V2 上更进一步。
  • 轻量后训练配合 SMART,可让同一个单向量模型在 Visual Document Retrieval 上超越 SoTA 多向量模型,同时训练开销远小于从头训练多向量系统。
  • 多层 Late Interaction 分析表明,中间层(非最后层)的 hidden states 贡献了最多的局部匹配信号。

与基线的深度对比

与典型多向量模型(如 ColBERT 风格)不同,SMART 不要求改变训练范式:它复用了单向量模型的对比监督信号,因而无需专门构造局部正/负例。相比纯粹的单向量检索,SMART 在保持紧凑全局表示的同时,自动捕获了 token 级交互,弥补了单向量模型丢失局部证据的短板

在即插即用模式下,SMART 未增加任何训练开销,却能在多个基准上系统性超过原始模型;加入适配器或 LoRA 后,它甚至能以更少的计算量反超纯多向量方案,揭示出现有单向量模型的巨大未开发潜力。

行业影响

落地场景

SMART 为多模态检索提供了一种即插即用的升级方案,无需重新训练即可将现有单向量模型(如 CLIP、BLIP)转化为多向量检索器,显著提升对细粒度局部证据的召回能力。主要落地场景包括:

  • 电商搜索:在商品图像检索中,利用后期交互捕捉商品细节(如 Logo、纹理),提升以图搜图准确率。
  • 内容平台:视频/图文平台中,对视频帧、文档截图等富视觉内容进行精细化片段检索,改善用户体验。
  • 企业知识库:视觉文档(PDF、扫描件)的跨模态搜索,快速定位图表、表格等关键信息区域。

商业价值

  • 降低成本:SMART 直接复用已有的单向量模型,省去从零训练多向量模型所需的大量 GPU 时和标注成本。通过轻量化 LoRA 微调,甚至能让单向量模型超越专门的多向量模型 SOTA,进一步压缩算力投入。
  • 收入提升:在广告推荐、电商搜索等场景中,更精准的检索直接转化为更高的点击率和转化率。
  • 体验升级:用户可进行更细粒度的查询(如“找带红色条纹的衬衫”),系统能理解局部属性,而不仅是全局语义,减少无关结果。

与现有产品/工作流的接口

SMART 可无缝嵌入主流向量检索架构:

  • 推理侧:作为编码器后的后处理层,在生成单向量全局表示的同时,保留隐藏状态用于后期交互。只需增加一个轻量级的 MaxSim 算子即可,兼容 Faiss、Milvus 等向量引擎。
  • 训练侧:若需进一步提升,可采用 SMART 提出的 Two-Stage 微调策略:冻结原有参数,仅插入小型 Adapter 或使用 LoRA 训练少量参数,避免灾难性遗忘,且训练成本极低。

具体落地用例

  1. 某全球电商平台:使用 CLIP-ViT 作为基座,通过 SMART 直接升级商品图像检索流程,无需修改索引结构,在多属性组合查询(如“黑色皮质手提包 金色五金”)场景下,mAP 提升约 5%,同时保持推理延迟无明显增加。
  2. 在线教育平台:对海量教学视频进行视觉片段检索,用户输入“黑板上的积分公式推导过程”截图,SMART 能精准定位到对应帧,而非仅返回相似整框架的视频,大幅缩短学习资料查找时间。

局限

  • **依赖高质量对比训练**:SMART 的提升效果高度依赖于基础单向量模型通过对比训练所习得的表示质量。论文证明池化嵌入的梯度流会隐式塑造隐藏状态,但如果基础模型训练不充分或改用非对比目标(如生成式损失),后期交互可能无法有效激活局部证据。实验未在不同预训练范式下验证,可能导致方法在非标准对比训练模型上泛化能力不足。
  • **推理效率与存储开销未充分分析**:尽管 SMART 避免了多向量模型的重训练,但在推理时对序列所有 token 的隐藏状态执行后期交互,当序列较长(如长文档、高分辨率图像、视频)时,计算和内存成本显著增加,可能削弱单向量模型原本的高效优势。论文缺少与原生单/多向量模型的延迟和峰值内存对比,大规模部署的可行性存疑。
  • **任务覆盖与零样本能力局限**:实验主要聚焦多模态检索,尤其是视觉文档检索,对纯文本、视频时刻检索等任务仅有定性讨论,缺少系统性量化评估。轻量级后训练虽节省算力,但仍需领域标注数据,零样本或无监督场景下的表现未探索,限制了方法在标签稀缺领域的直接应用。
论文Jianrui Zhang2026-05-24原文

相关内容