论文

ColNanoVDR:基于最优传输的多向量视觉文档检索免文档查询蒸馏

ColNanoVDR:基于最优传输的多向量视觉文档检索免文档查询蒸馏

基于 视觉语言模型(VLM) 的多向量检索器在视觉文档检索(VDR) 中处于领先地位,但每次搜索都要运行一个数十亿参数的查询编码器。标准的蒸馏做法是匹配 teacher 的 MaxSim 分数,因而必须编码并缓存每一张训练页面,页面 token 量可达 TB 级。NanoVDR 改为仅用 teacher 的查询嵌入来训练、完全绕过页面,但只适用于单向量检索器。 本文提出 ColNanoVDR,据我们所知是首个将这种免文档蒸馏带入多向量 VDR 的框架。其目标函数 OTW(Optimal Transport with Learned Weights) 通过熵最优传输对齐 student 与 teacher 的查询 token,并为每个 student token 学习一个权重,无需两种 tokenization 之间存在对应关系。作者进一步证明,该对齐代价能够上界每一页上的 MaxSim 分数差。 从五个 SOTA teacher 蒸馏出的 149M 纯文本 student,在 ViDoRe v1-v3 上保留了 teacher 约 95% 的 NDCG@5,查询编码速度最高提升 26 倍。在相同训练条件下,OTW 的效果与分数蒸馏相当,却不编码任何页面,读取的缓存 teacher 数据少 12.6 倍。

论文精读

TL;DR ColNanoVDR 首次将无文档蒸馏扩展到多向量视觉文档检索:仅用教师查询嵌入,通过最优传输对齐 token 训练 149M 文本学生模型,保留约 95% NDCG@5 且查询编码快 26 倍,无需缓存 TB 级页面。

问题

问题背景

视觉文档检索(VDR)领域当前聚焦于基于视觉语言模型(VLM)的多向量检索器,它们通过多个 token 嵌入表示页面和查询,能捕捉文档图像中的细粒度语义,在多个基准上达到领先效果。

现有方法局限

这类检索器在每次检索时都需要运行一个参数量达数十亿的查询编码器,导致查询延迟高、计算成本大。标准蒸馏方案是匹配教师模型的 MaxSim 分数,但这要求提前编码并缓存所有训练页面,页面 token 总量可达 TB 级,存储与预处理开销极其庞大。NanoVDR 提出了仅利用教师查询嵌入进行蒸馏的文档无关方案,成功避免了页面缓存,但该方法仅适用于单向量检索器,无法直接扩展到多向量场景,因为多向量查询由多个 token 组成,教师与学生模型之间的 token 化方式不一致,缺乏天然对应关系。

为什么这个问题难且重要

多向量蒸馏的核心难点在于:

  • 教师和学生查询编码器的 token 数量与语义分布不同,无法逐 token 对齐。
  • 需要一种机制自动判断哪些 token 对检索更重要,从而在蒸馏时分配不同权重。
  • 必须保证蒸馏后的学生模型在任意页面上与教师模型的 MaxSim 分数差异有界,以维持排序质量。

最优传输(Optimal Transport) 提供了一种无需固定对应的对齐方法,但如何将传输成本与检索评分建立理论联系、如何学习 token 权重,是尚待解决的关键问题。业界对视觉文档检索的线上部署有强烈需求,降低查询编码成本而不牺牲精度,直接关系到系统可用性与扩展性。

行业类比

类似于将高精度但需大量计算的多模态检索引擎压缩为轻量级文本编码器,使实时文档搜索或问答系统可以在资源受限的环境中高效运行。

核心洞察

  • 文档无关蒸馏从单向量扩展到多向量:ColNanoVDR 将查询视作加权 token 集合,用熵正则化最优传输对齐学生与教师查询 token 分布,训练时完全不需要编码或缓存任何文档页面。这区别于标准多向量检索蒸馏必须匹配教师 MaxSim 分数、因而要缓存 TB 级页面 token 的做法,也突破了 NanoVDR 仅适用于单向量检索的局限。对实际工程而言,监督成本从 TB 级页面缓存降至仅教师查询嵌入,读取缓存数据量减少 12.6 倍,使大规模多向量 VDR 蒸馏具备可行性。
  • OTW 目标中的学习 token 权重和对齐成本为蒸馏质量提供理论保证:论文证明学生-教师查询 token 的最优传输对齐成本能够界定任意页面上的 MaxSim 分数差异,因此无需 token 对应关系也能约束排序偏差。相比固定权重的文档无关目标或需要页面分数的蒸馏方法,OTW 的可学习权重让每个学生 token 自适应地匹配最相关的教师 token,提升了小容量 text-only 学生逼近视觉-语言教师的效果。实验表明在相同训练设置下,OTW 与分数蒸馏达到同等 NDCG@5,却无需页面编码,为低资源环境部署多向量检索器提供了有保证的路径。

方法

方法流程

输入 仅需教师查询嵌入缓存,无需编码或缓存任何文档页面。学生侧为 text-only 查询编码器,输出多 token 向量。

关键模块:

  • 查询作为加权 token 集合:学生将查询编码为若干 token 向量,并为每个 token 学习一个权重,构成带权集合表示。
  • 最优传输对齐:使用 entropic optimal transport(Sinkhorn 求解器)计算学生 token 集合与教师 token 集合之间的对齐成本,无需 token 位置或分词对应。
  • OTW 目标:将对齐成本作为训练目标,同时学习 token 权重,必要时结合覆盖损失防止权重退化。

理论保证:证明该对齐成本是任意页面上 MaxSim 分数差 的上界,因此只对齐查询就足以约束排序一致性。

输出:训练后的轻量学生查询编码器(149M 参数)可直接查询教师已构建的索引,推理时学生 token 及权重参与 MaxSim 评分。

与同类方法差异

与标准 score distillation 相比,OTW 完全免文档,训练数据读取量约降低 12.6 倍;相比 NanoVDR 仅支持单向量,它首次将 document-free 蒸馏扩展到多向量检索。

实验

实验设计

论文将 ColNanoVDR 蒸馏到 149M 参数的纯文本学生模型,从五个 SOTA 多向量视觉文档检索教师 (具体名单未在摘要列出) 学习,在 ViDoRe v1-v3 上评估。核心目标 OTW (最优传输加权) 将学生 query token 集合与教师 query token 集合对齐,无需页面编码;对比基线包括标准 score distillation (需缓存所有训练页面) 与单向量 document-free 方法 NanoVDR。

关键发现

蒸馏学生在 ViDoRe v1-v3 上保留约 95% 的教师 NDCG@5,查询编码速度最高提升 26 倍;与 score distillation 相比,在相同训练设置下 OTW 匹配其效果,但不编码任何页面,且读取缓存教师数据量减少 12.6 倍。

基线对比解读

相对于 score distillation 需 TB 级页面 token 缓存,OTW 通过仅使用教师 query embeddings 实现 document-free,大幅降低监督存储与 I/O。理论证明对齐代价能界定每个页面上的 MaxSim 分数差,为多向量检索的蒸馏提供了有保证的替代。相比 NanoVDR 只支持单向量,本文方法首次将该思路拓展到多向量,同时学生模型规模小、纯文本,部署成本显著下降。

行业影响

落地场景

ColNanoVDR 面向多向量视觉文档检索(VDR)的查询侧加速,适用于电商商品图搜、企业知识库问答、医疗影像报告检索、法律文书检索等场景。例如:电商平台用 VLM 对商品详情页截图建多向量索引,用户文本查询时换用 149M 纯文本学生编码器,可支持高并发实时搜索;企业文档助手可快速检索含图表的技术报告,无需重新索引文档。

商业价值

降本:查询编码从数十亿参数 VLM 降至 149M 模型,推理成本显著下降;训练过程无需编码页面,缓存数据量减少 12.6 倍,省去 TB 级存储与计算开销。 体验:查询延迟降低约 26 倍,同时保留约 95% NDCG@5,实现检索质量与速度的细粒度平衡。 增收:高吞吐、低延迟的检索服务可支撑更多实时推荐与交互式问答场景,间接提升用户转化与留存。

跟现有产品/工作流的接口

学生查询编码器可直接接入教师已有的多向量文档索引,无需重建索引;训练只需教师查询嵌入缓存,适合集成到现有知识蒸馏 pipeline。OTW 目标基于 Sinkhorn solver,实现简洁,可在 PyTorch/TensorFlow 推理栈中轻量部署,并支持后续索引压缩进一步降低服务成本。

局限

  • 论文方法依赖教师查询 embeddings 的质量与分布,未讨论当教师模型更新或替换时的适配成本。学生仅用文本查询蒸馏,未见对视觉查询(如截图、图表输入)的支持实验,限制了其在多模态查询场景的应用。与标准 score distillation 相比,虽然训练不读页面,但 Sinkhorn 求解与梯度回传增加了每次迭代的计算开销,在超大规模教师缓存(数十亿 token)下仍需高效实现验证。
  • 实验范围限于 ViDoRe v1-v3 与五名教师,未在更丰富的数据集(如企业级文档、扫描件、长文档)或跨域零样本场景下验证。论文未报告训练稳定性指标(如 OT 熵参数 ε 的敏感性、覆盖损失的权重选取),可能对超参数调节有隐式要求。另外,学生为 149M text-only,未探索更大或视觉学生模型,容量上限与教师 index 的兼容性仍待测试。
  • 作为首个文档无关多向量蒸馏工作,缺乏同类方法直接对比,只能对标 score distillation 或固定权重目标,无法完全证明 OTW 是最优的文档无关方案。理论边界依赖于特定向量归一化与 MaxSim 定义,若更换相似度函数(如 IP、L2)或索引压缩方式,不等价性可能削弱。论文对部署时索引压缩(如 pooling)只提及未深入。
论文Zhuchenyang Liu2026-09-28原文

相关内容