论文

ConceptFormer: 学习自适应潜在概念用于视觉文档检索中的查询-文档对齐

ConceptFormer: 学习自适应潜在概念用于视觉文档检索中的查询-文档对齐

视觉文档检索是多模态检索增强生成的关键组成部分,旨在从文档集合中识别与查询相关的页面,而证据分布在文本、布局、图表和视觉结构中。近年来,细粒度监督的工作主要依赖文本描述或局部视觉区域作为证据代理。然而,此类监督信号要么忽略复杂的视觉结构,要么提供不完整、不准确的证据表示。 为解决上述局限,我们提出 ConceptFormer,一种用于视觉文档检索的潜在概念表示学习框架。ConceptFormer 将查询相关证据建模为连续的、查询条件的潜在概念,显式连接局部视觉证据与语义相关性,既不需要文本中间表示,也不直接依赖原始视觉标注。训练时,ConceptFormer 采用强视觉语言模型动态确定潜在概念 token 数量,并以这些概念作为中间表示来弥合查询与文档间的语义鸿沟,从而引导嵌入空间的学习。 在多个视觉文档检索基准上的实验表明,ConceptFormer 在平均 NDCG@10 上相较于最强的视觉检索基线和最强的 OCR 文本检索基线分别实现了 16.7% 和 22.1% 的相对提升。 进一步分析显示,潜在概念有效连接局部视觉证据与语义相关性,使检索器既能捕捉细粒度文本线索,也能捕捉复杂文档级视觉结构,同时保持强检索对齐。代码与数据见 https://github.com/Neuir/ConceptFormer。

论文精读

TL;DR ConceptFormer 为视觉文档检索学习查询条件化的连续潜在概念,不依赖 OCR 文本或区域标注即可桥接局部视觉证据与语义相关性,相对最强视觉基线 NDCG@10 提升 16.7%。

问题

问题背景

多模态 RAG 中,视觉文档检索要求从包含文本、版面、图表、视觉结构的页面集合中找出查询相关页。当前重点已从整页相似度转向如何利用细粒度证据监督提升检索对齐。

现有方法局限

早期视觉文档检索直接编码整页图像,通过 页面级对比学习 优化相关性,但损失函数只提供文档级正负信号,无法指出哪些局部证据真正贡献相关性。近期细粒度方案用两类代理:

  • 文本描述:容易遗漏复杂视觉结构(如表格布局、图表语义);
  • 局部视觉区域:依赖 OCR 或检测框,可能割裂跨区域视觉证据,产生不完整且不准确的表示。

这些代理与真实证据之间存在偏差,导致检索模型难以同时捕捉细粒度文本线索与文档级视觉结构。

为什么难且重要

查询与页面相关性往往由多类异构证据协同决定,证据标注成本高、精确标签难以获得,只能依赖弱监督或代理信号。模型需要在无显式证据标注下,自动学习 query-conditioned 潜在概念,既保留局部视觉信息又对齐语义相关性。这直接影响多模态 RAG 的检索质量,是业界落地文档智能与知识增强生成的基础环节。

行业类比

类似视觉问答中不依赖人工注意力框、自动定位支撑答案的图像区域;ConceptFormer 的 latent concepts 可视为检索流程中的“软证据定位器”。

核心洞察

  • ConceptFormer 将 query 相关证据建模为连续的、query 条件的 latent concepts,而非文本描述或视觉区域,从而避免传统监督信号的局限。文本描述容易忽略复杂视觉结构,局部视觉区域可能不完整或不准确;而 latent concepts 可以动态适应 query 与 document 的匹配粒度,提供更完整的证据表示,同时不依赖额外的文本中间表示或原始视觉标注。这个角度的独特之处在于从表征层面解决证据对齐问题,而非在输入空间做显式提取或标注,为视觉文档检索提供了一条更灵活的训练路径。
  • ConceptFormer 利用强 VLM 动态确定每个 query-document 对所需的 latent concept token 数量,实现自适应证据容量分配。与传统固定 token 数量或手工设计证据表示的方法不同,该机制可根据文档复杂度和 query 需求动态调整概念容量,既能捕捉细粒度文本线索,也能建模文档级视觉结构,从而在视觉文档检索中同时兼顾局部与全局信号,最终带来 NDCG@10 的显著提升。这对工程实践的启示是:多模态检索系统不必预设固定粒度,而应让模型学习按需分配表示容量,以适应不同复杂度的文档内容。

方法

输入:查询文本与文档页面图像。

视觉编码器 将页面切分为 patch 并提取视觉特征;查询编码器 获得查询向量。

关键模块:

  1. Evidence Proposer 与 Concept Capacity Allocation:利用 vision-language model 对查询与页面交互进行推理,动态确定 latent concept tokens 的数量。这些 latent concepts 是连续的、query-conditioned 表示,显式桥接局部视觉证据与语义相关性,不依赖文本中间表示或原始视觉标注。
  2. Matryoshka 表示学习:在多个嵌套维度上学习 concepts,以捕捉不同粒度的证据(细粒度文本线索与文档级视觉结构)。
  3. Visual-Language Alignment:利用 latent concepts 作为中间表示,通过对比学习优化 query-document embedding 空间。

输出:query-document 相关性分数,用于排序检索。

差异点:与以往用文本描述或局部视觉区域作为监督代理的方法不同,ConceptFormer 将证据抽象为自适应数量的连续 latent concepts,由 VLM 动态分配容量,避免信息不完整或表示不准确的问题,更贴合视觉文档中复杂、分布式的证据结构。

实验

实验设计

ConceptFormer 在多个视觉文档检索 benchmark 上进行评估(具体数据集名单在可获取内容中未列出),对比最强视觉检索 baseline 与最强 OCR-based 文本检索 baseline。训练阶段,模型利用强 VLM 动态确定 latent concept token 数量,并以这些概念作为查询和文档之间的中间表示进行对比学习。评估指标采用 NDCG@10。

关键发现

ConceptFormer 在平均 NDCG@10 上分别取得相对提升 16.7%(对比最强视觉 baseline)和 22.1%(对比最强 OCR-based 文本 baseline)。进一步分析显示:latent concepts 能有效连接局部视觉证据与语义相关性,使检索器同时捕获细粒度文本线索(如数字、关键词)和复杂文档级视觉结构(如图表、布局)。Token 分配行为分析表明模型自适应地为不同查询分配合适数量的概念 token,避免固定数量的冗余或不足。

与基线对比解读

传统视觉检索 baseline 一般只做 page-level 对比学习,缺少细粒度的证据定位;OCR-based 文本检索 baseline 则依赖 OCR 提取文本,容易丢失版面、图表等视觉信息。ConceptFormer 的训练信号来自查询条件的连续隐式概念,既不依赖文本中间表示(避免 OCR 错误传播),也不依赖原始视觉标注(降低人工注释成本),因此能在复杂版面中更好地对齐查询意图和文档证据,实现更强的检索对齐。

行业影响

落地场景

Visual Document Retrieval 在多模态 RAG 中有广泛应用,适合从大量非结构化文档中检索证据的场景:金融研报、医疗文献、企业知识库、教育资料、电商商品文档等。ConceptFormer 不依赖 OCR 文本中间层,对含复杂图表、布局的页面更鲁棒。

商业价值

  • 降本:减少 OCR 预处理和人工标注成本,训练时无需文本描述或区域标注。
  • 增收/体验:检索准确率提升(NDCG@10 相对提升 16.7%–22.1%)直接改善 RAG 系统回答质量,减少用户流失,提升转化率(如电商导购、客服)。

集成方式

可作为 retriever 编码器嵌入现有 RAG pipeline。输出 embedding 可存入向量数据库(如 FAISS/Milvus)。训练阶段用强 VLM 生成潜在概念 token,推理时仅需文档图像和查询,与现有 API 兼容,无需更改下游生成器。

ConceptFormer 通过潜在概念桥接视觉证据与语义相关性,适合部署在已有视觉检索模块中,替换或增强 OCR-based 检索器。

具体用例

  1. 金融投研平台:用户查询“某公司季度营收增速趋势”,检索包含图表和表格的财报 PDF,ConceptFormer 可捕捉图表中的趋势线索,返回含关键图表的页面,辅助分析师快速定位。
  2. 电商商品问答:用户提问“两款手机续航对比”,商品详情页含图片、规格表,潜在概念能对齐到图片区域与文字描述,返回最相关商品页,提升导购体验。

局限

  • 论文方法依赖一个强视觉语言模型(VLM)来动态生成潜在概念 token 数量并作为证据提议器,这显著增加了训练阶段的计算开销和实现复杂度。论文未深入探讨不同 VLM 骨干(如不同规模或架构的模型)对最终检索性能的影响,可能导致在资源受限或需要快速迭代的场景下难以部署。此外,VLM 自身的偏差和错误会直接传播到潜在概念表示中,影响检索鲁棒性。
  • 潜在概念虽被证明能桥接视觉证据与语义相关性,但其本身缺乏显式的语义标签,可解释性仍有限。案例研究展示了概念与某些视觉区域的对齐,但并未提供系统性的可解释性评估指标(如人工评估或概念纯度度量)。在实际应用中,当检索结果出现错误时,工程师难以快速定位是概念分配不当还是 embedding 空间学习不充分,增加了调试成本。
  • 实验主要在视觉文档检索基准上验证,未涉及其他多模态检索任务(如通用图像-文本检索、视频定位等),泛化能力有待考证。推理阶段需要额外的证据提议和概念容量分配步骤,可能引入不可忽略的延迟,对实时性要求高的在线系统不太友好。与直接使用文本描述或区域监督的基线相比,ConceptFormer 虽然性能更优,但模型复杂度更高,需要权衡精度与效率。
论文Peng Chunyi2026-08-16原文

相关内容