论文

ProMSA:用于基于知识的视觉问答的渐进式多模态搜索代理

ProMSA:用于基于知识的视觉问答的渐进式多模态搜索代理

基于知识的视觉问答(KB-VQA) 要求模型结合图像理解与外部知识。以往方法大多采用固定的检索-生成流水线,使用预选检索器和静态 top-k 设置,推理过程中缺乏自适应性。 针对这一问题,本文提出 ProMSA,一种渐进式多模态搜索代理。给定图像-问题对,代理在明确的工具调用预算下迭代选择图像搜索、文本搜索或停止,并通过去重避免冗余检索。 训练方面,首先使用拒绝采样 SFT 学习有效的工具使用格式,然后引入序列级强化学习目标 TN-GSPO,该目标根据生成长度和工具交互深度对更新进行归一化。 在 E-VQA 和 InfoSeek 数据集上的实验表明,ProMSA 相比强 RAG 及代理基线取得一致提升,同时改善了检索和端到端准确率。代码已开源:https://github.com/DingWu1021/Promsa。

论文精读

TL;DR ProMSA 提出一种可动态选择图像/文本搜索的渐进式多模态搜索代理,通过工具调用预算与去重减少冗余,并借助序列级强化学习优化策略,在知识密集型 VQA 上显著提升检索与问答精度。

问题

问题背景

知识库视觉问答(KB-VQA)是评估多模态模型识别长尾视觉实体并利用外部知识进行推理的核心任务。随着 MLLMs 能力提升,如何高效调用外部知识源(如 Wikipedia)来补充图像缺失事实,成为提升回答准确性的关键。

现有方法局限

大多数现有方法采用固定的“先检索后生成”流水线:预先选定单一检索器(如 CLIP 图像检索或 BM25 文本检索),并为所有查询统一设定静态 top-k 召回数量。该范式存在三个明显局限:

  • 策略僵化:检索与推理完全解耦,模型无法根据中间推理状态动态决定“是否需要检索”、“检索哪种模态”或“何时停止”,导致简单问题过度检索、复杂问题检索不足。
  • 冗余检索:缺乏去重机制,固定 top-k 反复召回相似信息,浪费计算资源并可能引入噪声。
  • 训练与推理脱节:检索与生成模块分开优化,难以端到端地针对答案质量进行协同训练,尤其无法在序列级别优化多步工具交互相对于最终答案的贡献。

为什么这个问题难且重要

KB-VQA 的难点在于长尾实体先验知识不足,必须通过检索补全,但检索决策本身是序列化、多模态的决策过程。挑战包括:

  • 动态工具选择:在图像检索、文本检索间切换需理解问题语义与缺失信息类型,比单一模态检索复杂。
  • 预算与效率平衡:代理需在有限工具调用次数内最大化信息增益,避免冗余调用。
  • 训练目标设计:传统 SFT 只能学习静态“一步检索”行为,而 RL 训练代理时奖励稀疏且序列长度差异大,易导致优化不稳定。

业界对 KB-VQA 关注度持续攀升,因为它既是衡量 MLLMs 真实世界知识覆盖与推理能力的试金石,也直接关系到信息搜索、辅助决策等产品的体验。

行业类比

这类似于智能文档问答中,自适应检索代理根据已读内容动态决定继续搜索段落、查阅表格还是直接作答,避免蛮力全量检索,节省 API 成本并提升响应质量。

核心洞察

  • ProMSA 将 KB-VQA 的检索过程建模为多模态搜索代理的逐步决策,打破了传统固定管线的限制。与常见的 retrieve-then-generate 模式不同,代理在每一步动态选择 image search、text search 或 stop,并受显式工具调用预算约束与去重机制控制,从而避免冗余检索,使外部知识的获取更贴合推理的实际需求。这种自适应检索策略让模型能够针对不同难度的样本灵活调整搜索深度,在长尾知识环境中比静态 top-k 检索基线和单步代理都有明显提升。
  • 论文提出的 TN-GSPO (Tool-Normalized GSPO) 是首个在序列级强化学习中同时考虑生成长度与工具交互深度的目标函数,直接解决了多步代理训练中因轨迹长度差异导致的更新不公平问题。与标准 GSPO 相比,TN-GSPO 通过对奖励做双重归一化,使短序列或浅层工具调用的正样本和长序列深层交互的负样本都能获得合理的梯度更新,促进了模型在检索性价比与最终答案准确性之间取得更好平衡。

方法

输入与初始状态

给定图像-问题对,ProMSA 将其转化为一个多步交互式搜索任务。代理以多模态大语言模型(MLLM)为基础,维护一个包含视觉特征与文本上下文的状态,并在每轮决策中输出结构化动作(工具调用或停止)。

渐进式多模态搜索代理

代理在显式的工具调用预算(最大步数)约束下,循环执行以下步骤:

  1. 决策:基于当前状态,模型生成一个动作——从预设工具集中选择 ImageSearch(以图搜图)、TextSearch(文本检索外部知识库)或 Stop(终止并生成答案)。
  2. 去重与执行:对检索出的文档或图像进行去重,避免重复查询浪费预算,并过滤冗余信息。
  3. 状态更新:将检索结果(文本片段或相似图像)拼接到对话历史,作为下一轮推理的上下文。

这种设计使代理能自主判断何时需要更多外部知识、何时信息已足够,从而摆脱传统固定 top-k 检索参数的束缚。

训练策略:SFT + 序列级 RL

  • 拒绝采样 SFT:用具有工具标注的少量示范数据进行监督微调,生成带格式的动作序列;再通过拒绝采样筛选出有效执行路径(工具调用格式正确且能成功停止),以此训练模型掌握基础工具使用语法。
  • TN-GSPO 强化学习:为进一步优化搜索策略,引入工具归一化的序列级策略优化(TN-GSPO)。该目标将最终 VQA 准确率作为奖励,并按生成长度与工具交互深度对梯度更新进行归一化,防止模型因过长序列或过多工具调用遭受惩罚,从而鼓励高效的信息检索过程。

输出

代理在发出 Stop 动作后,基于累积的检索上下文生成最终答案。整个过程可端到端地通过 RL 奖励信号优化,无需额外标注中间步骤。

差异点

与先前固定检索-生成流程的工作相比,ProMSA 的自适应搜索策略序列级 RL 优化使其能根据问题难度动态分配检索预算,并在工具交互深度与答案质量间取得平衡。

实验

实验设计

ProMSA 在 E-VQAInfoSeek 两个 KB-VQA 基准上评估,涵盖长尾实体与知识密集型场景。对比基线包括三类:

  • 固定检索-生成管线:如 CLIP 检索 + LLM 回答,使用静态 top-k 策略;
  • 多模态 agent 基线:基于 ReAct 等范式的搜索 agent,可调用图像/文本检索工具;
  • 消融变体:移除去重或替换为常规 PPO 的 ProMSA。 所有方法均在相同工具调用预算(总步数限制)下运行。训练分两阶段:先通过 拒绝采样监督微调 让模型生成合法工具调用序列,再用 TN-GSPO (工具归一化的群采策略优化)进行序列级 RL,奖励为答案准确性,归一化项包含生成长度与工具交互深度。

关键发现

  • 一致提升:ProMSA 在所有指标(检索命中率、端到端 VQA 准确率)上均优于固定管线和 agent 基线。
  • 自适应搜索有效:动态选择图像搜索、文本搜索或停止,避免无关检索和冗余调用,在长尾实体问题上检索精度提升更明显。
  • TN-GSPO 稳定训练:联合归一化生成长度与工具深度,防止 RL 偏向过度搜索或过长回答,消融实验中替换为普通 PPO 性能下降。
  • 去重必要:去除重复查询机制后,模型更易陷入重复检索,浪费预算且引入噪音。

与基线对比的深度解读

传统 KB-VQA 方法的固定检索模式在遇到未知实体时无法动态决策,常因检索过多无关段落而稀释有效信息。ProMSA 将检索建模为 agent 的序列决策,每一步可基于当前上下文选择最适配的工具(或停止),使搜索过程与推理节奏耦合。相比 ReAct agent,其策略不仅在选择工具时更灵活,且通过工具调用预算与去重实现了效率-效果平衡。TN-GSPO 的序列级更新与长度/深度归一化,解决了直接应用 PPO 时可能出现的工具调用膨胀问题:模型学会在何时“适可而止”,避免产生昂贵却低效的检索。整体上,ProMSA 展示了一种更高效、自适应的多模态搜索范式,为下一代言式 RAG 系统提供了新思路。

行业影响

落地场景

ProMSA 的渐进式多模态搜索能力可直接嵌入需要结合图像理解与外部知识的应用:

  • 电商商品问答:用户拍摄商品图片并提问(如“这个面料的产地是哪里?”),系统通过自适应检索商品数据库与百科知识,给出精准答案。
  • 内容平台审核与溯源:针对用户上传的图片(如历史建筑、艺术品),自动检索知识库生成解释,提升内容可信度与互动性。
  • 教育辅导:学生拍摄题目或实验器材照片,系统通过多轮工具调用查找相关知识片段,逐步推理出解答。
  • 医疗影像辅助:结合影像特征与医学知识库,动态选择搜索策略,为医生提供鉴别诊断参考。

商业价值

  • 降本:通过 tool-call 预算去重机制 显式控制单次查询的检索次数与重复调用,避免固定 top-k 的冗余消耗,在大规模服务中直接降低 API 调用成本(如搜索引擎、向量数据库计费)。
  • 增收:更高的端到端准确率可提升用户对“以图搜知”类产品的信任,促进付费订阅或交易转化;在客服场景中减少人工介入,提高自动化解决率。
  • 体验提升:渐进式的检索-推理过程具备可解释性,用户能看到系统“搜索了什么”,对长尾实体回答更可靠,降低幻觉带来的风险。

与现有产品/工作流的接口

ProMSA 可作为 检索增强生成(RAG) 流水线中的智能路由层 集成到现有技术栈:

  • 输入为 <image, question>,输出为最终答案;内部自动调度图像搜索与文本搜索工具,外部仅需暴露统一的问答接口。
  • 可对接现有的多模态向量数据库(如图像特征库)和文本检索引擎(如 Elasticsearch、维基 API),只需将工具描述转化为标准 function call 格式。
  • 训练方面,TN-GSPO 强化学习目标可复用企业已有的偏好数据(如用户点赞/点踩),无需复杂的人类反馈流程,适合在冷启动后进行效果调优。

具体落地 Use Case

  1. 全球电商平台的视觉商品问答
    用户对商品图提出长尾属性问题(如“这款手表采用哪种机芯?”)。系统先用图像搜索找到相似商品,再融合文本百科逐步回答,减少因固定 retriever 无法覆盖专有知识而导致的错误。该过程可在毫秒级延迟内完成,与现有客服 Bot 无缝衔接。

  2. 在线教育平台的交互式题目辅导
    学生拍摄一道数学几何题,系统先尝试图像搜索寻找类似题目模板,若失败则转为文本搜索相关定理,最后生成分步解答。通过显式的 stop 决策避免无意义循环,同时将工具调用次数上限定为 4 次,确保响应时间可控。

局限

  • **工具依赖与搜索质量瓶颈**:ProMSA 的性能高度依赖底层图像搜索和文本搜索 API 的质量。论文仅使用 Bing Search 作为检索后端,若搜索源无法覆盖所需知识(如长尾实体无索引或返回结果噪声大),代理的渐进式检索策略仍会产生次优证据,直接影响答案生成。代理自身缺乏对检索结果可信度的细粒度判断机制,难以在无高质量外部信息时转为保守回答或拒绝。
  • **训练与评估范围有限**:训练采用的两阶段流程(rejection-sampling SFT + TN-GSPO RL)仅在 E-VQA 和 InfoSeek 两个 KB-VQA 数据集上验证,未见更大规模开放域 VQA 或不同领域的跨域实验。工具调用预算作为固定超参,需针对不同任务人工调节,未研究自适应预算停止条件。此外,序列级 RL 训练的计算开销和收敛稳定性未与常用 BRPO/GRPO 等方法做详细对比,实际部署成本不清晰。
  • **代理架构的抽象层次较浅**:虽然提出渐进式搜索决策,但代理仅为顺序选择工具类型(image / text / stop),未涉及更细粒度的查询重写、多工具调用组合或子问题分解。与能够规划多步查询并组合多种工具的通用智能体(如 ReAct、Toolformer 的高级变体)相比,ProMSA 的决策空间较窄,可能无法处理需要复杂多跳检索和交叉验证的场景。
论文ZhengXian Wu2026-06-26原文

相关内容