论文

GRASP: 粒度感知搜索策略用于Agentic RAG

GRASP: 粒度感知搜索策略用于Agentic RAG

Agentic RAG 允许语言模型迭代推理、生成搜索查询、检索证据并预测答案,但决定何时检索、使用词法匹配还是语义相似度,以及控制上下文粒度以防无关标记干扰推理仍具挑战。 本文提出 GRASP,一个基于 强化学习 的框架,训练代理在多步推理中自适应协调互补检索工具。GRASP 提供三种动作:语义搜索(广度探索)、关键词搜索(实体证据)和 段落阅读(局部验证),仅在需要时扩展句子级证据的上下文。策略通过联合奖励优化答案准确度、基础阅读、互补搜索和轮次效率。 在 多跳推理 基准(如 HotpotQA)上的实验表明,GRASP 相比单步检索、基于提示的 Agentic RAG 和基于强化学习的检索基线,显著提升检索召回和下游问答性能。定性分析与消融实验显示,策略发展了可解释的略读与扫描行为:语义搜索用于广泛探索,段落阅读用于局部验证,关键词搜索用于特定实体证据。这些结果表明,学习协调检索信号与上下文粒度对代理正确推理至关重要。

论文精读

TL;DR GRASP 用强化学习训练智能体自适应编排语义、关键词和段落检索,按需控制证据粒度,显著提升多跳推理的准确率与效率。

问题

问题背景

Agentic RAG 赋予语言模型迭代推理能力,使其自主生成查询、检索证据并预测答案,是当前提升大模型知识准确性与可解释性的核心路线之一。

现有方法局限

现有工作多为静态或硬编码检索策略:单步检索难以覆盖多跳推理所需的分散证据;而基于提示的 Agentic RAG 虽能多轮交互,却缺乏对检索时机与工具选择的细粒度控制,常因无关上下文引入噪音,干扰推理链。具体而言,语义搜索 容易召回主题相关但实体不精确的片段,关键词检索 可能遗漏同义表达,且二者各自检索粒度固定,无法按需在句子级证据与段落级上下文间动态切换。强化学习方法虽已用于检索策略学习,但先前工作大多仅优化单一检索动作或忽略上下文粒度的自适应调整。

为什么这个问题难/重要

难度在于,模型必须同时决策三个紧密耦合的要素:何时检索(避免多余检索或信息不足)、选用何种检索信号(语义、关键词或两者互补)以及控制上下文粒度(句子级精准证据与段落级验证阅读的平衡)。这三者的组合搜索空间极大,且检索质量直接影响生成答案的事实性。业界对多跳推理、事实验证等复杂场景的检索效率与准确性高度关注,因为这类能力直接关系到智能体在开放域问答、企业知识库助手等场景下的可信部署。

行业类比

如同搜索引擎既要支持全文检索又要提供结构化片段,Agentic RAG 中的策略学习本质上是在构建一个上下文感知的检索路由器,动态调度不同召回引擎以避免信息过载。

核心洞察

  • **GRASP 通过 RL 训练代理学会在不同检索工具间动态切换,并细粒度控制上下文粒度,从而超越固定流程的 RAG 基线。** 传统 Agentic RAG 通常依赖启发式规则或 Prompt 决定检索时机,而 GRASP 将语义搜索、关键词搜索和段落阅读作为动作,让代理根据当前推理状态自适应选择。这种多工具协调结合句子级证据检索和按需扩展段落,有效减少无关上下文干扰,在 Multi-hop QA 上显著提升 Recall 和 Answer Accuracy。
  • **奖励函数中的 Complementary Search 和 Grounded Reading 项引导代理发展出可解释的 skim / scan 策略,为可解释 RL 检索策略提供范例。** GRASP 的奖励不仅优化答案准确度,还显式鼓励使用互补检索信号和不阅读无关证据。这使得代理在探索时自然形成“语义搜索做广泛探索 → 段落阅读做局部验证 → 关键词搜索做实体锁定”的行为模式,类似于人类略读和精读。消融实验证明,移除这些奖励项会导致检索行为退化为单一模式,从而验证了奖励设计的重要性。

方法

方法概述

GRASP 将多跳推理中的检索过程建模为 强化学习(RL)策略优化问题,核心是训练一个智能体在每一步自主选择检索动作,以平衡信息覆盖与上下文精度。

输入:一个复杂问题,搭配一个冻结的 LLM(作为策略网络),以及多个检索工具(语义搜索、关键词搜索、段落阅读)。背景语料库被预处理为句子级索引,使检索粒度可精细到单句。

关键模块与执行流程

  • 动作空间:智能体每步从以下动作中选择一个:

    • semantic_search(query):基于嵌入相似度检索 Top-K 句子,用于广泛探索;
    • keyword_search(query):基于词法匹配(如 BM25)检索句子,用于定位实体特定证据;
    • paragraph_read(doc_id):将某个已检索句子扩展为其周围段落,供 LLM 仔细阅读验证。
  • 状态与推理:状态包含已读取的句子/段落集合。智能体基于当前状态生成一个查询或读取指令,并更新上下文,直至决定输出答案。

  • 奖励设计:每个回合结合四个子奖励信号:

    • 答案准确性(R_A):最终预测与标准答案的 F1/EM 分数;
    • 有据可读(R_R):鼓励智能体阅读真实支持答案的证据句子,避免幻觉;
    • 互补搜索(R_S):奖励在语义搜索与关键词搜索之间切换的行为,促使多角度信息获取;
    • 轮次效率(R_E):惩罚多余步骤,防止无意义重复。 总奖励为加权和,引导策略在准确、有根据且高效的行动轨迹上收敛。
  • 学习算法:使用近端策略优化(PPO)训练策略网络,通过采样轨迹计算优势函数并更新参数。训练时对长序列采用损失掩码,并配合熵衰减以稳定探索。

输出:一个训练好的检索策略,面对新问题时能自适应地调度三种工具,展现出类似“浏览和扫描”行为:先用语义搜索广探,再用关键词搜索定点,必要时通过段落阅读验证细节。

与同类方法差异:相比固定流程的提示型 Agentic RAG 或单纯训练单一检索器,GRASP 通过 RL 显式建模检索信号协调与上下文粒度控制,使模型自主学会何时使用哪种检索手段以及何时扩展句子到段落。

实验

实验设计

论文在多跳推理基准上评估 GRASP,与三类基线进行比较:Single-Step Retrieval(静态检索)、Prompting-Based Agentic RAG(基于提示的多步检索)和 RL-Based Retrieval 基线。GRASP 将检索动作空间设计为三种互补工具:语义搜索(dense retrieval)、关键词搜索(lexical matching)和段落阅读(paragraph reading)。奖励函数同时考虑答案准确性、证据扎根性、搜索互补性与轮次效率,通过 PPO 进行策略优化。

关键发现

  • 检索召回与问答性能同步提升GRASP 在两个指标上全面超越所有基线,验证了自适应协调多种检索工具的有效性。
  • 可解释的略读-扫描行为:学习到的策略展现出规律性模式——语义搜索用于广域探索,段落阅读用于局部验证,关键词搜索用于实体级证据锁定。这种“速览+精读”的行为无需人工规则,完全由奖励函数驱动涌现。
  • 上下文粒度控制至关重要:通过句子级索引和按需扩展上下文,模型能有效抑制无关文本对推理的干扰,这是静态检索难以实现的关键能力。

基线对比深度解读

Single-Step Retrieval 相比,GRASP 打破了“一次检索、全文输入”的静态范式,动态决定何时检索、何时停止,并精确控制证据颗粒度,从而在长程推理中减少幻觉。相对于 Prompting-Based Agentic RAG,强化学习训练使策略不再依赖硬编码的提示模板,能根据任务状态自适应选择搜索类型,泛化性更强。与基于 RL 的检索方法相比,GRASP 的奖励设计引入了 Complementary Search 鼓励使用多样化工具,避免冗余搜索;同时 Grounded Reading 奖励确保模型真正依据检索到的证据进行推理,而非直接输出记忆中的答案。消融实验进一步证实,去除任意一种检索动作或奖励项都会导致性能下降,说明“协调多种检索信号与粒度控制”是智能体正确推理的关键因素。

行业影响

落地场景

GRASP 的检索策略可赋能任何依赖多跳推理的复杂问答系统。典型场景包括:

  • 电商搜索:用户查询“适合干性皮肤、不含酒精且 SPF30 以上的日霜”,模型需组合语义搜索(理解需求)、关键词检索(查找 SPF/成分)和段落精读(确认细节),最终给出精准商品列表。
  • 医疗循证问答:针对“二甲双胍对非糖尿病人群的抗衰老效果”,系统需从海量文献中先语义发现相关论文,再关键词定位特定段落,最后细粒度提取证据,辅助临床决策。

商业价值

GRASP 通过自适应检索与粒度控制,直接贡献于降本增效和体验升级:

  • 降本:减少不必要的全文检索和无关推理,节省 GPU/API 调用成本,尤其在付费商业大模型场景下效果显著。
  • 增收:更精准的答案提升用户信任和转化率;例如电商搜索中高相关商品点击率和购买率上升。
  • 体验:回答更可靠且有据可循(grounded reading),降低幻觉风险,增强可解释性,提升用户满意度。

与现有产品/工作流的接口

GRASP 可作为检索策略优化层无缝嵌入现有 RAG 栈

  1. 工具集成:现有 RAG 系统通常已包含语义搜索(如向量数据库)和关键词检索(如 Elasticsearch)以及文档解析(如 chunk 切分)。GRASP 通过 RL 策略在这些工具间动态切换,仅需封装成统一 action 接口(semantic_searchkeyword_searchread_paragraph),无需替换底层基础设施。
  2. 部署方式:可将训练好的策略模型部署为轻量级路由器,接收用户 query 和当前上下文,输出下一步检索动作,与主流 LLM 框架(如 LangChain、LlamaIndex)结合,通过自定义 Agent 实现。
  3. 反馈循环:利用线上用户反馈或离线评估数据持续优化 RL 奖励,形成闭环改进。

综上,GRASP 为 Agentic RAG 提供了一种可落地的检索协同机制,尤其适用于需要复杂推理和证据聚合的垂直行业应用。

局限

  • **任务与检索器依赖性**:实验仅在几个多跳推理数据集上进行,且使用的语义搜索引擎和关键词搜索引擎为固定、非学习的组件。GRASP 的策略高度依赖底层检索器的质量和覆盖范围,若检索器对特定领域知识覆盖不足,代理可能无法获取有效证据,导致策略失效。论文未讨论在检索器更新或更换后的策略迁移能力,实际部署时可能需要针对每个检索器重新训练。
  • **训练效率与样本复杂度**:GRASP 使用强化学习训练多步决策策略,奖励信号涉及答案准确、阅读广度、互补搜索和轮次效率,奖励计算依赖复杂的后处理(如经过规范化的答案提取、证据集合比较等),可能引入噪声并增加训练不稳定风险。论文未提供训练所需的计算资源和样本量,但此类 RL 训练通常需要大量 rollout,对大规模语言模型而言成本高昂,可能限制其在资源受限场景的实用性。
  • **动作粒度与场景局限**:GRASP 的动作空间设计为语义搜索、关键词搜索和段落阅读,虽能应对大部分多跳推理,但未涵盖更复杂的检索行为(如重新排序、片段级拼接等)。此外,策略仅在以句子级索引的语料库上训练,对于需要长段落或多文档综合推理的任务(如查询聚焦摘要)可能表现不足,泛化至其他检索场景(如表格、知识图谱)的能力未经检验。
论文Varun Gandhi2026-07-11原文

相关内容