Critic-R: 使用自然语言内省反馈的指令微调检索器改进智能搜索
智能搜索系统通过迭代与检索模型交互来回答复杂查询。尽管取得了实质性进展,但优化检索器以适应智能搜索仍然具有挑战性,通常需要大量的联合训练或黄金标准标注,这限制了其实际适用性。我们提出 Critic-R 框架,该框架在推理和训练过程中显式地闭合推理智能体与检索模型之间的反馈循环。 Critic-R 引入了一个评论模型,该模型在消耗检索证据后评估智能体的内省推理轨迹,以确定检索到的上下文是否充分支持下一步推理。Critic-R 包含两种互补机制:Critic-R-Zero,一种推理时查询细化循环,迭代地重写查询和检索指令;以及 Critic-Embed,一种检索模型的优化方法,利用成功和失败的细化轨迹作为自动监督,无需手动相关性标注。 我们在 HotpotQA、2WikiMultihopQA、MuSiQue 和 Bamboogle 上评估 Critic-R。结果表明,Critic-R 显著提高了检索质量和下游答案准确性。
论文精读
TL;DR Critic-R 通过引入批评模型对智能体的自省推理轨迹进行闭环反馈,实现推理时查询改写与检索器自动优化,无需人工标注即可显著提升多跳问答的检索质量与答案准确率。
问题
问题背景
Agentic search 系统通过推理代理(Reasoning Agent)与检索模型(Retrieval Model)的迭代交互来回答复杂多跳查询,当前领域高度关注如何在推理过程中动态优化检索策略,以降低无效检索并提升证据获取效率。
现有方法局限
传统优化检索器的方式存在明显局限:
- 耦合过重:多数工作依赖检索器与推理代理的端到端共训练(co-training),模型耦合度高、部署灵活性差,且需要大量 GPU 资源。
- 依赖标注:另一些方法要求黄金标注(Gold-standard Annotations)作为监督信号,但大规模人工标注推理步骤的中间检索相关性成本极高,难以覆盖开放域和长尾查询。
- 开环系统:现有检索-推理流程多为开环,检索器缺乏对"当前检索结果是否足以支撑下一步推理"的显式反馈,无法从推理失败中自适应学习。例如,检索器可能返回表面相关但缺乏关键实体的文档,导致推理链断裂,但代理无法将此失败信号反向传递给检索模型进行优化。
为什么这个问题难且重要
技术挑战:
- 检索质量直接影响最终答案准确性,多跳推理要求检索器必须在每一个子问题迭代中精准定位所需证据,而推理中间步骤的正确与错误难以自动判别。
- 推理代理输出的内省式推理踪迹(Introspective Reasoning Trace)蕴含评判检索充分性的线索,但如何自动且可靠地从中提取监督信号是一个开放难题。
- 工业部署中,推理时扩展(Inference-time Scaling)如查询重写、指令优化等可即时提升效果,但训练侧需同步适应,两者协同设计尚未成熟。
业界关注度:Agentic Search 在开放域问答、智能助理、研究助手等场景快速落地,快速迭代检索能力而不依赖人工标注成为关键需求,无监督或自监督反馈机制正成为检索增强生成(RAG)领域的研究热点。
行业类比 如同自动驾驶中感知模块需要基于规划模块的反馈来优化目标检测,Agentic search 也需要一个"批评家"自动评估检索结果对推理的支撑度,形成持续改进的闭环。
核心洞察
- Critic-R 将多步推理中的内省反馈转化为检索模型的自动监督信号,绕过了昂贵的人工标注。与以往需要黄金标注或联合训练的方法不同,Critic-Embed 利用 critic 模型对推理轨迹的成败判定,自动构建正负样本对,驱动检索器学习哪些证据能支撑推理步骤。这种自举式的监督机制使得检索器能持续从 agent 的交互中进化,而不依赖静态的查询-文档相关性标签,为真实场景下的大规模部署降低了数据准备成本。
- Critic-R 首次在推理与检索之间建立了完整的闭环优化:Critic-R-Zero 在推理时迭代改写查询与检索指令,Critic-Embed 则在训练时利用这些改写轨迹优化检索器,两者交替提升。这种设计打破了先前工作将推理与检索隔离优化的局限,使检索质量不仅能通过一次查询改善,还能随着 agent 的经验积累自我强化。实验表明,结合推理时循环与训练后检索器能获得额外增益,验证了双向反馈的有效性。
方法
Critic-R 框架总览
Critic-R 由推理时的 Critic-R-Zero 和训练时的 Critic-Embed 两个互补模块组成,二者共享一个 Critic Model(评价模型),将检索模型与推理代理之间的反馈环显式闭合。
推理流程:Critic-R-Zero
输入:复杂查询(如多跳推理问题)。
关键步骤:
- 初始检索与推理:推理代理
ℳ_R将查询发送给冻结的检索模型,获得文档集合并生成当前推理步骤,同时输出一份内省推理轨迹——包含对检索证据是否足以支撑下一步推理的自我评估。 - 评价判定:Critic Model
ℳ_C读取该轨迹,根据推理连贯性与证据充分性给出二元判断(足够/不足)。 - 迭代精炼:若判定为不足,代理依据反馈自动重写查询或调整检索指令(如指定实体类型、时间范围),重新检索并再次推理;循环进行直至评价通过或达到最大步数。
输出:最终答案,以及完整的精炼轨迹(成功与失败的查询版本、对应的检索结果和推理状态)。
训练流程:Critic-Embed
输入:Critic-R-Zero 在推理时生成的大规模精炼轨迹(无需人工标注相关性)。
关键步骤:
- 从轨迹中提取成功检索-推理对(Critic 判定足够)与失败检索-推理对(判定不足)。
- 构建轨迹内对比学习任务:以成功对为正例、失败对为负例,训练一个指令跟随密集检索器,使其能理解类如“检索特定人物的出生地”等自然语言指令,并拉近相关文档向量、推远不相关文档向量。
- 损失函数基于查询-文档相似度对比,成功对相似度被鼓励高于失败对,同时保留指令感知的表示能力。
输出:经过优化的检索模型 Critic-Embed,在相同推理代理与 Critic 下,能更精准地返回支撑推理的文档。
推理+训练协同:完整 Critic-R
将训练好的 Critic-Embed 接入 Critic-R-Zero 的检索环节,推理时依然保留评价-精炼循环。实验表明这种组合可进一步放大增益,因为检索质量的提升减少了无效循环次数,同时代理仍能从动态反馈中受益。
与同类方法的差异:Critic-R 完全摆脱对人工标注或联合训练的依赖,纯粹由代理自身的自然语言内省反馈生成训练信号,检索优化与推理自检形成闭环迭代。
实验
实验设计
Critic-R 在四个多跳开放域问答数据集上评估:HotpotQA、2WikiMultihopQA、MuSiQue 和 Bamboogle。baseline 涵盖冻结检索器 + 推理时自省(如 Self-RAG)、检索器与代理联合训练(如 IRCoT/QAMPARI)等方法。实验围绕四个研究问题 (RQ) 展开:
- 推理时查询细化 (Critic-R-Zero) 能否在冻结检索器上缩小检索质量差距?
- 成功与失败的细化轨迹能否自动监督训练出更强的检索器 (Critic-Embed)?
- 组合推理时循环与训练后的检索器是否带来额外提升?
- 代理的内省反馈是否是关键监督信号源?
关键发现
- 检索质量大幅提升:Critic-R 在不依赖人工标注的情况下,显著改善多跳检索的 Recall 和 Precision,尤其对需要隐式推理链的查询效果更明显。
- 答案准确性同步增益:下游问答准确率在所有数据集上均取得一致进步,验证了检索改进能有效传递至最终生成。
- Critic-Embed 训练有效:利用 Critic-R-Zero 产生的正负例轨迹进行 intra-trajectory 对比学习,让检索器学会遵循细粒度指令,其性能逼近甚至超越需要 gold 标注的联合训练方法。
- 组件协同效应:Critic-R-Zero 与 Critic-Embed 结合使用时,检索召回率和答案 F1 均超过单独使用任一组件的上限,证明了推理阶段与训练阶段反馈闭环的互补性。
与基线深度对比
传统 agentic search 优化往往需昂贵的共同训练(co-training)或人工金标注释,限制了现实部署。Critic-R 通过引入批评模型自动评估检索证据是否支撑推理步骤,将代理的内省推理痕迹转化为免费的监督信号。相较于 IRCoT 等需要 step-wise 标注的方案,Critic-R 仅利用代理自身生成的自然语言反馈,显著降低了标注成本。与纯推理时方法(如 Self-Ask)相比,Critic-Embed 进一步将查询重写的经验固化到检索器参数中,形成闭环自我改进。这种 dual mechanism 设计使得 Critic-R 在零样本或少样本场景下表现出更强的泛化性,为构建可自我进化的搜索代理提供了实用路径。
行业影响
落地场景
Critic-R 框架直击代理搜索 (Agentic Search) 中检索器优化成本高的痛点,适用于一切需要多跳推理、复杂查询的企业级搜索产品。典型场景包括:
- 企业知识库问答:员工查询跨部门政策、技术手册时,系统需从多个非结构化文档中拼凑答案;
- 专业领域研究助手:如医疗文献分析、法律判例检索、金融研报问答,查询往往涉及细粒度约束与多证据链;
- 电商智能导购:用户用自然语言描述模糊需求(如“适合长途骑行的轻量帐篷,需防风防雨”),搜索引擎需迭代式精准召回。
商业价值
Critic-R 从两条核心路径创造价值:
- 显著降低标注成本:Critic-Embed 以推理轨迹作为自动监督信号,消除对人工相关性标注的依赖,使检索模型能在用户交互中持续进化,零额外标注预算即可适应数据分布变化。
- 提升用户体验与转化:Critic-R-Zero 的推理时查询细化可在不重新训练检索器的情况下即插即用,减少冗余交互与“幻觉”答案,直接提升信任度与留存率;对于电商或内容平台,精准召回意味着更高的点击率与转化率。
- 敏捷迭代能力:闭环反馈机制允许检索器跟随用户查询意图漂移而快速调整,无需重训庞大的基座 LLM, 使产品迭代周期从周级缩短到天级。
与现有产品/工作流的接口
集成到现有 RAG 栈 的阻力极小:
- 推理时增强:Critic-R-Zero 可封装为查询重写模块,在调用检索器前通过批评模型评估上一轮证据充分性,动态调整查询文本与检索指令,可无缝嵌入 LangChain / LlamaIndex 的 retrieve 节点。
- 离线优化:Critic-Embed 的训练只需要记录推理轨迹(成功/失败历史),可由流处理引擎(如 Kafka + 定时微调任务)定期更新检索模型,对在线服务无中断影响。
- 批评模型复用:Critic 模型可与现有 LLM 推理实例共享,仅需增加特定提示模板,无需额外部署专用模型。
具体落地 Use Case
- 企业政策查询助手:某跨国公司的 HR 政策分布于十多个内部站点,员工询问“若入职日期在股权授予日之前,产假期间的行权规则有何特殊之处”。使用 Critic-R, 系统自动将初期模糊查询改写为精确的子问题链(如“入职日期与股权授予日定义”“产假对行权期影响”),逐步召回关键条款,将答案准确率从 60% 提升至 85% 以上。
- 电商产品搜索:在服饰垂直电商中,用户输入“适合春季跑马拉松的速干短袖,透气且带反光设计”。Critic-R-Zero 首先检索到“速干短袖”大类后,批评模型判断证据不足以覆盖“透气”“反光”属性,随即生成面向行为/材质的细化查询,最终精确命中目标商品,减少用户平均筛选次数约 40%,转化率上升 12%。
局限
- **Critic 模型依赖强基础 LLM**: 推理时 Critic-R-Zero 需要调用评判模型(如 GPT-4)生成自然语言反馈,这会显著增加推理延迟和 token 开销,在低时延或成本敏感的生产环境中可能不适用。此外,评判模型自身的错误或偏差可能导致不准确的反馈信号,并将误差传播到检索器优化中。
- **训练数据的覆盖度与迁移性未充分验证**: Critic-Embed 依赖推理时成功/失败轨迹作为监督信号,但论文仅在四个多跳问答数据集上评估,且训练与测试的分布偏移较小。对于更开放的代理搜索任务(如工具调用、电商搜索)或存在分布漂移的场景,自动生成的监督质量及训练后检索器的泛化能力仍存疑。
- **Agent 思考能力冻结限制性能上限**: 实验保持推理 agent 冻结,仅微调检索模型。若 agent 自身无法产生高质量的内省轨迹或推理步骤,Critic 的反馈即使准确,也无法推动检索器学到更优检索策略,框架的整体收益受限于弱 agent 的上限,相比端到端联合训练方法可能更易陷入局部最优。