论文

CAFE: 自我改进的搜索智能体需要共同进化的反馈

CAFE: 自我改进的搜索智能体需要共同进化的反馈

问题:结果监督的搜索智能体(outcome-supervised search agents)能学会何时以及如何检索证据,但终局奖励既不能定位中间错误,也不能在错误累积之前引导正在进行的轨迹。将纠错反馈视为学习到的轨迹内干预(in-trajectory intervention),会耦合两个角色:智能体必须决定何时请求并使用反馈,而评判者必须从结果混淆的 rollout(其失败模式随智能体改进而改变)中推断出有用的纠正。 方法:本文提出 CAFE(Coupled Agent--Feedback Evolution),一个共享参数模型交替扮演搜索智能体和评判者的框架。CAFE 首先从围绕基础智能体自身失败构建的轨迹中初始化反馈条件恢复(feedback-conditioned recovery),然后耦合在线与离线优化。在线 RL 阶段,比较反馈估计(comparative feedback estimate)利用提示级别的呼叫-跳过成功差距(call--skip success gap)来塑造请求收益,而反馈感知的优势塑造(feedback-aware advantage shaping)会重新加权反馈前后的 token 优势。离线阶段,从 rollout 派生的偏好优化(rollout-derived preference optimization)从匹配的成功与失败轨迹中学习反馈。 实验:在七个智能体搜索基准上,CAFE 平均优于所评估的基于 RL 的搜索智能体,在所有六个域外基准上保持其收益,并减少了答案级幻觉。单侧消融显示,仅改进智能体或仅改进评判者最终会达到平台期,而交替进行两种更新则能持续提升性能。 结论:这些发现表明,自我改进的搜索智能体需要与其所引导的策略共同进化的反馈。

论文精读

TL;DR CAFE 耦合搜索代理与评论家共享参数交替进化,在线/离线学习轨迹内纠正反馈,在 7 个基准上超越 RL 基线并减少幻觉,证明自改进搜索代理需要共同进化的反馈。

问题

问题背景

当前探索式搜索代理的研究重点在于让模型自主决定何时检索、如何利用证据。结果监督(outcome supervision)通过最终答案的对错来训练检索策略,但这类终端信号过于全局化。

现有方法局限

  • 终端奖励 无法定位中间步骤的错误:即使最终答案错误,也无法判断是检索时机不当、证据选择错误,还是推理环节出错。
  • 现有工作将纠正性反馈(corrective feedback)视为固定外部模块,忽略了代理策略改进后失败模式会漂移:批评者(critic)从结果混淆的 rollout 中推断纠正信号,容易学到过时或有害的干预。
  • 代理与批评者单独优化容易陷入平台期:只改善代理或只改善批评者,性能增长有限。

为什么这个问题难/重要

搜索代理的任务是多步决策,中间错误会级联放大;反馈必须精确到 token 级别,且能适应策略的非平稳性。业界需要可靠、低幻觉的搜索代理,用于开放域问答、企业知识检索等场景。

行业类比

类似自动驾驶中的实时纠偏系统:车辆若仅依靠终点成功与否来调整驾驶策略,无法对中途的偏离车道做出及时修正;需要车载反馈系统与驾驶策略共同进化。

核心洞察

  • 自改进搜索代理的核心瓶颈不是检索策略本身,而是反馈信号无法随策略同步演化。现有 outcome-supervised RL 通常使用固定规则或独立 critic,当 agent 策略行为分布变化后,旧反馈会逐渐失效;CAFE 让共享参数模型交替扮演 agent 与 critic,从同一批 rollouts 中联合在线与离线优化,使反馈与策略保持耦合,避免单向优化出现的性能平台期。
  • 将反馈建模为策略内部干预(in-trajectory intervention)弥补了 terminal reward 的稀疏性。现有方法只在回合结束给予反馈,无法定位中间错误;CAFE 引入 comparative feedback estimate,利用 prompt-level call-skip success gap 构造请求反馈的即时奖励,并对反馈前后的 token advantage 重新加权,使 agent 在错误累积前主动请求并利用纠正,从而降低 answer-level hallucination。

方法

输入 → 关键模块 → 输出

输入:搜索型 agent 面临的 question 与基础 agent 的初始 rollout(可能包含错误检索与推理轨迹)。

关键模块:

  1. 角色条件模型与反馈条件恢复初始化:共享参数模型在 agent 与 critic 角色间交替。先以基础 agent 自身失败轨迹构造反馈条件恢复数据,让模型学会在收到纠正反馈后修正后续步骤。
  2. 在线 agent 优化:agent 在轨迹中决定何时请求反馈(call)或跳过(skip)。采用 比较反馈估计 (CFE) 奖励:利用 prompt 级别的 call–skip 成功差距来塑造请求回报,引导 agent 在低置信或高不确定处发起反馈请求;同时 反馈感知优势塑造 重新加权反馈前后的 token 优势,使模型更关注反馈引入的修正动作。
  3. 离线 critic 优化:从在线 rollouts 中筛选成功轨迹与失败轨迹,通过 结果引导的偏好过滤 构造对比对,再用 rollout 派生的偏好优化(类似 RDPO)更新反馈生成能力,让 critic 学会给出更有用的纠正。
  4. 迭代共进化:交替执行在线 agent 优化与离线 critic 优化,共享参数同步更新,使反馈策略与搜索策略互相适配。

输出:一个能自适应请求并利用反馈的搜索 agent,在需要时主动纠正证据检索方向,减少答案级幻觉。

差异点:与单纯结果监督 RL 或固定 critic 的纠正框架不同,CAFE 让反馈信号与策略共同进化,避免单边优化陷入性能平台。

实验

实验设计

CAFE 在七个 agentic search benchmarks 上评估,覆盖 in-domain 与 six out-of-domain 基准,基线为 evaluated RL-based search agents。采用 shared-parameter model 交替扮演 search-agent 与 critic。

关键发现

  • 平均性能优于 RL-based search agents;
  • 在全部六个 out-of-domain 基准上保持增益,体现泛化;
  • 降低 answer-level hallucinations;
  • 消融:单独优化 agent 或 critic 最终 plateau,交替更新两者持续提升。

与基线对比

outcome-supervised search agents 依赖 terminal reward,无法在轨迹中间定位错误;CAFE 通过 comparative feedback estimate (CFE) 和 feedback-aware advantage shaping 实现 in-trajectory intervention,并利用 rollout-derived preference optimization 让 critic 与 agent 共同进化。这解释了一边倒消融的 plateau 现象:仅提升策略或仅提升反馈都会遇到瓶颈,双向耦合才是关键。

行业影响

落地场景

CAFE 适用于任何依赖 search agent 或 RAG 的产品线,例如企业知识库问答、电商导购搜索、医疗文献辅助决策、金融研报信息抽取等。具体场景:

  • 电商智能客服:用户提出多条件商品咨询,代理需多轮检索与比较,中间反馈可及时纠正错误商品池,避免沿无效路径浪费推理预算。
  • 企业知识管理:内部问答系统中,代理面对多文档检索时,反馈信号可阻止其在无关文档上继续钻取,减少最终答案的幻觉与事实错误。

商业价值

  • 降本:通过 in-trajectory feedback 减少无效检索与冗余 token 消耗,尤其在长链路搜索任务中,每轮纠正都直接节约 API 调用成本。
  • 体验提升:answer-level hallucinations 显著下降,用户对 AI 回答的信任度增加,降低人工复核成本。
  • 增收:在电商或内容推荐场景,更准确的检索与比较能提升转化率与用户留存。

与现有产品/工作流的接口

CAFE 的共享参数模型可嵌入主流 agent 框架(如 LangChain、LlamaIndex)作为代理与 critic 的统一后端。集成路径:

  1. 将现有 agent 的 rollout 轨迹(含每一步检索、生成、最终奖励)导出为训练数据;
  2. 使用 CFE 奖励和反馈感知优势塑造进行在线 RL 微调;
  3. 通过离线偏好优化(RDPO)迭代更新 critic 能力;
  4. 部署时同一模型在推理中按需切换代理/评论家角色,无需额外服务。

该方式与现有 RLHF/DPO 流水线兼容,可逐步替换固定 prompt 式的反馈机制,降低迁移成本。

局限

  • - **训练开销显著**:CAFE 需在线 RL 与离线 RDPO 交替进行,每轮迭代都要收集 rollout、构建偏好对、更新 agent 与 critic 双角色参数,相比纯 outcome-supervised RL 增加了 critic 训练和对比样本构建的成本。在大型 backbone 上,这种双角色交替训练会消耗大量计算资源与时间,限制了在资源受限场景下的实际应用。
  • - **共享参数模型存在角色冲突风险**:同一模型既要学会何时请求反馈并利用反馈恢复(agent 角色),又要生成有效纠正(critic 角色),两个优化目标可能相互制约。论文未深入分析参数共享下两种能力的交互,也未对比使用独立 critic 网络的变体,因此共享参数是否必要、是否导致性能上限仍不明确。
  • - **评估领域相对集中**:实验主要在 agentic search benchmarks 上进行,尽管包含了 out-of-domain 测试,但均为检索问答类任务,未覆盖更广泛的 agent 场景(如多步工具调用、开放环境规划)。同时,对比基线仅限部分 RL-based search agents,未纳入其他引入中间反馈的方法(如 self-refine 或外部 verifier),CAFE 的优势可能受基准选择影响。
论文Boyang Liu2026-08-25原文

相关内容