SlimSearcher: 通过自适应奖励门控训练效率感知的Web智能体
深度研究智能体在复杂信息检索任务中表现出色,但高昂的计算成本成为瓶颈。现有模型基于准确率驱动的训练范式,采用暴力搜索策略,表现为盲目依赖工具和表演性推理,生成冗长的轨迹,导致大量工具调用和令牌消耗。 为突破这一效率陷阱,我们提出 SlimSearcher 框架,在监督微调(SFT)和强化学习(RL)阶段同步优化准确率与计算代价的帕累托前沿。SFT阶段通过Pareto高效过滤 蒸馏出既成功又经济的轨迹,引导模型形成效率感知的搜索行为;RL阶段引入自适应奖励门控(Adaptive Reward Gating),一种动态奖励塑形机制,在采样队列中评估工具与令牌的相对效率。该机制通过级联自适应效率度量与严格正确性门控,有效避免了绝对惩罚带来的简洁性偏差,并缓解了奖励破解。 在 GAIA、BrowseComp 和 XBenchDeepSearch 等长程基准上的大量实验表明,SlimSearcher 在保持或提升准确率的同时,将平均工具调用轮次减少了 17%–58%。
论文精读
TL;DR SlimSearcher 通过帕累托高效轨迹过滤与自适应奖励门控,训练出高效搜索智能体,在保持准确性的同时减少 17%–58% 的工具调用轮次。
问题
深度研究型智能体(deep research agents)在复杂信息搜寻任务中展现出强大能力,但其高昂的算力消耗成为落地瓶颈。当前领域高度关注如何在保持准确率的前提下压缩推理成本,因此效率感知的训练范式是前沿课题。
现有方法主要存在三类局限。首先,主流的 SFT 训练仅过滤失败轨迹,保留成功但冗余的轨迹,导致模型学习到盲目工具调用和表演性推理(performative reasoning)——生成大量不必要的中间步骤与 token。其次,RL 阶段的奖励设计通常采用固定的效率惩罚(如按工具调用次数扣分),容易引发简短偏好偏差(brevity bias),模型可能为了规避惩罚而伪造简短但错误的答案,即奖励劫持(reward hacking)。再者,绝对效率指标缺乏上下文参照,不同任务所需的合理步骤数差异巨大,硬性惩罚无法自适应。
该问题的技术挑战在于:效率与正确性两个目标天然存在冲突,需要在监督微调(SFT)与强化学习(RL)两个阶段协同优化 Pareto 前沿。从工程角度看,信息搜寻智能体通常运行在长周期、多轮交互环境中,一次推理可能涉及数十次工具调用与数万 token,任何微小的效率提升都能累积成显著的成本节约。业界对 GAIA、BrowseComp 等长程基准的关注度持续攀升,这些环境强度高、任务复杂,是检验训练框架是否真正高效的试金石。
这一挑战类似于RAG 系统中的检索增强生成:初期追求召回率最大化导致大量冗余检索,后来通过端到端优化逐步学会按需检索。而 SlimSearcher 在训练阶段引入的自适应门控奖励机制,则相当于教会智能体“在运行时判断哪些步骤真正有用”。
核心洞察
- SlimSearcher 通过 Adaptive Reward Gating 在 RL 阶段引入相对效率锚定,动态评估同组采样轨迹中的工具调用和 token 消耗效率,仅在正确答案的基础上附加奖励。这种相对比较而非绝对阈值的机制,有效避免了传统方法中因固定惩罚或硬性截断导致的“简短偏误”和奖励黑客,使得智能体在保持探索能力的同时自发收敛到经济行为,为 RL 阶段的效率奖励设计提供了更鲁棒的范式。
- 在 SFT 阶段,SlimSearcher 利用 Pareto-efficient filtration 从成功轨迹中筛选出同时满足正确且资源消耗少的样本,而非简单选择最高分或随机采样。这一策略从数据源头注入效率意识,让模型在行为克隆阶段就学到节俭的搜索模式,区别于事后通过正则化或约束解码来压缩推理成本的工作,为构建“从数据中内化效率”的训练流程提供了明确工程路径:精心构建兼顾多个目标的 SFT 混合数据,比单纯堆叠数据或后期惩罚更有效。
方法
SlimSearcher 遵循“输入—关键模块—输出”流程,从基座模型和复杂搜索任务出发,通过两阶段训练框架产出高效 web agent。
输入
- 基座模型(预训练大语言模型)
- 任务集(如 GAIA, BrowseComp, XBench-DeepSearch,涉及多步信息检索与推理)
- 工具环境(搜索 API、浏览器等,每次调用产生工具轮次和 token 消耗)
SFT 阶段:效率感知的拒绝采样
基于奖励模型对模型生成的多个候选轨迹打分,综合考虑正确性与效率(工具调用次数、总 token 数)。采用 Pareto 高效过滤:仅保留在正确性和效率两维度上均不劣于其他轨迹的样本,构建高质量微调数据集。这些轨迹既成功完成任务,又天然具备经济性,引导模型学习高效搜索行为。
RL 阶段:多阶段自适应奖励门控
在强化学习优化中,设计级联门控奖励函数:
- 正确性门(Correctness Gate):只有最终答案正确的轨迹才进入后续效率评估,否则奖励为 0。
- 工具效率自适应锚定(Adaptive Anchoring for Tool Efficiency):对每个采样批次,计算工具调用次数的中位数;优于中位数的轨迹获得正奖励,劣者受罚,幅度取决于偏差大小。
- Token 效率自适应锚定(Adaptive Anchoring for Token Efficiency):类比工具效率门,以 token 消耗中位数为基准,动态调整奖励。
三层门控级联生效:正确性是前提,两种效率门在批次内形成相对竞争,驱动模型在不牺牲准确率的前提下压缩冗余步骤。由于锚点随批次分布自适应变化,避免了固定惩罚引起的“简洁性偏差”和奖励黑客。
输出 经 SFT+RL 联合训练的策略模型,在面对长周期复杂搜索任务时,能自主平衡准确率与计算开销,平均工具轮次降低 17%–58%,且准确率持平或提升。
与同类工作的差异:现有方法常使用绝对效率阈值或固定系数惩罚,容易陷入过度精简或盲目堆砌工具的极端。SlimSearcher 通过批次内相对比较和动态中位数锚定,让奖励信号自适应于模型当前能力分布,更稳健地推动效率前沿,而不会牺牲正确性。
实验
实验设计
在三个长时域基准上评估 SlimSearcher:GAIA(多步复杂推理)、BrowseComp 和 XBench-DeepSearch(开放域探索)。训练分两阶段:SFT 阶段使用 Pareto-efficient 过滤,从成功轨迹中筛选高性价比样本;RL 阶段引入 自适应奖励门控,在组内比较工具调用轮次和 Token 效率,级联一个严格的正确性门控。基线与纯准确率驱动的模型对比,并消融各组件效果。
关键发现
- 效率大幅提升:平均工具调用轮次减少 17%–58%,同时保持甚至略微提升准确率。
- 多任务泛化:在需要严格执行纪律的 GAIA 上有效抑制多余工具调用;在探索类任务上消除“效率陷阱”,避免爆发式无意义搜索。
- 消融结论:奖励引导拒绝采样提供了高质量 SFT 种子;正确性门控防止奖励黑客;自适应锚定比绝对阈值更鲁棒,避免简洁偏向。
基线对比深度解读
与传统的“准确率优先”训练范式相比,SlimSearcher 从根源上修正了表现性推理和盲目工具依赖。绝对惩罚方法(如按轮次扣分)常导致模型过度压缩输出而损害准确率,SlimSearcher 的组内相对效率锚定将优化目标从“尽可能简单”转向“在同批次中更高效且正确”,成功逼近帕累托前沿。这一设计对实际工程有启示:在资源受限的在线服务中,可通过类似自适应奖励机制动态平衡成本与质量,而非采用静态预算截断。
行业影响
落地场景
SlimSearcher 主要面向需要多步工具调用的深度研究智能体,例如自动化市场调研、竞品分析、知识图谱构建、学术文献综述等场景。在电商选品与价格监控中,代理需要频繁调用搜索引擎或商品 API 获取聚合信息,传统暴力搜索会产生大量冗余 token 和请求;在金融研报自动生成中,需遍历新闻、财报、公告等多个数据源,盲目扩展工具调用将推高成本且延迟过大。该框架通过效率感知训练,使代理在复杂长程任务中动态平衡准确性与资源消耗,显著压缩推理成本。
商业价值
直接价值在于降低推理成本的单位经济模型:实验表明平均工具调用轮次降低 17%–58%,对应 API 调用费和 GPU 时间的大幅节省。在需要大规模部署研究代理的 SaaS 平台中,这能直接转化为毛利率提升。同时,更紧凑的轨迹提升终端用户体验(响应时间缩短),并能支撑更高的并发查询量,间接提升客户留存和扩展性。此外,该方法不牺牲甚至提升准确率,降低了引入效率优化时的质量风险。
与现有产品/工作流的接口
SlimSearcher 可嵌入标准 SFT + RL 训练管线,无需大幅改造现有智能体架构。在 SFT 阶段,可直接替换原有数据过滤逻辑,采用 Pareto 高效筛选 生成效率-质量兼优的训练样本;在 RL 阶段,将 Adaptive Reward Gating 作为奖励生成模块接入现有 PPO 或 GRPO 流程。该框架与工具增强框架(如 LangChain、AutoGPT)解耦,作为策略优化层引入,不侵入工具调用协议。部署时只需在奖励计算中增加相对效率门控,对现有系统改动极低。
具体落地案例
- 电商竞品监控代理:自动收集竞品价格、评价、库存变动。传统代理可能对每个 SKU 反复搜索相似产品,导致大量无意义 API 调用。使用 SlimSearcher 后,代理学会仅在关键维度(如价格大幅波动或新评论事件)时执行深度搜索,其余时刻复用缓存或缩短搜索链路,平均月度 API 成本可下降 40% 以上。
- 金融研报助理:生成一份公司深度研报需爬取历年财报、新闻、行业报告。原代理可能将所有潜在段落逐一下载并分析,产生庞大的 token 消耗。效率感知训练后,代理在发现关键段落时才会深入解析,并主动跳过过于相似或低信息量文本,生成单份研报的 token 费用从数十美元级降至几美元级,同时保持报告质量。
局限
- SFT 阶段的帕累托有效过滤需要生成大量候选轨迹以进行 rejection sampling,这带来了不小的前期计算开销。尽管最终训练出的模型能显著降低推理成本,但训练过程本身可能消耗更多 GPU 时与 API 调用次数,对于资源敏感的应用场景,这种权衡可能不够经济,限制了其在轻量级管线中的直接部署。
- Adaptive Reward Gating 通过采样批次内轨迹的相对效率比较来产生奖励信号,因此对批次的多样性高度依赖。当策略进入收敛期,生成轨迹趋同,效率差异缩小,奖励便失去区分能力,可能导致训练停滞。同时,正确性门控作为奖赏的硬过滤条件,在开放域或主观性强的任务中难以准确界定,可能错误地奖励简洁但部分错误的响应,存在 reward hacking 风险。
- 实验目前仅在 GAIA、BrowseComp 和 XBench-DeepSearch 等固定基准上进行,虽然这些基准覆盖了复杂推理与探索任务,但无法充分模拟真实世界搜索代理面临的动态工具集变化与环境噪声。方法尚未与 prompt 压缩、推理时自适应截断等轻量效率优化手段进行系统对比,其对工具集与任务分布偏移的鲁棒性也未经验证,因而在复杂工程系统中的直接应用价值尚待进一步确认。