ABSeeker: 通过答案回溯的信用分配训练长视野搜索智能体
长视野搜索智能体需要执行多个连续动作(步骤)来搜索、检索、验证并整合证据,最终得出答案。然而,现有的训练方法在监督微调(SFT)和强化学习(RL)中通常将轨迹中的所有步骤统一处理,无法区分有效动作与错误或冗余动作。 本文提出 Answer-Backtracked Credit Assignment (ABC),一种细粒度信用分配框架,通过将稀疏的轨迹级结果转化为密集的步骤级监督信号,奖励有效动作(即使在失败的轨迹中)同时抑制错误或冗余动作。具体来说,给定一个可能模糊的查询及其对应 ground-truth 答案,ABC 首先执行 Answer-Backtracked Clue Recovery,从答案回溯恢复解决该问题所需的中间线索;随后应用 Clue-Anchored Step Scoring 评估每个搜索步骤与这些线索的契合度,将稀疏的二值结果监督转化为密集的步骤级奖励。基于这些奖励,我们开发了 ABC-SFT(重新加权每轮损失)和 ABC-GRPO(将步骤级分数作为 GRPO 中的奖励)。 在此基础上,我们仅用 8.5k 个样本基于 Qwen3.5-4B 训练了 ABSeeker。在 BrowseComp 上达到 37.3%,在 BrowseComp-ZH 上达到 39.1%。通过上下文管理,分数进一步提升至 55.3% 和 52.9%,显著优于同规模(4B)智能体,甚至可与更大规模(约 30B)的模型性能相当。这些结果证明了基于答案回溯的步骤级信用分配在训练长视野搜索智能体方面的有效性。
论文精读
TL;DR 通过答案回溯线索恢复实现步骤级信用分配,将稀疏结果转化为密集奖励,训练4B搜索智能体超越同规模并匹敌30B模型。
问题
问题背景
长程搜索智能体(long-horizon search agents)需要执行多步搜索、检索、验证与证据整合,以回答复杂查询。近期代表性系统如 OpenAI Deep Research、Tongyi DeepResearch 等推动了这一方向的发展,但如何高效训练这类智能体仍是一个关键挑战。
现有方法局限
当前训练方法在监督微调(SFT)和强化学习(RL)阶段均将轨迹内的所有步骤同等对待,忽略单个动作的质量差异:
- SFT 局限:标准交叉熵损失对每个 token 平等计算,不区分关键搜索步骤与冗余、错误步骤,导致模型可能模仿低质量行为。
- RL 局限:常用奖励信号仅为轨迹级的二元结果(成功/失败),奖励极度稀疏且噪声大——有用的步骤若出现在失败轨迹中被施加惩罚,而无用步骤若出现在成功轨迹中却获得奖励。
这种“均匀信用分配”使得模型难以准确识别哪些搜索行为真正贡献了最终答案,训练效率低下。
为什么这个问题难且重要
搜索过程中的步骤高度多样化(查询、浏览、过滤、推理),中间结果可能包含错误或冗余信息,最终答案的正确性无法直接反映中间步骤的贡献。缺乏细粒度的步骤级反馈会导致:
- 训练信号信噪比低,模型容易学到表面捷径而非真正的多步推理能力;
- 在长程任务中,稀疏奖励导致的信用分配问题尤为严重,限制了从少量数据中高效训练出强智能体的能力。
业界对搜索智能体的需求日益增长,但依赖大规模模型或海量数据并非可持续之道,因此精确的步骤级信用分配成为提升数据效率和性能的关键技术突破口。
行业类比
类似训练对话式 AI 时,仅凭最终任务成功率难以指导每一轮对话的改进,需要细粒度的轮次级意图识别与信用分配;搜索智能体同样需要回溯答案以明确每个搜索行为的价值,从而突破稀疏奖励瓶颈。
核心洞察
- 答案回溯式线索恢复实现从稀疏结局到密集步骤级信用的转换,突破了传统 long-horizon agent 训练中无法区分有效、错误与冗余动作的瓶颈。以往监督微调与强化学习均等同处理轨迹内的所有步骤,而 ABC 通过对标答案反推关键中间线索,并以此为锚点评估每一步的贡献,首次将失败轨迹中的有益动作也纳入正向反馈,极大提升了信用分配的精度与数据效率。
- 基于细粒度步骤奖励的 ABC-SFT 与 ABC-GRPO 使得仅 4B 参数的 ABSeeker 在只用 8.5k 样本训练后便达到与 ~30B 模型相当的性能(BrowseComp 55.3%),证明小模型可以通过高质量过程监督超越暴力缩放。这为资源受限条件下构建高性能搜索 agent 提供了工程可行的路线,并暗示了答案回溯策略在其他需要多步推理的任务中的泛化潜力。
方法
ABC 方法接收一个可能含歧义的查询及其标准答案作为输入,目标是训练一个长期搜索智能体,使其多步搜索动作(搜索、检索、验证、整合)能直接指向有用信息。
关键模块
Answer-Backtracked Clue Recovery(答案回溯线索恢复) 从标准答案出发,逆向推理出解决该问题所必需的中间线索。这一过程通常由一个大语言模型(如提示后的 Qwen)完成,将答案分解为一系列可验证的事实或推理步骤,从而将最终答案的“黑盒”转化为可操作的线索序列。
Clue-Anchored Step Scoring(线索锚定的步骤评分) 对搜索智能体轨迹中的每一步(如一次搜索查询、一次页面点击),评估其与之前恢复的线索的相关性。评分机制会判断该步骤是:
- 有用:直接匹配或明显推进某条线索;
- 错误:偏离正确线索,甚至引入误导信息;
- 冗余:重复已有信息,未提供新线索。 由此,原本稀疏的轨迹级二元标签(最终答案是否正确)被转化为稠密的步骤级奖励分数。
输出与训练
基于步骤得分,形成两种训练信号:
- ABC-SFT:在监督微调中,每个 step 的损失根据其得分进行加权,让有用步骤的梯度贡献更大,抑制错误或冗余步骤的影响。
- ABC-GRPO:在强化学习(Group Relative Policy Optimization)中,直接将步骤得分作为每步的奖励,指导策略网络提升有用动作的概率,降低无效动作的概率。
该框架的核心价值在于利用失败轨迹中的有用动作——传统方法因只有轨迹级反馈,容易将包含部分正确步骤的失败轨迹完全当作负样本,而 ABC 能从中提取有效信号进行学习。
与同类方法的差异:传统 SFT 或 RL 训练搜索智能体时,对轨迹内所有步骤一视同仁,而 ABC 首次通过答案回溯实现步骤级别的信用分配,在不增加人工标注的前提下将稀疏反馈转化为密集监督,特别适用于长期搜索场景中失败轨迹的复用。
实验
实验设计
实验旨在验证 Answer-Backtracked Credit Assignment (ABC) 在长程搜索 agent 训练中的效果。基于 Qwen3.5-4B 模型,使用仅 8.5k 条高质量样本,分别采用 ABC-SFT(加权微调)与 ABC-GRPO(步级强化学习)训练得到 ABSeeker。评估基准为极具挑战性的 BrowseComp 和 BrowseComp-ZH 数据集,要求 agent 执行多步搜索、检索、验证并整合信息得出最终答案。主要对比对象包括同规模(4B)的搜索 agent 以及更大规模(约 30B)的模型,并测试了引入上下文管理(context management)后的性能上限。
关键发现
- 步级信用分配至关重要:ABC 通过“答案回溯线索恢复”与“线索锚定步级评分”,将稀疏的轨迹级结果转化为稠密的步级监督,即使失败轨迹也能发掘有效动作,从而大幅提升训练效率。
- 小样本高效率:仅 8.5k 训练样本即达到 BrowseComp 37.3% 和 BrowseComp-ZH 39.1% 的准确率,证明 ABC 能够从有限数据中充分挖掘学习信号。
- 上下文管理带来大幅增益:启用上下文管理后,两个基准上的性能分别跃升至 55.3% 和 52.9%,表明 ABC 训练出的 agent 具备良好的可扩展性,能更好地利用长上下文。
基线对比解读
相比现有工作,ABSeeker 在 4B 参数级别取得了显著优势,甚至与 30B 级模型性能相当。这主要归功于 ABC 的细粒度奖励设计:传统方法(如直接使用轨迹级奖励的 SFT/RL)将所有动作视为等同,容易使模型学到冗余或错误行为;而 ABC 能精准区分有用步骤与无效步骤,使得 RL 训练更加稳定,SFT 更加聚焦关键决策点。这一结果揭示了在长程代理任务中,对中间步骤的显式信用分配是缩小小模型与大模型差距的关键路径。
行业影响
落地场景
长周期搜索智能体(如深度调研、竞品追踪、医疗证据检索)天然适配 ABSeeker 框架。典型产品包括:
- 电商平台的 智能导购与比价助手:用户提出模糊需求(“适合户外运动的降噪耳机”),智能体需多步搜索、核实参数、整合评测,最终给出精准推荐。
- 企业知识管理系统的 深度检索问答:员工提问“公司内部哪些项目使用了 React 18 并发特性”,智能体需跨不同知识库、文档格式逐步检索、校验上下文。
商业价值
核心在于 降低失败轨迹的浪费,提升数据效率。
- 降本:传统监督微调(SFT)和强化学习(RL)将整个搜索轨迹同等对待,导致大量含有噪声步骤的样本被直接丢弃或产生负向更新。ABC 框架通过 答案回溯信用分配(Answer-Backtracked Credit Assignment),从失败轨迹中也能提取有效步骤,显著提升训练样本利用率。实验中仅用 8.5k 样本 就将 4B 模型提升至可媲美 30B 模型的水平,训练成本大幅下降。
- 增收/体验提升:更精准的步骤级信用分配使智能体减少无效搜索轮次,降低延迟,提升最终答案的召回率与准确率。对于付费订阅的深度搜索产品(如 OpenAI Deep Research),体验提升直接转化为留存率与付费意愿。
与现有产品/工作流的接口
ABC 框架可通过以下方式集成进现有产品管线:
- 数据飞轮:在已有的搜索日志中,利用正确答案反向恢复中间线索(Answer-Backtracked Clue Recovery),自动化生成步骤级别的奖励标注,无需昂贵人工评估。
- 训练流程插件化:ABC-SFT 可作为加权损失函数直接嵌入现有的 SFT 流程;ABC-GRPO 则利用步骤级奖励替换 GRPO 中的粗粒度结果奖励,与现有强化学习训练器(如 TRL 或自定义 RL 框架)兼容。
- 在线优化:生产环境中,可对用户采纳的答案离线回溯线索,构建持续更新的步骤级监督信号,驱动 自改进循环(self-improvement loop)。
具体落地 use case
金融研报自动生成:分析师输入“近期美联储加息对全球半导体供应链的影响”,智能体需多轮搜索:政策声明、行业报告、头部公司财报、分析评论。传统方法可能因某次搜索返回不相关页面对整个轨迹降权,而 ABC 可以精细识别每一步(如成功检索到政策文件)并给予正向奖励,即便最终整合潦草。这种粒度使训练出的智能体在复杂信息整合任务中更稳健,降低了对海量人工标注的依赖。
医疗证据检索与综合:临床决策支持系统需回答“对于 EGFR 突变阳性非小细胞肺癌患者,奥希替尼对比厄洛替尼的脑转移控制效果”。搜索智能体需查询 PubMed、临床试验库、指南文件等多个源头,并交叉验证。ABC 框架可让智能体学会甄别高价值检索步骤(如直接命中 meta 分析),抑制冗余查询,使最终证据摘要的召回率与可靠性显著提升。
局限
- **对 ground-truth 答案的强依赖**:ABC 框架的核心——Answer-Backtracked Clue Recovery——需要预先知道每个查询的正确答案,才能反向推断中间线索。这限制了其在开放域问答、实时信息检索或没有标注答案的场景下的应用。即使有标注,自动回溯生成的线索质量可能参差不齐,进而影响步骤评分的准确性。与基于过程奖励模型(如稠密奖励搜索、自批评方法)相比,ABC 缺乏对无答案任务的通用性,可能在未来扩展到更通用的智能体训练时面临挑战。
- **小规模数据训练的泛化性存疑**:ABSeeker 仅使用 8.5k 例子训练,尽管在 BrowseComp 等基准上表现优异,但如此小的数据量可能使模型过度拟合训练集的特定模式或领域分布。论文未在更多样化的搜索场景(如多语言、多模态、长尾知识)上进行充分评估,其泛化性能有待进一步验证。此外,从 4B 模型迁移到更大基座模型的 scaling 效果和稳定性也未探讨。
- **额外的计算开销与可扩展性**:ABC 方法引入的答案回溯和步骤评分模块,需要在训练过程中额外调用语言模型进行推理,增加了计算成本,特别是在长轨迹下可能显著延长训练时间。论文未详细分析这部分开销,也未与更轻量级的信用分配方法(如基于启发式的 Stepwise Reward)进行成本-收益对比。当扩展到更大规模模型或更长步数的搜索任务时,这些开销可能成为瓶颈。