论文

FORT-Searcher: 合成抗捷径搜索任务以训练深度搜索代理

FORT-Searcher: 合成抗捷径搜索任务以训练深度搜索代理

训练深度搜索代理需要可验证的问题,其答案直到通过搜索获取足够证据后才可获得。现有合成方法常通过丰富图结构来增加表观难度,但结构复杂并不能保证实现搜索难度:预期的搜索过程可能通过更廉价的识别路径坍塌。本文用捷径感知难度框架形式化这一差距,并识别出四种可操作的捷径风险:证据共覆盖、单线索选择性、暴露常量、先验知识绑定。为了诊断这些风险的真实影响,我们使用轨迹特征,包括求解代价、答案命中时间、先验捷径率。在该框架指导下,我们提出 FORT,一个抗捷径训练数据合成框架。FORT 通过控制实体选择、证据图构建、问题构建和对抗性细化中的捷径风险,构建抗捷径训练数据。实验表明,与现有开源深度搜索数据集相比,FORT 能诱导更长的搜索前时间,并减少捷径模式。利用生成的轨迹,我们仅通过监督微调(SFT)训练得到 FORT-Searcher,在具有挑战性的深度搜索基准测试中,它在同等规模的开源搜索代理中取得了最佳整体性能。相关资源将发布于 https://github.com/RUCAIBox/FORT-Searcher。

论文精读

TL;DR FORT 框架识别并缓解四种捷径风险来合成抵抗捷径的搜索训练数据,使仅经监督微调的 FORT-Searcher 在深度搜索基准上达到同类最优。

问题

问题背景

训练能够执行深度搜索 (deep search) 的 AI 智能体是当前研究热点,这类智能体需要通过多步信息检索与推理,回答无法直接从预训练知识中获得的复杂问题。

现有方法局限

为合成训练数据,现有方法通常试图通过增加证据图 (evidence graph) 的结构复杂性来提升任务难度,例如引入更多实体、关系和跳数。然而,结构复杂性 并不能可靠地转化为实际搜索难度:智能体可能发现并利用合成过程中无意留下的“捷径”,从而绕过精心设计的搜索路径。论文归纳了四种典型捷径风险:

  • 证据共覆盖 (evidence co-coverage):多条推理路径共享部分证据,浅层搜索即可命中;
  • 单线索选择性 (single-clue selectivity):图中存在高辨识度中间实体,一个特定查询便能锁定答案;
  • 暴露常数 (exposed constants):问题文本直接包含与答案强相关的常量或数值;
  • 先验知识绑定 (prior-knowledge binding):答案可通过模型已有知识直接推断,无需搜索。

这些缺陷导致智能体习得“走捷径”而非真正的探索能力。

为什么这个问题难/重要

合成“抗捷径”的训练数据极具挑战,因为捷径风险隐藏在多维度设计细节中,传统基于结构指标的评估无法捕捉智能体的实际行为偏差。论文采用轨迹签名 (trajectory signatures) 如解决成本答案命中时间先验捷径率来量化真实难度,揭示了现有数据集普遍存在严重的搜索崩塌。若不解决,基于此类数据训练的智能体将在遭遇真实世界的长尾、多跳问题时表现脆弱,限制其在智能助理、科研分析等场景的落地。业界亟需可规模化且可靠的深度搜索训练范式。

行业类比

这类似于训练代码生成模型时,若训练样本充斥易于匹配的模板,模型便不会真正推理算法逻辑;同样,深度搜索智能体需要短路抵抗 (shortcut-resistant) 的训练数据,才能培养出稳定的多步推理与探索技能。

核心洞察

  • 搜索任务的难度度量不应止于结构复杂度,而需区分“预期难度”与“实现难度”。论文指出,即使图结构复杂,若存在“捷径”(如证据共覆盖、单线索选择性、暴露常数、先验知识绑定),智能体可能通过廉价识别路径绕过深度搜索,导致训练失效。为此,作者提出了**捷径感知难度框架**,并引入轨迹签名(解决成本、答案命中时刻、先验捷径率)来量化这些短路风险,为诊断和修正合成数据提供了工程化指标,区别于以往仅靠图谱增广的简单做法。
  • FORT 的关键创新在于**对抗性精炼**环节:它系统性地排查并消除四种预定义捷径,确保生成的问题必须经过充分证据获取才能解答。这与仅依赖问题生成或图增强的方法不同,它主动对抗塌缩,从而诱导出更长的答案前搜索轨迹和更少的捷径模式。仅用监督微调,在同等规模的开源搜索智能体中,FORT-Searcher 即在多个深层搜索基准上取得最优综合性能,证明了捷径抵抗数据对训练实效的决定性影响。

方法

FORT 训练数据合成管线

FORT 框架将深度搜索代理的训练数据生成视为一个捷径风险控制过程,输入为知识图谱的种子实体,输出为经过对抗验证的问答对及其关联证据图。

1. 图初始化与实体选择

从大规模知识图谱中选取一组种子实体,作为搜索环境的起点。实体选择策略已考虑不让答案实体被轻易定位,降低单线索选择性风险。

2. 证据图构建

围绕种子实体,通过以下步骤构建结构丰富但不可塌缩的证据图:

  • 多源融合:从多个知识源(如 Wikidata、维基百科)抽取事实,增加信息冗余度。
  • 派生事实构造:基于已有事实推导新关系,形成多跳推理链,迫使代理必须沿链搜索。
  • 事实验证与通用事实筛选:剔除噪声,并选择对代理模型不具备先验知识的事实,避免先验知识绑定。 这些操作共同抵抗证据共覆盖暴露常量两类捷径风险。
3. 问题制定

基于构建好的证据图,生成要求多跳推理且答案无法被直接“命中”的问题。问题模板确保答案实体必须在搜索过程中逐步获取证据后才会出现,从而杜绝直接从问题中猜测答案的答案命中时间捷径。

4. 对抗性细化

将生成的问题交由代理模型尝试搜索,收集轨迹签名(如解决代价答案命中时间先验捷径率)。若代理通过捷径行为(如利用共覆盖线索)廉价求解,则回溯调整图结构或问题措辞,直到轨迹签名显示代理必须经历充分的搜索。

最终输出用于监督微调的完整轨迹数据,只需SFT即可训练出能抵御捷径的搜索代理 FORT-Searcher

与同类方法的差异点:现有框架仅通过增加图节点或边数来提升表面难度,而 FORT 直接诊断并系统性地消除四种可操作的捷径风险,使搜索代价与预期推理深度真正对齐。

实验

实验设计

论文设计了一套评估流程来检验 FORT 合成数据的有效性。首先,通过 FORT 框架生成捷径抵抗型训练样本,这些样本在实体选择、证据图构建、问题表述和对抗性精炼四个阶段均控制四种捷径风险(证据共覆盖、单线索选择性、常量暴露、先验知识绑定)。基线包括多个开源深度搜索数据集(如现有的图谱式合成数据)和对应的搜索智能体。使用有监督微调(SFT) 训练 FORT-Searcher 模型,并与同规模开源搜索智能体在多个深度搜索基准上对比。评估指标聚焦于搜索轨迹特征:预回答搜索步数答案命中时间先验捷径率,以及最终任务成功率。

关键发现

  • 使用 FORT 数据训练的智能体在挑战性深度搜索基准上取得开源模型中的最优整体性能
  • 轨迹分析表明,FORT 数据显著延长了找到答案前的搜索步数,并大幅减少了捷径模式(如利用暴露常量或单一线索直接猜测答案)。
  • 消融实验证实,移除任一捷径抵抗机制(如对抗性精炼)都会导致训练数据难度下降,进而降低最终智能体的搜索鲁棒性。
  • FORT 生成的训练轨迹与真实复杂搜索行为更相似,验证了其作为训练信号的价值。

与基线对比解读

相较于仅依赖图结构复杂度增强难度的现有合成方法,FORT 框架的核心优势在于识别并显式消除捷径,而非单纯堆砌证据数量。这使得训练的智能体不再依赖表面线索或内部知识“走捷径”,而是真正执行多步推理和证据交叉验证。与使用原始结构型合成数据训练的基线相比,FORT-Searcher 在需要深层信息联接的任务上优势更明显,体现了从“结构难”到“认知难”的转变。该工作也为后续训练数据合成提供了可诊断的难度框架轨迹代理指标,具有工程落地指导意义。

行业影响

落地场景

FORT-Searcher 为深度搜索智能体(Deep Search Agent)而生,核心能力是将训练数据合成过程中的“捷径”显式建模并消除,迫使模型展开多步证据获取而非依赖表面线索。最能直接受益的产品包括:

  • 企业知识库问答:内部文档散落,答案需要跨文本综合,如售后服务、合规审计。
  • 科学文献分析:要求从海量论文中验证假设,避免断章取义。
  • 金融/法律尽调:涉及多实体关系与矛盾信息,需严格证据链。
  • 电商比较式搜索:商品参数对比、评价可信度交叉验证。

商业价值

  • 降本:FORT 数据合成管线可自动化生成抗捷径的训练数据,减少人工标注复杂查询的成本,并为搜索类 Agent 提供高质量 SFT 轨迹,省去昂贵的 RL 对齐流程。
  • 增收:更高的搜索准确率和可解释性直接提升用户信任与转化,例如在电商导购中降低退货率、在金融终稿中加快尽调周转。
  • 体验提升:模型不再是“看一眼问题就猜答案”,而是展开真正的搜索—推理过程,答案附有可追溯的证据片段,符合高信任场景要求。

论文指出 FORT 仅需 SFT 即能在困难的深度搜索基准上取得最佳整体性能,这意味着训练成本与部署门槛大幅下降。

与现有产品/工作流的接口

FORT 的 pipeline 可无缝接入现有搜索 Agent 框架(如 LangChain、AutoGPT 类工具),具体集成方式:

  1. 作为数据工厂:接入知识图谱构建引擎(如 Neo4j)与搜索 API,定期自动产出“防捷径”训练集,供内部 LLM 精调。
  2. 嵌入闭环评估:利用论文提出的轨迹签名(求解代价、答案命中时间、先验捷径率)实时监测线上 Agent 是否出现衰退,触发数据回灌。
  3. 与现有 RAG 栈协同:FORT 生成的问答对可作为增强型的查询—证据对,直接提升检索器的段落对齐质量。

具体落地 Use Case

  • 电商智能导购:用户提问“适合油皮的持妆粉底液,且不能含XX成分”,常规搜索可能直接给出爆款列表,而 FORT 驱动的 Agent 会依次检索成分表、功效测评和真实性验证,避免被付费推广内容误导,输出有据可依的推荐,提升客单价与满意度。
  • 医疗指南多步循证:面向临床决策支持,问题如“针对EGFR突变非小细胞肺癌,PD-1联合化疗比单药化疗在PFS上的获益程度”,FORT - trained Agent 不会仅凭记忆或单篇摘要回答,而是逐步检索多中心临床试验、荟萃分析,并标注证据级别,满足严格合规要求。

局限

  • **对预构建知识图的强依赖**:FORT 的合成流程需要从结构化知识库(如 Wikidata)中抽取实体和关系来构建证据图,这限制了生成任务的**领域多样性**和**可迁移性**。对于非结构化网页、多模态证据源或实时动态信息,自动构建高质量抗捷径问题仍面临挑战,可能无法直接覆盖真实搜索场景的复杂性。
  • **捷径风险分类的有限覆盖**:论文总结的四类捷径(证据共覆盖、单线索选择性、暴露常量、先验知识绑定)主要面向基于图的多跳推理设计。在实际深度搜索中,智能体还可能利用 **查询优化、页面缓存或URL模式** 等绕过完整搜索过程,这些模式未被现有框架诊断和抑制,可能导致部分训练场景下捷径仍难以根除。
  • **纯 SFT 训练范式的局限**:FORT-Searcher 仅用监督微调(SFT)训练,未引入强化学习或过程监督。虽然 SFT 在相对受限的合成数据上表现良好,但可能**限制了智能体在长轨迹探索中的策略鲁棒性**,尤其在需要动态调整搜索计划的真实任务中,智能体可能倾向于模仿训练数据中的固定模式,而非自主决策。
论文Jia Deng2026-06-10原文

相关内容