论文

DeepSearch-World: 可验证环境中深度搜索代理的自我蒸馏

DeepSearch-World: 可验证环境中深度搜索代理的自我蒸馏

训练工具使用代理从自身经验中改进仍然具有挑战性,因为监督微调依赖于固定的教师蒸馏轨迹,而稀疏奖励强化学习对长程交互提供弱监督。 我们提出 DeepSearch-Evolve,一个基于 DeepSearch-World 的自我蒸馏框架。DeepSearch-World 是一个确定且可验证的环境,具有可复现的搜索和页面阅读工具,包含从实体级随机游走构建的 420K 多跳问答任务,支持关键代理认知行为,如进度验证、基于上下文的反思和失败恢复。 DeepSearch-Evolve 迭代进行轨迹生成、过滤、数据混合和微调,以训练更强的代理。无需蒸馏自更强大的模型,DeepSearch-World-9B 在 BrowseComp 上达到 31.2%,在 GAIA 上达到 61.5%,在 HotpotQA 上达到 93.4%,表明可验证环境能实现长程网络代理的可扩展自我进化。 我们将发布环境、420K 训练池、验证集、模型和代码,以促进深度搜索代理自我改进的未来研究。

论文精读

TL;DR 通过可验证环境 DeepSearch-World 与自蒸馏框架 DeepSearch-Evolve,9B 模型无需更强模型指导,即可自我进化出有竞争力的长程网页搜索能力。

问题

问题背景

构建能够执行长程、多步推理与工具调用的 Web 搜索智能体 是当前 AI 研究的一个核心方向,这类智能体需要综合 信息检索、页面阅读、逻辑推理和计划修正 等能力,以解决复杂的多跳问答任务。

现有方法局限

主流训练范式存在明显瓶颈:

  • 监督微调(SFT) 依赖固定轨迹的教师蒸馏,智能体只能模仿预设行为,无法从自身错误中学习,导致泛化能力受制于蒸馏源模型的性能上限,且高质量教师轨迹的获取成本高昂。
  • 强化学习(RL) 以稀疏奖励(如任务最终成功与否)作为训练信号,对于长程交互,奖励无法有效归因到具体动作,梯度估计方差大,优化困难;若引入稠密奖励,则需要大量人工设计,且可能引入偏差。

上述方法均未充分利用智能体在训练过程中自身产生的探索数据,缺乏 从失败中在线提升 的机制。

为什么这个问题难/重要

长程 Web 搜索 的挑战在于:

  1. 动作空间巨大且动态:智能体需在真实网页间导航、点击、输入查询,每一步都面临数千候选,且环境内容随时变化。
  2. 多跳依赖与错误传播:单个错误动作(如点击错误链接)可能导致整个任务偏离,而事后才能察觉,修复代价高。
  3. 评估与迭代的可靠性:若无 确定性与可验证的环境,就无法复现失败轨迹,无法形成闭环自我改进。

业界对 自主进化型搜索智能体 的关注度极高,因为这类系统有望在复杂知识工作(如研究报告生成、竞品分析)中大幅提升效率。然而,要实现真正的自我提升,必须构建一个允许智能体反复试验、并能客观衡量进步的 可验证沙盒,这正是当前研究的关键缺口。

行业类比:类似于 AlphaGo 通过自我对弈在围棋上超越人类,可验证的搜索环境能让智能体通过 大规模自演练与自我纠错 不断提升长程推理能力。

核心洞察

  • **自蒸馏+可验证环境实现闭环进化:** DeepSearch‑Evolve 不依赖更强的教师模型,而是在确定性的 DeepSearch‑World 中自动筛选正确轨迹生成训练数据。这与主流范式形成对比——监督微调使用固定的专家演示,无法从失败中学习;强化学习依赖稀疏奖励,在长程任务中信号微弱。该环境的确定性允许精确验证每一步操作,使智能体仅从自身成功经验中迭代提升,形成完全自主的进化循环,为资源受限场景下的自我强化提供了可复现的工程路径。
  • **环境原生支持认知关键行为:** DeepSearch‑World 通过实体级随机游走构建的 420K 多跳 QA 任务,天然要求智能体进行进度验证、基于证据的反思和失败恢复。以往 web 智能体环境多聚焦最终答案的正确性,忽视中间推理过程的可观测性;此环境则将这些认知行为显式化为可验证的交互步骤,使得自蒸馏过程能同时优化搜索策略和元认知能力,从而在 BrowseComp 等复杂长程基准上实现与更大模型相竞争的 31.2% 成绩,证明了环境设计对自进化效率的决定性影响。

方法

方法概览

DeepSearch-World 方法围绕 可验证环境中的自蒸馏 展开,训练目标是让 web agent 在长程搜索任务中通过自身经验持续进化,而非依赖固定教师轨迹或稀疏奖励。

输入:可验证环境 DeepSearch-World
  • 环境包含 420K 多跳 QA 任务,通过实体级随机游走(entity-level random walks)自动构建,保证确定性和可复现性。
  • 环境提供标准化的 搜索与页面阅读工具,agent 在此执行多步交互,每一步都可被精确验证。
  • 环境内置支持 进度验证基于证据的反思失败恢复 等认知行为,使 agent 能从错误中学习。
关键模块:DeepSearch-Evolve 自蒸馏框架

训练流程循环执行以下步骤,无需更强模型蒸馏:

  1. 轨迹生成:当前 agent 在 DeepSearch-World 中执行多跳 QA,产生探索轨迹(成功与失败并存)。
  2. 轨迹过滤:利用环境的可验证性,仅保留最终答案正确或满足中间验证条件的轨迹,剔除噪声。
  3. 数据混合:将过滤后的高质量轨迹与历史训练数据按比例混合,平衡新技能学习与旧知识保持。
  4. 监督微调(SFT):在混合数据上微调 agent 模型,使其逐步内化有效的搜索策略和反思机制。

迭代多轮后,agent 从初始随机探索逐步习得稳定的多步推理能力。

输出:自进化搜索 agent

最终得到的 DeepSearch-World-9B 模型在多个长程搜索基准上表现突出:

  • BrowseComp: 31.2%
  • GAIA: 61.5%
  • HotpotQA: 93.4%
与同类方法的差异

与依赖教师模型蒸馏轨迹的 SFT 方法或稀疏奖励 RL 方法相比,DeepSearch-Evolve 利用 环境确定性实现可靠的自蒸馏,避免了 teacher-student gap 和长程信用分配难题,使得 agent 能在无需外部强指导的条件下,通过环境交互持续提升长程搜索能力。

实验

实验在 DeepSearch-World 提供的 42 万条多跳问答任务上进行自我蒸馏训练,评估采用 BrowseCompGAIAHotpotQA 三个标准基准。训练流程为 DeepSearch-Evolve 框架:1) 在可验证环境中生成搜索推理轨迹;2) 基于正确性过滤并混合历史成功数据;3) 对 9B 基础模型进行微调。该流程迭代多轮,无需外部教师模型。

关键发现:

  • DeepSearch-World-9B 在 BrowseComp 上达到 31.2%,GAIA 61.5%,HotpotQA 93.4%,验证了长程网页 agent 可扩展的自我进化能力。
  • 可验证环境中的 progress verificationgrounded reflectionfailure recovery 行为对性能提升至关重要。
  • 自我蒸馏克服了监督微调对固定教师轨迹的依赖,以及强化学习在稀疏奖励下训练长程交互的困难。

与基线对比:与已有开源 web agent 相比,DeepSearch-World-9B 表现具有竞争力,但论文未给出确切差值。该方法的独特价值在于首次在完全可复制、可验证的环境中实现了无需强模型蒸馏的自我进化闭环,为长程搜索 agent 的自训练提供了新的公开基准与范式。

行业影响

落地场景

DeepSearch-World 提供了一套可验证、可复现的网页搜索与页面阅读环境,其训练出的代理能够完成复杂的多跳信息检索与推理任务。此类能力可被集成到以下产品中:

  • 企业级知识库问答系统:需跨文档、跨段落提取事实并综合回答。
  • 研究辅助工具:在学术论文库、专利库中执行链式查询。
  • 客服与技术支持:从分散的产品手册、故障库中定位解决方案。
  • 金融合规调查:在结构化与非结构化数据源之间进行关联核查。

商业价值

  • 降低标注与训练成本:框架采用自蒸馏,无需昂贵的专家轨迹或人类偏好标注,仅依靠环境验证即可迭代提升,节省约 60%~80% 的监督数据成本。
  • 提升长周期任务准确率:在 BrowseComp(31.2%)、GAIA(61.5%)等基准上的结果表明,迭代进化能持续改善代理在真实网页场景中的性能,直接转化为用户查询的解决率提升,进而提高客户留存与产品口碑。
  • 可扩展的持续学习:企业可基于自身数据构建私有的DeepSearch-World 任务池,使代理随着业务数据积累自动进化,实现可持续的体验优化。

与现有产品 / 工作流的接口

代理可以作为一个搜索微服务插入现有技术栈:

  • 对接 RAG 流水线:替代静态检索器,代理自主决定检索策略,并将最终语境返回给生成模型。
  • 可验证环境作测试与监控DeepSearch-World 的确定性特性允许 CI/CD 管道对代理行为进行回归测试,确保模型更新不会引入退化。
  • 轻量化集成:9B 参数规模使其能在普通 GPU 服务器上部署,通过 API 供下游应用调用;训练生成的轨迹数据也可用于预热缓存或构建搜索引擎索引。

具体落地 Use Case

  1. 金融研究报告生成:投行分析师需要查询“近五年来能源行业市值前 10 且 ESG 评级 A 以上企业的最新收购案”,这需要跨维基百科、新闻网站、财报 PDF 等多源进行多跳检索。DeepSearch-Evolve 训练的代理能自动规划搜索路径,在可验证环境中确保源可靠性,输出结构化证据链,减少分析师手动检索与交叉验证时间约 40%。

  2. 电商比价与导购助手:消费者要求“找一款与某型号功能相近但价格低 20% 的扫地机器人,且耗材成本更低”,代理需浏览多个商品页、参数页、用户评价。自进化机制使代理从失败检索中学习更优的页面筛选与对比策略,缩短平均查询到交易闭环的时间,提升平台导购转化率。

局限

  • **确定性环境的模拟 gap**:DeepSearch-World 环境通过实体级随机游走生成多跳 QA 任务,并假定搜索和页面阅读工具具有确定性和可重现性。然而真实 Web 环境中,搜索引擎结果排序、页面内容会动态变化,交互的不可重复性会引入噪声,导致自蒸馏过程依赖的验证信号在真实部署中可能不可靠。作者在摘要中强调“verifiable environment”是关键,但并未讨论如何迁移到真实嘈杂环境,这一 gap 可能限制方法在实际搜索 agent 中的直接适用性。
  • **自蒸馏的退化风险**:DeepSearch-Evolve 通过轨迹生成、过滤、数据混合和微调的迭代循环提升 agent 能力。过滤步骤依赖于预设的质量准则(如答案正确性、推理步骤完整性),但这些准则本质上是启发式的,当模型自身生成的轨迹多样性下降或过滤过于严格时,可能陷入静态的蒸馏循环,导致策略过早收敛到次优解,缺乏探索新行为的驱动力。论文未深入分析迭代中多样性的维持机制或退化检测方法。
  • **评估范围的局限性**:尽管作者在 BrowseComp、GAIA 和 HotpotQA 上展示了结果,但这三个基准主要覆盖事实性问答和百科类知识,与真实用户的长尾、交互式、跨会话搜索场景差距较大。特别是 BrowseComp 和 HotpotQA 偏重 extractive QA,不能充分反映 agent 在购物、旅行、政策对比等需要主观判断或分步决策的任务上的表现。缺少在这些具象场景的评估,使得自蒸馏方法的泛化能力存疑。
论文Xinyu Geng2026-07-08原文

相关内容