论文

QUEST: 用完全合成任务训练前沿深度研究智能体

QUEST: 用完全合成任务训练前沿深度研究智能体

深度研究智能体扩展了搜索引擎的角色,从检索关键词匹配页面转向知识合成,深刻改变了人机交互方式。然而,前沿系统多为闭源,现有开放智能体在不同任务类型上泛化能力不足,尚不明确如何训练通用型深度研究智能体。 我们发布QUEST系列开放模型(2B至35B),作为通用深度研究智能体,旨在处理各类长时搜索任务,在事实查找、引文溯源和报告合成方面表现强劲。训练方案结合中期训练、监督微调和强化学习,核心是基于统一规则树的数据合成管道,无需人工标注即可生成带可验证奖励的训练数据。此外,QUEST内置上下文管理机制,支持有效长时推理与知识合成。 仅用8K合成任务,QUEST在涵盖多种任务类型的八个深度研究基准上接近甚至超越前沿闭源智能体,并在近期开放权重智能体中取得最佳综合表现。我们已完全开放模型、数据和训练脚本。

论文精读

TL;DR QUEST 用全合成任务与强化学习训练开放深度研究 agent,仅 8K 任务即逼近或超越闭源前沿系统,并开源模型、数据与脚本。

问题

问题背景

大型语言模型驱动的 深度研究智能体 (deep research agents) 正从被动关键词检索转向主动的多步推理与知识合成,成为信息获取范式的关键突破口。然而,性能最强的系统(如 OpenAI Deep Research)仍保持闭源,其训练细节与数据配方不公开,社区缺乏可复现的全能型开源方案。

现有方法的局限

  • 任务泛化能力不足:开源智能体多为特定任务类型(如事实核查、报告生成、引文验证)分别设计,缺少统一的架构和训练策略,跨任务表现脆弱。
  • 训练数据依赖人工:高质量搜索轨迹和合成报告的标注成本极高,难以规模化,导致数据覆盖范围窄,模型容易过拟合到有限的任务分布。
  • 长程上下文管理薄弱:现有智能体在超长任务中频繁出现推理链中断、中间信息遗漏或幻觉,缺乏内建的上下文压缩与记忆机制,限制了其在复杂研究任务中的实用性。

技术挑战与重要性

构建通用深度研究智能体的核心难题在于:

  1. 可验证的自动数据合成:需设计无需人工标注的流程,生成覆盖多种任务类型且奖励信号可计算的训练样本;
  2. 长程推理的稳定性:如何在千步级交互中维持逻辑连贯,同时避免历史信息丢失或低效重读;
  3. 多能力对齐:事实准确性、引文可靠性和报告质量三者的优化目标可能冲突,需要精细的强化学习策略。

业界对开放、可扩展的训练方案需求迫切,因为闭源模型的高昂成本与不透明性正阻碍搜寻引擎进化到下一代智能助手。

深度研究智能体的训练挑战类似自动驾驶中的仿真泛化——若无大量自动合成的多样化场景,模型难以覆盖真实世界中开放域、长尾且跨领域的信息搜索需求。

核心洞察

  • 统一评分树(rubric trees)驱动的数据合成管线,使模型在没有人工标注的情况下,为事实搜寻、引用定位和报告合成等多种任务生成可验证的奖励信号。 与现有开源深度研究代理通常针对特定任务类型设计、依赖人工示范或规则式模板不同,QUEST 的评分树通过将任务分解为可量化的子目标,统一了不同任务的评估标准。这一机制保证了合成数据的多样性与覆盖度,使得仅用 8K 个训练任务就能在多个基准上接近甚至超过闭源代理,验证了可验证合成数据在复杂搜索代理训练中的可行性与高效性。
  • 内置上下文管理机制(context management)实现了面向长程推理与知识合成的有效信息流控制。 长期信息检索与报告生成常因上下文窗口扩展而导致信息遗忘或注意力分散,很多开放代理缺乏系统化的上下文组织策略。QUEST 通过显式管理工具调用、检索结果与中间推理的存储和引用,确保模型在长交互中保持对关键信息的聚焦。这种机制与强化学习结合,使模型能稳定完成需要多步搜索和综合整理的深度研究任务,在报告合成的连贯性与事实准确性上表现出显著优势,为构建可靠的长程代理提供了工程参考。

方法

QUEST 的训练方法以 完全合成数据 为核心,通过“规则树 → 多阶段训练 → 长程推理集成”路径构建通用深度研究代理。

输入与数据合成

输入仅为任务类型定义(如事实核查、引文溯源、报告合成),采用 统一规则树 (unified rubric trees) 对每种任务进行结构化拆解:树节点规定子目标、评估维度与可验证奖励(如答案正确性、引用跨度准确性)。基于规则树,系统自动生成大量多步推理与搜索轨迹,并附带奖励信号,全程无需人类标注

关键训练模块

QUEST 的训练分为三个阶段:

  • Mid-training:在领域相关语料上进行继续预训练,扩展模型对长上下文、检索结果的理解与整合能力;
  • 监督微调 (SFT):使用合成数据中的正确轨迹,让模型学习搜索、阅读、引证、总结等行为模式;
  • 强化学习 (RL):利用规则树产生的可验证奖励(而非训练一个奖励模型),通过策略优化(类似 PPO)提升模型在真实搜索与推理场景下的泛化表现。

此外,模型内置 上下文管理机制 (context management mechanism),对长序列中的检索文档、历史推理步骤进行动态压缩与关键信息保留,避免遗忘,支撑有效长程推理与知识综合。

输出

最终产出 2B 至 35B 参数的多尺寸模型系列,可直接完成复杂搜索、问答及报告生成任务。仅用 8K 合成样本即达到甚至超过闭源系统水平,并开源全部模型、数据与训练脚本 (见 GitHub)。

与同类方法的差异:多数开源代理依赖闭源语言模型 API 或大量人工标注数据,QUEST 则以 统一规则树驱动的全合成管道 替代人工,并能跨任务复用奖励设计,训练开销极低且性能足以对齐前沿闭源方案。

实验

实验设计

QUEST 采用基于 统一 rubric trees 的数据合成管线,在不依赖人工标注的情况下生成覆盖多种深度研究任务类型的训练数据。合成任务总计仅 8K,每条任务配有可自动验证的奖励信号。训练分三阶段:持续训练(mid-training)、监督微调(SFT)和强化学习(RL)。模型内置 上下文管理机制,以支持长程推理与知识合成。评估在 8 个多样化的深度研究基准上进行,涵盖事实检索、引文定位、报告合成等能力。

关键发现

  • 仅用 8K 合成数据,QUEST 在多数基准上 逼近甚至超越 前沿闭源系统,展示了合成数据与 RL 结合的高效性。
  • 统一 rubric tree 能适配不同任务类型,使合成任务保持高质量与多样性。
  • 上下文管理机制对长文档信息合成至关重要,有效扩展了模型的推理窗口。
  • 模型规模从 2B 到 35B 均表现一致,体现方法的可扩展性。

与基线对比解读

相较于现有闭源深度研究 Agent,QUEST 以更轻量的训练数据实现了竞争力的性能,说明关键在于训练数据的 质量和任务覆盖率 而非纯粹数据量。与近期开源 Agent 相比,QUEST 在多个 benchmark 上综合最优,验证了 合成数据 + RL 范式在深度研究任务中的泛化优势。此外,纯合成数据方案彻底消除了人工标注成本,为构建低资源通用型 Agent 提供了可复现的路径。

行业影响

落地场景

QUEST 作为通用型深度研究智能体,能够处理长周期、多源信息搜索与合成任务,适用于以下产品与业务:

  • 企业知识工作自动化:法律研究、专利查新、市场分析、药物文献综述等,自动生成带引用的报告。
  • 智能客服与IT支持:针对复杂技术问题,跨文档、论坛、内部知识库进行深度检索并给出有依据的答案。
  • 教育与科研辅助:自动收集、比对学术文献,辅助撰写综述或实验背景调研。
  • 内容平台与创作工具:为写作者提供事实核查与拓展参考,增强生成内容的事实准确性。

商业价值

  • 降本:仅需 8K 合成样本即可训练出性能比肩闭源 Agent 的模型,显著降低数据标注成本;模型开源且覆盖 2B–35B,支持私有化部署,避免 API 调用费用和数据泄露风险。
  • 增收:更准确、可追溯的信息合成能力提升决策质量,加快研究报告、竞品分析等产出速度,直接缩短商业决策周期。
  • 体验提升:内置上下文管理与引用溯源机制,让用户获得可信、结构化的答案,减少幻觉与无关信息。

与现有产品/工作流的接口

  • 即插即用的模型集成:提供完整训练流程(mid-training + SFT + RL)与推理代码,可微调后部署为内部 REST API,无缝接入现有 RAG 管道或 Copilot 类工具。
  • 与搜索基础设施协同:QUEST 依赖外部搜索 API(如 Bing、Google 或企业自建索引),可作为搜索结果的“合成层”,直接嵌入 Elasticsearch 或 Solr 的后续处理环节。
  • 轻量级 Agent 架构:可直接替换现有 ReAct 或 Tool-use Agent 中的推理模块,无需改造整体框架,只需适配搜索工具接口。

具体行业用例

  1. 法律科技
    律所使用 QUEST 自动搜集相关判例、法规条文并交叉比对,生成带引用出处的法律备忘录草案,初级律师可将审查时间从 2 小时压缩至 20 分钟。
  2. 金融投研
    分析师向 QUEST 输入公司名称和目标市场,Agent 自动遍历财报、新闻、社交媒体舆情及行业报告,输出结构化 SWOT 分析与关键风险摘要,集成到 Bloomberg 终端或内部研究平台,加速投资决策。
  3. 智能写作平台
    内容平台(如 Notion 或 Medium 风格)嵌入 QUEST 作为“研究面板”,用户在撰写深度文章时一键触发多源事实核查与扩展阅读推荐,显著增强内容权威性。

局限

  • **合成数据分布 gap**:QUEST 的**统一规则树 (unified rubric trees)** 合成管道虽能生成多样任务,但合成数据与现实查询的分布仍可能存在差异,尤其是需要实时信息、隐式知识或复杂多模态交互的场景。模型在封闭合成任务上训练,对开放域动态检索环境(如事实随时间变化)的适应能力尚未充分验证,可能在实际部署中性能下降。
  • **长程推理的上下文管理瓶颈**:内置**上下文管理机制**提升了长视距推理能力,但在极多步推理(数十步以上)时,信息压缩与关键证据遗忘仍是挑战。35B 模型可能仍受限于参数容量,导致在超长文档综合或多轮事实核查中,信息保真度与引用准确性出现衰减,需引入外部记忆或分段检索等工程手法弥补。
  • **训练规模与泛化鲁棒性**:仅用 **8K 合成任务** 训练,尽管在 8 个基准上表现优异,但任务量级较小,可能未覆盖现实世界中所有边缘情况,泛化鲁棒性有待更大规模真实任务验证。此外,对比的闭源模型(如 GPT-4o 深度研究)可能在参数量和训练数据规模上远超 QUEST,QUEST 的优势可能部分来自基准特化,而非根本性能力超越。
论文Jian Xie2026-05-22原文

相关内容