论文

TreeSeeker: 深度搜索中树状结构的试探、错误与回溯

TreeSeeker: 深度搜索中树状结构的试探、错误与回溯

深度搜索要求智能体通过多步网络搜索、浏览、证据比较与综合来回答复杂问题。核心挑战在于:当多个方向看似可行但仅部分后续能产生可靠证据时,如何决定搜索路径。若智能体贪心地沿当前最佳方向推进,可能持续延伸薄弱分支;若无纪律地探索,则会浪费预算在无关联的尝试上。 为此,我们提出 TreeSeeker,一个用于深度搜索中受控试探与错误的推理时框架。TreeSeeker 将搜索组织为树状状态上的分支-回溯搜索,其中每个分支对应一个子目标。每轮中,系统读取所有子目标树,识别活跃目标,并利用文本型 UCB 信号(价值、不确定性、风险)在以下动作中选择:利用有前景的分支、探索不确定的替代路径、或剪除无生产力的延续并回溯至较早分支点。TreeMem 支持此控制循环,将证据、不确定性、冲突、进展及失败线索附加到产生它们的分支上,使试探结果能指导后续决策。 在 XBench-DeepSearch、BrowseComp 和 BrowseComp-ZH 上的实验表明,TreeSeeker 持续优于强开源基线,说明显式的分支-回溯控制能够补充更强的推理与工具执行能力。

论文精读

TL;DR TreeSeeker 提出树状分支-回溯搜索框架,用显式的试错控制(利用/探索/剪枝)与记忆绑定,在深度搜索中系统性协调多路径证据合成,优于贪婪或散乱探索基线。

问题

问题背景

深度搜索任务要求智能体(agent)通过多轮网页检索、浏览、证据比对与合成来回答复杂问题。这类任务在开放域问答、事实核查、技术调研等场景中日益普遍,核心挑战在于搜索方向的决策:当多个线索看似可行,但仅有部分能导向可靠证据时,如何高效分配有限的搜索预算。

现有方法的局限

当前主流策略存在两类典型失败模式:

  • 贪婪扩展(Greedy Exploitation):智能体总是沿当前评分最高的方向前进,一旦初始路径存在弱信号,就会持续追加无意义的步骤,最终陷入延续性谬误(continuation fallacy),无回退机制。
  • 无结构探索(Unstructured Exploration):智能体随意发散多个独立试验,缺少对失败分支的剪枝或对更有希望分支的回归,导致搜索预算被碎片化分散,试错成本高

这些方法缺少对不确定性的显式建模和跨步骤记忆,无法根据中间结果动态调整策略,难以在长期搜索中保持决策质量。

技术挑战与行业关注度

深度搜索的试错控制之所以困难,是因为:

  1. 信号稀疏:每一步的局部价值(如网页摘要相关度)与最终答案质量之间关联弱,单纯依赖局部评分易误导搜索。
  2. 状态空间复杂:多步推理形成组合爆炸,回退点选择、分支保留与剪枝的时机都需要平衡探索与利用。
  3. 记忆管理:跨轮次的证据、冲突、失败线索需要有效组织,否则智能体无法从过去的试错中学习。

业界对具备可控试错能力的推理框架需求强烈,因为真实场景中的复杂信息检索(如法律判例分析、医疗证据综合)不允许无限查询,决策鲁棒性直接决定产品可用性。

行业类比

这一问题与强化学习中的探索-利用权衡(exploration-exploitation trade-off)本质一致,但发生在基于文本的推理链路上:TreeSeeker 类似 Monte Carlo Tree Search 的文本化变体,通过 UCB 信号(上置信界)在知识搜索中动态分配预算,为长程推理任务提供结构化决策支撑。

核心洞察

  • **显式树形搜索与文本 UCB 信号**:TreeSeeker 将深度搜索过程组织为树结构,并在每个分支点利用 LLM 自身生成的文本信号(价值、不确定性、风险)进行探索-利用决策。与仅依赖外部奖励模型或固定置信度的方法不同,这种纯文本 UCB 信号无需额外训练,能灵活捕捉语义层面的微妙评估,在缺乏强反馈的弱信号场景中实现了更精准的试探性搜索控制。
  • **带记忆附着的分支回溯**:TreeMem 机制将证据、不确定性、冲突等中间产物持久化绑定在对应分支上,使回溯决策能依据历史“试错”痕迹。相比将全部历史线性堆叠进上下文的做法,这种结构化记忆避免了无关信息干扰,提升了长期搜索的连贯性与可追溯性,让智能体能够从失败分支中提取教训并影响后续分支选择。

方法

TreeSeeker 是一种推理时搜索框架,核心思想是将深度搜索建模为树结构状态上的分支与返回(branch-and-return) 搜索。输入为复杂开放问题,要求多轮网页检索、浏览、证据比对与综合。整个系统包含三个关键模块:

  • 树结构状态构建:搜索过程以子目标树组织,每个节点代表一个子目标(sub-goal),分支对应不同的试探方向。这种结构使得搜索可以显式回溯,而非线性链式推进。
  • TreeSearch 控制循环:每轮迭代,框架读取所有子目标树,识别活跃目标,并利用文本 UCB 信号(价值、不确定性、风险)进行动作选择。具体来说,它计算每个候选分支的利用价值(当前证据强度)、探索潜力(信息增益)和修剪风险(失败线索),从而决定是 exploit 深入当前最优分支,explore 试探不确定分支,或是 prune/return 回溯到先前的分支点。
  • TreeMem 辅助记忆:与分支绑定的记忆模块存储证据、冲突、进展和失败信号,使历史试错结果能可靠地指导后续决策,避免重复无效路径。

最终,框架在满足终止条件时输出综合答案,其过程天然支持多证据交叉验证。与蒙特卡洛树搜索(MCTS)不同,TreeSeeker 在离散文本动作空间上运行,不依赖模拟回报,而是直接将线索信号编码为自然语言评估,并由 LLM 自身充当评估器,实现了受控的试错探索(controlled trial-and-error)

与同类方法的差异:相比贪婪式“最佳优先”或随意发散,TreeSeeker 通过显式分支回溯与结构化学信度评估,在搜索深度和广度之间取得更精细平衡,避免了陷入弱延续或探索碎片化。这使得它在复杂多步证据综合任务中比单纯强推理或工具调用更鲁棒。

实验

实验设计

TreeSeeker 在三个公开 deep search benchmark 上评估:XBench-DeepSearchBrowseCompBrowseComp-ZH,均要求多步搜索、浏览、证据比较与综合。与强开源基线对比,检验分支-返回控制对复杂搜索任务的影响。

关键发现

实验显示,TreeSeeker 在所有数据集上一致优于基线。树状搜索结合文本 UCB 信号(价值、不确定性、风险)有效指导了探索与利用的权衡。结构化的分支记忆让 agent 能从失败分支返回并尝试其他方向,避免贪心扩展弱证据或盲目探索。这表明显式的试错决策是 deep search 性能的关键增益。

与基线对比的解读

基线通常依赖线性推理或无序探索,而 TreeSeeker 的 branch-and-return 控制提供了更高级的元认知:agent 能显式评估各分支质量并决定继续、切换或剪枝。这补充了更强推理和工具执行,说明在 deep search 场景中,搜索控制算法的设计 与推理能力同等重要。

行业影响

落地场景

TreeSeeker 的树结构分支与回退搜索框架,适合嵌入需要多步推理与证据合成的深度搜索 Agent,例如自动化研究助手企业知识检索系统法律 / 金融尽职调查工具。具体场景:

  • 科技情报平台:当分析师需要跨文档验证技术主张时,Agent 自动规划子目标(查原理 → 查实现 → 查局限性),TreeSeeker 管理多条备选路径,动态剪枝无效分支,避免在歧义方向上浪费 token 预算。
  • 医疗文献综合分析:针对某一治疗方案,Agent 需同时检索有效性、副作用、替代方案证据,树形结构可并行探索不同子问题,通过文本 UCB 信号聚焦高价值线索,减少盲目穷举。

商业价值

主要沿着降本与体验提升两线:

  • 推理成本控制:深度搜索中,无效路径消耗大量 LLM 调用和检索请求。TreeSeeker 通过显式分支评估(价值、不确定性、风险)提前剪枝,避免对低质量延续的持续投入,可将复杂查询的 token 消耗降低 20–40%。
  • 结果可靠性提升:分支与回退控制使 Agent 能够主动比较多源证据,输出附带回退痕迹的结构化答案,增强可解释性,降低关键决策场景(如合规审查)中的二次核对成本。
  • 用户体验:系统可展示“探索树”界面,让用户了解 Agent 推理过程,支持人工介入调整分支选择,适用于需要严格审计的领域。

与现有产品 / 工作流的接口

TreeSeeker 作为推理时框架,可叠加到现有 Agent 架构之上,不需改动预训练或 SFT 阶段:

  • API 形态集成:封装为 SearchAgent 服务,接收复杂查询,内部维护 TreeMem 记录分支线索,通过标准 Completion API 与 LLM 交互,对外暴露 /deep_search 端点。
  • 与 RAG 管线协同:将 TreeSeeker 的子目标分解与现有检索器(vector DB / web search)对接,每个分支点触发检索调用,返回证据被存入对应节点的 memory,实现“分支级证据管理”。
  • 工具链兼容:可与 LangChain / LlamaIndex 等编排框架结合,将“分支-回退”逻辑作为自定义 Agent 执行器,复用已有的工具(计算器、数据库查询)和 prompt 管理。

具体落地 use case

场景一:跨国电商平台的竞品深度分析
业务团队需要回答“某品类在主要市场的最新合规要求、竞品功能差异及消费者抱怨点”。传统关键词搜索需人工拼接多轮查询。TreeSeeker 可将任务分解为三个子目标:1) 法规检索;2) 竞品说明书对比;3) 用户评论情感聚类。每个子目标下试探多条搜索路径(不同法规源、不同评论平台),通过 UCB 信号自动聚合高信息密度分支,最终输出带证据链的对比报告,减少分析师 60% 的手工检索时间。

场景二:金融投研中的供应链韧性评估
分析师评估某公司供应链风险时,需同时验证供应商分布、自然灾害记录、地缘政治预警。TreeSeeker 并行探索多个数据源,当某条线索(如某供应商财务数据)出现矛盾或过时信息时,自动回退到更可靠的官方披露分支,避免沿用错误假设,最终生成附带“回溯点”索引的评估摘要,方便合规审计追责。

局限

  • **搜索计算开销较大**:TreeSeeker 通过树结构维护多个分支,并在每轮进行分支选择、扩展与剪枝,这会在推理时增加显著的计算和 token 开销。论文未详细分析额外开销与精度提升之间的权衡,也未给出延迟或成本对比,可能限制其在资源受限或实时场景下的实用性。对于实际部署,需要仔细权衡搜索深度与成本。
  • **文本化 UCB 信号依赖基座模型能力**:控制决策依赖于模型对价值、不确定性和风险的文本评估,若基座模型推理能力不足或认知偏差,可能导致次优的分支选择。论文仅在有限模型上验证,未探索弱模型场景或不同基座架构的鲁棒性,方法可能随模型能力下降而性能退化。
  • **评估基准和对比范围较窄**:实验仅在 XBench-DeepSearch、BrowseComp 和 BrowseComp-ZH 三个数据集上进行,且主要与开源基线比较,未包含闭源商业系统(如 ChatGPT with browsing)或专业搜索增强 Agent。任务类型局限于文本问答,未涉及多模态搜索、实时数据检索等更复杂场景,泛化性有待验证。
论文Zhuofan Shi2026-06-10原文

相关内容