SearchSwarm: 面向长周期深度研究的Agentic LLM委托智能
大语言模型(LLM)被期望处理日益复杂的长周期真实世界任务,其上下文需求可能无限增长,而模型上下文窗口却始终有限。近期工作探索了一种范式:主代理将任务分解并派遣子任务给子代理,子代理执行后仅返回汇总结果,从而节省主代理的上下文预算。然而,这要求委托智能——即分解复杂任务、判断何时委托何种任务、并将返回结果整合到工作流中的能力。 自然文本中此类训练数据稀缺,目前开源社区对于如何合成此类数据并训练模型获取该能力仍鲜有探索。为此,我们聚焦深度研究这一代表性长周期代理任务,设计了一套引导机制(harness)来引导模型进行高质量的任务分解与委托,同时约束子代理正确返回结果以支持主代理工作流。经引导的轨迹天然编码了正确的委托决策,我们将其作为监督微调数据,将委托智能内化到模型权重中。 最终模型 SearchSwarm-30B-A3B 在 BrowseComp 和 BrowseComp-ZH 上分别取得 68.1 和 73.3 的分数,为所有同规模模型最优。我们将公开引导机制、模型权重及训练数据,以促进未来研究。
论文精读
TL;DR SearchSwarm 用合成数据训练模型的**委托智能**,主代理分解任务并协调子代理,以有限上下文高效完成长程深度研究,在 BrowseComp 上取得同级最优成绩。
问题
问题背景
大型语言模型 (LLM) 正被用于处理越来越复杂的长期现实任务,例如深度研究或自动化决策支持。这类任务在执行过程中会不断积累海量中间信息,极易超出模型的上下文窗口限制,导致长周期工作流无法持续。
现有方法局限
为应对上下文窗口瓶颈,近期工作引入主代理-子代理范式:主代理分解任务,将子任务派发给子代理执行,子代理仅返回精炼结果,从而控制主代理的上下文消耗。然而,这一范式的有效性强烈依赖委托智能——即模型必须自行判断何时委托、如何切分子任务,以及如何将返回的摘要信息无缝整合到当前工作流程中。现有模型普遍缺乏这种能力,因为:
- 训练数据匮乏:自然文本中几乎不存在显式的、正确的委托决策序列,难以通过常规预训练获得该技能。
- 合成与训练方法缺失:如何系统性地合成高质量委托轨迹,并通过监督微调 (SFT) 将委托智能内化到模型权重中,在开源社区中基本未被探索。
- 启发式框架的局限性:简单依赖硬编码规则或固定线程池无法应对复杂、动态变化的查询需求,往往导致错误的委托时机或不合理的子任务拆分,反而降低最终输出质量。
为何该问题重要且困难
长期规划已成为智能体研究的核心挑战。业界关注点正从单轮对话转向能自主完成数小时甚至数天任务的自治代理。委托智能作为管理长上下文的关键手段,直接影响代理能否在有限资源下持续产出可靠结果。技术难点在于:委托本身是一个元决策——既要理解任务全局目标,又要预估各子任务的执行成本与信息丢失代价,还需在运行中动态调整计划。这种高阶认知能力很难通过简单的 prompt 工程实现,必须通过针对性的训练数据构造与模型优化才能习得。
正如一个项目经理必须懂得将任务拆分给合适的团队成员并汇总进展,LLM 代理也需要类似的“宏观调度智能”,否则一旦任务链条拉长,要么因上下文溢出而失败,要么在无谓的全局搜索中耗尽算力。
核心洞察
- 委托智能(delegation intelligence)并非单纯的工具使用,而是一种可训练的策略能力,通过 harness 引导轨迹生成训练数据,将主代理的上下文管理决策过程从手工规则转向模型权重内化。与传统方法依赖硬编码的分解逻辑或人工模板不同,该工作利用约束引导的主-子代理交互生成高质量委派示例,再用 SFT 蒸馏进模型,使模型在脱离 harness 后依然能自主做出“何时委派、委派什么、如何整合结果”的正确决策,这是将委派从工程技巧升级为模型原生能力的关键一步。
- 将委派视为上下文管理手段,通过子代理返回摘要结果而非原始中间输出,从根本上缓解了长程任务中的上下文膨胀问题。与简单拼接、检索增强或递归压缩等方法相比,委派式上下文管理在保持任务结构连贯性的同时,主动将信息量压缩到对后续步骤有价值的粒度,且由主代理保留核心判断权(如验证引用、决定下一步),这实现了信息压缩与决策保真度的更好平衡,为长程 agent 架构提供了更可扩展的范式。
方法
方法概述
SearchSwarm 旨在将委托智能 (delegation intelligence) 内化到语言模型中,以支持长跨度深度研究任务。整体流程分为Harness 引导轨迹生成和监督微调 (SFT) 两个阶段。
输入 → 关键模块 → 输出
输入:需要多步检索与综合的复杂查询(如 BrowseComp 基准中的问题)。
Harness 引导的委托执行 (数据收集阶段)
- 主智能体在受限上下文内运行,通过定制工具(如
delegate_subtask)和系统提示被鼓励进行任务分解与委托,而不是自行处理所有细节。 - 提示设计强调:主智能体保留核心判断(如最终答案整合),子智能体必须返回基于引文的简报 (citation-grounded reporting),确保信息可信且可溯源。
- 在 Harness 约束下,模型自动生成包含正确委托决策(何时委托、委托什么、如何集成结果)的完整轨迹。这些轨迹天然编码了所需的委托行为。
- 主智能体在受限上下文内运行,通过定制工具(如
监督微调 (训练阶段)
- 从上述轨迹中筛选高质量样本,构建 SFT 数据集。
- 对基座模型(如 30B 参数模型,采用 MoE 架构仅激活 3B)进行标准语言建模训练,损失函数为下一个 token 预测的交叉熵。
- 微调后得到的 SearchSwarm-30B-A3B 模型能将委托智能内化到权重中,无需再次依赖 Harness 即可自主完成复杂任务的分解与子智能体调度。
与同类方法的差异
不同于依赖固定分解规则或外部编排器的多智能体框架,SearchSwarm 通过从自生成轨迹中学习,以 SFT 方式让模型习得自适应委托策略,使模型本身即具备判断何时、如何委托的能力,而非在推理时依赖人工设计的提示模板或工作流引擎。
实验
实验设计
训练数据通过 harness 引导 生成:约束主智能体分解任务、决定委托时机,子智能体返回精炼结果。将这些正确委托决策轨迹作为 SFT 数据,微调得到 SearchSwarm-30B-A3B 模型。评估集中在 长程深度研究任务,使用 BrowseComp 及其中文版本 BrowseComp-ZH,并对比同等规模模型。进一步考察了 harness 有效性、不同基模型影响、单智能体泛化 及开放式深度研究表现。
关键发现
- SearchSwarm-30B-A3B 在 BrowseComp 达 68.1,BrowseComp-ZH 达 73.3,均取得 同类规模最佳。
- 去除 harness 后模型仍保持较高委托智能,证明 能力已内化至权重。
- 切换到其他基模型同样能通过该流程获得提升,表明方法具有 通用性。
- 即使在无子智能体的单智能体设置下,模型也展现更好的任务分解与规划行为,说明 委托智能可迁移。
- 主智能体主要充当 编排者,直接工具调用多用于验证,符合预期角色分配。
与基线对比解读
该方法区别于传统仅扩展上下文或简单滚动摘要的方案;通过学习 何时与如何委托,在有限上下文内维持长程任务的一致性。与同等规模的直接推理模型相比,搜索集群模型在深度研究任务上更擅长多源证据交叉验证与引用溯源,从而显著提高准确性。此外,由于委托智能数据合成成本可控,这一范式为开源社区提供了可行的 长程智能体能力增强路径。
行业影响
落地场景
SearchSwarm 的委托智能体范式可赋能一切依赖长时深度研究的场景,例如自动化市场调研、竞品分析、法律判例检索、学术文献综述等。在智能客服、企业知识库、新闻事实核查等产品中,需要从大量非结构化信息中提炼洞察,传统单智能体受限于上下文窗口,多轮搜索容易遗忘或产生幻觉,而多智能体委托架构通过主代理编排、子代理执行摘要,天然适合此类信息密集、步骤繁多的任务流。
商业价值
价值主线在于降本与增效的叠加。一方面,通过子代理池替代单一大模型处理子任务,可大幅降低对超长上下文窗口昂贵模型的依赖,节省推理成本;另一方面,自动化分解与委托将人工从复杂的多源信息综合中解放,缩短研究周期。以 BrowseComp 上的 68.1 分(约 30B 参数)为例,同等规模下性能最优,表明在相同预算下可获得更高的准确性与完备性,直接提升下游决策质量。
与现有产品/工作流的接口
该模型可作为RAG 管道的上层编排器,替换或增强现有 Agent 框架(如 LangChain、CrewAI)中的主调度模块。Harness 生成的高质量分解轨迹可直接作为合成数据,通过 SFT 快速蒸馏到企业自有模型,实现领域适配。其子代理返回要求“基于引用”的报告,与现有向量数据库 + 搜索引擎的接口天然契合,易于集成进标准 LLMOps 栈。
具体落地案例
- 电商竞争分析:某全球电商平台用 SearchSwarm 自动化生成每周竞品报告。主代理将“分析十大竞争对手的定价与新品动态”分解为十个子任务,分别委托给轻量子代理抓取价格、促销信息,最后汇总对比,节省分析师 80% 的时间。
- 内容平台事实核查:新闻聚合平台集成 SearchSwarm,将一篇长文的声明拆解为多个子断言,子代理并行搜索权威来源进行验证,主代理综合后给出可信度评分与出处,减少人工核查工作量,并提升内容质量。
局限
- **任务泛化性有限**:论文仅针对 **deep research** 场景设计,并主要在 **BrowseComp** 和 **BrowseComp-ZH** 两个封闭式问答基准上评估。虽然初步测试了 open-ended deep research,但未覆盖其他典型长周期代理任务(如复杂代码生成、多步决策、创意写作)。委托智能是否能迁移到不同任务结构与目标,尚缺乏实验支撑。
- **合成数据偏差**:训练数据完全由手工设计的 **harness** 引导生成,轨迹中的委托决策天然带有 harness 的偏好和约束。模型通过 SFT 内化的「正确」委托模式可能与真实世界中开放、多变的委托需求存在分布偏移,在面对 harness 未覆盖的意外情况时可能表现出脆弱性。
- **多代理协调开销未充分分析**:论文聚焦委托对主代理上下文的节约,但未详细量化子代理间的通信成本、错误传播与结果集成所需的额外上下文占用。在子代理数量增多或任务链极长的极端场景下,上下文管理是否仍能维持有效,以及主代理是否可能成为新的瓶颈,都缺乏系统性的鲁棒性评估。