AgentFugue: 通过集体推理扩展长时任务中的智能体规模
近期的长时智能体任务进展主要通过扩展单一智能体(更强的模型、更好的工具、更有效的框架)来实现。相比之下,对于横向扩展(scaling out)的理解要少得多:多个对等智能体(peer agents)针对同一任务,能否在无需明确角色分工或工作流编排的情况下,成为额外能力来源? 我们研究这一问题,提出了 AgentFugue ,一种围绕共享推理中心(reasoning hub)构建的集体推理框架。对等智能体并行探索同一任务时,中心记录每个智能体已建立、尝试或排除的简洁笔记,并使每个智能体能够以对其当前搜索有用的形式,有选择地访问其他智能体的发现。这种设计将原本孤立的轨迹变为可复用中间推理的互联生态,无需集中规划。我们将推理中心实现为即插即用的通信层,通过 监督微调 和 端到端强化学习 训练。 在我们研究的具有挑战性的长时任务场景中, AgentFugue 优于强基线。我们的结果表明,集体推理可以将横向扩展对等智能体系统转变为能力增益的独立来源,而不仅仅是消耗更多计算的方式。
论文精读
TL;DR AgentFugue 通过共享推理中枢让多个对等智能体并行探索长程任务,将孤立的中间推理转化为可复用的集体知识,在不依赖中心化规划的情况下实现 scaling out 带来的性能增益。
问题
长期智能体任务(long-horizon agentic tasks)的扩展方式,当前主要聚焦于“纵向扩展”(scale up):用更强的基座模型、更丰富的工具、更精巧的推理脚手架(如 ReAct、DeepResearch)提升单个智能体的能力。相比之下,“横向扩展”(scale out)——让多个对等智能体(peer agents)并行探索同一任务——尚未被充分利用。
现有多智能体系统大多依赖显式的角色定义或工作流编排(如规划者-执行者分工),智能体之间的信息交换局限于预设结构,无法灵活复用并行过程中产生的中间推理片段。这导致横向扩展往往仅是多耗算力,而非获得真正的能力增益。
该问题的技术挑战在于:长期任务的知识搜索空间庞大,单个智能体易陷入局部最优;多个并行智能体虽能扩大探索范围,但产生的推理结果碎片化、部分有效,且缺乏中心化规划。如何让这些中间知识被其他智能体按需发现和利用,同时避免信息过载或错误传播,是集体推理的核心难点。
AgentFugue 提出的共享推理枢纽(Shared Reasoning Hub)提供了一种新范式:每个智能体将已验证的结论、尝试失败的路径等以简洁笔记写入 Hub;其他智能体在推理中可基于意图选择性读取相关笔记。这种设计将孤立轨迹转化为可复用的知识生态,在不牺牲个体灵活性的前提下实现并行探索的合力。类似软件工程中的分布式版本控制(如 Git):各分支独立开发,通过合并请求共享可行方案,加速整体进度。
核心洞察
- 将多个对等智能体横向扩展(scaling out)可视为一种有别于扩大单个模型或工具的能力来源。与主流研究通过更强模型、更复杂脚手架来提升单智能体性能不同,AgentFugue 表明,让同侪智能体并行探索同一任务,并通过共享推理中心复用彼此的中间推理片段,能产生超出纯算力叠加的协同增益——搜索效率提升来自于知识重用,而非简单的投票或多数选择。这为构建大规模智能体系统提供了新的设计维度:横向扩展可成为能力增长的一级杠杆,而不仅仅是投入更多计算资源。
- 共享推理中心(reasoning hub)作为无中心的协调层,将各智能体孤立的尝试、排除的路径转化为可被选择性读取的知识片段。这种设计避免了显式角色分工、工作流编排或中心化规划,通过意图驱动的读取机制让智能体按需获取他人发现,形成一种自组织的集体推理生态。与现有基于消息传递或预定义角色的多智能体系统不同,AgentFugue 的 hub 是训练得到的可插拔通信层,能够适应不同团队规模与模型异构性,并在弱模型上带来更显著的增益,为去中心化智能体协作提供了一种可复用的范式。
方法
输入
多智能体团队接收同一长周期任务,每个 peer agent 配备独立的工具栈(搜索、代码执行等),并行探索解空间。各 agent 基于自身轨迹生成中间推理片段(如已证实的结论、已排除的路径、待验证的假设),这些片段最初相互隔离。
关键模块:共享推理中心(Shared Reasoning Hub)
Hub 是核心通信插件,具备两种经训练的行为:
- Episode Writing:将每个 agent 的推理片段压缩为结构化笔记(“failure map” / “success clue”),写入共享记忆槽,并基于上下文长度触发旧笔记汰换。
- Intent-driven Reading: agent 在规划下一步时,以当前意图为查询,从 Hub 检索其他 agent 的笔记,仅拉取对当下搜索最有用的发现,避免信息过载。
训练流程:先用人类标注或高质量轨迹进行 监督微调(SFT),教会 Hub 何时写、写什么、如何响应读取请求;随后用 Group Relative Policy Optimization(一种端到端多智能体强化学习算法)联合优化所有 agent 的 Hub 读写策略,直接最大化任务成功率。整个 Hub 不预设角色分工或工作流编排,仅作为共享记忆层嵌入已有 agent。
输出
多轮交互后,从各 agent 产生的候选答案中使用 Best-of-N、多数投票等聚合策略得到最终答案。
与同类方法的差异
与显式规划多智能体流水线(如 Swarm、AutoGen 等)不同,AgentFugue 通过训练得到的轻量级共享记忆实现涌现式集体推理,无需中心化调度,使规模扩展(scaling out)成为独立的能力增益来源。
实验
实验设计
实验围绕三个高难度长时域任务数据集构建:
- BrowseComp:需要复杂网页浏览与信息综合;
- WideSearch:强调跨来源聚合与验证;
- HLE(Humanity’s Last Exam):覆盖多学科专家级问答。
基线分为三类:
- 单智能体 ReAct(如 Claude-Opus-4.5, Qwen3.5-35B-A3B)与 DeepResearch(如 WebSailor-32B, OpenAI DeepResearch);
- 多智能体系统 Naive-Multi-Agent 与 Swarm-Multi-Agent,无共享记忆;
- 与 AgentFugue 相同结构但移除 hub 的变体,用于消融。
所有评估使用 Best-of-N 作为默认聚合规则,同时对比多数投票、加权多数投票等策略。智能体均配备统一工具栈,交互预算与上下文窗口固定。
关键发现
- 同质团队缩放:每智能体性能随团队规模 N 增大而提升,但在 N≈5 时饱和;hub 以少量探索多样性换取更好的跨智能体协调,使整体成功率持续上升(Fig. 2)。
- 异质团队:引入不同模型能力的智能体后,弱模型获益最大(Fig. 4(a)),异质性带来更丰富的探索路径,hub 读写频率显著增加(Fig. 4(b))。
- 聚合策略鲁棒:缩放优势在多种聚合规则(BoN、MV、WMV 等)下均成立,覆盖度与一致性差距缩小。
- 消融实验:移除 hub 或限制其上下文窗口,性能明显下降,证实共享推理记忆是关键增益来源。
与基线的深度对比
AgentFugue 与强基线的差异不仅仅在于性能提升,更体现在能力增益的来源:
- 对比单智能体 ReAct/DeepResearch,AgentFugue 可将多智能体的并行探索转化为可复用的中间推理,避免每个智能体从零开始搜索;
- 对比 Naive-Multi-Agent 和 Swarm-Multi-Agent,AgentFugue 通过 hub 实现了“失败地图”式的集体记忆,降低重复错误;
- 缩放行为表明,横向扩展(scaling out)在 AgentFugue 中产生的边际收益远超单纯增加计算预算的 naive 多数投票,证明共享推理架构能高效转化额外算力为任务能力。
案例研究表明,hub 记忆可有效指引下游智能体规避已验证的死胡同,但也可能在信息不完整时引发确认偏差,未来需在记忆保真度与多样性间平衡。
行业影响
落地场景
AgentFugue 的集体推理范式可直接嵌入需要长周期复杂决策的智能体产品:
- 深度研究助手:金融或法律领域的尽调任务,需多线索并行检索与交叉验证,多个对等Agent通过共享推理中心协调发现与排错。
- 自动化客户支持与售后服务:处理多层级的复杂工单时,多Agent并行探索不同解决路径,共享中间结论以快速收敛到有效方案。
- 代码库级别的软件工程:Bug修复或特性开发中,多个代码探索Agent并行分析代码依赖与潜在根因,共享已排除的假设与已验证的修复路径。
商业价值
- 降低单位任务的边际成本:无需昂贵的手工工作流编排或角色特化,通过scaling out同构Agent即可提升任务成功率,减少重复探索的推理token消耗。
- 提升长周期任务交付质量与时效:在BrowseComp、HLE等复杂基准上,AgentFugue相比单Agent强基线有显著提升,可转化为客户合同中更高的SLA达成率与更低的人工介入率。
- 解锁新的产品边界:将原本因单Agent成功率过低而无法产品化的长周期任务(如全自动竞品分析、复杂供应链优化)变为可行,开辟增量市场。
与现有产品/工作流的接口
AgentFugue的共享推理中心作为插件式通信层,可无缝集成到现有Agent框架(如LangGraph、AutoGen)中:
- 保留现有工具与模型:AgentFugue不依赖特定模型或工具栈,可与已有的API、检索器、代码执行器兼容。
- 轻量级集成:只需为现有Agent添加
hub_write与hub_read动作,中心通过SFT+RL训练得到,可作为独立服务部署,与主Agent逻辑解耦。 - 渐进式采用:可先对部分高价值任务启用集体推理,其余任务仍用单Agent模式,风险可控。
具体用例
- 全球电商平台的自动化选品决策:多个Agent并行分析不同品类的趋势数据、供应链成本与用户评价,共享已证伪的选品方向,最终聚合推荐高潜力SKU,减少人工分析耗时。
- 流媒体内容平台的版权合规审核:复杂的长视频内容需多Agent同时检查不同版权库与法律条款,推理中心记录已触发的风险片段与合规依据,避免重复扫描,提升审核吞吐量。
局限
- **训练数据依赖与泛化性**:AgentFugue 的核心组件 reasoning hub 需要经过监督微调(SFT)和端到端强化学习(GRPO)训练,这要求收集大量高质量的 agent 交互轨迹作为训练信号。论文仅在 BrowseComp、WideSearch 和 HLE 三个长时程问答数据集上进行评估,尚不清楚该训练得到的 hub 在分布外任务或更开放的 agentic 环境中的迁移能力。此外,训练过程可能隐式地过拟合于特定任务模式,如信息检索与证据综合,而在涉及代码执行、多模态交互等复杂场景下的表现未经验证。
- **扩展时的上下文瓶颈**:hub 通过共享上下文窗口向 peer agents 传递中间推理片段,但窗口大小固定(根据附录 H 的消融实验,窗口增大后收益递减)。当 agent 数量超过某个阈值(如 N>5)时,信息交换量急剧增大,可能导致关键信息被截断或稀释,从而限制从更大规模团队中获得的边际收益。论文也观察到 saturates around N=5 的现象,印证了这一瓶颈。此外,hub 的协调开销可能随团队规模增加而非线性增长,抵消 scaling out 的部分收益。
- **记忆诱导的确认偏误风险**:论文附录 E 中给出了一个失败案例——hub 中记录的错误中间结论导致下游 agent 产生确认偏误,强化了错误推理。这说明当前的共享记忆机制缺乏对信息可靠性或不确定性的显式建模,仅仅依靠 agent 自行过滤可能不够。在实际高风险场景中,这种负面记忆传播可能比单 agent 的随机错误更具破坏性,而论文未提出相应的缓解策略(如置信度标注、溯源质疑机制),这是该框架走向生产级应用必须解决的缺陷。