论文

自组织 Agent 团队学会共同推理

自组织 Agent 团队学会共同推理

集体智能 不仅取决于成员知道什么,也取决于他们如何组织工作。当解的结构未知时,角色与分工无法预先指定,团队必须从经验中学会组织推理。人类团队常这样适应,而现有 AI agent 团队依赖固定协议、显式任务分解或路由。 我们提出 Self-Organizing Agent Teams (SAT):固定的 AI agent 团队从过往协作中学习可复用策略,用以组织角色、对话阶段、参与方式与信息流,从而实现 协作计算(collaborative computation)——agent 彼此交换、质疑、修补并综合局部推理,得出任何成员单独都产生不了的解。仅用 15 道数学题和 25 道研究生水平知识题学到的策略,即可原样迁移到未见基准。 在五个数学与物理基准上,自组织团队平均准确率为 66.7%,最强成员 48.8%,该成员等算力推理 58.7%,对成员独立答案的完美路由器 59.0%;在 AIME 2026 上更超出该路由器 13.4 分。 由于增益因基准而异,我们追问自组织协作何时有效。八个基准显示,可论证性(demonstrability,即团队能否区分正确与错误推理)与相对最强成员的提升强相关(Spearman ρ=0.90, p=0.005):当正确推理一出现就能被识别时,团队收益最大。更广泛地说,组织本身或可成为一种 agent 能力。

论文精读

TL;DR SAT 让固定 AI 智能体团队从少量合作经验中学习自组织策略,在数学物理基准上平均 66.7% 准确率,超最强成员 17.9 点、超完美路由 7.7 点,证明组织本身可成为智能体能力。

问题

问题背景

多智能体系统(MAS)和 agentic AI 正成为解决复杂推理任务的重要方向。业界焦点从单体模型性能转向 团队组织与协作机制,以应对数学、物理和知识密集型问题。

现有方法局限

现有 agent 团队通常依赖三类方案:

  • 固定协议:如预设发言顺序或辩论回合,无法根据中间推理结果动态调整。
  • 显式任务分解:需要人工预先将问题拆成子任务并分配 agent,难以处理结构未知或需交叉验证的开放问题。
  • 路由选择:从多个 agent 的独立答案中选出最优,但丢失了讨论过程中产生的 协作计算 增益。

这些方法假设任务结构在设计时已知,或可由外部规则穷举。当解空间未知时,无法学习可重用的组织策略,也难在推理过程中重新分配角色和信息流。

为什么这个问题难/重要

核心难题在于 组织策略本身成为学习对象。任务解空间未知,不能预先指定谁发言、何时挑战、如何综合。策略空间巨大且跨任务泛化困难,同时缺乏自动评估组织优劣的指标。业界高度关注,因为优化团队协作能显著提升复杂推理准确率并降低推理成本。论文实证显示,自组织团队在多个基准上超越最强成员、计算匹配推理和完美路由,表明 组织能力可以是智能体的可学习能力。

行业类比

类似软件工程自动调试中,多个 agent 分别生成补丁、测试反例和综合结论;若团队能学会何时让反例 agent 介入、何时重新分工,就能应对无预设流程的意外缺陷。

核心洞察

  • 组织本身可成为智能体能力:从有限协作经验中学习可复用的团队策略,而非依赖固定协议或显式任务分解。与基于固定流程的多智能体辩论/投票、显式编排或对成员独立答案的完美路由不同,SAT 将角色分派、会话阶段、参与度与信息流全部作为可学习策略,使智能体之间能够进行协作计算:交换、挑战、修复并综合各自部分推理,从而产生单个成员无法独立达成的解决方案。
  • 团队策略具有跨领域可转移性,且增益可用组织心理学的可证明性指标预测。仅使用 15 个数学问题和 25 个研究生级知识问题学习的策略,可直接迁移到未见基准(如 AIME 2026),表明其捕获的是任务无关的团队工作流而非领域启发式;同时,demonstrability(团队区分正确与错误推理的能力)与相对最强成员的提升高度相关(Spearman ρ=0.90),这为判断何时采用自组织协作提供了工程诊断信号,避免在低可证明性场景中浪费推理预算。

方法

输入

给定一个问题 q 和一个固定多智能体团队 {A1,...,An},每个智能体拥有独立推理能力;不提供预定义角色或任务分解。

关键模块

  1. 策略语言:策略 π 以自然语言/结构化指令描述团队协作规则,包括角色分配(如 Solver / Critic / Synthesizer)、会话阶段(先发散生成,再集中批判,最后合成)、参与时机(谁在何时发言)和信息流(谁看谁的输出)。
  2. 策略学习:在极少量训练问题上(15 道数学、25 道研究生知识题),团队按初始随机组织运行,记录完整对话轨迹;随后执行 teamwork reflection,由元级评估器判断哪些组织模式贡献了正确解,并蒸馏出 问题无关 的策略候选,形成策略库(如 AIME-2024 策略库 10 条)。整个学习过程不针对测试问题微调。
  3. 部署:对新任务,从策略库中选择或固定组合策略,团队严格按该策略进行多轮交互:智能体交换部分推理、质疑、修复并综合,最终输出协作答案。策略在测试时保持不变。

输出

团队通过 协作计算 产生的最终答案;该答案可能没有任何单个成员能独立得到。

与同类方法的差异

SAT 学习的是可复用的 组织策略,而非静态路由、投票或前馈聚合;其策略在问题间迁移,且仅需极少训练样本。

实验

实验设计

论文在两个独立设置中学习团队协作策略:数学/物理设置用 15 个数学问题训练,知识/逻辑设置用 25 个研究生级知识问题训练。策略在未见的 benchmark 上直接部署,不做微调。评估覆盖五个数学/物理基准和八个基准的 demonstrability 分析。基线包括最强成员独立回答、compute-matched inference(同计算预算的单 agent 推理)以及 perfect router(对所有成员独立答案做完美路由选择)。

关键发现

  • SAT 在五个数学/物理基准平均准确率 66.7%,对比最强成员 48.8%、compute-matched 58.7%、perfect router 59.0%。
  • AIME 2026 上超越 perfect router 13.4 点,说明团队协作策略可跨年份、跨竞赛、跨领域迁移。
  • Demonstrability 与相对最强成员的提升高度相关(Spearman ρ=0.90,p=0.005),当正确答案出现后可被辨别时团队收益最大。
  • 知识/逻辑团队准确率领先但低于 routing-oracle coverage,说明生成与选择能力存在分离。

基线对比解读

对比最强成员表明团队并非简单叠加能力,而是通过 exchange/challenge/repair/synthesize 实现 collaborative computation。对比 perfect router 尤其关键:如果团队只是事后从独立答案中选择最佳,性能上限是路由上限;SAT 超过路由,证明交互过程本身产生了成员独立无法得到的解。compute-matched inference 控制计算预算,排除单纯增加推理算力。工程启示:组织策略(角色、阶段、参与、信息流)本身可作为可学习的 agent capability,部署时可复用为固定策略库,无需在线搜索或额外路由,成本可控。

行业影响

落地场景

Self-Organizing Agent Teams(SAT)可应用于需要多角色协作的复杂推理任务:电商平台纠纷调解、金融合规审查、医疗辅助诊断、内容平台事实核查、企业数据分析。这些场景中,解决方案结构未知,固定流程难以覆盖。

商业价值

  • 降本:通过小样本学习(15-25 个问题)获得可复用协作策略,减少人工设计角色与流程的工程成本;提升自动化水平,降低人工干预。
  • 提质:在数学/物理推理上相对最强单体提升约 17.9 个百分点(66.7% vs 48.8%),在路由 oracle 之上继续提升,可降低高价值场景的错误成本。
  • 可迁移:策略可跨基准、跨领域迁移,减少重复调优。

与现有产品/工作流接口

SAT 可集成进 LangGraph / AutoGen / CrewAI 等 agent 编排框架,作为高层策略层。现有单 agent 或 RAG pipeline 的推理步骤可由 SAT 替换,输入问题,输出经过协作计算的答案。策略库(strategy bank)可序列化存储,运行时按任务嵌入检索并加载。模型侧无需修改,仅需 LLM API 调用。

具体用例:

  1. 电商平台复杂售后:多个 agent 分别扮演用户诉求分析、订单政策匹配、沟通记录摘要,动态组织讨论,生成仲裁方案,减少人工客服。
  2. 金融投资分析:多个 agent 分析财报、新闻、监管文件,交叉质疑与修正,输出投资备忘录,替代初级分析师初稿。

局限

  • 训练与推理成本较高:SAT 需要通过多轮 agent 协作学习策略,虽然训练问题少(数学 15 个、知识 25 个),但每次协作涉及多次模型调用与交互,学习阶段计算开销显著高于单模型推理。部署时,团队仍要遵循学习到的对话流程,相比单模型推理或简单路由,推理延迟和 token 消耗更高,对延迟敏感或低成本场景不友好。论文未报告绝对成本,也未讨论如何根据计算预算调整团队规模或交互轮数。
  • 任务泛化边界不明确:在数学物理基准上收益明显,但在知识逻辑基准(如 GPQA-Diamond)上,团队虽超过最强成员却未超过完美路由 oracle,说明组织学习并非在所有任务类型上都优于基于独立答案的选择。论文用 demonstrability 解释何时帮助大,但该指标依赖任务和模型特性,难以事先预估。同时训练问题数量极少,策略可能过拟合于特定领域或难度分布,迁移到分布差异较大的任务时效果可能下降。
  • 依赖成员能力与初始配置:SAT 固定团队,成员为预训练强模型,若成员能力不足或同质化严重,协作增益有限。论文未探索不同成员多样性、能力水平或团队规模对学习策略的影响,也未说明如何为新任务选择合适的成员组合。方法隐含假设团队成员具备基础推理能力且能产生部分正确推理,对于完全陌生的领域或极低资源场景,可能无法有效提升,甚至带来额外开销。
论文Aneesh Pappu2026-09-19原文

相关内容