AI21 Labs 合并弱智能体,实现最先进深度研究者
AI21 Labs 发现,将多个弱 AI agent 合并,能产生比任何单独模型更强的深度研究能力,无需额外训练。
AI21 Labs 提出一种新方法,通过合并多个弱 AI 智能体(单独表现不佳的模型),构建出在复杂研究任务上达到最先进水平的深度研究者。该技术利用了智能体间的互补性,无需重新训练大模型。
正文摘录
作者: Adi Elbaz, Eran Goldstein, Tamar Levy Loboda, Niv Granot, Yuval Belfer 概览 [DeepResearch Bench II](https://agentresearchlab.com/benchmarks/deepresearch-bench-ii/index.htmlhome) (DRB II) 是一个基准测试,它用 9,430 条专家编写的评分 rubric 对 132 个任务上的深度研究 agent 进行评分。我们以 64.38 的总分达到第一名 —— 比此前最佳报告结果高出 +3.2。我们的方法利用了较弱 agent(排行榜第 7-13 名,没有一个得分超过 45)的输出,并将它们合并。  图 1: 2026 年 6 月 24 日的 DRB II 排行榜,我们的提交(AI21)以 64.38 的总分位列第一。 6 个月上升 20 分:发生了什么变化? 大约六个月前,DRB II 上最好的深度研究 agent 得分约为 45。自那以后,这个领域做了领域该做的事:构建更好的 agent。更好的编排、搜索、分解,以及底层更好的模型。每一个进步都来自让单个 agent 变得更强。 我们想提出一个不同的问题:不是“如何构建一个更好的 agent?”,而是“从已经存在的 agent 中,我们还能榨取出多少?” 这个问题值得问,因为深度研究的性质如此。给定一个真实任务(比如“评估投资电动汽车充电基础设施的收益和风险”),agent 需要工作几分钟,搜索网络,并撰写一份长报告。