论文

AgentWorld: 面向多智能体 LLM 长程协作的基准测试

AgentWorld: 面向多智能体 LLM 长程协作的基准测试

现有多智能体基准 主要考察竞争性场景、20 步以内的短程交互,或仅简单聚合个体表现,难以隔离并凸显基于 LLM 的智能体的真实协作能力。为此,我们提出 AgentWorld,一个包含 100 个人工标注任务(另有 100 个增强变体)的基准,用于评测长程、多智能体协作。 任务在丰富的 MMORPG 沙盒中跨越 50+ 交互轮次,需要 3-20 个具备非对称角色与能力的智能体,在黑盒设定下(每个智能体独立行动、无法访问他人内部状态)通过通信、联合规划与资源共享进行协调。 除传统的二值任务成功率外,我们还提出 Causal Collaboration Effectiveness(CCE),一个基于图的指标,用于追踪智能体动作之间的因果依赖,并量化团队投入中真正对结果产生贡献的比例。 在 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 与 DeepSeek R1-70B 上的实验表明,即便是最佳模型也仅取得 52.0% 的任务成功率,并呈现出系统性失败模式,包括通信中断、角色混淆,以及无法跨轮次维持共享计划。AgentWorld 已完全开源。

论文精读

TL;DR AgentWorld 用 100 个 MMORPG 长程任务(50+ 轮、3-20 智能体、不对称角色)评估多智能体 LLM 协作,并引入 CCE 因果贡献指标,发现最强模型团队仅 52% 成功率。

问题

问题背景

多智能体 LLM 系统逐渐成为复杂任务求解的研究方向,但评估其真正协作能力仍缺乏可靠基准。

现有方法局限

  • 多数基准侧重竞争性博弈 或短视界交互(如 `<=20` 步),无法暴露长时程协作中的计划漂移与错误累积。
  • 一些工作仅聚合单个 agent 的独立表现,忽略 agent 间动作的因果依赖,导致无法区分“各自干活”与“真正协作”。
  • 缺少对任务成功之外协作质量的度量:即使任务成功,也可能存在大量冗余通信或无效贡献。

为什么难/重要

长时程协作(50+ 轮)要求 3–20 个非对称角色 agent 通过通信、联合规划、资源共享 保持共享状态;在 black-box 设置下,agent 无法访问他人内部状态,只能依赖外部消息对齐。这容易引发通信中断、角色混淆、共享计划丢失等系统性故障。业界对多 agent 部署(如游戏 AI、流程自动化、分布式科学发现)的关注度持续上升,可靠基准是衡量进展的前提。

行业类比

如同微服务架构中,单个服务单元测试通过并不保证端到端链路可靠;多 agent 系统也需要因果级协作评估才能避免“伪协作”。

核心洞察

  • AgentWorld 通过长时程、非对称角色与黑盒设置,将多智能体评估从“聚合个体性能”推向“真实协作依赖”。 现有基准要么竞争导向、要么少于 20 步、要么把多个独立智能体的得分相加,无法暴露协作中的通信断裂与角色混淆。AgentWorld 的任务需要 3-20 个角色能力各异的智能体在 50 轮以上交互中共享资源、联合规划,且每个智能体无法访问他人内部状态,迫使模型依赖显式通信,从而让“更多通信未必更好”成为可测量的失败模式。
  • Causal Collaboration Effectiveness (CCE) 将团队成功分解到因果层面,量化每个智能体动作对最终结果的真实贡献比例。 传统 binary task success 只能判断任务完成与否,无法区分“搭便车”与关键协作。CCE 构建因果动作图,回溯哪些动作是结果的原因,发现绝大多数动作对成功无贡献,且 CCE 与人类因果判断一致、对 judge 模型鲁棒。这为多智能体系统提供了比准确率更细粒度的调试信号,可用于识别冗余通信、优化角色分配和早期终止低效动作。

方法

输入与任务定义

AgentWorld 接收手工标注的 100 个任务(含 100 个增强变体),每个任务定义在 MMORPG 沙盒环境中,要求 3–20 个 agent 在 50+ 轮交互内协作完成。每个 agent 拥有非对称角色与能力,且处于黑盒设置:只能通过通信、联合规划与资源共享协调,无法读取他人内部状态。

关键模块

  • 仿真环境:提供 agent-environment 接口与编排,agent 逐轮观察、行动,环境根据物理规则与任务逻辑更新状态。
  • 任务设计:人工标注任务目标与验证脚本,覆盖不同类别与难度,并通过增强生成变体测试泛化。
  • 评估指标:
    • 任务成功率 (SR):二值判定任务是否完成。
    • 因果协作效率 (CCE):构建因果动作图 (CAG),由 judge 模型识别成功动作,再逐轮回溯因果依赖,计算真正贡献成功的动作占比,并提供 per-agent contribution (PAC)。

输出

对每个被测模型输出 SR 与 CCE 分数,并分析系统性失败模式(如沟通中断、角色混淆、无法维持共享计划)。

与同类方法的差异:该基准区别于仅测竞争、短时程(<20 步)或聚合个体表现的现有多智能体基准,专门隔离并凸显长时程、非对称角色与黑盒条件下的真实协作能力。

实验

实验设计

  • 在 AgentWorld 基准上评估 100 个人工标注任务及 100 个增强变体,环境为 MMORPG 沙盒,要求 3–20 个非对称角色智能体进行 50+ 轮协作,智能体独立决策(blackbox 设置),无法访问他人内部状态。
  • 评测模型:Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini、DeepSeek R1-70B;指标包括任务成功率(SR)和因果协作效率(CCE)。

关键发现

  • 最佳模型任务成功率仅为 52.0%,表明长视界、多智能体协作对当前 LLM 仍有巨大挑战。
  • 系统化失败模式包括:沟通中断、角色混淆、无法跨轮维持共享计划。
  • 通信频率与协作效果不成正比,更多通信不必然提升合作质量。
  • CCE 分析显示绝大多数智能体动作对最终结果无直接因果贡献,说明表面参与度高不等于有效协作。

与基线对比

  • 以往多智能体基准多侧重竞争、短视界(<20 步)或简单聚合个体表现,AgentWorld 通过长视界、非对称角色与独立决策强制暴露真实协作缺陷。
  • 四个模型间未给出细化分数,但最佳仅 52.0% 说明当前模型均未达到可用水平,差距主要源于协作策略而非个体能力;项目页 AgentWorld 提供完整开源资源。

行业影响

落地场景

AgentWorld 适用于需要多个 LLM agent 长时程、非对称协作的企业场景,例如电商订单履约(库存 agent 与物流 agent 多轮协商)、软件研发 pipeline(需求分析、编码、测试 agent 协同)、客服工单跨部门流转,以及游戏 NPC 团队任务设计。其 50+ 轮交互与 3–20 个 agent 的规模,贴近真实复杂工作流,可用来在部署前评估多 agent 系统的协作稳定性。

商业价值

当前最佳模型(GPT-5 Mini)仅 52.0% 任务成功率,暴露了多 agent 协作的巨大优化空间。企业若直接采用现有多 agent 编排框架,可能面临通信断裂、角色混淆、共享计划无法维持导致的任务失败与 token 浪费。CCE(Causal Collaboration Effectiveness) 指标可量化每个 agent 动作对最终结果的因果贡献,帮助企业识别无效动作、精简 agent 数量或提示词,直接降低推理成本;同时提升任务完成率可转化为客户体验改善或交付周期缩短。

与现有产品 / 工作流的接口

AgentWorld 完全开源,可直接集成到现有 agent 编排平台(如 LangGraph、AutoGen、CrewAI)的回归测试链路中:

  • 将 AgentWorld 任务作为预发布基准,每次修改 agent 提示词或框架后自动跑分。
  • 利用 CCE 作为生产环境监控插件,定期审计多 agent 动作的因果贡献,发现冗余通信或无效协作。
  • 任务生成与环境可作为仿真沙盒,用于训练 agent 的长期规划与通信策略。

具体落地 use case:

  1. 电商大促订单履约:3–5 个 agent 分别负责库存查询、价格调整、物流协商、客户沟通,通过 AgentWorld 测试 50 轮以上的连续协作,避免因沟通延迟或角色错位导致超卖或订单流失。
  2. 金融风控多源核查:多个 agent 并行收集征信、交易流水、反欺诈信号,再共同评审,利用 CCE 找出哪些 agent 的动作真正影响了最终审批决策,优化 agent 配置与成本。

局限

  • **环境真实性与泛化性局限**:AgentWorld 基于 MMORPG sandbox,任务高度抽象且规则固定,可能无法充分反映真实世界协作中的动态变化、不完整信息和长期记忆要求;且任务设置局限于游戏化场景,与商业谈判、软件开发等实际多智能体应用存在差距。此外,虽然提供了 100 个增强变体,但基准规模仍相对有限,可能不足以捕捉模型能力的完整分布。这提示实际工程中不能仅凭该基准结果推断模型在真实部署环境下的协作性能。
  • **CCE 指标依赖 LLM 评判的潜在偏差**:论文中 CCE 使用 LLM 作为 judge 进行因果图构建和回溯,尽管实验显示对 judge 模型选择具有一定鲁棒性,但无法完全避免 LLM 在理解复杂交互、推断因果链时产生的幻觉或误判;且 CCE 的计算基于动作级别的事件日志,可能忽略隐式信息传递和未记录的环境影响。对于工程实践,这意味着自动化评估指标仍有不确定性,关键决策建议结合人工抽检。
  • **模型覆盖与黑盒设置的局限**:实验仅评估了四个模型(Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini、DeepSeek R1-70B),未包含更大规模或专为多智能体优化的模型;黑盒设置虽然贴近真实 API 使用,但限制了分析智能体内部状态对协作的影响。与某些提供白盒可观测性的基准相比,AgentWorld 更关注行为输出,可能掩盖了导致失败的内在机制。
论文Raphael Shu2026-09-25原文

相关内容