论文

Agents' Last Exam

Agents' Last Exam

近期AI系统在众多基准测试中表现出色,但这些成果并未转化为多个专业领域中有经济意义的实际部署。我们认为,这一差距很大程度上源于评估问题:广泛使用的基准缺乏对真实且具有经济价值的工作流的持续性能测量。本文介绍Agents' Last Exam(ALE),一个旨在评估AI代理在长期、经济价值高、可验证结果的真实世界任务上的基准。ALE与250多名行业专家合作开发,覆盖参照ONET/SOC 2018(美国联邦职业分类)定义的非体力劳动行业。其任务分类法包含13个行业集群下的55个子领域,涵盖1000多项任务。当前结果显示,最难的任务层级远未饱和:主流框架与骨干配置下,平均完全通过率为2.6%。ALE设计为活基准,其任务池随新工作流和行业的上线而持续增长。更广泛地,ALE不仅意在作为另一排行榜,而是作为弥合基准成功与GDP相关影响之间差距的工具。 该基准聚焦于经济价值,覆盖多个行业集群,并采用可验证的长期任务评估。当前远未饱和的表现表明,现有AI系统在实际高价值工作流中的能力仍有巨大提升空间。ALE的活基准特性确保其能持续跟进行业演进,从而保持评估的时效性与相关性。

论文精读

TL;DR Agents' Last Exam (ALE) 是一个涵盖 13 个行业集群、1K+ 真实经济价值长周期任务的 AI 代理基准,当前最强系统平均通过率仅 2.6%,揭示基准与产业部署间的巨大鸿沟。

问题

问题背景

当前AI系统在多项标准基准上性能快速提升,但在专业领域的经济性部署中,实际收益远未兑现。业界普遍关注如何将模型能力转化为真实工作场景下的可靠产出。

现有方法局限

广泛采用的评估方案存在明显缺陷:

  • 任务碎片化:基准测试多为孤立、短期的问答或简单工具调用,缺乏对长时间跨度、多步骤协同工作的测量。
  • 经济价值缺失:评估任务与GDP相关的职业工作流脱节,无法反映代理在真实经济场景中的实用性。
  • 结果不可验证:许多基准依赖人工评分或非确定性匹配,缺少自动化、可复现的严格验收标准。
  • 静态与饱和:固定题库易被过度拟合,像SWE-bench等现有工程基准已被部分突破,但更高难度的真实任务仍缺乏有效度量。

技术挑战与重要性

真实世界的职业任务(参照O*NET / SOC 2018分类)对AI代理提出多重挑战:

  1. 长程依赖:任务涉及数十个步骤,需维护跨环境的上下文,任一环节出错都可能导致全局失败。
  2. 工具与接口多样性:代理需在CLI、GUI、API等混合界面中切换,理解具体行业的软件生态。
  3. 隐性知识:许多专业工作流包含非书面的规则和经验判断,难以通过简单指令覆盖。
  4. 可靠性与成本约束:企业部署要求低失败率与可控资源消耗,现有模型在2.6%的完全通过率下远不能满足。

此类基准的缺失导致模型研发方向可能偏离实际经济需求,无法有效指引资源投入。

行业类比

就如自动驾驶从封闭场地测试转向复杂城市路况的里程累积一样,AI代理也需要从孤立的程序合成任务迁移到由>250位行业专家构建的、覆盖13个行业集群的长期真实工作流验证,才能真正衡量其经济影响潜力。

核心洞察

  • - ALE 将评估任务直接锚定于 O*NET/SOC 职业分类体系,确保每项任务具有真实经济价值与可验证产出,这弥补了当前基准只关注孤立能力而忽略长时间工作流整体效能的断层。不同于 SWE-bench 等针对固定步骤或封闭域的评测,ALE 要求 AI agent 端到端完成跨工具、跨决策节点的复杂职务,更能暴露当前系统在规划、错误恢复和成本控制上的工程短板,为将模型性能提升切实转化为对 GDP 的贡献提供了量化标尺。
  • - ALE 设计为持续演进的“活基准”,任务池随行业工作流动态增长,从根源上解决静态基准快速饱和与过拟合的问题。从实验结果看,目前最强模型在最高难度任务的完整通过率平均仅 2.6%,说明即使单步能力再强,agent 在长程执行中仍因上下文漂移、工具误用等导致整体失败。这种以“完整任务通过”为评判单元的方式,将重点从模型得分转移到端到端可靠性,为产品化落地指明了最关键的技术攻关方向。

方法

输入:经济价值驱动的任务定义

ALE 的任务池基于 O*NET/SOC 2018 职业分类体系,覆盖 13 个行业簇、55 个子领域,共计 1,000+ 任务。每个任务由 250+ 行业专家协作创建,要求满足:长期范围(long-horizon)可验证的经济价值真实工作流场景。任务以 任务卡片 形式结构化存储,包含指令、环境要求、输出规范和评分标准,确保跨代理的公平比较。

关键模块:任务构建与评估管道

  • 任务分类法:将任务按行业簇分层组织,从简易到硬核分档,硬核层级要求复杂工具链协同与多步推理,完全通过率仅为 2.6%。
  • 构建管道:专家撰写原始工作流,经标准化协议转化为可执行任务实例;配备隔离执行环境(如容器、沙箱),保证任务时延与资源消耗可控。
  • 评估架构:采用 通用计算机使用代理(CUA) 作为核心交互接口,兼容 CLI/GUI 操作模式。每个任务实例配备自动 评分法官(含 LLM 辅助层),基于可验证结果(文件、API 响应等)计算 完全通过率、部分得分等复合指标。代理 harness 可插拔,支持不同骨干模型与工具集。
  • 生存基准机制:任务池持续接收新行业的新工作流,每轮评估随机抽取子集,防止过拟合。

输出:多维性能剖面

评估产出包括各层级完全通过率、故障分类分布、成本/时间/Token 效率等分析。实验揭示主流代理配置在最难任务上远未饱和,模型能力与真实部署之间存在显著鸿沟。

相较于 SWE-bench、WebArena 等侧重单一领域或短交互的基准,ALE 的压力在于跨行业、长链路、经济结果可核验的持续任务流,并以活基准形式追踪代理泛化能力的演进。

实验

实验设计

ALE 基准在 13 个行业集群1K+ 任务 上评估 AI 智能体,覆盖 55 个子领域。任务均为长时程、有可验证结果的真实经济工作流,由 250+ 行业专家协作构建。评估采用主流 harnessbackbone 配置的组合,测量 全通过率 (full pass rate),即智能体完整完成任务的比率。

关键发现

  • 最难层级 远未饱和:平均全通过率仅为 2.6%
  • 多数配置在需要持续推理、长时程决策的任务上表现脆弱,表明当前模型在 经济价值驱动的工作流 中仍存在严重性能缺口。
  • 高变异性:不同行业集群、任务类型间的得分差异显著,说明通用智能体远未达到可部署水平。

与基线对比的深度解读

与传统基准(如问答、短脚本)上接近饱和的表现不同,ALE 暴露了前沿模型在 真实、长时程、复杂 任务上的系统性失败模式。即使最强模型,其有效完成率也停留在个位数百分比。这揭示了一个核心差异:现有基准大多测量 静态知识或单步能力,而 ALE 测量 持续执行与适应性。该差距并非由算力或模型规模简单填补,而是需要 智能体架构、工具使用和长效规划 的根本性进步。作者强调 ALE 作为 活基准,持续新增任务以防止过拟合,成为衡量 GDP 级影响力 的标尺。

行业影响

落地场景

ALE 直接服务于企业级 AI Agent 的选型与迭代,尤其适用于需要长周期、多步骤、可验证结果的非体力职业场景,覆盖 13 个行业集群(如财务审计、法律文档处理、软件工程、生物信息学等)。产品形态上,它可以作为 AI 自动化平台的内置评测层,也可以嵌入人才技能匹配系统——基于 O*NET/SOC 职业分类,将 Agent 能力映射到具体职业标准,辅助 RPA 或 Agent 编排平台的流程选择。

商业价值

  • 降本:通过高保真基准提前暴露 Agent 在真实任务中的薄弱环节,避免在生产环境中无效部署,减少人工兜底与返工成本。当前最难关卡仅 2.6% 的全通过率,表明盲目上线将导致严重业务风险。
  • 增收:量化评估为 AI 服务商提供了客观的第三方认证,有利于向客户证明产品成熟度,加速专业服务领域的商业化(如 AI 审计、AI 法律顾问)。
  • 体验提升:可靠的自动化直接提升内部流程效率与终端客户响应质量,例如智能客服能完成“订单修改+库存校验+物流通知”的闭环,减少客户等待与错误。

与现有产品/工作流的接口

ALE 提供标准化的任务规范、评估流水线和 Agent harness,可通过 API 集成到 CI/CD 管线。例如,Agent 开发平台(如 LangChain、AutoGPT)可将 ALE 的私有子集作为回归测试套件,在模型或插件更新时自动运行;企业也可基于开源框架构建内部基准,并将自定义任务贡献回社区,形成持续演进的评估生态。评分返回细粒度的full_pass_rate及失败分类,便于工程师针对性调优。

具体落地 Use Case

  1. 电商智能客服 Agent:大型电商平台使用基于 LLM 的 Agent 处理退款、换货等需跨系统协同的售后流程。集成 ALE 客户服务子集后,平台定期评测 Agent 在“用户提交退换货→系统校验库存→生成物流面单→通知用户”这一真实工作流上的通过率,仅当核心场景通过率 >90% 才批准上线,避免大量人工介入。
  2. 金融合规审查 Agent:金融科技公司构建 Agent 自动审查反洗钱报告,需分析交易链、识别可疑模式并生成 SAR 报告。利用 ALE 中涉及文档审查与规则推理的任务进行基准测试,对比不同 backbone(如 GPT-4o 与 Claude 3.5)的时延、成本与准确率,最终选定成本效益最优的方案,同时满足审计可追溯性要求。

局限

  • **任务覆盖的行业偏向性**:ALE 主要聚焦非物理行业(如金融、法律、软件),虽在附录中提及制造、机器人等领域,但核心任务池仍以信息工作者任务为主,缺少需要物理交互或实时感知的真实工作流。这可能导致基准对具身智能、工业自动化等方向代表性不足,无法全面衡量 AI 代理在广义经济价值上的潜力。
  • **评估粒度过粗与部分得分缺失**:采用完全通过率(full pass rate)作为核心指标,要求代理从始至终无错误地完成任务,任何中间步骤失败则整个任务计为 0 分。这种二值化评估虽然客观,但忽视了部分完成的价值,且不提供过程性反馈,不利于定位代理在规划、工具使用或错误恢复中的具体短板,对指导模型改进的信息量有限。
  • **活基准维护的可比性隐忧**:ALE 设计为持续增长的任务池,新行业和工作流的持续加入会导致基准组成动态变化,不同时期评测结果难以直接对比。此外,任务构建依赖大量行业专家手动创建和验证,成本高、扩展慢;专家主观性可能引入任务难度和质量波动,长期维护的一致性和公平性面临挑战。
论文Yiyou Sun2026-06-03原文

相关内容