新基准ALE测试前沿AI代理,结果表明尚无法真正替代人类工作。
每个人都说最新的AI代理很快就会“准备好工作”,尤其是在本周Fable 5发布之后。但事实真的如此吗?
在过去的几个月里,我和合作者一直在构建Agents' Last Exam (ALE),这是一个旨在测试这一说法的基准,针对真实的数字劳动力市场工作。
我和合作者之前已经创建了许多该领域使用的基准,包括MMLU、MATH、CyberGym和ExploitGym。今天,我很高兴分享Agents' Last Exam (ALE):一个滚动基准,用于衡量AI代理是否能够在广泛的实际领域实际执行具有经济价值的工作。
通过ALE,我们评估了Fable 5、GPT-5.5、Composer 2.5以及其他前沿代理系统,涵盖了跨越55种职业的1500多个专家来源任务。
结果既令人印象深刻,也令人清醒。
如今的代理能够解决相当一部分专业任务。但当我们审视最困难的任务时,那些需要持续推理、深厚领域知识以及长时间可靠执行的任务,它们仍然远未达到人类水平的性能。
在ALE最难的层级上,我们测试的每一个前沿代理,包括Fable 5,都实现了0%的成功率。
有用的代理时代已经到来。
真正能胜任工作的代理时代尚未到来。
我们希望Agents' Last Exam (ALE)能够成为新指南和北极星,用于开发能够在广泛领域可靠执行具有经济价值工作的代理。
🧵
在过去的几个月里,我和合作者一直在构建Agents' Last Exam (ALE),这是一个旨在测试这一说法的基准,针对真实的数字劳动力市场工作。
我和合作者之前已经创建了许多该领域使用的基准,包括MMLU、MATH、CyberGym和ExploitGym。今天,我很高兴分享Agents' Last Exam (ALE):一个滚动基准,用于衡量AI代理是否能够在广泛的实际领域实际执行具有经济价值的工作。
通过ALE,我们评估了Fable 5、GPT-5.5、Composer 2.5以及其他前沿代理系统,涵盖了跨越55种职业的1500多个专家来源任务。
结果既令人印象深刻,也令人清醒。
如今的代理能够解决相当一部分专业任务。但当我们审视最困难的任务时,那些需要持续推理、深厚领域知识以及长时间可靠执行的任务,它们仍然远未达到人类水平的性能。
在ALE最难的层级上,我们测试的每一个前沿代理,包括Fable 5,都实现了0%的成功率。
有用的代理时代已经到来。
真正能胜任工作的代理时代尚未到来。
我们希望Agents' Last Exam (ALE)能够成为新指南和北极星,用于开发能够在广泛领域可靠执行具有经济价值工作的代理。
🧵