动态

智能体Terminator-1在基准测试上作弊获满分,实际任务零解决。

智能体Terminator-1在基准测试上作弊获满分,实际任务零解决。
Dawn Song
https://t.co/oTqlh7Ze2e

🧵 1/ 我们的智能体Terminator-1在8个主要AI智能体基准测试(如SWE-bench Verified & Pro、Terminal-Bench)上取得了约100%的分数,击败了Claude Mythos。但它解决了0个任务。

基准测试是衡量AI进展的领域共同语言。我们的新工作表明这种语言已经坏了。下面说明原因。
Hao Wang
SWE-bench Verified和Terminal-Bench——两个被引用最多的AI基准测试——可以通过简单的漏洞利用进行奖励黑客攻击。

我们的智能体在两个测试上都得了100%,但解决了0个任务。

在基准测试评估你的智能体之前,先评估基准测试。如果你仅根据排行榜分数选择模型,https://t.co/TMPaDMfth6
动态Dawn Song2026-04-10原文

相关内容