揭露AI基准测试可被简单漏洞利用,满分实为0分。 Hao WangSWE-bench Verified 和 Terminal-Bench——两个最常被引用的AI基准测试——可以通过简单的漏洞利用获得奖励作弊。我们的代理在两个测试上均获得100%的分数,但它实际解决了0个任务。在评估你的代理之前,先评估基准测试。如果你仅仅根据排行榜分数来选择模型,那么你正在优化的方向上出了错。🧵 动态Hao Wang2026-04-09原文 打开互动版