动态

AI编码代理索引更新,DeepSWE替换SWE-Bench Pro,模型排名变化

AI编码代理索引更新,DeepSWE替换SWE-Bench Pro,模型排名变化
Peter Steinberger 🦞
我们更新了人工分析编码代理索引,用Datacurve的DeepSWE基准替换了SWE-Bench Pro——这一替换将搭载GPT-5.5(xhigh)的Codex提升至Opus 4.8(max)的Claude Code之上,而新发布的Claude Fable 5(max)在Claude Code中首次登顶。

DeepSWE由@datacurve构建,其任务从头编写,而非改编自公开的GitHub issue或PR,因此训练期间没有任何模型见过解决方案。这一点很重要,因为它所取代的SWE-Bench Pro已变得可被攻破——有些模型从仓库的提交历史中恢复修复,而非真正解决问题。

此次重新排序索引:搭载GPT-5.5(xhigh)的Codex从65升至76,超过搭载Opus 4.8(max)的Claude Code(73)。搭载Fable 5(max)的Claude Code直接进入刷新后的索引,以77分领先。SWE-Bench Pro此前对某些组合有所高估,对另一些则低估。
更多内容见下文。
动态Peter Steinberger 🦞2026-06-12原文

相关内容