新基准 SWE Refactor Bench 测试代码库全量迁移,前沿模型成功率仅 5.4%
这个新基准把考题从修 bug 升级为整个代码库的技术栈迁移,结果最先进的 AI 也几乎全败,说明距离真正自主的软件工程还很远。
SWE Refactor Bench 要求模型将整个代码库迁移到另一技术栈,并保持行为完全一致。8 个前沿模型、520 次尝试中仅 28 次通过全部三轮评测,13 项任务无人解出。此前在 DeepSWE 等基准上表现优异的模型,面对真实工程中的仓库级重构仍力不从心。
正文摘录
.jpg) 从 SWE-bench Verified 到 SWE Pro,再到 DeepSWE,模型们已经把这套题目快刷到头了 —— 修复 bug、实现功能,这些 “ bounded repair ” 任务,当前的大模型已经做得足够好,好到可以放心让它们无人值守地跑。 但真正的软件工程,从来不只是修 bug。 DeepSWE 已经撕开了一道口子 —— 当考题从 “改几行代码” 变成跨文件长任务改写,顶级模型通过率从 96% 跌至 70%。 但 DeepSWE 仍然不是终点。 对 Coding Agents 的终极考验不是本地编辑,而是整个代码库的演进。 把一套 20 万行的系统,从 C 语言整个重写成 Rust,接口不变、行为不变、旧代码全部删掉 —— 这才是工程师日历上真正填满的工作。 而这件事,AI 还远远做不到。 比 DeepSWE 更残酷的 “地狱级” 新基准 Einsia AI 旗下 Navers Lab 最近放出了一个新基准 —— SWE Refactor Bench ,该项目在 X 发布后获得了 50 万次浏览,并引起了海外社区 3000 多个相关讨论。