新基准Claw-SWE-Bench评估AI编码工具链,强调工具链选择影响巨大
在相同的编程任务上变换模型和工具链(包裹模型并驱动它的层),结果差异巨大:仅改变代理提交工作的方式,成功率从19%跃升至73%;仅改变工具链,成功率差异可达27个百分点;仅改变模型,费用差异可达170倍,即使最终结果仅差8个百分点。你应该深入研究刚刚在GitHub上发布的Claw-SWE-Bench。这是TokenRhythm Technologies、Infinigence AI、香港城市大学、SEE Fund、北京大学、上海交通大学、北京交通大学和清华大学联合发布的最新论文和基准测试——一个真正反映工具链能力的严谨基准。选择合适的工具链非常重要。但是在OpenClaw、Hermes、ZeroClaw、GenericAgent和NanoBot中,哪一个在编码任务上表现最好?凭直觉?还是靠实际测试?如果你测试,怎么测?你按你的方式,我按我的方式——结果如何比较?Claw-SWE-Bench的观点很简单:每个工具链都带着自己的任务、预算、提示和模型报告分数——所以你永远无法知道高分来自强大的模型、强大的工具链还是简单的问题。Claw-SWE-Bench通过构建一个共享考试来结束这种“各自为政”的混乱,将工具链作为唯一比较变量:同一份试卷:350个真实GitHub问题,涵盖8种语言和43个仓库——每个工具链解决相同的集合。相同规则:相同的问题描述和相同的预算(每任务最多1小时,仅一次尝试,固定并发),全部由同一个官方SWE-bench评分器评分。关键举措——评判代码而非空谈:无论工具链输出JSON、纯文本还是什么都不输出,都不算数。评分仅取决于它在仓库中实际更改了哪些文件。这最终让截然不同的工具链能坐在同一张桌子上。防作弊:一些测试环境让AI窥视“来自未来的答案”。论文清除了所有这些漏洞。它评估成本而不仅仅是正确性:每个工具链还必须报告消耗了多少资金、花费了多长时间以及缓存命中率——因为两个精度几乎相同的设置,费用可能相差100倍。添加新工具链?只需编写一个小适配器。任何实现少数固定接口的工具链都可以直接接入考试——无需更改任务集或评分器。因此,这不仅是对这五个工具链的一次性测试,而是一个可以持续增长的标准。它还附带一个80任务的Lite版本,成本仅为完整运行的约23%,但能复现大致相同的排名——便于快速迭代。论文与代码:https://t.co/FOPh6hba6z