AI2 研究:Harness Evolution 未必优于简单多跑几遍
同等预算下,Agent 的"自我进化"收益可能只是多跑了几遍换来的,这动摇了过去自我进化类工作的评估方式。
AI2 与华盛顿大学把 Harness Evolution(让 Agent 自动改写自己那套运行框架的方法:Prompt、工具、Memory、控制逻辑)和最简单的 test-time scaling(多次采样、顺序修正等纯加算力的做法)放到同等反馈与推理预算下对比,结果复杂进化并不稳定胜出;换到未参与优化的新任务,提升只剩很小一部分。
正文摘录
.jpg)   - 论文标题:Rethinking the Evaluation of Harness Evolution for Agents - 论文链接:https://arxiv.org/abs/2607.12227 - 代码:https://github.com/rethinking-harness-evolution - 博客:https://yikee.github.io/harnessevolution/ 一个 Agent 第一次没把任务做对。 接下来,你有五份额外的推理预算,可以有很多种花法。 你可以让它把同一道题重新做几遍,从多个结果里挑最好的;可以把上一次失败的过程交给它,让它接着修;