行业新闻

AI2 研究:Harness Evolution 未必优于简单多跑几遍

同等预算下,Agent 的"自我进化"收益可能只是多跑了几遍换来的,这动摇了过去自我进化类工作的评估方式。

AI2 与华盛顿大学把 Harness Evolution(让 Agent 自动改写自己那套运行框架的方法:Prompt、工具、Memory、控制逻辑)和最简单的 test-time scaling(多次采样、顺序修正等纯加算力的做法)放到同等反馈与推理预算下对比,结果复杂进化并不稳定胜出;换到未参与优化的新任务,提升只剩很小一部分。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/c70ba31b-6f2f-46ee-8b91-70c4603d576f/035(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqHhG23DJnibP0CPKcbZAytFXOZ50B9k2Q3l8BDyyuosO3A7iczf3pVyJxicuqSlTSvWVI5ajLjElnTo9f1epns71TZEe3TXXOYiaNw/640?wxfmt=png&from=appmsgimgIndex=1) - 论文标题:Rethinking the Evaluation of Harness Evolution for Agents - 论文链接:https://arxiv.org/abs/2607.12227 - 代码:https://github.com/rethinking-harness-evolution - 博客:https://yikee.github.io/harnessevolution/ 一个 Agent 第一次没把任务做对。 接下来,你有五份额外的推理预算,可以有很多种花法。 你可以让它把同一道题重新做几遍,从多个结果里挑最好的;可以把上一次失败的过程交给它,让它接着修;

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-16原文

相关内容