行业新闻

EverMind 推出 HarnessBank,解决 AI 自进化的验证难题

自进化不是玄学:EverMind 用 HarnessBank 的严格门控,让 Harness 改进真正可验证、可复用。

同一个模型,不改参数只换运行外壳(Harness),表现可能大起大落。EverMind 的 HarnessBank 用双 Agent 架构和四道门控,把自进化变成可验证的工程流程,在七个基准上提升 5 到 15 个百分点,并强调没有万能 Harness。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/1feb775d-2586-47bd-87da-836c9a19251c/020(2).jpg) 同一个模型,权重一个参数都不改,只是换一套 Harness,表现就可能大幅波动。这看似是 Agent 工程中的「玄学」,实际上暴露了自进化走向产品必须回答的两个问题:怎样证明改进真实有效,以及怎样获得足够连续、真实、可回溯的数据,让改进能够长期发生。 EverMind 正试图用 HarnessBank、Raven 与 EverMe,把这两个问题接成同一条产品路径。 模型没有变,为什么换个 Harness 就「变笨」? 在 AI Agent 的实际应用中,模型只是能力的一部分。包裹在模型外围的提示词、知识注入、工具调用、运行时逻辑与配置,共同构成了 Harness,也就是 Agent 的「运行外壳」。同一颗模型放进不同 Harness,可能像同一个人进入不同组织:知识与智力没有改变,决策流程、工具条件和反馈机制一变,最终表现便会截然不同。 EverMind 在 HarnessBank 研究中给出了一个直观结果:在 AppWorld 测试集上,同一颗冻结权重的 Qwen3.6-27B 模型,仅通过 Harness 进化,测试集 Pass@1 从 41.3% 提升至 56.7%。在覆盖终端操作、代码生成、数学推理、网页研究、知识工作、应用控制与代码修复的七个基准中,测试集 Pass@1 均取得正向提升,幅度为 5.1 至 15.4 个百分点。 但真正困难的并不是让某一次分数上涨,而是 证明上涨来自可复用的机制改进,而不是随机波动、任务过拟合,甚至沙箱崩溃与验证器超时造成的「假成功」 。如果连提升是否真实都无法判断,所谓自进化就可能变成自动制造回归。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-11原文

相关内容