冻结模型权重,ModularRSI 让 Agent 通过改造 Harness 持续进化
这篇研究证明 Agent 的进步不必依赖重训模型:改好外围的 Harness,冻结的模型也能靠经验持续变强,且改进能泛化。
IQuest Research 联合北航、曼彻斯特大学发布 ModularRSI:在基础模型权重全程冻结的前提下,让 Agent 根据自身执行轨迹反复修改模型外围的运行机制 Harness(模型之外决定它如何看环境、管上下文、调工具、判完成的那套机制)。在 Terminal-Bench 2.0 上准确率从 47.57 升到 52.43,且改进可迁移到未参与演化的任务、领域和基础模型。
正文摘录
.jpg)  近日,IQuest Research 联合北京航空航天大学、曼彻斯特大学等合作伙伴发布 ModularRSI,尝试让 Agent 根据自身执行经验,持续修改模型外围的运行机制 —— Harness。 在基础模型全程冻结的情况下,经过 Harness 演化,系统在 Terminal-Bench 2.0 上的准确率从 47.57 提升至 52.43 。更关键的是,这些改进还能迁移到未参与演化的任务、不同领域乃至不同基础模型。