南洋理工大学安波团队研究:Harness 与模型的适配取决于任务组合
Harness 不是越通用越好,而是和具体模型、任务绑定;换一个模型或任务,最佳的 Harness 就可能换人。
开发 Agent 应用时选哪套 Harness(模型外面的执行框架,负责工具调用、上下文管理和错误恢复)一直很纠结。南洋理工大学安波团队把模型与 Harness 当整体比较,交叉测试 4 套可配置 Harness 与 5 个模型、3 个任务集,共 66 项结果。结论是:Harness 没有固定优劣,取决于它与模型、任务的组合,应该围绕真实任务做联合评估,而不是找一套通用方案。
正文摘录
.jpg) 开发 Agent 应用时,大家一定都为选择 Harness 纠结过:同一个模型接入不同 Harness,工具调用、上下文管理和错误恢复的方式都会发生变化,最终表现也可能相差很大。一套 Harness 在某类任务上表现突出,换到另一类任务后,却未必仍是最佳选择。 那么,不同任务究竟该选择哪套 Harness?是否存在一套能够稳定适配多种任务的通用方案?模型厂商提供的原生 Harness,又是否一定更适合自家模型? 新加坡南洋理工大学安波教授团队在最新报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》中,对这些问题进行了系统研究。