论文

协同演化 Harness 与模型:On-Policy 纠错让较弱模型在模仿失效处实现追平

协同演化 Harness 与模型:On-Policy 纠错让较弱模型在模仿失效处实现追平

Agent harness(系统提示、工具集、执行 hook 与上下文管理脚手架)是决定 agentic 任务成败的关键因素,自动化 harness evolution 能让较小模型以远低于前沿模型的成本胜任领域特定任务。由于 harness 与模型权重共同塑造行为,本文追问二者应如何结合。 在 七个企业 agent 任务 上,作者先用较弱模型演化出 harness,却发现更强的 expert 往往能更有效地使用它,说明 expert 监督有望补上剩余差距。但在演化后的 harness 下,用 expert 完整轨迹训练弱模型反而反噬:在 Qwen3-Coder 与 Gemma 4 上,七个任务全线回退 4 至 30 分,尽管同一流程在未演化的 harness 下是有效的。 分析表明,模仿虽能迁移知识、提升 scaffold 使用率,却破坏了 model-harness fit:弱模型采纳了 expert 的规划策略,却不具备执行它的能力,也不再匹配围绕其原生规划风格演化出的 harness。为此作者提出 on-policy expert-correction 流程,由 meta-level MLE agent 自动化,定位弱模型自身 rollout 中的失败 turn,仅让 expert 重写该 turn,从而在保有其规划风格的同时,兼得 harness evolution 与模型适配的收益。 该工作识别并化解了 harness 更新与权重更新之间的一处冲突,给出面向企业领域任务、兼顾兼容性的经济型协同演化配方。

论文精读

TL;DR 模仿专家轨迹在演进后的 harness 下会让弱模型全面退化,根因是破坏原生规划风格;本文改用 on-policy 专家纠错仅重写失败轮,在七项企业任务上实现 harness 与模型兼容共进化。

问题

问题背景

在 agentic 任务中,agent harness(系统提示、工具集、执行钩子、上下文管理脚手架)与模型权重 共同决定最终表现。业界正寻求通过自动演化 harness 或轻量微调(如 LoRA)让较小模型在领域任务上逼近前沿模型,以显著降低成本。

现有方法局限

近期工作已证明单独演化 harness 能提升弱模型,且更强专家模型往往能更好地利用演化的 harness。一个直接思路是用专家在演化 harness 下产生的完整轨迹来微调弱模型。但本研究在七个企业 agent 基准上发现,这种模仿学习导致 Qwen3-Coder 和 Gemma 4 模型在全部任务上性能回退 4 到 30 个点,即便同样的步骤在未演化的基线 harness 上有效。原因在于模仿同时转移了知识和脚手架使用,但破坏了 model-harness fit:弱模型采纳了专家的规划策略,却不具备执行该策略的能力,且不再匹配围绕其原生规划风格演化的 harness。

为什么这个问题难/重要

harness 和权重的更新并非独立,二者的组合可能产生负向交互。要安全组合两个杠杆,需要保持弱模型自身的规划风格,同时引入专家知识;这要求更精细的干预粒度。业界对低成本企业 agent 的需求持续上升,如何让模型与脚手架协同演化而不冲突,是实际部署的关键挑战。

行业类比

类似在 RAG 系统中,企业定制了检索器和 prompt 模板后,直接让小型 LLM 模仿大型 LLM 的完整回答步骤,反而会因能力不匹配而输出错误,需要定位到具体失败节点进行局部修正。

核心洞察

  • 模型与 harness 的适配性是协同演化的核心约束,模仿学习会破坏弱模型的原生规划风格,导致性能倒退。这不同于将 SFT 视为通用提升手段的传统认知:在 evolved harness 下,弱模型虽然学到专家知识并增加 scaffold 使用,但因缺乏执行能力而采纳专家规划策略,与围绕其原生风格演化的 harness 失配,在所有七个任务上全面退化(-4 至 -30 点)。这一发现揭示了 harness evolution 与权重更新之间存在隐性冲突,需显式管理兼容性。
  • On-policy 局部专家修正(仅重写失败轮次)通过保持弱模型自身 rollout 的规划轨迹,实现了 harness 与模型增益的叠加。与全轨迹模仿不同,该方法利用 meta-level MLE agent 定位失败轮次并让专家只重写该轮,避免了全局策略迁移带来的不匹配,同时保留原生风格。这为经济型领域微调提供了新的范式:在已演化的 harness 基础上,用最小干预的 on-policy 数据实现模型适配,而非全量模仿。

方法

输入为弱模型(如 Qwen3-Coder-30B-A3B-Instruct)、专家模型、领域任务集与初始 agent harness。流程分三步:

  1. Harness 演进:在弱模型原生行为上自动搜索/优化 harness(系统提示、工具配置、执行钩子等),得到 evolved harness,该 harness 已针对弱模型的规划风格调优。
  2. On-Policy 专家修正:让弱模型在 evolved harness 下生成 rollout(自身轨迹);用一个 meta-level MLE agent 自动定位 rollout 中导致失败的 turn(如错误工具调用或推理步骤),仅将该 turn 发送给专家模型进行重写(可能生成多个候选,通过 best-of-N 选择最优修正)。修正后的 turn 拼回原轨迹,构造 SFT-corr 数据。
  3. 模型适配:用 SFT-corr 数据对弱模型做轻量微调(如 LoRA),输出在 evolved harness 下性能提升且保留原生规划风格的模型。

关键点:失败的 turn 来自弱模型自身 rollout,专家只修正局部,不提供完整专家轨迹,因此不会把专家的高层规划策略强加给弱模型。

跟同类方法的差异点:与直接模仿专家完整轨迹(imitation learning)不同,on-policy 修正只干预失败步骤,保持模型与 harness 的兼容性。

实验

实验设计

在七个企业 agent 基准上,先对较弱模型(Qwen3-Coder-30B-A3B-Instruct 与 Gemma-4-26B-A4B-IT)进行 harness evolution,获得适配其原生规划的脚手架。随后让更强的专家模型使用演化后的 harness,观察性能余量;再尝试用专家完整轨迹对弱模型做模仿微调。

关键发现

  • Harness evolution 可使弱模型在领域任务上获得显著增益。
  • 专家使用演化 harness 时表现更佳,暗示模仿学习可能进一步缩窄差距。
  • 但模仿专家轨迹导致弱模型在全部七个任务上回归 4 至 30 点,该结果在 Qwen 与 Gemma 两个模型家族上复现。
  • 分析表明模仿虽传递知识并提高脚手架使用率,但破坏了模型- harness 匹配:弱模型采纳了专家的规划策略,却不具备执行能力。

与基线对比的深度解读

相同的模仿流程在未演化 harness 下有帮助,但在演化后失效,说明 harness 更新与权重更新之间存在冲突。作者提出 on-policy expert correction 流程,由 meta-level MLE agent 定位弱模型自身 rollout 中的失败 turn,仅让专家重写该 turn,从而保留模型原生规划风格,使 harness 与模型适配可组合。该方法将 harness 演化与模型微调从对立变为协同。

行业影响

落地场景

  • 企业服务 / RPA:自动化处理内部工单、数据录入、报表生成等,利用小模型 + 定制 harness 在特定领域接近专家模型效果。
  • 电商售后:智能客服 agent 处理退款、物流查询、投诉分类等高频任务,通过 harness 进化 + on-policy 修正,小模型可稳定执行多步工具调用。
  • 金融合规:自动审核交易报告、提取关键信息、生成合规摘要,要求高准确率与可审计性,该方案可提供低成本高可靠的自适应 agent。

商业价值

  • 降本:使用 Qwen3-Coder-30B-A3B / Gemma-4-26B-A4B 等小模型替代大模型,推理成本下降一个数量级,同时保持任务成功率。
  • 提效:on-policy expert correction 避免了模仿学习在 evolved harness 下的性能回退(-4 到 -30 点),确保 harness 进化与模型适配的收益叠加,减少人工干预和返工。
  • 体验:更快响应、可私有化部署,满足数据隐私与合规要求,提升企业客户信任度。

与现有产品/工作流的接口

  • 将 harness 配置(系统提示、工具集、执行 hooks)纳入版本管理,类似 MLOps 中的配置文件,支持 A/B 测试与回滚。
  • on-policy correction pipeline 可集成到现有微调流程:先采集弱模型 rollout,用 meta-level MLE agent 定位失败 turn,再调用专家模型重写该 turn,生成 SFT 数据。
  • 与 LoRA/QLoRA 等参数高效微调结合,周期性执行“harness 进化 → 模型适配”循环,适合 LangGraph / AutoGen 等现代 agent 框架。

工业界核心启示:不要简单用专家轨迹微调已进化 harness 的小模型,应采用 localized correction 保持模型原生规划风格,实现兼容性共进化。

局限

  • 论文实验仅覆盖七个企业 agent 任务,且模型限于 Qwen3-Coder-30B-A3B 与 Gemma-4-26B-A4B 两个 MoE 模型,未验证方法在更大规模模型、非 MoE 架构或通用 agent 基准(如 GAIA、SWE-bench)上的泛化性。此外,harness 进化过程依赖特定任务设计,可能对任务分布敏感,过拟合风险未被系统评估。
  • 所提出的 on-policy 专家修正管线依赖一个 meta-level MLE agent 自动定位失败 turn,但该 agent 本身的决策质量、运行成本与鲁棒性未在论文中充分讨论;同时要求专家模型参与重写,实际部署成本仍然较高,且与直接使用强化学习(如 DPO/PPO)或偏好优化相比,该方法的相对优势缺乏系统对比。
  • 论文未探索其他模型适应策略(如直接 RL、拒绝采样、DPO)在同一联合进化框架下的表现,也未说明专家重写轨迹的质量控制手段(如 best-of-N 仅作简单筛选)。此外,实验只在两个模型家族上复现回归现象,样本量有限,结论的统计显著性和跨任务一致性证据不足。
论文Zhou Yu2026-09-08原文

相关内容