论文

Harness-Zero:通过 Agent-as-Harness 实现 Harness 蒸馏

Harness-Zero:通过 Agent-as-Harness 实现 Harness 蒸馏

Agent harness 是介导模型与环境交互的外部系统,能显著提升 agent 表现,但其收益在部署时仍绑定于具体的 harness。由于最优 harness 因领域、实例与模型而异,通用 agent 只能退而接受次优的共享 harness,或在不断增多的专用 harness 之间做路由。为此,本文研究 agent harness distillation:在训练阶段以领域或实例优化的 harness 作为指导,把它所诱导的行为迁移进模型权重,使收益在单一固定目标 harness 下依然保留。 难点在于两种 harness 的动作空间与可用信息不同,优化 harness 的指导无法直接充当目标 harness 的监督信号。为此提出 Harness-Zero,通过 agent-as-harness 实现 harness 蒸馏:在优化 harness 的引导下,一个 harnessing agent 在目标 harness 的动作空间中先修正学生回答再执行,把 harness 指导转化为训练示范。在所得轨迹上微调可将 harness 诱导的行为内化进模型,部署时即可移除专用 harness。 实验覆盖知识工作、工具使用与科学领域,结果如下: 1. 对使用同一演进 harness 的前沿 LLM,agent-as-harness 优于 code-as-harness。 2. 部署时移除专用 harness,Harness-Zero 将基模型的宏平均任务成功率从 23.3% 提升至 44.3%,甚至超过仍挂载该 harness 时的 41.7%。 3. Harness-Zero 恢复了基模型缺失的 harness 诱导行为,在三个领域的 28 种模式上平均恢复率达 82.3%。

论文精读

TL;DR Harness-Zero 用 agent-as-harness 把专用 harness 的引导转为训练演示,微调后模型在移除 harness 时性能反超带 harness(23.3%→44.3%),实现通用 agent 对多域 harness 增益的权重内化。

问题

问题背景

当前 AI agent 领域关注通过外部 harness(如工具调用、记忆系统、代码执行环境)提升模型与环境交互的能力,但性能增益通常绑定于特定 harness 配置。

现有方法局限

主流方案包括 code-as-harness 和 模型与 harness 共同进化,但均面临部署难题:

  • code-as-harness 需要针对每个域或实例手工设计或进化代码,推理时依赖该 harness,若更换环境则收益消失;
  • 共同进化 使模型权重与特定 harness 强耦合,难以迁移到新模型或新任务;
  • 蒸馏特权指导 通常假设源 harness 与目标 harness 的动作空间和观测信息一致,而实际中优化 harness 可能引入额外工具、记忆或预填充机制,导致指导信号无法直接作为目标 harness 的监督标签。

为什么这个问题难且重要

难点在于 跨 harness 蒸馏 属于异构策略迁移:源与目标动作空间不同、可用信息不对称,无法直接使用行为克隆或 DAgger 等传统模仿学习。同时,agent 系统正从研究原型走向产品化,工业界需要 通用、可部署的模型,而非路由到不断增长的专用 harness 集合——后者增加运维复杂度和推理延迟。因此,将专用 harness 诱导的行为 内化到模型权重 具有重要实用价值:推理时无需额外组件,即可保留大部分性能增益。

行业类比

类似自动驾驶领域,将高精地图或激光雷达的先验知识蒸馏到纯视觉端到端模型,使车辆在仅依赖摄像头时仍能保持安全决策能力。

核心洞察

  • Harness Distillation 将训练时专用的 harness 所诱导的行为迁移到模型权重中,使部署时无需该 harness 也能保留其增益。此视角与常见的 harness 优化或路由策略不同:那些方法要么依赖于固定的共享 harness,要么需要维护不断增长的专用 harness 集合,而蒸馏直接改变模型本身,从根本上解耦了性能与部署时 harness 的绑定。
  • Agent-as-Harness 通过引入一个受优化 harness 引导的代理,在目标 harness 的动作空间中修正学生响应,从而生成可供微调的训练轨迹。这解决了跨 harness 蒸馏的核心难题:不同 harness 拥有不同的动作空间与可用信息,导致优化 harness 的指导无法直接作为目标 harness 的监督信号。该创新将不可对齐的监督问题转化为可执行的轨迹生成问题,是 Harness-Zero 方法有效性的关键。

方法

方法流程

Harness-Zero 针对跨 harness 的蒸馏问题,输入为:基础模型(学生)、领域/实例优化的 harness(教师),以及部署时固定的目标 harness。

1. Harness 进化与适配

首先通过 skill-guided evolution 生成针对特定领域或实例优化的 harness,其组件可能包括代码工具、记忆模块、技能描述等。随后进行 harness adaptation,将该优化 harness 的元素映射到目标 harness 的动作空间与信息约束下,保留核心行为模式(如预填充单元格、技能调用格式等)。

2. Agent-as-Harness 干预

引入一个 harnessing agent,它接收优化 harness 的引导(提示、工具说明、示范等),观察学生模型在目标 harness 下的原始响应,并在执行前进行干预:修正错误、补充必要信息、调整动作格式,使其在目标 harness 的动作空间内合法且有效。干预受到约束,避免引入目标 harness 不支持的操作。

3. 从审阅轨迹中学习

收集学生原始响应、harnessing agent 修正后的响应、以及环境反馈构成的轨迹,将其作为训练演示。在目标 harness 下对基础模型进行 监督微调(行为克隆),使模型学会在目标 harness 下复现优化 harness 诱导的行为。

输出:微调后的模型在部署时仅需固定目标 harness,无需优化 harness,且性能不低于附加优化 harness 的水平。

差异点:与直接从优化 harness 输出(如 code-as-harness)蒸馏不同,Harness-Zero 通过一个中介 agent 在目标动作空间内生成同质监督,避免了异构动作空间之间的直接映射问题。

实验

实验设计

论文在知识工作、工具使用、科学三个领域评估 Harness-Zero。首先通过 skill-guided harness evolution 生成领域或实例特化的 harness,再经 harness adaptation 适配到目标 harness 约束。随后,harnessing agent 在 optimized harness 引导下,对 student 响应进行干预修正,生成训练轨迹;最后用这些轨迹微调 student 模型,部署时移除 specialized harness。

关键发现

  1. agent-as-harness 在相同演化 harness 下,优于 code-as-harness。
  2. 移除 specialized harness 后,base 模型宏平均任务成功率从 23.3% 提升到 44.3%,比仍携带该 harness 时的 41.7% 还高 2.6 个百分点。
  3. 行为内部化分析显示,Harness-Zero 平均恢复 82.3% 的 harness-induced 行为模式,覆盖 28 种跨领域模式。

对比解读

与直接部署带 harness 的模型相比,蒸馏到权重带来两个工程优势:一是避免运行时依赖外部 harness,降低系统复杂度和推理开销;二是通过 fine-tuning 让模型内化更适应固定目标 harness 的行为,而非简单依赖特化 harness 的信息注入。agent-as-harness 的设计将 guidance 从不同动作空间转换到目标空间,解决了直接监督不可行的问题,可视为一种基于轨迹的跨 harness 知识迁移范式。

行业影响

落地场景:企业级 AI Agent 平台、自动化客服、代码助手、科研助手等。通过蒸馏将专用 harness 的行为内化到模型权重,部署时只需单一通用 harness,无需为不同领域维护多个 specialized harnesses。适用于对响应延迟敏感、需要高频调用的生产环境。

商业价值:降低部署与运维成本(减少 harness 数量、简化系统架构),提升推理效率(避免 runtime harness 选择与路由开销),同时保持甚至提升任务成功率(44.3% vs 41.7% with harness attached)。对提供 Agent 服务的 SaaS 厂商,可减少定制化开发,加速交付。

与现有工作流集成:训练阶段,利用优化后的 harness 生成 corrective trajectories,对基础模型(如 GPT-4o、Claude)进行 SFT;部署阶段,使用统一固定 harness,无缝接入 LangChain、AutoGPT 等框架。无需改动推理代码,仅需替换模型权重。

具体 use case:1) 电商智能客服:处理订单查询、退款等多步工具调用场景,训练专用 harness 优化工具序列,通过 Harness-Zero 蒸馏到基座模型,部署时不用切换 harness,降低延迟与 token 消耗。2) 企业知识工作自动化:如合同审查、报告生成,不同任务需要不同工具组合,蒸馏后单一模型处理多任务,减少工具路由和维护成本。

局限

  • **依赖优化 harness 的可用性与质量**:Harness-Zero 的训练流程首先需要一个在特定领域或实例上表现优异的 harness 作为指导。然而,这种优化 harness 的获取本身就需要额外计算与人工设计,且并非所有环境都能轻易构造出优于固定目标 harness 的定制 harness。如果优化 harness 的优势有限或不存在,蒸馏所能转移的行为增益也会受限。论文未系统讨论当优化 harness 与目标 harness 差距过大时(例如动作空间差异极大、可用信息严重不对称)方法的退化情况,这限制了其在实际复杂场景中的直接部署。
  • **泛化性与遗忘风险**:实验仅在知识工作、工具使用、科学三个领域验证,虽显示宏平均成功率从 23.3% 提升到 44.3%,但缺乏更广泛的域外测试。此外,在特定 harness 诱导行为上微调可能导致模型在原始通用任务上的性能下降(灾难性遗忘),论文未报告基础能力保留情况。且行为恢复率 82.3% 并非完全恢复,说明仍有部分 harness 行为未能内部化,可能影响其在需要完整 harness 逻辑的任务中的表现。
  • **计算开销与实时性**:agent-as-harness 在训练时需要引入一个额外的 harnessing agent 对每个学生响应进行审查和纠正,这显著增加了训练时的推理成本。与纯代码 harness 或直接行为克隆相比,该方法需要更多轮次的大模型调用,对大规模训练或高吞吐场景构成压力。此外,虽然部署时移除了 specialized harness,但目标 harness 本身可能仍然存在部分固定结构,不能完全排除 harness 依赖。与直接使用优化 harness 的 routing 方案相比,本方法在部署灵活性上有优势,但训练成本更高。
论文Haoran Ye2026-09-21原文

相关内容