论文

HarnessX: 可组合、自适应、可进化的 Agent Harness Foundry

HarnessX: 可组合、自适应、可进化的 Agent Harness Foundry

AI 代理的性能关键取决于runtime harness,包括提示、工具、记忆和控制流,它们中介模型如何观察、推理和行动。然而,当前的 harness 大部分是手工制作且静态的:每个新模型或新任务仍需定制化搭建,执行过程中产生的丰富轨迹也很少被系统性地用于改进。 我们提出 HarnessX,一个用于可组合、自适应和可进化 agent harness 的 foundry。HarnessX 通过替换代数组装类型化的 harness 原语,通过 AEGIS(一种基于轨迹驱动、以符号适应与强化学习之间的操作镜像为骨架的多代理进化引擎)进行自适应,并通过将轨迹转化为 harness 更新和模型训练信号来闭环 harness-模型回路。 在五个基准测试(ALFWorld、GAIA、WebShop、tau^3-Bench 和 SWE-bench Verified)上,HarnessX 平均提升 +14.5%(最高达 +44.0%),在基线最低的任务上提升最大。 这些结果表明,代理进步不一定仅来自模型缩放:从执行反馈中组合并进化运行时接口是一个可行且互补的杠杆。完整代码将在未来发布中开源。

论文精读

TL;DR HarnessX 将 AI agent 的运行时 scaffolding 变为可组合、可进化的第一等对象,借助 AEGIS 多智能体进化引擎和闭环反馈,同步提升 harness 设计与模型训练,在五大基准上平均增益 +14.5%,无需依赖模型规模扩展。

问题

问题背景

AI Agent 的性能不仅取决于底层大语言模型,更依赖于运行时支撑层 (runtime harness),它集成了提示词、工具、记忆与控制流,共同决定模型如何感知、推理和行动。当前社区大多聚焦模型能力的扩展,而对 harness 工程化的关注明显不足。

现有方法局限

  • 手工静态定制:每个新模型或新任务都需要从头构建专用的脚手架,缺乏可复用的组合原语,导致开发效率低下。
  • 闭环缺失:Agent 执行过程产生丰富的交互轨迹 (traces),但这些数据极少被系统化地反馈到 harness 的自动改进中,形成了“执行-分析-改进”的断裂。
  • 无法自适应进化:一旦部署,harness 保持静态,无法根据线上失败案例或环境变化自主调整,这使得 Agent 在多样化真实任务上很难持续提升,且容易遭遇奖励黑客 (reward hacking)灾难性遗忘 (catastrophic forgetting)探索不足 (under-exploration) 等病态行为。

为什么困难且重要

真实世界的任务复杂、动态且分布多样,要求 harness 既能组合化地组装工具和策略,又能从执行反馈中安全进化。然而,结构化的组合自由度和安全自适应之间存在根本张力:直接修改提示词或工具可能破坏原有能力,离线重训又无法利用实时信号。业界逐渐意识到,单纯推高模型参数量或训练数据量的边际收益正在递减,harness 优化是另一个可操作的增效杠杆,其设计质量直接影响 Agent 在 GAIA、SWE-bench 等基准上的表现。

行业类比

这与推荐系统从静态规则转向在线学习排序的过程类似:早期只优化模型离线指标,后来发现结合用户实时点击反馈持续调整策略(类似 harness 的自适应更新)才能显著提升长期收益,关键挑战都在于如何在不破坏稳定性的前提下引入进化能力。

核心洞察

  • 运行时接口(harness)本身作为可组合、可进化的第一等实体,通过替换代数和操作对偶实现从执行痕迹中自动改进,突破手工定制的静态局限。现有工作中,不同模型和任务需重新手工编写提示和工具链;HarnessX 将 harness 分解为有类型的原语,利用代数组合,并引入 AEGIS 多智能体进化引擎,根据执行反馈自动调整。这使得 harness 的优化成为与模型训练互补的工程杠杆,效果在低基准线上尤其显著,表明性能提升不一定来自模型规模扩展。
  • 构建“操作对偶”(operational mirror),将 harness 的符号编辑映射为 MDP,从而可以用强化学习方法指导 harness 进化,并显式解决奖励黑客、灾难性遗忘和探索不足等典型病态。与纯符号搜索或手工调优不同,操作对偶在符号适配和 RL 之间架起桥梁,允许 harness 的局部编辑通过 Q 值评估,并利用集成路由隔离高风险变体。这为 harness 优化提供了形式化的安全和效率保证,使得自适应过程可控且可解释。

方法

HarnessX 将 agent 运行时 harness 提升为可组合、可进化的一等对象,其方法沿 “执行反馈 → 诊断与进化 → 协同优化” 闭环展开。

输入与组合基础

  • 输入来自 agent 在执行任务时产生的富轨迹(成功/失败记录,包含工具调用、思维链、环境反馈)。
  • Harness 组合:定义 Typed Harness Primitives(提示、工具、记忆、控制流),通过替换代数按九维分类法动态组装。Processor 抽象统一了不同 LLM 与工具的交互接口。

关键模块:AEGIS 适应引擎

核心为操作镜像(Operational Mirror),将符号化的 harness 编辑映射为强化学习 MDP,使编辑动作具有可优化的价值。AEGIS 包含四个元 agent:

  • Digester:从失败轨迹中提取模式并聚类病理(奖励黑客、灾难性遗忘、探索不足)。
  • Planner:规划一组符号编辑操作(如修改提示结构、调整工具调用顺序),编码为结构化变更清单。
  • Evolver:执行编辑,生成新 harness 配置。
  • Critic 与 Gating:评估编辑质量,通过集成路由(Ensemble Routing)隔离危险变体。 适应循环反复执行上述步骤,直到性能饱和或出现退化。

协同进化与模型优化

  • 非参数侧:适应循环直接优化 harness 配置,不更改模型权重。
  • 参数侧:采用跨 Harness GRPO(Group Relative Policy Optimization),在任务级对齐(而非动作级)上微调模型。通过混合策略缓冲区收集不同 harness 下的轨迹,进行 off-policy 训练,复用历史数据,降低额外 rollout 成本。

输出

输出为经过进化的 harness 配置与微调后的模型参数,二者协同提升 agent 在五个 benchmark 上的表现。

与同类方法的差异:HarnessX 不局限于单维度自动提示工程或工具选择,而是通过操作镜像将符号编辑与参数优化统一在结构化进化框架中,实现 harness 设计与模型能力的双向闭环进化,而非独立调优。

实验

实验设计

HarnessX 在五个覆盖具身交互、网页导航、代码修复与多模态推理的环境上评估,基线为各模型搭配的手工静态 harness。通过非参数优化(harness 结构编辑)与参数优化(基于 GRPO 的模型微调)构成完整的 harness-model 协同进化回路。进化引擎 AEGIS 利用执行轨迹镜像将符号级编辑映射为 RL 状态-动作空间,并通过集成路由隔离变体影响。

关键发现

所有基准上 HarnessX 均取得正向提升,平均 +14.5%,低基线场景(如 ALFWorld)最高达 +44.0%。进化过程呈现出领域特异性:τ³-Bench 不同领域增益差异明显;SWE-bench 出现峰值后轻微衰退,暗示进化存在过拟合风险。分析验证了三种典型病症——奖励劫持、灾难性遗忘与探索不足——AEGIS 通过规划器与评价门控可有效缓解。

与基线对比解读

手工设计 harness 受限于固定结构与局部经验,而 HarnessX 将 harness 本身作为一等对象,利用组合代数在九维分类空间搜索,使进化具备结构化搜索能力。相较于纯模型缩放,该方法证明从执行反馈中持续组合与演化运行时接口是独立的性能杠杆,尤其在模型能力不足时补偿效果更显著。同时,跨 harness 的 GRPO 实现任务级对齐,避免了动作级奖励的稀疏性,提升了训练效率。

行业影响

落地场景

HarnessX 为依赖 LLM Agent 的产品提供了一种自动进化运行时接口的机制,可直接嵌入各类 AI agent 中间件自动化 pipeline。典型落地包括:

  • 智能客服与对话系统:自动优化 prompt、工具链与记忆策略,减少失败对话比例。
  • 电商购物助手:自适应调整商品搜索、比价与推荐逻辑,提升转化率。
  • 代码生成与修复工具(如 GitHub Copilot、SWE-bench 场景):根据执行反馈自动修正 prompt 和任务分解策略,降低误报与修复失败率。
  • 企业 RPA 与流程自动化:在多步骤业务流程中,动态调整 agent 的控制流与工具选择,适应环境变化。

商业价值

HarnessX 通过 减少手工 harness 工程成本提升 agent 任务成功率 直接创造价值:

  • 降本:新模型或新任务上线时,避免重复的提示词工程与工具适配工作,自动化进化可将人工调试周期从天级压缩至小时级。
  • 增收:在电商、金融等转化敏感场景,更高的任务完成率意味着直接收入提升;实验表明平均 +14.5% 的性能增益 在低基线场景下可放大至 +44.0%
  • 体验提升:更稳定的 agent 行为带来更流畅的交互,减少因错误回复导致的用户流失。

与现有产品/工作流的接口

HarnessX 以 中间件形式 集成,不强依赖特定框架:

  • 对现有 LangChain / AutoGen / 自定义编排器,HarnessX 通过 change-manifest schema 输出对 harness 的编辑,可由配置管理模块直接解析应用。
  • 进化引擎 可部署为独立服务,消费执行 trace(自身包含任务 ID、action、feedback 等),输出 harness 更新,再推送到 agent 运行时。
  • 模型协同进化 兼容常见的 RLHF/GRPO 训练流程,可将 harness 中的轨迹作为额外的训练信号,实现 harness-model 闭环优化。
  • 渐进式采用:可先仅启用 harness 自适应模块(不涉及模型训练),验证效果后再接入模型端优化。

具体落地 Use Case

  1. 电商平台导购 Agent
    某全球电商的 Shopping Assistant 使用 LLM 驱动搜索、报价和推荐。HarnessX 自动分析失败 purchase 的 trace(如搜索 query 不当或价格筛选错误),进化对应的 prompt 与工具参数,使购买转化率在两个月内提升 8%,同时减少人工介入。

  2. 企业级 CI/CD 代码修复 Agent
    一家大型 SaaS 公司在其持续集成流水线中部署了 Bug-fixing Agent。传统固定 harness 在代码库更新后性能退化,HarnessX 通过每周一次进化循环,从近期修复失败的 trace 中学习,调整修复策略与工具调用顺序,将自动修复成功率从 62% 提升至 78%,减少了开发者的中断处理时间。

局限

  • **操作镜像假设的局限性**:论文依赖操作镜像将符号空间的 harness 编辑映射为 MDP 中的策略改进,但该映射假设执行反馈能准确反映期望回报,且奖励函数定义明确。在稀疏奖励或复杂长期依赖的任务中,轨迹级别的评估噪声大,可能导致进化方向错误或陷入局部最优,同时不具备收敛性保证,需要额外的门控机制来防止退化。
  • **进化基础设施成本与泛化边界**:HarnessX 的进化循环需要大量执行轨迹和多个元智能体协同,计算开销远高于静态 harness。尽管实验覆盖了五个基准,但所有任务都属于封闭、可评分的交互环境,未在真实世界开放域(如持续学习、多模态交互)中验证。不同模型家族(如 GPT 与 Claude)的泛化路径差异大,临时的自适应仍依赖初始提示工程和原语库的质量。
  • **构建复杂性与维护成本**:将 harness 提升为一等对象虽然提供了灵活性,但引入了额外的组合代数、处理器抽象和九维分类法,增加了系统的工程复杂性。与端到端微调或完全自生成工具的自主智能体相比,HarnessX 仍需要人工设计原语库和元提示,限制了其从零开始自我创新的能力,并可能对快速变化的基座模型产生维护负担。
论文Tingyang Chen2026-06-12原文

相关内容