论文

Adaptive Auto-Harness: 面向开放式任务流的智能体系统部署的持续自我改进

Adaptive Auto-Harness: 面向开放式任务流的智能体系统部署的持续自我改进

现有的自动编排系统(如 A-Evolve、GEPA 和 Meta-Harness)通过从执行反馈中优化提示、技能、工具、记忆及支撑基础设施来改进大语言模型(LLM)智能体,但这些系统通常仅在固定的离线基准上评估。实际部署场景面临开放式任务流:历史记录持续增长无固定终点,异构任务需要不同的编排配置,且问题分布随时间变化。这些挑战导致单一且过于密集更新的编排方案变得脆弱——性能在早期达到峰值后便迅速下降,从而需要具备任务级适应能力的持续编排构建。 我们提出 Adaptive Auto-Harness 框架与系统,专门应对此类任务流。该框架将实际编排与理想编排之间的差距分解为 演化损失(evolution loss)和 适应损失(adaptation loss)。系统通过以下机制解决这些损失:一个有状态的多智能体演化器(stateful multi-agent evolver)、一个带运行时路由的编排树(harness tree),以及在历史数据缺乏必要信号时进行的人工引导钩子(human-steering hooks)。 在预测市场、安全竞赛和事件预测三个任务流上的实验表明,Adaptive Auto-Harness 优于五种现有的自动编排基线。消融实验将性能增益归因于更好的构建、路由或针对性的手动引导。代码已开源:https://github.com/A-EVO-Lab/AdaptiveHarness。

论文精读

TL;DR Adaptive Auto-Harness 通过分解进化损失与适应损失,结合多智能体演化与 harness 树路由,首次实现开放式任务流上的持续自改进,性能显著超越现有 auto-harness 方法。

问题

问题背景

LLM 驱动的智能体在开放域任务中表现日益增强,但依赖手工设计的提示、工具、技能和记忆等“外挂”(harness)成为瓶颈。自动外挂优化(auto-harness) 研究通过从执行反馈中自动改进这些组件,提升了智能体性能,然而现有工作几乎全部在固定离线基准上验证,与实际生产环境中的开放任务流存在严重脱节。

现有方法局限

当前 auto-harness 方法(如 A-Evolve, GEPA, Meta-Harness)假设任务分布静态,通过密集更新一个无状态的全局 harness 来迭代优化。但在开放任务流中:

  • 历史数据不断累积,没有结束点,持续更新导致 harness 脆弱;
  • 不同任务需要异构的 harness 配置,单一 harness 无法适配;
  • 任务分布随时间漂移(non-stationary),早期优化到的峰值随后快速退化。

实验表明,这种“单一密集更新”策略会在早期达到准确率峰值后持续下降,无法维持长期自我改进。

为什么这个问题难且重要

开放任务流带来的核心挑战是非平稳性无界演化:智能体需要持续适应分布变迁,同时不能遗忘历史经验。技术难点在于:

  • 如何拆解性能劣化的源头——演化损失(evo loss,因优化本身不足)与适应损失(adapt loss,因无法针对不同任务选最优 harness);
  • 如何构建能增量学习按需路由的 harness 基础设施;
  • 如何在自动反馈信号不足时引入人机协同,避免性能崩塌。

业界对自提升智能体的长期部署需求迫切(如自动调试、持续监控、动态交易),但缺乏能处理开放流的方法。

行业类比

这一挑战类似于推荐系统中的实时概念漂移:用户兴趣、内容分布持续变化,单纯的离线重训无法保持线上效果,必须设计流式学习与自适应策略。真正的自提升 Agent 系统同样需要从开放、漂移的数据流中持续进化,而非仅在静态测试集上“刷点”。

核心洞察

  • 开放任务流中自动缰绳系统性能衰退的根源并非历史积累不足,而是演化损失(从历史中学习最优缰绳)与适应损失(缰绳与当前任务分布匹配)之间的折衷。该分解揭示了现有系统在固定基准上离线评估的局限,为持续自我改进提供了可量化的双重优化目标,指导设计同时兼顾长期经验积累与即时分布适应的机制。
  • 通过缰绳树与求解时路由,Adaptive Auto-Harness 将缰绳构建解耦为离线的多智能体有状态演化与在线的任务自适应选择,使系统能够在保留历史最佳组件的同时,按任务特征动态组合缰绳部件,有效避免了单一全局缰绳因任务漂移和过度更新而导致的脆性退化。

方法

输入:开放任务流

系统接收 开放任务流(open-ended task streams),例如预测市场、安全竞赛和事件预测等。流中任务持续到达,无固定结束点;任务类型异构,需要不同的 harness 配置;且任务分布随时间漂移,存在概念漂移。已有 auto-harness 方法(如 A-Evolve、GEPA、Meta-Harness)在固定离线基准上优化单一 harness,但在开放流中,单一 harness 的密集更新会导致性能早衰——准确率先升后降,即产生 演化损失(evolution loss)和 适应损失(adaptation loss)。

关键模块

损失分解框架
将当前 harness 到 oracle harness 的性能差距分解为两部分:

  • 演化损失:由 harness 更新策略(如学习率、更新步长选择)引入的优化过程误差。
  • 适应损失:为每一个任务实例选择最优 harness 变体时的决策误差。

状态化多智能体演化器(Stateful Multi-Agent Evolver)
维护多个智能体,每个智能体持有一个 状态化的 harness 构件集(提示、技能、工具、记忆等),并通过历史任务反馈持续协同演化。演化过程借鉴进化算法,智能体间通过选择、交叉和变异产生新的 harness 候选,并利用累积的状态信息评估其长期适应性,从而降低演化损失。

Harness 树与求解时路由(Harness Tree with Solve-Time Routing)
演化生成的 harness 变体组织成一棵 Harness 树,树中节点对应不同粒度的 harness 配置(如全局共享、领域特定、任务特定)。在求解时,系统根据当前任务的特征(如文本描述、元数据)动态走树,路由到最优 leaf 节点的 harness 执行,从而最小化适应损失。

人机协同通道(Human-Steering Hooks)
当历史反馈包含的信号不足以支撑可靠路由或演化时,系统暴露 人类引导接口,允许人类专家注入少量标记信号,修正演化方向或路由决策。该通道仅在必要时触发,保持高自动化水平。

输出与差异

系统输出一个能够 在开放任务流中持续自我改进 的 agentic 部署框架,相比现有 auto-harness 基线,在长周期持续性能、任务级适应性和人类介入效率上取得显著提升。

与方法同类的差异:现有 auto-harness 工作仅聚焦于离线优化单一全局 harness,而 Adaptive Auto-Harness 首次将问题定位于开放流下的 持续演化与运行时适应联合优化,并通过状态化多智能体、树路由和按需人类引导三个机制共同解决流动场景中的脆性退化。

实验

实验设置

我们在三个开放任务流上评估:PolyBench(预测市场)、CTF-Dojo(安全竞赛)和FutureX(事件预测),每个流中任务以连续、无固定终点的方式到达,且分布随时间漂移。对比五种现有 auto‑harness 基线(如 A‑Evolve、GEPA、Meta‑Harness),均采用单 harness 密集更新策略。

核心发现

  • 性能持续领先:Adaptive Auto‑Harness 在三个流上的累积准确率均显著超越基线,且避免了后者“先达峰值后持续下降”的典型退化。
  • 增益归因:消融实验表明,提升来源于三方面:
    • 更好的 harness 构建:状态化多智能体演化器从执行反馈中更高效地迭代优化。
    • 适应性路由:harness 树在解题时动态选择最匹配的分支,避免全局统一配置的僵化。
    • 人机协同:在历史信号缺失时,人类引导钩子注入外部知识,提升罕见或漂移任务的处理能力。
  • 对比解读:传统 auto‑harness 在开放流中迅速过拟合早期分布,后期性能崩塌;而本方法通过解耦演化损失与适应损失,以树形结构加多智能体协同实现持续稳定的自我改进,验证了任务适应性 harness 设计的必要性。

行业影响

落地场景

Adaptive Auto-Harness 面向需要长期在开放任务流中运行的 LLM agent 系统。适用场景包括:动态环境下的 客户支持 agent(问题类型随产品更新、用户行为变化而漂移)、安全运营中心 (SOC) 的威胁检测 agent(攻击模式持续演变)、内容平台的审核与推荐 agent(政策、热点、社区规范频繁调整),以及 金融风控 agent(欺诈手法不断翻新)。这些场景的共同痛点是:一次性优化的 prompt / 工具集 / 技能(harness)会随时间失效,性能先升后降。

商业价值

传统 auto-harness 系统需要周期性人工介入触发重新优化,且重训成本高、易过时。Adaptive Auto-Harness 将持续自改进所需的“进化”与“适配”解耦,通过状态化多智能体进化器求解时路由,在不打断在线服务的前提下,自动维持甚至提升性能。直接收益包括:

  • 降低运维成本:避免工程师频繁手动调整 prompts 和工具链。
  • 减少性能退化导致的商业损失:在电商推荐中可维持长期转换率;在安全检测中可防止漏报率随时间上升。
  • 提升系统韧性:适应任务分布漂移,无需额外标注或重训练大模型。

与现有产品/工作流的接口

该系统可作为现有 Agent / LLM 编排平台(如 LangChain、Semantic Kernel、Dify)的 持续优化层 集成。接口逻辑为:

  1. 将现有 agent 的 harness 注册为初始节点。
  2. 流式接入任务日志与反馈信号(奖励信号或人工标注)。
  3. 输出新的 harness 版本并自动 A/B 测试路由。

无需替换现有推理栈,只需添加 Adaptation API,即可将静态 agent 升级为持续自适应的 agentic system

具体落地案例

场景一:电商多模态搜索 agent
大促期间,用户查询模式从“平铺式商品搜索”变为“性价比对比 + 优惠券适配”。Adaptive Auto-Harness 可根据转化率反馈自动调整工具选择(增加价格比对工具)与 prompt(加入促销语境),并在树状结构中为不同意图分支路由不同 harness,使转换率在活动期不降反升。

场景二:金融交易监控 agent
合规要求与市场操纵手段动态变化。Adaptive Auto-Harness 利用状态化进化器,从历史调查案例中提取新型信号,更新监控 agent 的工具与规则集;同时通过求解时路由在同一策略体系下服务不同细分市场(股票 vs 加密货币),避免单一 harness 对多类交易的顾此失彼。当历史信号不足时,人工介入通道允许合规专家直接输入规则,实现快速冷启动。

局限

  • **依赖人类信号以应对分布外场景**:系统包含 `human-steering hooks`,当历史反馈不足以指导进化时需人工介入。在完全自主的部署环境(如持续运行且无法低成本获取人类判断的流)中,这一依赖可能限制可扩展性,并引入标注延迟与主观偏差。此外,论文未给出人类干预的频率与成本分析,工程落地时需额外成本模型。
  • **任务流多样性有限且可能过拟合领域特性**:实验仅在预测市场、安全竞赛、事件预测三个流上进行,这些流均以自然语言推理为主,且任务结构相对清晰。对于更开放的任务流(如代码生成、开放式对话、多步工具调用),构造有效 `harness tree` 和定义适配损失可能更困难,泛化能力未经验证。
  • **系统复杂度可能带来较大计算开销**:相比单 `harness` 基线,该方法引入了 `stateful multi-agent evolver`、`harness tree` 构建与 `solve-time routing`,在线更新和推理时均需额外算力。论文未提供详细的资源消耗对比(如 GPU 时/千任务、延迟增加),这使工程选型时难以权衡收益与成本,尤其在低延迟或资源受限场景下。
论文Zewen Liu2026-06-01原文

相关内容