论文

Harness Updating 并非 Harness Benefit:自进化 LLM Agent 中进化能力的解耦

Harness Updating 并非 Harness Benefit:自进化 LLM Agent 中进化能力的解耦

LLM agent 日益被部署为围绕可编辑外部 harness(包括提示、技能、记忆和工具)构建的系统,这些 harness 在不改变模型参数的情况下塑造任务执行。Harness 自进化通过从执行证据中更新这些 harness 来适应此类代理。然而,尚不清楚模型在任务求解中的基础能力是否预测其 harness 自进化能力:哪些模型能产生有用的 harness 更新,哪些模型实际从中受益?我们分析了两种 harness 自进化能力: 1. Harness-updating:从执行证据中产生有用的持久 harness 更新的能力。 2. Harness-benefit:在任务求解中从更新后的 harness 中受益的能力。 我们的分析揭示了两个发现。首先,harness-updating 在基础能力上是平坦的:来自不同能力层次的模型产生的 harness 更新能带来惊人相似的增益;甚至 Qwen3.5-9B 的更新所产生的增益也可与 Claude Opus 4.6 相媲美。其次,harness-benefit 在基础能力上是非单调的:弱能力模型从更新的 harness 中获益甚少,中端模型获益最多,而强能力模型获益少于中端。我们将弱能力层的低增益归因于两种失败模式:弱能力模型可能无法激活相关的 harness 工件,或者激活了但未能忠实地遵循它们。这些发现表明,应将能力预算投入到任务求解 agent 而非进化器中,并在 agent 训练中针对 harness 调用和长程指令遵循进行优化。 我们的源代码已在 https://github.com/A-EVO-Lab/a-evolve/tree/release/harness-evolution 公开。

论文精读

TL;DR LLM 智能体的自我演化应拆分为“更新外部配置的能力”和“从更新中受益的能力”,发现更新能力与模型强弱无关,而受益能力呈非单调分布,为工程部署提供了预算分配与训练重点的新视角。

问题

问题背景

LLM agent 越来越多地以 外部 harness(提示、技能、记忆、工具)为核心构建系统,通过在不修改模型参数的前提下更新这些 harness,实现 自演化 (self-evolution)。这种范式让 agent 能从执行经验中学习,动态适应新任务,正成为构建自适应智能体的关键路径。

现有方法局限

当前研究大多默认:

  • 用一个模型(evolver)为 agent 生成 harness 更新,且
  • 更强的 base model 自然会产生更好的更新,同时 agent 也能更好地利用这些更新。

然而这种假设并未被系统验证。实践中常出现算力错配:将最强模型用于 evolver,但其产生的 harness 更新增益可能并不比弱模型高;或让弱模型作为 agent,却无法有效激活或遵循更新后的 harness。由于缺乏对 harness-updating(产生有效更新)与 harness-benefit(从更新中受益)这两种能力的解耦分析,开发者无法定位性能瓶颈到底在更新侧还是执行侧,资源分配缺乏理论依据。

为什么这个问题难且重要

解开这两类能力面临双重挑战:

  1. 度量分离:更新质量并非独立变量,必须通过 agent 的性能提升间接衡量,但 agent 本身的受益能力又与之耦合,需要精心设计的实验协议才能解耦。
  2. 能力非单调:初步观察表明,harness-updating 能力在不同模型间出奇平坦,而 harness-benefit 能力随 base capability 呈倒 U 型曲线——弱模型几乎不受益,中强模型收益最大,更强模型反而收益下降。这一反直觉现象颠覆了「更大模型总更好」的直觉,直接冲击当前多 agent 系统、自动化 prompt engineering 和持续学习架构的设计原则。对实际工程而言,这意味着算力预算应该倾向 task-solving agent 而非 evolver,并且需要在 agent 训练中专门强化 harness 调用与长程指令跟随能力。

行业类比

如同知识蒸馏中,更大的 teacher 模型并不保证产出最适合 student 的软标签,agent 自演化里选择 evolver 也需要匹配 agent 的「吸收能力」,而非一味追求 evolver 的绝对能力。

核心洞察

  • **Harness 更新能力与基础能力脱钩颠覆了“强模型强更新”的工程假设**。现有 self-evolution 研究通常默认用最强模型充当 evolver,认为更强的 base capability 会自动产出更优的 harness 更新。本文首次系统证明 harness-updating 在不同能力等级(从 Qwen3.5-9B 到 Claude Opus 4.6)上效果非常平坦,弱 evolver 的更新几乎不输强 evolver。这意味着在预算分配上,不应将宝贵的大模型算力投给 evolver 侧,而应转移至 task-solving agent 本身。对于全球 AI 工程团队,这条发现直接挑战了“谁进化谁就用最大模型”的直觉,重塑了 self-evolving agent 系统的资源规划策略。
  • **Harness 受益能力的非单调性揭示了 agent 侧能力训练的盲区**。结果指出,中等基础能力的模型从 harness 更新中受益最大,弱模型因无法可靠激活或忠实遵循 harness 内容而受益甚微,强模型则因本身已趋饱和而增量有限。这表明当前 LLM agent 训练普遍忽视**长程指令遵循**和**harness 调用稳定性**两类关键行为,而非单纯缺乏推理能力。对开发者而言,这意味着与其追逐更大的预训练模型,不如针对性优化 agent 在多步任务中对 harness 加载与执行的一致性,这正是后续训练和微调应重点投入的方向。

方法

核心思路:解耦 harness 自我进化中的两种能力

本文关注 LLM agent 的外部 harness 自我进化——不修改模型参数,仅通过编辑 prompts、skills、memories、tools 等外部组件来提升任务表现。

方法输入:初始 Harness State(一组可编辑的 harness artifacts),以及一系列任务环境;每个任务执行后生成 execution evidence(如成功/失败状态、中间步骤日志)。

关键模块与流程

  1. Evolver(进化器)
    一个独立 LLM,负责根据历史 execution evidence 生成 persistent harness updates。对每轮进化,它接收 agent 执行任务的完整记录,输出修改后的 harness artifacts(例如改写 system prompt、补充 skill 描述)。

  2. Evolution Protocol(进化协议)
    迭代式更新:将当前 harness state 交给 agent 执行一组任务 → 收集 evidence → evolver 生成新 harness state → 下一轮 agent 使用新 harness 继续执行。如此多轮,模拟自我进化。

  3. 两维能力度量

    • Harness-updating capability:以固定 agent 测评不同 evolver 产出的 harness 带来的增益(Δ_update),衡量 evolver “写出好更新”的能力。
    • Harness-benefit capability:以固定 evolver 产出的同一 harness 测评不同 agent 模型,观察增益差异(Δ_benefit),衡量 agent “用好更新”的能力。

关键输出:研究发现 harness-updating 随 evolver 基础能力提升几乎持平(甚至 Qwen3.5-9B 能产出与 Claude Opus 4.6 相近的增益),而 harness-benefit 呈非单调趋势:弱模型获益极少(因无法正确激活或遵从 harness),中间模型获益最大,强模型获益反而回落。

与同类工作的核心差异:已有工作多聚焦于模型参数级的自我微调(如 RL-based agent tuning),而本文专门研究 外部 harness 的自我进化,并首次将进化能力拆解为 更新能力获益能力 两个维度,揭示出模型在这两项上的显著不对称性,为 agent 设计中的能力预算分配提供了新视角。

实验

实验设计

作者构建了 harness self-evolution 框架,将 LLM agent 拆解为不可变的 task-solver(代理) 与可编辑的 harness(提示、技能、记忆、工具),并由 evolver(进化器) 基于执行轨迹生成 harness 更新。实验系统评估了从弱到强多个 LLM(如 Qwen3.5-9B、Claude Opus 4.6、GPT-4o 等)分别担任 evolver 和 agent 时的表现,量化两个关键能力:harness-updating(生成有效更新的能力)和 harness-benefit(从更新中获益的能力)。

关键发现

  • harness-updating 平坦性:不同能力层级的模型产生的 harness 更新带来的任务增益惊人相似,小模型 Qwen3.5-9B 的更新效果与超大模型 Claude Opus 4.6 相当,表明“写 harness”的门槛远低于“做任务”。
  • harness-benefit 非单调性:弱模型(如 Qwen2.5-7B)几乎无法从更新中受益,中等模型(如 Qwen3.5-14B)增益最大,而强模型(如 GPT-4o)增益反低于中等模型。弱模型失败模式归因于 harness 激活失败(未调用相关工件)或 遵循失败(调用但未忠实执行)。强模型则因其基线能力已高,提升空间有限。

与基线对比及工程启示

与传统依赖固定 harness 或随机进化相比,针对性 harness 进化普遍带来正向增益,但幅度高度依赖 agent 基础能力,颠覆了“模型越强演化效果越好”的直觉。这提示在设计自进化 agent 系统时:

  • 可将计算预算重点投入 task-solver 的能力提升,而非一味追求更强 evolver;
  • 应针对性训练 agent 的 harness 正确调用长程指令遵循,以放大进化收益。 实验结果表明,harness self-evolution 中“更新能力”与“受益能力”彼此解耦,为未来解耦式 agent 架构设计提供了重要依据。

行业影响

落地场景

LLM Agent 自演化 技术可直接应用于依赖外部配置(提示词、工具、技能记忆)的智能体产品。例如:

  • 智能客服 利用历史会话证据自动优化应答策略和 FAQ 模板;
  • 自动化工作流(如 RPA)根据执行日志动态调整任务分解提示与工具调用链;
  • 代码助手 从用户反馈中学习更精准的代码生成提示和检索增强规则。 这些场景中,模型参数不变,仅需持续迭代 Harness,显著降低更新成本。

商业价值

  • 降本:弱模型也能产生与强模型等效的 Harness 更新,且中规模模型获益最大,企业无需为 Evolver 模块采购顶级模型,可将算力预算集中在任务执行 Agent 上。
  • 增收与体验提升:持久化更新使智能体越用越准,直接提升任务成功率、客户满意度与付费转化。自动演化还减少了人工调优开销,加速产品迭代。

与现有产品/工作流的接口

该方案可作为 MLOps/LLMOps 管线中的自动化反馈闭环

  1. 从生产日志中抽取 执行证据(成功/失败轨迹);
  2. Evolver 模型(可选用中低规格模型)生成 Harness 更新(新提示、新技能);
  3. 通过配置管理(如 Git 或特征开关)推送到 Agent,无需重新部署模型。 与现有 A/B 测试、监控、版本控制 等工程实践完全兼容,可逐步引入。

具体落地用例

  • 电商推荐助手:使用 Qwen3.5-9B 级模型作为 Evolver,分析对话中用户未采纳的商品,自动优化推荐提示和商品过滤规则;执行 Agent 采用中规模模型,随时间提升转化率。
  • 在线编程教育平台:系统记录学生代码调试过程,Evolver 更新指导风格提示与常见错误的知识条目,使辅导 Agent 更精准地提供提示而非直接答案,提高学习留存。

局限

  • **实验范围有限**:论文仅在 GAIA 和 WebArena 两个 agent 基准上评估,且只涵盖 prompts、skills、memories 等典型 harness 组件,未探索更复杂的多轮交互、动态工具生成或不同粒度的进化策略。进化协议固定为基于执行证据的迭代更新,其他自演化范式(如对抗式更新、离线学习)的结论是否一致存疑,外部效度尚待更多环境验证。
  • **分析深度与解决方案脱节**:虽然清晰诊断出弱模型 harness-benefit 低的两类失败模式(无法激活相关组件 / 激活后不遵循),但未提出并验证任何针对性缓解措施,仅给出宏观建议(把能力预算投向任务求解 agent 而非 evolver)。工程落地时,如何有效提升弱模型在 harness 调用与长程指令遵循上的性能仍是开放问题。
  • **模型选择与混杂因素**:实验直接使用多个不同规模、不同训练范式的现成模型(从 Qwen 到 Claude),未控制指令微调风格、对齐程度、上下文窗口等可能干扰 harness 自演化能力的变量。结论“updating 能力平坦”可能部分源于这些混杂因子,在更严格消融实验下是否依然成立有待验证。
论文Minhua Lin2026-05-28原文

相关内容