论文

递归式 Harness 自我改进

递归式 Harness 自我改进

在模型-Harness 协同进化 (model-harness co-evolution) 的范式下,Harness 不仅是推理时的脚手架 (scaffold),更是可生成数据的关键组件——其执行轨迹能够影响未来基础模型的训练。这催生了 Harness-in-the-loop 学习:优化 Harness 以同时提升当前代理的即时表现和用于未来模型训练的轨迹质量。然而,持续更新由提供者构建的脚手架代价高昂且劳动密集。为应对这一挑战,本文研究是否能在任务特定方式下优化用户构建的 Harness,从而提升执行轨迹质量,同时保持计算轻量且仅需少量更新迭代。 为此,作者提出 Recursive Harness Self-Improvement (RHI),将 Harness 表示为代理循环 (agent loop) 的提示级规范 (prompt-level specification),并通过自身修订历史中的成对反馈 (pairwise feedback) 迭代精炼该规范。在涵盖量化金融、机器人学和制药学的 30 个合成机器学习研究任务上,仅需少量 RHI 迭代即可显著提升低推理努力代理 (low-reasoning-effort agents) 的性能上限,甚至超越对应的最大推理努力设定 (maximum-reasoning-effort setting),同时将推理成本降低高达 60%。实验表明,性能提升主要源于更有效的代理间信息流所带来的改进任务特定上下文管理,而非更长的推理轨迹。最后,作者从信息论角度形式化该行为,提出 RHI 的隐式优化目标假说,并将其视为模型-Harness 协同进化范式下持续学习的实用算法。

论文精读

TL;DR RHI 通过迭代优化任务专用 harness(提示级智能体循环规范),仅需少量成对反馈即可大幅提升低推理努力智能体的性能,超越最大推理设置并降低 60% 推理成本,收益主要源于更高效的上下文与信息流管理。

问题

问题背景

当前 AI 领域正从单体模型向 模型–harness 协同演化(model–harness co-evolution) 范式过渡,harness(即 agent 推理循环的支架)不再仅是推理时的固定脚手架,而是生成训练数据的关键组件,其执行轨迹将直接影响未来基础模型的训练质量。

现有方法的局限

传统的 harness 大多由模型提供商预设(如固定的提示模板、工具调用流程),虽稳定但缺乏适应性。对于下游任务,用户构建的 harness 往往依赖试探性手工设计,存在以下具体局限:

  • 一次性工程(initial-effort engineering):harness 设计后很少迭代优化,难以适应任务动态或模型更新。
  • 忽视轨迹质量:优化目标仅关注 agent 的即时成绩,忽略执行轨迹作为未来模型训练数据的潜在价值。
  • 高维护成本:通过人工持续更新 provider-built 支架成本高昂,无法规模化支撑多任务、多场景的快速演进。

为什么这个问题难且重要

技术挑战:优化 harness 需联合考虑即时性能与轨迹质量,但这两者可能冲突;同时要求计算轻量、迭代次数少,避免重训练或海量评估。业界关注度:随着 agent 在复杂任务(如自主科研、自动化交易)中部署增加,持续提升 harness 的泛化与数据生成能力成为降低推理成本、提升模型演化效率的关键。现有方法要么依赖高推理投入(如更长思考链),要么需大量人工干预,未能实现低成本自动化迭代。

行业类比

该问题类似于 AutoML 应用于 LLM agent 工作流:不是搜索模型架构,而是自动搜索最优的 agent loop 规范,用极少的反馈迭代提升 agent 系统的整体效能与数据产出质量。

核心洞察

  • **脚手架作为数据生成器的自我改进闭环**:传统方法将脚手架(harness)视为固定的推理时工具,而 RHI 将其提升为可通过迭代反馈自我优化的数据生成器。这种视角转换意味着用户构建的任务特定脚手架不仅指导智能体行为,其产生的执行轨迹还会反哺自身优化,形成低成本、高适应性的持续改进循环,区别于需要人工反复调整或依赖预训练大模型更新固定脚手架的方式。
  • **轻量迭代引发性能跃升,降低高成本推理依赖**:RHI 仅需对 prompt 级脚手架进行少量成对比较更新,即可显著提升低推理努力智能体的任务成功率,甚至超越同等模型在最大推理努力下的表现,同时推理成本降低最高 60%。这突破了以往需大幅提升模型规模或推理深度来增强能力的范式,为资源受限场景提供了高效增强路径。
  • **性能增益源于任务特定上下文管理优化,而非推理长度**:RHI 带来的提升主要来自更优的智能体间信息流和上下文整合,而非简单延长推理链。这一发现从信息论角度揭示了脚手架优化的隐式目标——最大化任务相关的互信息,为设计更高效的智能体架构和训练方法提供了可解释的理论基础,区别于盲目堆叠推理步骤的黑盒优化。

方法

整体流程

RHI 将 Harness(即 Agent 循环的执行脚手架)表达为 prompt-level 规范,并通过迭代自改进提升其质量。流程为:

  1. 输入:任务描述、初始 Harness 文本(描述子 Agent 的调用规则、信息流与终止条件)、评估指标或奖励信号。
  2. 执行与 Trace 生成:在任务上运行当前 Harness,产生完整的 执行 Trace(包含各子 Agent 的输入输出、中间推理与最终答案)。
  3. 成对反馈收集:将当前 Harness 与历史修订版本在该任务上的 Trace 进行配对,由 LLM-as-Judge 或环境奖励给出偏好标签 — 偏好更高效、更准确的 Trace 对应的 Harness。
  4. Harness 自改进:利用成对反馈,通过 结构化提示优化(如基于 DPO 思路的 prompt editing)修改 Harness 文本,重点增强 任务特定的上下文管理子 Agent 间信息流,减少冗余推理。改进后的 Harness 进入下一轮迭代。

关键设计

  • 轻量级修订:仅更新文本形式的 Harness,不涉及模型权重更新,迭代次数极少(若干轮)。
  • Trace 质量优先:优化目标隐式为最大化执行 Trace 对未来模型训练的数据价值(信息论假设),而非单纯提高单次任务得分。
  • 成对比较历史:将当前版本与历史版本对比,避免遗忘有效设计,引导 Harness 朝上下文效率更高的方向进化。

与同类方法差异

PromptAgentAPE 等通用 prompt 优化方法不同,RHI 针对 多步 Agent 循环 进行递归自改进,其反馈信号源自 Trace 级别的成对比较,直接优化 Agent 间的协作模式与中间信息传递效率,而非仅寻找单个最佳参数化 prompt。这种 Harness-in-the-loop 的设计使其天然适应模型-Harness 共同演化的持续学习场景。

实验

实验设计与关键发现:

实验设计 RHI 将 agent 循环的 harness 表示为 prompt 级别的描述,利用历史修订的 pairwise feedback 进行迭代优化。在 30 个合成机器学习研究任务上评估,涵盖定量金融、机器人、制药等领域。对比基准包括:未优化的低推理能力 agent、最大推理努力设定 agent,并分析 trace 质量与推理成本。

关键发现 仅需少量 RHI 迭代,低推理能力 agent 的性能上限即显著提升,超越了原本最大推理努力设定,同时推理成本降低最多 60%。实验表明,性能提升并非源于更长的推理链,而是来自 任务特定上下文管理 与更有效的 agent 间信息流 的改善。

深度解读 与依赖提供商更新重型脚手架或增加推理 token 的传统方法不同,RHI 证明了 用户端 harness 优化 的有效性:以轻量、任务特化的方式迭代,即可在不修改底层模型的情况下实现性能飞跃。这不仅降低了持续学习的工程成本,也为 模型- harness 协同演化 范式提供了实用算法支撑,表明通过 harness 层面的数据生成优化,可以反哺未来基座模型的训练。

行业影响

落地场景

Recursive Harness Self-Improvement (RHI) 主要面向需要多 agent 协作动态上下文管理的复杂推理场景。其核心能力在于:通过轻量级迭代优化 harness(agent 循环的 prompt 级规范),提升低推理开销 agent 的性能,同时降低推理成本。适用产品线包括:

  • 金融数据分析平台:自动化研报生成、多源数据融合分析、量化策略回测。
  • AI 驱动的药物研发:多 agent 协作完成分子生成、虚拟筛选、文献整合。
  • 机器人流程自动化:复杂任务拆解与多步骤执行中的 agent 间信息传递优化。
  • 企业级智能客服或知识管理:多 agent 分工处理售前、售后、知识检索等任务。

商业价值

核心收益路线在于降本增效

  • 推理成本大幅缩减:论文实验表明,RHI 可将推理成本降低 60%,同时使低推理努力 agent 性能超越高推理努力设定。对于大模型调用量巨大的 SaaS 产品或云服务,直接降低 token 消耗,提升毛利。
  • 性能天花板提升:不需要升级基础模型或增加推理预算,仅通过优化协同 harness,即可将现有 agent 组合的效果推至新高。
  • 快速迭代与敏捷部署:RHI 仅需少量更新迭代,且不依赖模型重训,能够快速响应业务需求变化,缩短从实验到生产的时间窗口。

与现有产品/工作流的接口

RHI 可作为一个轻量级后训练或运行时优化模块嵌入现有 agent 构建管线。具体集成方式:

  1. LangChain、AutoGPT、CrewAI 等主流 agent 框架中,harness 通常体现为自定义的 agent loop 或 workflow prompt。RHI 可直接作用于这些 prompt 模板,通过记录执行轨迹、收集成对反馈,自动迭代优化 harness。
  2. 可与 LLM 微调prompt engineering 流程并行:模型负责单次推理,RHI 负责跨回合的协作与信息路由优化。
  3. 对已有 AgentOps 或可观测性平台,RHI 的轨迹数据可用于增强分析,形成“执行→反馈→harness 升级→再执行”的持续学习闭环。

具体落地 Use Case

1. 金融量化研究 Agent 系统
某量化基金采用多个 LLM agent 分别负责市场情绪分析、财报解读、技术指标生成。使用 RHI 迭代优化它们之间的信息传递协议(harness),使得分析 agent 能根据交易 agent 的实时反馈动态调整输出重点。几轮 RHI 后,低推理预算下生成的复合策略报告精准度超过原有高预算版本,token 成本下降约 55%,直接提升投研人效。

2. 电商智能客服多 Agent 协作
一个由售前顾问、售后处理、物流查询三个 agent 组成的客服系统,初期协作经常出现信息冗余与错误路由。通过 RHI 优化三者的交互 harness,系统学会简洁传递用户意图与上下文,首解率提升 12%,单次会话平均 token 消耗下降 40%,在保持客户体验的同时显著降低 LLM 账单。


RHI 的关键启示在于:在 模型与 harness 协同进化的范式下,持续投资于 harness 层面的自动改进可以带来与升级模型同等甚至更大的收益,且成本可控、工程侵入性低。

局限

  • **任务场景局限于合成领域**:实验基于 30 个合成的机器学习研究任务(量化金融、机器人、药学),这些任务由作者构造,其复杂度与真实世界任务可能存在差距。真实应用中,harness 需要处理更多样且噪声更大的环境,RHI 的泛化能力尚未验证。此外,合成任务可能过度简化了 agent 间的信息流模式,导致观察到的“通过更有效的信息流提升性能”这一结论在真实多步推理任务中不一定成立。
  • **Harness 表示能力的上限**:RHI 将 harness 表示为 prompt 级别的 agent 循环规格(prompt-level specification),这意味着 harness 的调整空间受限于自然语言描述和模型遵循指令的能力。对于需要复杂控制流、工具调用、记忆管理的场景,这种表示可能表达力不足,无法表示结构化的规划或动态路由。与那些用代码或配置直接定义 agent 流程的方法(如 LangGraph、AutoGen)相比,RHI 的 harness 优化粒度更粗,可能错过细粒度的执行改进。
  • **迭代过程依赖可靠的成对反馈**:RHI 通过 harness 的历史版本进行成对比较(pairwise feedback)来指导优化,这要求存在一个可靠的评估信号来区分轨迹质量。论文未明确指出反馈信号的来源(是否自动生成、是否依赖人类判断),若评估本身存在噪声或偏差,优化方向可能出错。此外,迭代次数少虽然提高了效率,但也可能会因为探索不充分而收敛到次优 harness 配置,特别是在反馈信号稀疏时。
论文Hyunin Lee2026-07-17原文

相关内容