Retrospective Harness Optimization: 通过轨迹回滚上的自我偏好改进LLM智能体
AI智能体依赖由技能、工具和工作流程组成的工具链来解决复杂问题。持续优化此工具链对于适应新任务至关重要,但现有方法通常需要真实标注的验证集,这在实际部署中难以获取。为解决这一问题,我们提出回顾式工具链优化(RHO),一种仅利用历史轨迹的自监督方法。具体而言,RHO从历史轨迹中选择具有挑战性的多样化核心集,并并行重新求解。智能体通过自我验证和自我一致性分析这些回滚,生成候选工具链更新,并通过自身的成对自我偏好选择最有效的更新。 我们在软件工程、技术工作和知识工作三个不同领域评估RHO。值得注意的是,仅一轮优化就将SWE-Bench Pro上的通过率从59%提升至78%,无需任何外部评分。分析表明,RHO有效针对先前的失败模式,优化后的工具链改变了智能体的行为模式,并在长时间会话中维持更高的准确性。
论文精读
TL;DR RHO 是一种自监督 agent 优化方法,仅凭历史轨迹就能自我改进工具与工作流,无需外部验证,单轮优化将 SWE-Bench Pro 通过率从 59% 提升至 78%。
问题
问题背景
AI 智能体(agent)通过组合技能、工具与工作流形成的 harness(执行框架) 来解决复杂任务。随着任务分布变化,持续优化 harness 是保持智能体能力的关键。
现有方法局限
现有 harness 优化方法普遍依赖带标注的验证集,通过 ground-truth 反馈来评估改进效果,例如基于任务成功率的搜索式优化或梯度引导。然而,在生产环境中,获取真实标注成本高昂、滞后严重,且任务多样性使得固定验证集难以覆盖长尾场景。此外,基于人工反馈的优化(如 RLHF)需要大量人类评审,扩展性差;而单纯依赖经验回放的方法(如 Dynamic Cheatsheet)缺乏对失败原因的深层诊断,优化方向粗糙,容易过拟合历史分布。
为什么这个问题难/重要
技术挑战在于:智能体必须在无外部监督的条件下,自主识别 harness 的薄弱环节,并生成有效的改进方案。这要求智能体同时具备:
- 自我诊断能力:从历史轨迹中发现模式性失败(而非偶然错误);
- 候选生成与择优:在巨大的更新空间中进行搜索,并利用自我偏好比较不同更新的优劣,避免灾难性遗忘;
- 分布外泛化:优化后的 harness 不能仅对重放任务有效,还要能推广到新任务。
业界高度关注自监督智能体自改进,因为它能降低持续维护成本,使智能体在开放环境中实现“运行中学习”(learning on the job)。从 SWE-Bench Pro 到 GAIA-2,衡量标准逐渐从单轮成功转向长期会话中的稳定准确率,凸显了 harness 优化的实用价值。
行业类比
类似自动驾驶系统通过收集 corner cases 回传训练管道,但无需人工重新标注——智能体从自身的试错历史中萃取经验,自动升级执行策略。
核心洞察
- - **无外部监督的自演进能力**:RHO 完全摆脱了对人工标注验证集的依赖,仅通过 agent 自身的历史轨迹实现 harness 优化。这与依赖 ground-truth 反馈的现有方法形成根本差异,意味着部署后的 agent 可以在无人类干预下,基于自身经验持续自我改进,显著降低了长期维护成本。
- - **定向失败修复与行为重塑**:RHO 通过精心设计的 coreset 选择机制,从历史轨迹中挑取多样且高难度的任务子集,再结合并行重解与自我偏好排序,能精准定位并修正 agent 的既往失败模式。对比随机重放或均匀采样,这种以困难样本为导向的策略更高效地驱动 harness 更新,改变了 agent 在长程任务中的行为模式,使准确率持久提升。
方法
RHO 是一种自我监督的 agent harness 优化方法,完全基于过去的交互轨迹,无需人工标注或外部验证集。其工作流程分为四个主要阶段:
1. 核心集选择(Coreset Selection)
从历史轨迹库中,RHO 首先使用一个 难度判别器(Difficulty Judge) 筛选出具有挑战性且多样化的任务子集。该判别器评估任务难度,确保选出的核心集既包含 agent 曾经的失败案例,又覆盖不同的能力维度,从而为后续优化提供高信息量的反馈信号。
2. 群体重放(Group Rollout)
选定核心集后,RHO 并行地重新求解这些任务,生成多条 rollout 轨迹。每条轨迹都是 agent 从头执行该任务的完整记录,包括思考、工具调用和中间结果。并行执行提高了效率,同时多条轨迹提供了丰富的对比素材。
3. 自我诊断与一致性分析
Agent 利用 自我验证(self-validation) 评估每条 rollout 的正确性和质量,并结合 自我一致性(self-consistency) 比较不同轨迹之间的差异。通过这种内省分析,agent 识别出重复出现的错误模式、低效的 skill 使用或需要调整的 workflow 环节。
4. 候选 harness 提议与择优(Best-of-N Harness Proposal)
基于诊断结果,agent 生成多个候选的 harness 更新方案(例如修改提示词、调整工具选择策略、重新编排 workflow)。然后,agent 使用 成对自我偏好(pairwise self-preference) 机制:将每个候选方案与当前 harness 进行并行比较,评估其在解决核心集任务上的相对改进程度,最终选择表现最优的更新方案。整个过程无需人工介入,agent 自己扮演“评委”和“优化者”的双重角色。
与同类方法的差异: 与需要外部 ground-truth 验证集(如 Meta-Harness 依赖验证集反馈)或使用额外训练(如 ReasoningBank 需要专门训练的奖励模型)的方法不同,RHO 完全依赖 agent 自身的回顾分析能力,实现了零标注、零外援的自我进化。
实验
实验设计
RHO 在三个异构领域评测:SWE-Bench Pro(软件工程)、Terminal-Bench 2(技术操作)和 GAIA-2(知识问答)。优化流程仅依赖智能体历史交互轨迹,不引入任何外部标注或验证集。每次优化包含四个阶段:(1) 从历史轨迹中选取多样且困难的故障样本组成核心集;(2) 使用同一智能体并行重新求解这些任务;(3) 基于自验证与自一致性分析生成候选 harness 更新;(4) 通过智能体自身的成对偏好比较选出最优 harness。评估对象包括单轮优化后的 harness,并与无反馈基线(Dynamic Cheatsheet、ReasoningBank、Sleep-time Compute、Meta-Harness)及验证反馈优化方法进行对比。所有比较均无外部评分介入。
关键发现
- SWE-Bench Pro 通过率从 59% 跃升至 78%,单轮优化提升 19 个百分点,超越所有无反馈基线。
- 优化后的 harness 不仅提升准确率,更在长周期会话中保持稳定性,行为模式发生结构性变化,例如更系统的验证步骤和更好的错误恢复策略。
- 核心集选择机制有效覆盖先前的故障模式,使得优化聚焦于真正制约性能的任务类型,而非平均用力。
- 自偏好排名可甄别有效更新,避免劣化;接受门控(acceptance gate)设计确保无改善时不更新 harness。
对比解读
无反馈基线多依赖静态提示工程或简单记忆机制,难以自适应未知任务分布。RHO 通过回顾式自我改进,将智能体自身的轨迹转化为优化信号,避免了传统方法对外部验证集的强依赖。与使用验证反馈的方法相比,RHO 在 SWE-Bench Pro 上达到相似甚至更优水平(无外部标签),凸显了自监督在现实部署中的价值。此外,并行重新求解与成对排序的设计使得优化成本可控,且易于集成现有智能体框架。这一结果说明,历史交互中蕴含的自我偏好信号足够支撑有效的 harness 优化,为终身智能体系统提供了无需人工标注的持续进化路径。
行业影响
落地场景
RHO 无需人工标注即可利用历史轨迹优化 Agent harness(技能、工具集合、工作流),适合一切需要 Agent 持续迭代的长周期复杂任务场景。典型产品包括:
- 代码助手:自动改进搜索、测试生成、修复补丁等工具的调用策略,提升 Issue 修复率。
- 智能客服:从对话日志中发现政策理解错误或 API 调用失败,自优化知识检索与回复流程,降低转人工率。
- 自动化数据工程:优化数据清洗、特征工程管道中的工具编排,减少流水线失败次数。
- 研究辅助 Agent:改进文献检索、实验设计、结果验证的工作流,提高任务完成率。
商业价值
RHO 通过自监督回放优化直接削减三个核心成本:
- 标注成本:无需 golden validation set,节省领域专家人工审查费用,尤其适合冷启动或快速变化的业务。
- 运维成本:Agent 自动从失败轨迹中发现 harness 缺陷并生成改进,减少人工调试时间。实验显示 SWE-Bench Pro 单轮优化将通过率从 59% 提升至 78%,直接影响服务可用性 SLA。
- 机会成本:长时任务中通过持续优化维持高准确率(论文证实长程会话表现更稳定),避免因调优导致的业务中断。体验层面,用户感知到 Agent 表现得“越来越懂行”,提升留存与付费转化。
与现有产品/工作流的接口
RHO 可封装为 Agent 框架的一个后台优化管道:
- 从 Agent 执行日志自动提取轨迹,定期触发
coreset selection + group rollout + self-preference流程。 - 输出优化过的
harness配置(prompt、工具描述、流程定义等),通过 A/B 测试或金丝雀发布挂载到现网 Agent。 - 与现有 MLOps 栈兼容:可用 Jenkins / Airflow 调度,结果存入模型注册表(如 MLflow),与 CI/CD 流程串联,实现 “Agent 自我维护”的持续交付。
具体行业用例
- 电商智能客服:某平台售后 Agent 使用 RHO 优化退货政策解释工具。历史对话中 Agent 常错误引用旧版政策,RHO 从失败轨迹中提取多样化难例回放,Agent 自我诊断发现提示词歧义,生成更新后的
policy_qa工具描述及调用时机,经自我偏好筛选后上线,将退货会话一次性解决率提高 12%。 - 金融代码审计 Agent:某公司内部合规 Agent 自动扫描代码仓库中的安全漏洞。RHO 分析过往轨迹中的漏报模式(如未正确调用静态分析工具链),生成改进的 harness pipeline(调整工具调用顺序、增加结果交叉验证步骤),优化后误报率降低 18%,且无需安全专家手工修复规则。
局限
- **自我评价信度风险**:RHO 的核心依赖 LLM 的自我验证(self-validation)与成对自偏好(pairwise self-preference)来筛选 harness 更新,但代理本身的能力边界可能导致评价偏差。若当前代理在某些任务上表现不佳,其自评估可能循环强化已有偏见,从而选择并非真正最优的 harness 修改,甚至引入新的错误模式。该方法缺少外部或更可靠的验证信号,长期迭代下可能放大而非消除系统性缺陷。
- **对历史轨迹分布敏感**:RHO 优化完全基于过去轨迹,其效果严重受限于轨迹的覆盖率和难度分布。若历史任务集合过于简单或缺乏多样性,core-set 选择可能无法充分代表未来的困难场景,优化后的 harness 容易过拟合到已知模式,泛化至新任务时性能提升有限。此外,若初始 harness 本身较差,轨迹中几乎没有成功案例,自监督信号将变得稀疏且噪声较大。
- **计算成本较高**:RHO 每轮优化需并行重新解决 core-set 中的任务并生成多个 harness 候选,再通过自偏好排序,这会带来显著的推理与评估开销。尽管论文通过 core-set 选择和 parallel rollout 控制成本,但对于需要频繁在线更新的低延迟或资源受限部署环境,该方法可能不够轻量。实验未充分对比与其他自改进方法在同等计算预算下的效率。