论文

Prime Agent: 自我改进的 RLM Harness

Prime Agent: 自我改进的 RLM Harness

语言模型本质是序列处理器,但长程代理(long-horizon agency)需要超越模型权重和活动上下文的外部信息与计算。Prime Agent 是一个开源 harness,面向长程评估与编码代理工作流。 其核心是一个持久的 IPython REPL,遵循 Recursive Language Model (RLM) 抽象,实现程序化上下文处理与测试时计算;Continual Harness 在轨迹间保留历史、记忆、技能、提示词与子代理配置。递归子代理通过直接代理间通信协调,Agents View 让人类检查和管理守护进程会话。Prime Agent 标准化了执行、恢复、验证与资源统计,而将策略构建留给模型本身。 这种低摩擦、富有表达力的“膜”避免 harness 故障演变为模型故障,推动测量更接近模型真实最大底层能力。在 ARC-AGI-3 上,Prime Agent 将 RHAE Best@1 从 30% 提升到 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建与自主 nanoGPT 速度跑中达到或超过原生及主流 harness。在 Factorio 中,精炼(refinement)支持持续技术进步,专用子代理实现并行工作。

论文精读

TL;DR Prime Agent 是一个开源长期智能体 harness,通过递归子代理、持久 IPython REPL 与 agent-to-agent 通信,将 ARC-AGI-3 Best@1 从 30% 提升至 95.5%,并在多类编程和推理任务中达到或超越现有方案。

问题

问题背景

长时程自主代理(long-horizon agency)是当前 AI 研究的热点:模型需要在多步任务中持续获取外部信息、进行计算与决策,而不是仅依赖权重和固定上下文。

现有方法局限

现有的评估与执行框架往往存在以下技术短板:

  • 状态不持久:多数 harness 在一条轨迹结束后丢弃历史、记忆、技能或提示,模型无法跨轨迹复用经验,导致重复探索。
  • 缺乏递归协调:子代理之间没有直接通信机制,任务分解与信息汇总依赖顶层模型串行处理,效率低且难以并行。
  • 计算环境割裂:模型不能直接操作一个持久的交互式计算环境(如 IPython REPL),测试时计算难以程序化实现。
  • 故障归因混淆:harness 自身的执行失败、恢复逻辑缺失或资源计量不准,经常被错误地算作模型失败,无法准确衡量模型真实能力。

为什么这个问题难/重要

长时程任务要求模型在数小时甚至数天内维持一致目标、管理大量中间状态,并动态调整策略。技术挑战在于:

  1. 如何设计一个低摩擦、表达力强的执行层,让模型专注于策略构建而非基础设施细节;
  2. 如何标准化执行、恢复、验证与资源核算,确保评估结果可复现;
  3. 如何在不改变模型权重的前提下,通过测试时计算扩展其能力边界。 业界对这类系统的关注度极高,因为它直接决定了大模型能否从“单轮对话工具”升级为“自主科研或工程伙伴”。

行业类比

这就像自动驾驶的仿真测试平台:只有让测试环境足够真实、稳定且可度量,才能准确评估车辆(模型)的驾驶能力——否则测试平台的缺陷会被误判为车辆性能不足。

核心洞察

  • Prime Agent 提出「低摩擦、表达性膜」概念,通过标准化执行、恢复、验证和资源核算,将评测 harness 的工程故障与模型智能缺陷分离。 与常见评测框架相比,它不把基础设施限制当作模型能力的一部分。当上下文溢出、工具调用异常或状态丢失出现时,Prime Agent 自动处理恢复与重试,避免这些失败被误判为策略错误。这使得 ARC-AGI-3 RHAE Best@1 从 30% 跃升至 95.5%,核心不是提升模型本身,而是移除了 harness 对模型真实最大潜力的压制,让测量更接近模型的上限。
  • Prime Agent 通过持久化 IPython REPL 和 Recursive Language Model 抽象,将长期状态管理和测试时计算从模型权重中剥离,转移到外部程序化环境。 这不同于依赖大上下文窗口或内部记忆的方法:模型可以显式地读写、执行代码、调用子代理,跨 trajectory 保存记忆和技能。该设计为长时程任务(如 GPU 内核生成、nanoGPT speedrun)提供了类似操作系统的稳定基础,而非一次性的工具调用序列。它让 agent 具备可积累、可恢复的工作记忆,从而在多天自主研究和复杂构建任务中与 native harness 持平或超越。

方法

输入与持久状态

模型接收用户任务或环境 observation。Prime Agent 的输入不仅包含当前 prompt,还通过 Continual Harness 跨 trajectory 注入持久状态:历史记录、记忆、技能、prompt、子代理规格等,存储于 daemon-backed 会话,可被程序化读写。

关键模块:RLM 与递归编排

核心抽象为 Recursive Language Model (RLM):把 LLM 视为顺序处理器,但每一步可通过持久 IPython REPL 执行代码,进行程序化上下文处理与 test-time compute。模型可生成子代理,子代理间直接 agent-to-agent 通信,递归分解任务。Agents View 为人类提供监控与管理入口。

执行、恢复与验证

Harness 标准化执行、失败恢复、结果验证与资源核算。策略构建完全交给模型,harness 只作为低摩擦膜层,确保 harness 故障不被记作模型故障,使测量趋近模型真实上限。输出为任务完成结果与评估指标,例如 ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%。

与普通 agent harness 的差异:Prime Agent 将持久 REPL、递归子代理、跨轨迹记忆与人类监督统一为可编程抽象,而非简单的工具调用或静态上下文管理。

实验

实验设计

Prime Agent 在多个长时域任务上验证,包括 ARC-AGI-3 RHAE(交互推理)、长上下文编码、GPU 内核生成、仿真器构建、自主 nanoGPT 加速,以及 Factorio 和 MazeBench 的持续交互。核心机制是持久化 IPython REPL 支持程序化上下文处理与测试时计算,Continual Harness 跨轨迹保存历史、记忆、技能和提示,递归子代理 直接通信协调。

关键发现

在 ARC-AGI-3 RHAE 上,Prime Agent 将 Best@1 从 30% 提升至 95.5%,近乎饱和。在其他任务上,该 harness 达到或超过原生及流行 harness 的表现,表明低摩擦执行层能够暴露模型真实能力上限。在 Factorio 中,细化(refinement)允许持续技术进展,专用子代理实现并行化工作。

基线对比解读

传统 harness 常因执行失败、状态丢失或工具限制导致模型表现被低估。Prime Agent 通过标准化执行、恢复、验证和资源核算,将策略构建完全留给模型,从而减少 harness 失败转化为模型失败。对比 ARC-AGI-3 的 30%→95.5%,证明评估基础设施的选择对模型能力测量影响显著,对工程实践而言,投资于弹性、可扩展的 harness 可带来显著收益。

行业影响

落地场景

Prime Agent 的持久化 REPL 与递归子 agent 架构适合多步、长时程、代码执行与验证的企业场景:

  • 企业级软件开发与 DevOps:自动生成、测试、部署代码,处理多仓库协作与持续集成。
  • 数据科学与 ML 工程:自动化特征工程、模型训练与实验结果追踪,持续优化 pipeline。
  • 自动化研究与内容生成:在电商、金融等领域生成报告、策略,并通过子 agent 并行执行任务。

商业价值

  • 降本:减少人工介入重复性编码、调试、验证,标准化执行与恢复机制减少 harness failure 转嫁给模型,提升任务成功率,降低 token 浪费。
  • 增收:加速产品迭代周期,使模型能力真正被释放(ARC-AGI-3 从 30% 到 95.5%),推动更高难度的自动化服务收费。
  • 体验提升:Agents View 提供人类可监控、干预的会话管理,提升企业客户对 AI 工作流的可信度与可控性。

与现有产品/工作流集成

Prime Agent 作为开源 harness,可与现有 LLM 推理服务(如 vLLM、TGI)和 agent 框架(LangChain、AutoGen)配合。通过持久层接口(如 SQLite/Postgres)连接记忆与状态,通过 API 暴露子 agent 通信。可嵌入 CI/CD 管道(GitHub Actions)、云函数或 Kubernetes 集群,使用容器化 daemon 管理长时程任务。

具体落地用例:

  • 电商平台:使用 Prime Agent 管理多店铺广告 campaign 的自动生成与 A/B 测试,子 agent 分别处理素材生成、投放优化、数据回收,持续运行数天。
  • 金融量化:自动化策略研究与回测,主 agent 分解任务给子 agent 处理数据清洗、因子挖掘、回测执行,持久记忆保存历史策略性能,持续改进。

局限

  • - **模型覆盖有限与新型失败模式**:论文主要在少数几个前沿模型(如 GPT-4o 和 Claude 3.5 Sonnet)上评估,未系统测试不同架构和规模,因此 harness 的通用性和对弱模型的提升幅度尚不明确。同时,尽管设计旨在防止执行环境错误传导给模型,但自身仍可能引入状态污染、子代理死锁等新失败模式,尤其在超长时程任务中难以定位和恢复。
  • - **依赖 Python 生态与高资源开销**:框架核心采用 IPython REPL 和 Python 工具链,对非 Python 工作流或需要实时物理交互的任务适配成本较高。`Continual Harness` 和 daemon-backed sessions 在长时间运行中需要持续的计算与存储资源,多代理并行进一步放大开销。此外,论文未对各个组件(RLM、持久状态、子代理通信)进行严格消融,难以判断性能提升的主要来源,给工业界采纳带来不确定性。
论文Seth Karten2026-08-24原文

相关内容