论文

Generalized Agent Iteration:面向迭代策略改进与递归自我改进的统一形式化框架

Generalized Agent Iteration:面向迭代策略改进与递归自我改进的统一形式化框架

当我们谈论 递归自我改进(recursive self-improvement, RSI)时,讨论的究竟是现象、机制,还是前景?面向自主且持续演化的智能,RSI 已在多种尺度上被主张,却始终缺少一个能形式化描述这些新兴实例的统一框架。它在经典领域的对应物——迭代策略改进(iterative policy improvement)——由 generalized policy iteration(GPI)刻画:该框架适用性广、理论性质清晰,但其前提是更新原则与评估基准都位于 agent 之外。 为此,本文提出 Generalized Agent Iteration(GAI),将迭代策略改进与 RSI 描述为同一学习范式的两个特例。GAI 把 agent 定义为系统内一组可修改组件的配置,并将学习过程建模为 agent evaluation 与 agent improvement 的循环。 两个关键调节维度区分了不同实例: 1. 改进机制本身是否属于 agent; 2. 其所依据的评估标准是否锚定在 agent 之外。 前者划定了 GPI 与 RSI 的边界,后者则决定系统的极性:anchored、goal drift 或 fully self-referential。 此外,作者用这组坐标把现有系统放到同样的两条轴上,使 递归自我改进 的缺陷能够被逐条陈述。本文视自身为探索 RSI 形式化刻画的第一步:它立足于经典理论,使现有系统之间可比,并为分析与设计新系统提供有原则的基础。

论文精读

TL;DR 提出 Generalized Agent Iteration (GAI) 框架,用两个维度统一迭代策略改进与递归自我改进,为 RSI 提供可比较的形式化坐标。

问题

问题背景

当前 AI 学习范式沿两条路径演化:经典 迭代策略改进(GPI) 在强化学习(RL)中理论成熟,而 递归自我改进(RSI) 在自主智能与 AGI safety 讨论中频繁出现,但两者缺乏统一形式框架。

现有方法局限

GPI 是一个有效抽象:将策略评估与策略改进交替进行,但前提是更新原则与评价基准均来自 agent 外部(如固定奖励、人工设计损失)。这使得 GPI 无法刻画 RSI 的核心特征——改进机制和评价标准内部化。另一方面,已有 RSI 系统(如 Gödel Machine、self-referential agents)各自为政,缺少共同坐标系来比较它们的结构差异和潜在缺陷;对“目标漂移”“完全自指”等现象没有可操作的正式定义。

为什么这个问题难/重要

RSI 涉及自指、自我评估与无基础评价的递归循环,容易引发不可控的目标变异或停滞。由于缺乏形式化刻画,研究者难以系统性分析哪个环节引入风险,也无法比较不同自改进架构。业界关注自主代理和模型自改进能力,但安全性与性能改进之间缺乏理论桥梁。一个既能涵盖经典 GPI 又能定位 RSI 的框架,可为设计和审计自改进系统提供原则基础。

行业类比

类似自动驾驶中模块化策略迭代(外部评测)与端到端在线学习系统(内部评测)的差异:没有统一框架,难以判断系统何时进入危险的自指循环。

核心洞察

  • GAI 框架通过两个可调节的旋钮将迭代策略改进(GPI)与递归自我改进(RSI)统一为同一学习范式的两种实例:旋钮一是改进机制是否属于 agent 内部,旋钮二是评估标准是否外部 grounded。这个角度独特在于,传统 GPI 理论假设更新原则和评估基准都在 agent 外部,而 RSI 缺乏形式化框架;GAI 首次用经典理论坐标系统一两者,使 RSI 从模糊概念变为可分析的机制,并与 GPI 的理论性质直接衔接。
  • GAI 的第二个旋钮将自改进系统划分为 anchored、goal drift、fully self-referential 三类极性,从而把 RSI 的缺陷(如目标漂移)定位为评估标准失去外部根基的具体条件。以往对 RSI 风险的讨论多停留在定性层面,GAI 使得缺陷可以“一次一个条件”地被陈述和比较,为后续设计安全的自我改进系统提供了原则性基础,也使现有系统(如 Gödel Machine、共同进化评估器)能够在同一二维平面上对照。

方法

方法核心:从输入到输出

输入:一个由可修改组件构成的系统(agent)及其任务环境与评价基准。

关键模块:GAI 将学习过程建模为 agent 评估 与 agent 改进 的迭代循环。

  1. Agent 评估:依据某个评价基准对当前 agent 配置打分,产生性能信号。
  2. Agent 改进:利用该信号修改 agent 的组件配置,生成新的 agent。

两个核心旋钮区分不同实例:

  • Dial 1——改进机制是否属于 agent 自身:若改进机制位于 agent 外部(例如经典策略迭代中,更新规则由设计者固定且不被 agent 修改),则为 GPI(广义策略迭代);若改进机制本身也是 agent 可修改组件的一部分,则为 RSI(递归自我改进)。这一旋钮划定了 GPI 与 RSI 的边界。
  • Dial 2——评价基准是否外部接地:若评估标准完全来自系统外部(如固定奖励函数或人工评判),则为 锚定(anchored);若评估标准部分或全部由 agent 自身生成或修改,则可能产生 目标漂移(goal drift) 或 完全自指(fully self-referential)。

输出:一套统一坐标系,可将任意迭代改进系统放置于“改进机制是否内化”与“评价标准是否接地”两个维度上,并明确其极性(锚定 / 目标漂移 / 自指)。框架使 RSI 的缺陷(如自评偏差、无接地基、目标漂移)可按条件单独陈述。

差异点:与 GPI 仅描述外部更新原则和外部评价基准不同,GAI 首次将 agent 的边界和评价标准的来源作为可调参数,在同一形式框架内同时涵盖经典迭代策略改进与递归自我改进。

实验

实验设计

本文为纯理论框架论文,未包含传统实验数据集或数值对比。其“实验”体现为对现有自我改进系统(如固定外环、Gödel Machine、共进化评估器)的概念定位与缺陷分析。

关键发现

GAI 框架将迭代策略改进与递归自我改进统一为同一学习范式:通过两个拨盘区分改进机制是否属于智能体、评估标准是否外部接地。第一拨盘区分 GPI 与 RSI,第二拨盘区分锚定、目标漂移、完全自指三种极性。

与基线对比

与 GPI 相比,GAI 显式允许改进机制和评估标准内置于智能体,从而涵盖递归自我改进;其坐标化表示使不同系统的缺陷可逐一陈述,例如无接地基座导致的 目标漂移。该框架为分析现有系统和设计新系统提供了原则化基础。

行业影响

落地场景

GAI 框架为自改进 AI 系统的设计、监控与故障诊断提供了统一语言。典型场景包括:推荐系统 中的策略迭代循环(如电商平台的商品排序、内容平台的 feed 排序)、自动驾驶 决策模型的在线更新、以及 企业级 LLM Agent 的自我改进流水线。例如,一个电商平台可以用 GAI 的两个 dial(改进机制是否在 agent 内部、评估标准是否外部锚定)来评估其推荐策略更新流程是否已经滑向目标漂移,从而在部署前拦截风险。

商业价值

主要价值在 运维降本 与 系统可靠性提升。通过显式区分 anchored、goal drift、fully self-referential 三种极性,团队可以在开发早期识别自改进系统的缺陷(如无根基的自我评估导致性能虚高),减少线上事故和人工回滚。对提供 Agent 平台的企业,GAI 可作为合规与安全审计的参考模型,帮助客户信任其产品的迭代边界。长期看,它可能催生新的中间件产品:自改进系统的“体检工具”。

与现有工作流集成

GAI 可直接作为 MLOps / LLMOps 栈中的一个评估层。实现上,可将 GAI 的 dials 编码为配置项(如 evaluation_grounding: external|internal),并集成到 CI/CD 流水线中,在每次 agent 更新时自动计算 polarity 并生成报告。同时也可对标经典 GPI (如 policy iteration / value iteration)的诊断实践,提供 Python 库或插件,与现有 RL 框架(如 Ray RLlib、Stable-Baselines3)对接,使团队无需重构即可获得自改进系统的可观测性。

局限

  • 本文明确属于概念框架研究,**GAI** 尚未转化为可执行的算法或给出实证验证;全文主要工作是形式化定义与分类现有系统,没有在具体任务或基准上展示该框架的分析或设计优势,因此其实际工程指导价值仍有待检验。
  • 框架中「agent」被定义为系统中可修改组件的配置,但缺乏严格的数学形式化,例如未定义状态的表示、改进算子的性质或收敛条件;这使得不同系统之间的比较更多依赖定性判断,难以进行定量测度或自动化分析,可能削弱框架的可证伪性与预测能力。
  • 与已有工作(如 **Gödel Machine**、**Reflective Oracles**)相比,**GAI** 在剖析 RSI 缺陷时仍以分类和列举为主,没有提出新的理论保证或设计准则;此外,框架主要针对单智能体、静态评估标准等简化场景,对多智能体交互、非平稳环境和分布式自改进等复杂情形的覆盖不足。
论文Hongyao Tang2026-09-11原文

相关内容