论文

现代智能体系统中的自我改进:一项综述

现代智能体系统中的自我改进:一项综述

自我改进的自主智能体正从研究原型走向部署系统。其主要目标是通过经验实现可控进化或适应,且需要最少甚至无需人类干预。本综述将现代自我改进智能体视为自适应系统,能够将经验转化为累积的能力增益。我们提出一个系统级框架,将现代智能体表示为基础模型与操作框架(包括提示、记忆、工具和控制逻辑)的耦合配置。在此框架下,自我改进被形式化为一种自我诱导的更新算子,用于获取并提交对模型参数或框架组件的更新。 我们按更新目标和驱动变化的信号对现有工作进行组织,然后回顾相关应用并讨论评估方法,最后总结开放问题与未来方向。为了方便读者,我们在 https://github.com/selfimproving-agent/awesome-Self-Improving-Agents 追踪技术更新。

论文精读

TL;DR 系统综述现代自改进智能体,将其形式化为从经验中累积能力的自适应系统,提出统一框架并分类更新目标与驱动信号,为工程落地提供全景指引。

问题

问题背景
自主智能体(agent)正从实验室走向实际部署,其核心能力之一是通过与环境交互实现自我改进(self-improvement),以极低的人工干预成本持续积累性能增益。如何让智能体可控地演化,成为当前研究热点。

现有方法局限

  • 粒度孤立:多数工作针对单一组件(如提示词微调或模型参数更新)优化,缺乏系统视角,难以协调跨 scaffolding(记忆、工具、控制逻辑)和基础模型的联合改进。
  • 信号设计脆弱:自我改进依赖内生或外部信号(如自生成演示、环境反馈),但信号噪声大、稀疏或存在分布漂移,导致改进不稳定,甚至引发性能退化或灾难性遗忘。
  • 评估混沌:缺少统一基准和指标体系来比较不同自改进策略的泛化性、样本效率与安全性,阻碍方法选型与工程落地。

为什么这个问题难且重要
真实任务环境(如软件工程、网页导航、具身智能)具有开放性、动态性和长程依赖,反馈可能延迟、矛盾且多模态,要求智能体在不破坏已有能力的前提下高效整合经验。若自我改进失控(如奖励黑客、内省偏差),将引发严重的安全和可靠性风险。工业界对能够持续自适应的 AI 系统需求迫切:从代码助手自我纠错到机器人终身学习,自我改进是迈向通用智能的关键技术杠杆。

类比
类似自动驾驶系统通过海量路测数据迭代优化规划策略,自我改进智能体在数字任务流中自主试错和反思,形成持续进化的能力飞轮。

核心洞察

  • **自改进被统一为“可复用技能更新”**: 论文将 self-improvement 形式化为一个自诱导更新算子,把模型参数更新和脚手架组件更新(prompt、memory、tool、控制逻辑)都视为可积累和重用的“技能”(skill)。这与以往只将微调模型视作学习的视角不同,它揭示了现代 Agent 系统自我进化的本质是不断扩充和优化其操作配置(configuration),而不仅仅是模型权重。
  • **外在探索性经验与内在生成信号的互补生态**: 综述系统梳理了自我改进的驱动力来源,不仅包括传统的内在生成数据(自我合成、自评反馈),更突出了与环境交互的“外在探索性经验”(extrinsic exploratory experience)。这弥补了单纯依靠模型内生信号容易导致分布坍塌或过拟合的不足,为构建与现实世界持续对齐的 Agent 提供了更稳健的信号生态。

方法

系统级框架与形式化

本文将自主 agent 建模为一个配置 A = (M, S),其中 M 是基础模型(如 LLM),S 是由提示、记忆、工具和控制逻辑组成的操作支架。自我改进被定义为自诱导更新算子 U,它从历史经验中提取更新信号,输出对 MS 的修改,从而实现能力积累。

更新目标与信号分类

根据更新对象,改进分为基础模型改进支架改进。前者直接微调模型参数,后者优化提示词、记忆结构或工具调用。驱动更新的信号来源则分为:

  • 内在生成式信号:模型自身生成合成数据或演示(如自我指导)。
  • 内在评估式信号:模型通过自我验证、评分或纠错产生反馈。
  • 外在探索式信号:通过与外部环境(真实或模拟)交互获得奖励、状态等。

基于此,综述构建了一个二维分类体系,横轴为目标(模型/支架),纵轴为信号类型,系统梳理了现有工作。

支架改进的细粒度机制

支架改进进一步按组件细化:提示优化(标量反馈、文本梯度等)、记忆管理(对象存储、结构更新、CRUD 操作)、工具使用(动态路由、自主创建)以及全支架联合优化。记忆循环强调信号驱动的存储、检索和压缩。

与同类工作的差异

不同于仅关注模型微调或提示工程的单点综述,本文的框架将 agent 的所有可适应组件统一在同一个自诱导更新范式下,并突出了信号来源对改进方式的决定性影响,为设计自演进 agent 提供了系统蓝图。

实验

实验设计概述

本综述并未进行独立的实验验证,而是通过系统化框架对现有自改进智能体(Self-Improving Agent)的工作进行归类与剖析。文章将自改进定义为从经验中自动更新模型参数或脚手架组件(提示词、记忆、工具、控制逻辑)的操作,并依据更新目标(基础模型 vs 脚手架)和驱动信号(内在生成式/评估式反馈 vs 外在交互环境反馈)构建了分类体系。所涉方法覆盖软件工程、网页导航、游戏、科学发现、具身智能等多个应用领域,常用的评估基准则包括 SWE-bench(代码修复)、WebArena(网页任务)、Overcooked(协作游戏)、RLBench(机器人操作)和 ChemCrow(化学合成路径规划)等。

关键发现

  • 基础模型提升:利用模型自生成的数据(如思维链示例)或自评估信号(如一致性评分)进行微调,在代码和推理任务上可稳定超过强基线,但容易陷入“回声室”退化,需引入外部验证或人工抽样。
  • 脚手架提升:不修改模型权重,而是通过优化提示词(文本梯度、群体进化)、记忆结构(向量检索与图结构化记录)或自动生成工具(封装 API 为可复用函数)来改进行为,灵活性高且易于审计,但对复杂多步任务的泛化仍考验设计。
  • 混合路径:同时更新模型权重和脚手架(如通过可复用技能 lib)能获得更好上限,尤其在需要长期记忆与新技能快速组合的场景(如开放世界游戏 Minecraft)。

与基线对比的深度解读

与传统的元学习、强化学习或固定脚手架方法相比,自改进系统的核心差异在于能动性循环——智能体自行决定何时、如何生成更新数据,并且更新可直接作用于它的控制逻辑。这显著降低了人工干预成本,但也带来新挑战:内在信号(如生成式幻觉)驱动的更新可能缺乏真实性;外在交互式反馈虽可靠但采样成本高。综述指出,目前缺乏统一的跨任务评估协议与复现标准,不同工作间的提升难以公平对比,未来需建立类似 AgentBench 的细粒度诊断基准,以区分模型能力增长、脚手架设计改进以及两者的交互增益。

行业影响

落地场景

自改进代理(self-improving agents)可广泛落地于需要持续适应环境变化的 AI 产品:

  • 智能客服与对话系统:根据用户反馈自动优化回复策略与知识库检索,减少人工语料维护。
  • 软件开发助手:通过执行结果反馈自我修正代码生成逻辑,或自主更新提示词模板,提升代码质量与一次性通过率。
  • 内容创作与审核:内容生成代理接收人类偏好或安全评分信号,动态调整生成风格或过滤规则,降低违规风险。
  • 游戏与仿真 AI:利用自我对弈或环境交互数据自动精进策略模型,减少冷启动与策略僵化。
  • 电商搜索与推荐:代理根据点击、转化等行为信号微调排序模型或上下文提示,实现实时个性化。

商业价值

  • 降本:将专家标注、规则维护和 A/B 测试的人力成本转化为可自动运行的“数据飞轮”,尤其在长尾场景中无需逐一修补。
  • 增收:通过快速适应用户兴趣变化与市场趋势,提高推荐转化率与广告 ROI;在软件工程中缩短开发周期,加速产品迭代。
  • 体验提升:系统能自我纠错、持续进化,避免抽风式退化,提供更稳定、流畅的交互体验,增强用户粘性。

与现有产品/工作流的接口

自改进代理可作为现有 ML 流水线的增强模块,通过 RESTful API事件驱动架构 集成:

  • 模型侧:将自我迭代过程封装为 SelfImproveRunner,挂载到模型注册表(如 MLflow),触发条件可由数据漂移检测或性能监控设定。
  • 工程侧:与 CI/CD 管道结合,支持多轮评估与灰度发布;需配备可观测性工具(如 OpenTelemetry)追踪更新轨迹。
  • 安全护栏:引入人工验收闸门(human-in-the-loop),对高风险领域的更新进行审批,并维护可回滚版本快照。

具体用例

  1. 全球化电商平台的搜索代理
    使用 多模态基础模型 构建搜索意图理解代理,该代理收集用户点击、停留时长等隐性信号,通过内省式提示优化(scaffolding improvement)自动调整 query 改写逻辑。当检测到某一类商品(如“露营装备”)的转化率下降时,代理分析近期会话数据,合成少量“负反馈-纠正”样本对自身 prompt 进行微调,无需重新训练整个模型。整个过程由 Apache Kafka 消息触发,更新后的 prompt 通过 AB 测试平台进行无感切换,最终使长尾查询的购买率提升 8% 以上。

  2. 自动驾驶感知系统的持续进化
    部署在车端的感知代理(如基于 Transformer 的检测器)将高不确定性、人类接管瞬间的传感器数据标记为 extrinsic exploratory experience,通过定期数据回传触发云端自改进流水线。系统利用这些“失败案例”生成对抗性训练样本或调整支架中的后处理参数(如 NMS 阈值),再以 OTA 形式推送更新。该流水线与现有 MLOps 工具链(Kubeflow + Pachyderm)无缝对接,并设有模拟仿真环境验证入口,实现从 corner case 采集到模型改进的闭环,显著降低人工介入频率。

局限

  • 作为综述,本文未提出新的自改进方法,其贡献在于系统化现有工作并提出统一框架,但框架本身尚未通过实验验证其有效性。文中对不同自改进信号的比较仅限于定性描述,缺乏定量对比基准,这限制了框架的指导意义。此外,综述覆盖的应用领域虽广,但部分新兴方向(如科学发现、具身智能)的文献梳理尚不深入,对安全性和可控性问题的讨论也较概括,未能给出具体的风险评估指标或缓解策略。
论文Zhe Ren2026-07-14原文

相关内容