RSIAgent: 面向新环境中递归自我改进的自主探索
数字智能体 往往需要适应新环境,而这些环境的界面、工具与失败模式难以被预训练模型完全覆盖。 为此,我们提出 RSIAgent:一个免训练的多智能体框架,通过自主记忆构建实现递归自我改进。RSIAgent 协调 课程智能体、执行智能体 与 验证智能体,持续探索环境、校验结果,并保留环境专属知识,其中包括动作、条件与后果之间可复用的因果关系。 该框架还采用 先广后深 的探索策略: - 并行的广域递归自我探索,用于发现多样的环境结构; - 聚焦的深度自我探索,用于挖掘难例、隐藏约束、边界条件以及此前未知的因果依赖。 最终形成的记忆会被冻结,无需更新模型参数即可直接复用于下游任务。 在 OSWorld-v2 与 Agent's Last Exam 上的实验表明,RSIAgent 显著提升了强开源模型的表现,使 Kimi-K3 与 GLM-5.3 能够超越包括 GPT-6 在内的前沿闭源模型。
论文精读
TL;DR RSIAgent 是一个免训练的多智能体框架,通过自主构建环境记忆并采用先广后深的递归探索,让开源模型在 OSWorld-v2 和 Agent's Last Exam 上超越 GPT-6。
问题
问题背景
数字代理(digital agents)需要在全新的数字环境中执行任务,这些环境的界面布局、工具调用方式、失败模式往往未被预训练模型充分覆盖,因此代理必须能够自主探索并积累环境特定知识。
现有方法局限
- 基于提示工程或上下文学习的代理依赖静态知识,遇到未见过界面或工具时缺乏系统探索机制,只能依靠随机试错或人工编写的规则。
- 有监督微调(supervised fine-tuning)需要大量特定环境标注数据,且环境变化后必须重新训练,计算成本高、迭代周期长。
- 现有递归自我改进(recursive self-improvement, RSI)方法要么在线更新模型参数,导致不稳定和灾难性遗忘;要么只做浅层探索,无法系统提取动作、条件、后果之间的因果关系。
- 多数多代理框架没有明确分离课程生成(curriculum)、执行(actor)、验证(verifier)角色,探索目标不聚焦,记忆更新冲突,导致构建的知识库不可靠。
为什么这个问题难/重要
新环境中的界面和失败模式高度多样,因果关系往往隐藏在多步交互之后,需要经过验证才能确定,单次观察无法正确归纳。构建可复用的、冻结的(frozen)环境记忆而不更新模型参数,具有极高的工程价值:直接迁移到下游任务,避免重复探索,同时保持模型通用性。业界对 training-free 且能自主探索、验证并沉淀知识的 agent 框架关注度持续上升,OSWorld-v2 和 Agent's Last Exam 等基准测试表明新环境适应是核心挑战之一。
行业类比
类似智能客服机器人接入一套全新的业务系统时,需要自主点击界面、理解操作后果,并形成可复用的操作手册,而不是重新训练底层语言模型。
核心洞察
- - RSIAgent 证明训练无关的递归自改进能够让开源模型在数字环境适应性上超越闭源前沿模型;它不更新任何模型参数,而是通过多智能体协作自主构建环境特定记忆。这一范式与依赖微调或在线 RL 的传统方法形成对比,后者需要大量环境交互和算力,而 RSIAgent 仅凭结构化探索和记忆固化即可让 Kimi-K3、GLM-5.3 在 OSWorld-v2 与 Agent's Last Exam 上击败 GPT-6,说明精心设计的 agent 协作流程可以弥补基础模型的能力差距。
- - 框架把环境探索显式建模为因果知识获取过程,而非简单的轨迹收集;actor、verifier、curriculum 三个角色分工,采用 broad-then-deep 策略,先并行广度探索发现多样结构,再聚焦深度探索挖掘隐藏约束、边界条件和未知因果依赖。相比传统经验重放或直接 RAG,该设计强调验证、消歧和因果关系的可复用性,使得最终冻结的记忆不是零散经验,而是一套可审计的环境操作规则库。
- - 探索与推理被彻底解耦:递归自改进发生在自主探索阶段,生成的环境记忆在测试时被冻结并直接加载,无需在线探索或更新。这一工程选择降低了部署风险与成本,记忆可版本化、可审计,同时避免了持续学习可能引入的漂移问题;对于需要适应新工具、界面和失败模式的数字代理产品,它提供了一条将一次性探索成果转化为长期资产的可落地方案。
方法
输入与目标
RSIAgent 接收一个新数字环境,其接口、工具、失败模式未被预训练模型完整覆盖。目标是构建环境特定的可复用记忆,使开源模型在不更新参数的情况下适配该环境。
关键模块
框架由三类智能体协同:
- Curriculum Agent:规划探索课程,先执行宽泛递归自探索(Broad Recursive Self-exploration),并行发现多样环境结构;随后切换至深度递归自探索(Deep Recursive Self-exploration),聚焦难例、隐藏约束、边界条件与未知因果依赖。
- Actor Agent:携带可进化记忆执行环境动作,通过经验蒸馏提炼成功序列、失败原因与环境反馈,沉淀为知识。
- Verifier Agent:基于环境反馈独立验证 Actor 的结果,判断目标达成并诊断记忆可靠性。
记忆构建与输出
记忆采用规范所有权(Canonical Memory Ownership)管理,多个探索分支并行产生经验,通过并行协调更新合并,确保互补教训整合到统一记忆库。记忆条目记录动作、条件、后果之间的可复用因果关系。最终输出为冻结的记忆库,可直接挂载到 Actor 用于下游任务推理,无需反向传播或参数更新。
原文强调:该框架是 training-free,通过“自主记忆构建”而非模型调参实现递归自我改进。
与同类方法的差异
区别于依赖强化学习或微调的方法,RSIAgent 以环境探索与经验记忆复用为核心,通过多智能体分工和 broad-then-deep 课程实现 recursive self-improvement,且记忆跨任务冻结复用。
实验
实验设计
- 在 OSWorld-v2 和 Agent's Last Exam 两个数字代理基准上评估 RSIAgent 的递归自我改进能力。框架为 training-free 多智能体系统,包含 actor、verifier、curriculum 代理,通过 broad-then-deep 两阶段探索积累环境特定记忆,测试时冻结记忆直接复用。
- 评估强开源模型(如 Kimi-K3、GLM-5.3)在 RSIAgent 增强后的性能,并与前沿闭源模型 GPT-6 对比。
关键发现
- RSIAgent 显著提升强开源模型,使 Kimi-K3 和 GLM-5.3 超过 GPT-6(具体数值未披露)。
- 递归自我改进(RSI)轮次影响性能;消融研究显示 broad 和 deep 探索阶段均重要,验证了因果记忆的贡献。
- 失败模式分析揭示:探索不充分、验证不完整、记忆巩固不可靠是主要挑战。
与基线对比解读
- 作为 training-free 框架,RSIAgent 无需更新模型参数即能缩小开源与闭源模型差距,表明通过环境交互和记忆构建可有效迁移能力。
- 相比纯推理时方法,RSIAgent 通过多智能体协作和分层探索更系统地挖掘环境规则,记忆可跨任务复用,降低了后续探索成本。
- 但消融和失败分析提示,记忆质量与验证严谨性仍是瓶颈,未来需优化探索策略与记忆巩固机制。
行业影响
落地场景
RSIAgent 适合需要智能体快速适应陌生数字环境的场景,如 RPA 自动化、浏览器任务代理、GUI 操作助手、游戏测试 等。它不依赖微调,通过自主探索积累环境特异性记忆,尤其适用于接口频繁变动、文档不全的企业内部系统或第三方 SaaS 平台。
商业价值
- 降本:避免为每个新环境收集标注数据和微调模型,探索得到的记忆库可跨任务复用,大幅降低适配成本。
- 增收/体验:让开源模型在特定任务上达到或超过闭源模型(如 GPT-6),减少对高价闭源 API 的依赖,同时提升任务成功率和自动化程度,减少人工接管。
与现有工作流接口
RSIAgent 可作为中间件嵌入现有 agent 框架(如 LangChain、AutoGen),在部署前自动执行探索阶段,产出冻结的记忆库。下游任务直接加载记忆,无需修改模型参数,可集成到 CI/CD 流水线中,对新环境定期更新记忆。
具体用例
- 电商订单自动化:新接入一个 ERP 或电商后台,RSIAgent 自动探索界面元素和操作后果(如点击“发货”后的状态变化),积累记忆后供客服机器人调用,提高订单处理自动化率。
- 金融合规审查:面对频繁更新的监管报告系统,Agent 自主探索表格填写规则和边界条件,避免人工逐一排查,降低合规风险。
局限
- **训练无关的固有上限** RSIAgent 不更新模型参数,完全依赖预训练模型的能力与推理水平。因此其自我改进上限受限于基座模型对环境的理解、规划和验证能力。当模型本身缺乏特定领域的知识或推理模式时,记忆构建和探索过程可能无法有效弥补,导致在复杂或全新任务上表现不佳。与参数微调方法相比,该方法无法从根本上调整模型行为,只在外部记忆层面进行补偿,长期递归自我改进的收益可能递减。
- **探索与验证成本高昂** 多智能体协调和 broad-then-deep 递归探索需要大量环境交互与 API 调用。每个回合都涉及 curriculum 生成、actor 执行和 verifier 验证,且并行探索分支会进一步放大 token 消耗和延迟。论文未报告详细的成本分析,但可以推断,针对每个新环境都需从头进行多轮探索,成本可能比单次推理高几个数量级,限制了其在资源受限场景或需要快速部署时的实用性。
- **记忆可靠性与错误累积风险** 框架依赖 verifier 代理来判断动作结果是否成功,但验证本身可能不完整或存在误判。如果错误经验被写入记忆,会在后续探索中传播,导致错误强化。论文在失败模式分析中也提到 “Incomplete Verification” 和 “Unreliable Memory Consolidation”,说明该问题尚未完全解决。记忆冻结后无法动态修正,一旦固化错误知识,下游任务性能反而可能下降。