Memento 3: 通过反思式规则手册实现的基于模型的递归自我改进
在陌生环境中行动,智能体 需推断世界如何运作并随新证据修正理解;但有限观测可能同时支持多个世界模型,它们能解释过去的交互,却对未见状态给出不同预测。 Memento 3 延续 Memento 系列,让冻结的 LLM 智能体通过外部记忆持续学习显式世界模型。智能体维护一份自然语言 规则手册(rulebook) 作为持久语义记忆,记录关于环境动态的可修正假设,并把未知部分保持未指定;该规则手册被编译为可执行代码以支持预测与规划。通过 观测—反思—规则修正—编译—验证 的持续循环,智能体用预测误差同时改进规则手册与代码;只有当 LLM 判定代码忠实于规则手册、且逐单元重放能复现观测转移时,更新才会被接受。 作者将该过程视为通往 递归自我改进(RSI) 的基于模型路径:智能体自主探索环境、修正世界模型,并以经核验的更新指导后续交互与学习,而底层 LLM 保持冻结。群体扩展则并行维护多个世界模型,共享交互证据并以其预测引导探索。 在 ARC-AGI-3 上,单模型智能体通关全部 25 个公开游戏的所有关卡,平均 RHAE 达 100.0,仅用人类动作数的 44%。Atari Pong 案例中,学得的反馈控制器在三段开局不同的回合里均以 21:0 取胜,且无需额外 LLM 调用。
论文精读
TL;DR Memento 3 让冻结 LLM 智能体通过自然语言规则簿与可执行代码的持续反思-编译-验证循环,在 ARC-AGI-3 全部 25 个公开关卡上达到 100.0 RHAE,且动作数仅为人类的 44%,展示了基于模型的递归自改进路径。
问题
问题背景
在开放环境与交互式任务中,LLM agent 需要在陌生场景下持续推断环境规则、修正自身认知,并据此做出决策。这类能力正成为通用智能体的核心挑战。
现有方法局限
- 纯端到端策略依赖隐式记忆与上下文窗口,无法显式维护可修正的世界模型,遇到分布外状态时容易产生错误泛化。
- 神经世界模型(如 Dreamer 系列)虽支持预测,但参数化表征难以进行符号级规则修正与验证,且训练需要大量交互样本。
- 基于 LLM 的反射机制(如 Reflexion、Voyager)将经验写入文本记忆,但缺乏可执行、可验证的编译步骤,规则与代码之间缺乏一致性约束,容易积累矛盾或幻觉。
- 现有方法往往把规则学习与规划执行割裂,难以在预测错误时自动触发结构化修订。
为什么难且重要
真实环境中,有限观测可能同时支持多个相互冲突的世界模型,它们在已见轨迹上表现一致,却在未见状态上产生不同预测。这要求 agent 具备显式的不确定性建模与可验证的假设淘汰机制。
同时,递归自改进要求模型能自主探索、发现预测错误、修订规则、验证更新,并让更新后的模型指导后续学习,而底层 LLM 参数保持冻结。这不仅是学术问题,也直接关系到工业界能否构建长期稳定、可审计的自主 agent。
行业类比
类似自动驾驶系统在陌生路况中,需要从少量传感器数据里不断修正对交通参与者的行为模型,并用仿真或回放验证新规则后再上路。
核心洞察
- 规则手册作为可编译的显式世界模型,让冻结 LLM 通过预测误差驱动递归自改进,无需梯度更新。 该工作区别于常见的 LLM 智能体反思机制:它不把历史经验直接注入上下文,而是维护一个自然语言规则手册作为持久语义记忆,未知部分保持欠指定,然后编译为可执行代码。每次交互后,利用预测误差触发规则修订,再通过 cell-exact replay 验证修订代码与观察完全一致,形成 observation→reflection→revision→compilation→verification 的闭环。这为模型-based 持续学习提供了脱离参数修改的路径,避免灾难性遗忘,同时保留可解释性和可审计性。
- 验证机制采用 cell-exact replay 与 LLM 忠实性判断双重门控,确保修订规则严格对齐环境动态,抑制幻觉。 相比传统基于 LLM 的规则生成,Memento 3 不仅要求更新后的代码通过单元级重放测试(覆盖已观察 transition),还要求 LLM 判断代码是否忠实于规则手册。这种强一致性约束防止智能体为拟合少量样本而引入过度特化的规则,在探索数据稀疏时依然保持世界模型的泛化能力。工程实现上,可将该双重验证内嵌于持续学习流水线,作为规则更新的安全闸门。
- 在 ARC-AGI-3 上以 44% 人类动作成本完成全部 25 个公共游戏,RHAE 达 100.0,说明显式规则驱动方法在抽象推理任务上具备高样本效率。 大多数 LLM 智能体在 ARC 基准上依赖密集试错或程序搜索,而 Memento 3 通过可执行的规则手册直接建模环境变换,利用模型-based 规划减少无效交互。Atari Pong 案例进一步表明,学习到的反馈控制器可在无额外 LLM 调用的情况下稳定制胜,验证了该框架从符号推理到连续控制的迁移潜力。
方法
输入与核心记忆
Memento 3 以环境交互记录为输入,固定底层 LLM 权重,通过外部记忆实现持续学习。核心数据结构是自然语言规则书:用可修订的假设描述环境动态,对未知部分显式保留未指定状态,避免过度承诺。规则书作为持久语义记忆,与可执行代码分离。
关键循环:观察 → 反思 → 修订 → 编译 → 验证
- 观察:收集当前交互状态与预测结果。
- 反思:LLM 比较预测与实际,定位规则书中可能出错的假设。
- 规则修订:LLM 仅修改受影响的规则条目,保留其余未指定部分。
- 编译:将更新后的规则书自动编译为可执行代码(用于预测和规划)。
- 验证:更新代码必须通过双重检查:
- 忠实性判断:LLM 判断代码是否忠于规则书;
- cell-exact replay:在历史交互轨迹上逐单元重放,必须精确复现观测到的状态转移。
只有通过验证的更新才被接受,否则回退到上一稳定版本。该循环构成模型驱动的递归自改进:agent 自主探索、修订世界模型,并用已验证更新指导后续交互和学习,而底层 LLM 保持不变。
规划与群体扩展
规划采用信念空间控制:将规则书与历史观测转化为当前状态的后验信念,可执行代码基于该信念进行前向模拟,选择最大化信息增益或任务奖励的动作。
群体扩展并行维护多个规则书/代码实例,共享交互证据,通过各自预测差异引导探索方向;最终由验证通过的模型决定联合策略。
差异点
与先前基于隐式世界模型或无验证回滚的 LLM agent 方法不同,Memento 3 强制显式的、可编译的、通过 replay 验证的规则书更新,为模型驱动的递归自改进提供了可追溯且可复现的记忆更新路径。
实验
实验设计
Memento 3 在 ARC-AGI-3 上评估单模型 agent 的持续学习能力,覆盖 25 个公开游戏。agent 通过观测、反思、规则修订、编译和验证的循环,在冻结 LLM 下自主探索环境、修正世界模型。另在 Atari Pong 做案例研究,检验学习到的反馈控制器在无进一步 LLM 调用时的表现。此外有 population 扩展,并行多个世界模型共享证据。
关键发现
- 单模型在 ARC-AGI-3 通关全部 25 个游戏的所有关卡,完成率 100%。
- 平均 RHAE 达 100.0,即动作效率与人类相当;但实际动作计数仅为人类的 44%,说明 agent 用更少动作达成相同结果。
- 在 Atari Pong 中,学习到的反馈控制器在三种不同开局下均以 21:0 获胜,且不再调用 LLM,证明世界模型可固化为高效策略。
对比解读
与传统 LLM agent 依赖在线推理不同,Memento 3 通过规则手册编译为可执行代码,将高层语义知识转化为确定性预测与规划,显著降低 LLM 调用频率和动作冗余。RHAE 100 与动作计数 44% 的组合表明,agent 不仅达到人类水平效率,而且在动作经济性上优于人类,这隐含了模型对环境动态的精确把握。相比无模型或少样本方法,递归自我改进使 agent 能在不更新 LLM 参数的情况下持续适应新环境,为终身学习和资源受限场景提供了可落地路径。
行业影响
落地场景
Memento 3 的核心能力是让冻结 LLM 通过外部记忆持续学习环境动态,主动探索、反思规则并生成可验证代码。这适用于需要自主适应变化环境的产品:
- 机器人/自动驾驶仿真测试:在模拟器中让 Agent 自主探索交互规则,减少人工编写环境模型。
- 游戏 AI 与虚拟角色:开放世界游戏中 NPC 持续学习关卡机制,自动生成策略。
- 电商智能客服/推荐 Agent:面对频繁变化的业务规则(促销、库存、合规),Agent 自行更新规则手册,减少人工维护。
商业价值
主要落在降本线和体验提升线:
- 降本:通过规则手册 + 代码编译 + 验证回放,Agent 对未知状态的预测错误驱动自我修正,显著减少人工干预和重新训练成本。在 ARC-AGI-3 上单模型使用 44% 人类动作数即清空全部关卡,意味着交互效率高,可节省推理算力与试错成本。
- 体验提升:在 Atari Pong 中学习到的反馈控制器无需额外 LLM 调用即可赢得 21:0,说明学习后的策略可固化执行,提供低延迟、高稳定性用户体验,适合实时交互产品。
与现有产品/工作流接口
Memento 3 可集成到现有 AI Agent 编排栈中,作为世界模型更新模块:
- 接入已有的 LLM Agent 框架(如 LangGraph、AutoGen),将规则手册存储在外部记忆库(如向量数据库或 Git 仓库)。
- 通过 观察-反思-修订-编译-验证 循环,把新学到的规则编译成可执行代码,部署为轻量级预测器,替代原 LLM 的反复调用。
- 人口扩展支持多个世界模型并行,共享交互证据,可用于 A/B 测试或集成投票,提升决策鲁棒性。
具体落地 use case:
- 跨境电商智能定价 Agent:平台促销规则与物流约束频繁变化,Agent 持续更新规则手册,编译出定价函数,在每次价格调整后通过回放验证,自动适应新规则而不需重新训练模型。
- 金融风控规则引擎维护:反欺诈规则随攻击模式动态变化,Memento 3 让 Agent 从新欺诈案例中反思修订风控规则,编译成可执行检测代码,人工审核通过后上线,降低规则更新周期从周级到小时级。
局限
- **底层 LLM 能力依赖**:Memento 3 的整个闭环——反射、规则修订、代码生成与验证——都依赖同一个冻结的 LLM,作者也承认性能受限于该 LLM 的推理和编程能力。若底层 LLM 无法正确生成可执行代码或准确判断代码与规则簿的忠实性,错误更新可能被接受,并在后续迭代中累积,导致灾难性遗忘或错误世界模型。此外,该方法需要多次 LLM 调用(预测、反思、验证),推理成本较高,限制了在实时或资源受限场景中的部署。
- **实验环境单一且规模小**:实验仅在 ARC-AGI-3 的 25 个公开游戏和 Atari Pong 上进行,缺乏更广泛的基准测试(如 Procgen、NetHack 或连续控制任务)。特别是 ARC-AGI-3 样本量极小,全清所有公开游戏可能包含对特定游戏规则的重度调参或偶然性,难以证明方法的通用性。论文未报告在私有测试集上的表现,也无法排除过拟合。与在多样环境中验证的通用方法相比,证据强度不足。
- **自动化程度与对比不足**:相比基于梯度的世界模型(如 Dreamer 系列)或端到端强化学习,Memento 3 需要手工设计规则簿结构、编译模板和验证协议,自动化程度有限,且未系统比较这些手工组件对最终性能的贡献。人口扩展虽然并行维护多个世界模型并共享证据,但论文未分析不同人口规模、多样性策略或通信机制的影响,可能只是简单的集成,并未展现显著增益。此外,与更轻量的内存增强 LLM 代理(如 Reflexion)相比,额外的代码编译和验证流程是否带来实质性提升,缺乏直接消融对比。