Meta^n:通过突现深度的递归自我改进
自我改进的大语言模型智能体往往只优化答案,而非产生答案的过程。添加元层级的系统会将该层级固定,而自我编辑的系统必须保留部分编辑机制不变以维持稳定,因此实际能达到的元深度约为两层。本文提出 Meta^n,它保持元操作固定,改为对输入进行递归。该操作 Ω 反复作用于自身产物:读取下方求解器栈的轨迹以及生成这些轨迹的代码,然后将下一层写为策略预处理与可调用辅助函数库。 由于 Ω 从不改变,系统不会失稳;由于输入严格增长,每一层都拥有比上一层更高的视角。深度由收敛决定而非预先设定,并通过进化档案对层级链进行搜索。在两个骨干模型上,Meta^n 在全部八个基准族上均优于先前的自我改进智能体,尤其是在为抵制技能记忆而构建的 ARC-AGI-2 上成为唯一取得非零分数的系统。 消融实验表明,递归带来的大部分收益来自每一层传递给下一层的条件设定;尽管没有任何提示指定,随深度增加仍会出现明显的层角色分化。
论文精读
TL;DR Meta^n 通过固定元操作 Ω 递归处理自身求解轨迹与代码,实现稳定且深度可扩展的自我改进,在 ARC-AGI-2 等八个基准上超越现有自改进代理,突破传统元深度两层限制。
问题
问题背景
自我改进 LLM agent 是当前 AI 研究焦点,目标是让模型不仅输出更好的答案,还能改进生成答案的过程本身。
现有方法局限
- 单层自改进:只优化最终输出(如答案或提示),不触动推理策略,难以应对需要多步抽象和策略转移的任务。
- 固定 meta-level:系统引入一个固定的高层控制器,但该层级自身不进化,导致改进能力有明确上限。
- 自我编辑:修改自身代码或权重时必须冻结部分编辑机制以保证稳定性,实际可实现的 meta-depth 不超过 2,无法形成更深层的策略-战术分层。
- 结果:在 ARC-AGI-2 等抵抗技能记忆的基准上,多数自改进 agent 得分为零,说明现有方法缺乏真正的递归抽象能力。
为什么这个问题难且重要
递归自改进的核心挑战是稳定性与深度的矛盾:增加 meta 层级容易导致系统崩溃或性能退化,而固定层级又无法突破深度瓶颈。业界对能处理开放世界、需要分层抽象和策略迁移的任务(如数学发现、算法设计)需求强烈,这类任务要求模型能从自身推理痕迹中提炼更高视角的策略,而非仅优化单次输出。因此,如何在不破坏系统稳定性的前提下实现可扩展的 meta-depth 是通向更强通用推理的关键。
行业类比
这类似于多智能体系统中 策略网络 与 价值网络 需要分层迭代优化;或者像编译器在自举过程中保持核心不变、逐步扩展优化 pass,才能安全提升编译能力。
核心洞察
- 固定元操作 Ω 递归应用于自身产物,实现稳定且可扩展的元深度。相比以往自我改进系统要么将元级别固定、要么因自我编辑需保留稳定部分而将元深度限制在约两层,Meta^n 保持 Ω 不变、仅递归输入,既避免系统不稳定,又突破深度上限,每一层从更高视角推理,深度由收敛而非预设决定,为工程上部署递归自我改进提供了安全路径。
- 进化存档搜索层链,让不同深度的层涌现出不同角色,且主要增益来自层间的条件传递。消融实验显示深度 2 层产生跨任务通用原语,深度 3 层出现专门化与干扰,更深层进行修正,这些角色并未通过 prompt 预先指定;同时大部分提升来自每层传递给下一层的 conditioning(策略、战术等),而非单纯增加递归层数,提示设计递归系统时应优先优化层间信息传递的质量。
- 在 ARC-AGI-2 基准上唯一得分非零,表明该方法能抵抗技能记忆、实现抽象推理。ARC-AGI-2 专为防止通过任务记忆刷分而设计,传统 LLM 表现接近随机,Meta^n 通过递归元操作构建愈发抽象的策略库,无需大量任务特定数据即可泛化,为评估模型真实逻辑推理能力提供了可信指标。
方法
输入与初始化
- 输入为任务描述、底层求解器(solver)的执行轨迹(traces)以及生成这些轨迹的代码。
- Meta^n 从一个初始求解器栈开始,栈中每一层都记录其推理过程和实现。
关键模块:固定元操作 Ω
- Ω 是一个固定不变的元操作,本身不被修改,因此系统不会因自编辑而失稳。
- Ω 读取当前求解器栈下方的轨迹和代码,生成下一层:一个战略性预处理模块(strategic pre-process)和一个可调用辅助函数库(library of callable helpers)。
- 这样每一层不仅输出答案,还输出一个“层”,为下层提供改进的执行条件。
递归执行与深度控制
- 通过包装器
M_d运行新生成的层,得到新的轨迹;这些轨迹连同旧输入一起作为 Ω 的下一轮输入,因此输入严格增长,每一层从更高视角推理。 - 递归深度不由预设层数决定,而是通过收敛准则(例如相邻层输出差异小于阈值)自动停止,避免无限递归。
- 提供线性递归(单链推进)和进化档案(evolutionary archive)两种编排模式:后者维护多条层链,按性能筛选并组合,实现跨链搜索。
- 引入consolidation guard 防止深层回归,确保深度增加不会破坏已获得的性能。
输出与推理
- 最终输出是一个多层递归构建的求解器栈,测试时可选用最优层链由 agentic solver 执行,得到任务答案。
- 消融显示,主要性能增益来自层间传递的条件化信息(conditioning),而非单纯增加代码量。
与同类自改进方法(固定单一元层级或自编辑)不同,Meta^n 保持 Ω 不变而递归增长输入,突破了约两层的元深度上限,同时通过固定操作避免了系统失稳。
实验
实验设计
Meta^n 在 八个基准家族 上进行评估,覆盖 ARC-AGI-2、CO-Bench、数学与算法发现、TerminalBench 2.0 及文本分类等任务,并在两种 backbone(如 GPT-5.2 与 Gemma 系列)上验证。方法包含线性递归与进化档案两种编排模式,通过收敛条件自动决定深度,并与 OpenEvolve、Gödel Agent 等基线进行算力平价对比。消融实验隔离了递归深度、层间条件传递等变量。
关键发现
- ARC-AGI-2 上 Meta^n 是唯一得分大于 0 的方法,而该基准专为防止技能记忆设计。
- 在所有八个基准家族上 Meta^n 超越先前的自改进智能体。
- 消融显示大部分递归增益来自每一层向下一层传递的 conditioning,而非单纯增加层数。
- 深度层级角色自然涌现:第 2 层生成通用原语,第 3 层出现专门化与层间干扰,更深层(4-6)承担修正与细化,无需 prompt 显式规定。
基线对比解读
传统自改进系统受限于固定元层级或自我编辑的不稳定性,实际元深度通常不超过二。Meta^n 保持元操作 Ω 不变,仅对输入递归,因此避免了自我修改带来的稳定性风险;输入严格增长使每一层从更高视角推理。与 OpenEvolve 的跨任务迁移对比显示计算平价下 Meta^n 仍有优势;Gödel Agent 两个配置均出现平台期,而 Meta^n 通过收敛阈值和进化档案持续改进。这一设计将深度从预先设定转为由数据驱动的收敛过程。
行业影响
落地场景
Meta^n 可嵌入需要深度推理与自适应策略搜索 的 LLM 代理系统。典型场景:
- 企业级自动化软件开发代理:在代码生成、自动调试、代码审查等任务中,代理利用递归层不断提炼预处理策略与可调用辅助函数库,适应不同代码库风格与长尾问题。相比一次性生成或固定提示工程,能随任务复杂度自动增加推理深度。
- 金融风险分析与研报生成:面向复杂金融产品分析,代理通过多层递归将原始数据逐步转化为结构化假设与结论,每一层基于上一层条件化输出,提升分析深度与解释性。
商业价值
- 降本:减少针对特定任务微调或人工设计提示的工作量,递归自我改进让通用模型在推理时自适应提升,降低维护与适配成本。
- 增收 / 体验提升:提高代理在新颖或少样本任务上的成功率(例如在 ARC-AGI-2 上唯一得分非零),使产品覆盖更广泛的长尾需求,提升客户信任与留存。
- 稳定性:固定
Ω元操作避免自我编辑引发的不稳定,降低生产环境故障率,这是相对其他自改进系统的关键差异。
与现有工作流接口
Meta^n 是模型无关的推理包装器,可在现有 LLM 推理服务(如 vLLM、TensorRT-LLM)上层集成,通过编排器管理递归调用。与 RAG、工具调用框架(LangChain、AutoGen)可结合:将检索结果或工具输出作为输入的一部分,递归层负责策略规划与条件化。进化档案可作为外部存储,与现有向量数据库或任务元数据系统对接。集成成本主要在于实现 Ω 驱动器和 wrapper 逻辑,无需修改基础模型权重。
局限
- **固定元操作的上限**:Meta^n 保持 Ω 不变,只对输入递归。这避免失稳,但也使系统无法改进自身的元操作。随深度增加,固定 Ω 的策略可能不再适配更高层推理,导致收益递减或需人工重设计。与可修改编辑机制的自指方法相比,Meta^n 放弃了对元层的自适应能力,长期自我改进存在理论瓶颈。
- **计算与上下文开销**:递归构建多层和进化档案搜索显著增加推理成本。每层需读取下层 traces 和代码,输入长度随深度线性增长,受上下文窗口限制。论文虽报告 wall-clock cost,但未提供与基线在相同计算预算下的严格公平对比,可能掩盖效率问题。实际部署中深度由收敛决定且可能很深,导致延迟与成本不可控。
- **评估范围与泛化性**:实验仅在 Gemma 与 GPT-5.2 两个 backbone 上覆盖八个 benchmark family,虽较广但对开放域、交互式任务的迁移证据有限。ARC-AGI-2 上得分虽高于零但绝对分数可能仍低,说明能力提升幅度有限。论文也未系统分析失败模式与跨领域稳定性,需更多独立复现验证。