论文

OPD-Evolver: 通过在线策略蒸馏培养整体智能体演化器

OPD-Evolver: 通过在线策略蒸馏培养整体智能体演化器

记忆已成为自演化智能体的标准基础组件,但保留经验并不等同于学会如何通过经验进行演化。现有记忆智能体能够存储轨迹、检索反思或积累技能,但通常缺乏整体能力以选择有用经验、据此行动、编写可复用知识并维护不断增长的仓库。 我们提出 OPD-Evolver,一种慢-快协同演化框架,通过在线策略自蒸馏培养这样的智能体演化器。在快循环中,OPD-Evolver 与四层记忆层级交互,以读取、使用、编写和维护经验,实现快速测试时演化。在慢循环中,结果校准的记忆归因与特权事后分析将这些能力蒸馏到可部署策略中。 在跨领域基准测试中,OPD-Evolver 超越记忆系统(如 ReasoningBank)高达 11.5%,并超越基于训练的方法(如 Skill0)约 5.8%。进一步分析表明,OPD-Evolver 内化了高价值经验与记忆管理,使 OPD-Evolver-9B 能够挑战巨量模型如 Qwen3.5-397B-A17B 和 Step-3.5-Flash,指向超越记忆增强型智能体、迈向真正合格的智能体演化器。

论文精读

TL;DR OPD-Evolver 通过快慢双循环协同进化与在策略自蒸馏,赋予智能体读、用、写、维护记忆的全能进化能力,9B 模型可匹敌数百 B 巨型模型。

问题

问题背景

自演化智能体(self-evolving agents)通过记忆系统在交互中持续学习,但当前领域面临的核心矛盾是:记忆存储 ≠ 演化能力。许多工作聚焦于如何记录更长的对话历史或检索更多样的经验,却忽略了智能体是否真正学会了“如何通过经验演化”。

现有方法局限

现有记忆增强智能体(如 ReasoningBank、Skill0 等)存在结构性欠缺:

  • 被动存储:仅保存原始轨迹(trajectories)或片段反思(reflections),缺乏主动筛选高价值经验的机制,导致记忆库快速膨胀且充满噪声。
  • 使用与写入割裂:智能体要么只能读取记忆辅助即时推理,要么只能写入技能库供后续重复调用,缺乏从经验中综合提炼可复用知识并动态维护的闭环。
  • 元能力缺失:记忆的读取、使用、写入和维护四种能力没有被统一优化,导致智能体在测试时无法自主决定何时检索、如何应用记忆、怎样更新知识,更难以将这种元能力内化到可部署策略中。

为什么这个问题难/重要

技术挑战在于多层级联合演化与信用分配。智能体需要同时优化四个记忆操作子模块(读、用、写、维),且必须在快速交互回路(test-time)中展现演化能力,再由慢速回路(offline distillation)将能力蒸馏为稳定策略。这要求解决“哪些经验值得学习”“如何将交互结果归因到记忆操作”“怎样避免灾难性遗忘”等深层问题。

业界对自适应AI的需求正从“静态工具”转向“长期自主伙伴”,如对话式应用需从对话历史中不断抽象用户偏好,仿真环境需持续更新世界模型。具备整体演化能力的智能体可显著降低人工再训练成本与策略退化风险,因此成为关键研究方向。

类比:现代LLM Agent框架(如LangChain)若只记录消息历史,却无法从对话中提炼长期偏好、行为准则和错误修正逻辑,其智能上限堪比只会复读的助手;OPD-Evolver 的思路正是补上这缺失的“演化肌肉”。

核心洞察

  • 核心记忆管理能力内化:现有记忆增强智能体多停留在存储轨迹、检索反思或累积技能,却缺乏对经验进行选择、使用、编写和维护的完整能力。OPD-Evolver 通过 on-policy self-distillation 将测试时快速循环中的四级记忆操作(读、用、写、维护)蒸馏为单一策略,使智能体学会如何从记忆中学习,而不只是拥有记忆。这种从“记忆存储”到“记忆管理能力”的质变,是其超越 ReasoningBank 等记忆系统和 Skill0 等训练方法的关键差异点。
  • 快慢循环协同让小模型实现跨量级竞争力:常规记忆增强或训练优化方法往往割裂测试时适应与训练时策略改进,而 OPD-Evolver 将快循环的实时进化与慢循环的归因蒸馏相耦合。慢循环利用结果校准的记忆归因和特权后见信息,将快速探索中涌现的宝贵经验提炼为模型权重的持久能力。这让 OPD-Evolver-9B 能以远小参数规模挑战 Qwen3.5-397B-A17B、Step-3.5-Flash 等巨型模型,提示工程实践中“如何进化”比“多大模型”更重要。

方法

OPD-Evolver 设计了一种 慢-快协同进化 框架,核心是将测试时的记忆交互能力蒸馏为可部署的 on-policy 自蒸馏 策略。

记忆层级与快速循环

快速循环是测试时进化(test-time evolution):agent 维护一个 四级记忆层次,分别处理:

  • 读取:从记忆库中检索与当前上下文相关的经验;
  • 使用:基于检索到的记忆调整行为或生成计划;
  • 写入:将交互过程中产生的新轨迹、反思或技能转化为可重用知识并存入记忆;
  • 维护:定期清理、合并或淘汰低价值记忆,保持记忆库的紧凑性和有效性。

快速循环允许 agent 在推理阶段动态利用记忆,无需额外训练即可适应新任务。

慢速循环与特权蒸馏

慢速循环是训练过程,目标是将快速循环中的四种能力(读、用、写、维护)注入一个轻量策略模型。具体做法:

  1. 结果校准的记忆归因:对快速循环中使用的每一段记忆,根据最终任务结果反向分配重要性权重,识别高价值记忆片段。
  2. 特权后见之明:在训练时向策略模型提供完整交互序列及最终结果的全局视图(这些信息在测试时不可得),让模型学习“事后看来”哪些记忆操作是关键的。
  3. on-policy 自蒸馏:以上述归因和特权信息作为监督,将快速循环的记忆操作逻辑蒸馏到目标策略中,使策略学会在没有完整后见之明的情况下,自行完成记忆选择、利用与维护。

最终输出的策略模型成为一个 agent evolver,能在部署时自主管理记忆并驱动自我进化,在推理效率与适应能力之间取得平衡。

与同类方法的差异:相比于仅存储轨迹的 Retrieval-Augmented Agent(如 ReasoningBank)或预先训练技能的 Skill0 等方法,OPD-Evolver 不依赖静态记忆或离线技能库,而是训练一个动态记忆操作策略,使 agent 同时具备“何时读、读什么、如何写、何时忘”的元认知能力。

实验

实验设置

  • 在多领域基准上评测,对比两类基线:基于记忆的代理系统(如 ReasoningBank)与训练型方法(如 Skill0)。
  • OPD-Evolver 采用四层记忆层级(读取、使用、写入、维护),快回路负责运行期记忆交互,慢回路通过结果校准记忆归因特权后见蒸馏将进化能力内化到策略中。

关键发现

  • OPD-Evolver 相较 ReasoningBank 最高提升 +11.5%,说明整体记忆管理(选择、使用、书写、维护)优于仅做检索的记忆系统。
  • 相比 Skill0 提升约 +5.8%,证实策略蒸馏让代理学会如何从历史中进化,而非仅模仿技能。
  • OPD-Evolver-9B 在部分基准上可与 Qwen3.5-397B-A17BStep-3.5-Flash 等巨模型竞争,展示小型进化器的潜力。

对比解读

  • 经典记忆代理重在存储,但缺失“价值判断”与“知识书写”;OPD-Evolver 的四层记忆层次使其能筛选有效经验、写出可复用知识并持续维护记忆库,从“记忆增强”跨越到“代理进化”。
  • 慢-快协同与蒸馏机制压缩了高成本进化信号,使部署策略同时具备高效推理与自主进化能力,为构建真正合格的代理进化器提供了新范式。

行业影响

落地场景

OPD-Evolver 的慢-快协同进化四级记忆层次(读取、使用、写入、维护)使其尤其适合需要持续经验积累与策略迭代的 AI 产品,例如:

  • 智能客服与对话系统: 能够从每一次用户对话中提取可复用知识,自动更新话术与问题解决逻辑,减少人工维护成本。
  • 个性化推荐与内容平台: 将用户反馈与交互轨迹转化为结构化经验,驱动推荐策略的在线进化,提升长期留存与点击率。
  • 企业知识库助手: 从文档交互中不断吸收、整理、重组知识,保持知识库的时效性与准确性。

商业价值

该框架通过在线策略自蒸馏将进化能力内化到可部署策略中,主要沿着三条价值线:

  • 降本: 减少对人工标注、规则维护和定期重训的依赖,记忆体系自我迭代,降低运营成本。
  • 增收: 更精准的策略进化直接提升转化率、用户满意度和长期留存,例如在电商场景中通过持续优化推荐带来 GMV 增长。
  • 体验提升: 系统能快速适应新场景、新需求,提供越来越贴合用户意图的回应,显著降低“过时感”。

与现有产品/工作流的接口

OPD-Evolver 可以作为一个记忆中间件进化层插入现有 LLM 应用栈:

  • 与 LangChain / LlamaIndex 等框架结合,将 OPD-Evolver 的四级记忆替代简单的向量存储,提供“读取-使用-写入-维护”全闭环能力。
  • 可在模型推理 pipeline 中部署一条慢循环,定期触发记忆归因与蒸馏,更新策略权重,无需全量重训。
  • 支持与任何支持工具调用的 agent 架构集成,通过标准化 memory 接口注入经验,提升规划与执行的一致性。

具体落地用例

  1. 电商全域推荐 agent: 将用户点击、加购、购买序列作为经验源,OPD-Evolver 自动提炼“高价值行为模式”并写入记忆。策略模型蒸馏后,实时推荐更符合用户长短期兴趣,同时减少冷启动与概念漂移问题。
  2. 金融投研辅助 agent: 研究员与市场数据交互过程中,agent 不断记住有效的分析框架、错误归因和校正步骤,形成可复用的投研记忆库,辅助新入门分析师快速对标成功历史推理路径,提升决策质量。

局限

  • 实验局限: 评估集中在推理、记忆和工具使用等文本基准(如 GAIA、ReasoningBank),尚未在视觉、具身智能等更丰富的模态或交互场景中验证。泛化能力可能受限于当前任务分布,迁移到动态环境时性能未知,这也是在抽象讨论部分承认的边界。
  • 方法敏感性: 快慢循环的协调、四级记忆结构的读写策略及 on-policy 蒸馏中的温度、样本权重等超参数,对整体进化效果影响显著。论文未系统分析这些因素在不同任务下的敏感度,部署到新领域时可能需要大量调参,增加了工程落地的不确定性。
  • 蒸馏脆弱性: 自蒸馏利用 privileged hindsight 将复杂记忆管理能力压缩至单策略,效果依赖 reward 信号质量。长周期训练中可能出现 reward hacking 或分布漂移,导致策略遗忘早期高价值经验;且蒸馏后的策略相较 teacher 可能牺牲部分探索能力,在需要持续学习的 open-ended 场景中存在退化风险。
论文Guibin Zhang2026-06-16原文

相关内容