Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
递归自改进(RSI)在长时程任务中仍然困难:不断增长的历史记录模糊了任务状态,导致技能调用错位。我们提出 Recuris,一种用于长时程 Agent 框架的递归经验-工作记忆架构。其中,工作记忆跟踪任务进度,并从经验记忆中指导技能选择,使技能使用基于当前需求而非完整历史。这种耦合还将执行过程转化为结构化证据,从而将失败定位到特定记忆组件。 在各类任务中,一个固定的元智能体将这些证据转化为经过验证门控的、针对技能记忆的局部更新,这些更新重塑执行过程并产生新证据,形成一个有界的递归记忆演化循环。在四个长时程基准和十个模型上,Recuris 在 37 个已完成的模型-基准组合中提升了 35 个任务成功率,将前沿模型带到 SOTA 级成功率:在 tau-bench 上,为 GPT-5.6 Sol 提升 +17.8 分,为 Claude Opus 5 提升 +15.6 分(使 Opus 5 达到 87.9%),在 SkillFlow 上为 Qwen3.6-27B/35B 提升 +16.6/+13.5 分。随着交互时程增长,优势扩大,在最长任务上达到 +32.2 分,常见的长时程失败减少高达 80%。 这些结果将递归演化记忆定位为 RSI 的可扩展基础,使智能体能够持续将积累的经验转化为日益高效的长时程行为。代码:https://github.com/Gen-Verse/Recuris
论文精读
TL;DR Recuris 用工作记忆跟踪进度并引导技能调用,将失败定位到具体记忆组件,由元代理验证门控更新技能记忆,形成有界递归演化,在最长任务上成功率提高 32.2 点。
问题
问题背景
长时程智能体(long-horizon agent)是当前自主智能体研究的核心方向,任务涉及多步交互、状态保持与技能组合,业界关注如何让智能体在复杂环境中稳定执行长程任务。
现有方法局限
- 主流做法将完整交互历史或压缩后的上下文输入策略模型,但历史增长导致关键状态信息被淹没,技能调用依据模糊,出现上下文稀释 和错误技能激活。
- 经验记忆(Experiential Memory)和技能库(Skill Memory)多为静态或启发式更新,缺乏与当前任务进度绑定的动态选择机制。
- 递归自我改进(RSI)在长时程任务中难以形成有效的反馈闭环:失败追踪难以定位到具体记忆组件,更新常是全局重训或提示词微调,效率低且容易破坏已有能力。
为什么这个问题难/重要
- 技术挑战:需要将执行轨迹转化为结构化证据,对失败进行模块级定位,并用验证门控的局部更新替代全局改动,避免灾难性遗忘。
- 业界关注:长时程智能体是客服、自动化工作流、多步工具调用等场景的核心,提升其成功率和可靠性直接带来生产力价值。论文在 4 个基准、10 个模型上验证,最长任务上提升 32.2 个百分点,表明问题存在普遍瓶颈。
行业类比
类似强化学习中的信用分配(credit assignment):长序列中让智能体知道哪些决策对最终成功有贡献,Recuris 通过工作记忆与经验记忆耦合,实现任务内的状态引导与跨任务的技能演化。
核心洞察
- Recuris 的核心设计是将长程任务中的状态跟踪与技能选择解耦,通过 Working Memory 维护结构化工作状态,指导从 Experiential Memory 中按需调用技能。 与依赖完整对话历史或静态检索的 baseline 不同,这种耦合让技能调用基于当前任务进度而非全量历史,有效抑制长程执行中的上下文噪声与技能错配,同时把执行过程转化为可定位的结构化证据,为后续记忆演化提供细粒度信号。
- 另一个关键贡献是把递归自我改进约束为有界的、验证门控的局部记忆更新。 Recuris 利用结构化痕迹将失败定位到具体的 Skill Memory 组件,固定 Meta-Agent 据此生成组件级补丁并通过验证才允许写入,形成闭环演化。相比全局微调或端到端 RSI,这种局部且有验证的更新既能持续提升长程任务成功率,又避免灾难性遗忘,并且演化后的技能可跨模型迁移,具备更强的可扩展性。
方法
输入
- 长程任务中的交互历史、当前任务状态、初始
Skill Memory集合以及任务描述。
关键模块与流程
- Working Memory (WM):维护结构化工作状态(如子目标、约束、已完成步骤),避免直接使用冗长历史。
- Experiential Memory (EM):存储可复用的技能/经验片段,WM 根据当前状态从 EM 中选择最相关的技能调用,即状态引导技能调用。
- EM–WM 耦合验证:执行后,结果作为证据用于更新 WM 状态(证据引导状态更新),形成闭环;同时将整个执行过程记录为结构化痕迹,便于失败定位。
- Skill Memory 演化:固定的 Meta-Agent 分析结构化痕迹,将失败定位到特定技能组件(如技能前提、动作序列、后置条件),并生成组件级补丁;补丁需通过验证门控(在验证集上评估)方可接纳,防止性能回退。
- 递归循环:更新后的 Skill Memory 改变执行行为,产生新痕迹,触发下一轮演化,构成有界递归记忆演化(轮数或更新幅度受限)。
输出
- 演化的
Skill Memory及对应的 agent 执行策略,在长程任务上持续提升成功率(论文报告 35/37 模型-基准对提升,最高 +32.2 分)。
与同类方法的差异点:不同于基于完整历史上下文的全局策略优化或一次性技能库构建,Recuris 通过 WM–EM 耦合将失败证据精确关联到记忆组件,实现局部、验证门控的递归更新,既避免灾难性遗忘,又支持跨任务/模型迁移。
实验
实验设计
Recuris 在四个长程基准(含 tau-bench、SkillFlow)上评估,覆盖十个模型、37 个模型-基准组合。对比各模型原生 agent 表现,采用验证门控的递归记忆进化机制。
关键发现
在 tau-bench 上,Recuris 将 GPT-5.6 Sol 提升 +17.8 分,将 Claude Opus 5 提升 +15.6 分(达到 87.9%);在 SkillFlow 上,Qwen3.6-27B 和 Qwen3.6-35B 分别提升 +16.6/+13.5 分。优势随交互 horizon 增长而扩大,在最长任务上提升 +32.2 分,常见长程失败率降低最多 80%。在 35/37 个模型-基准组合中均取得提升。
对比解读
相比原生 agent,Recuris 的 EM–WM 耦合使技能调用基于当前工作状态而非完整历史,显著减少长上下文干扰;递归进化将失败定位到具体记忆组件,验证门控确保更新不破坏已有能力。因此优势在更长 horizon 上愈发显著,表明其作为 recursive self-improvement 基础的可扩展性。
行业影响
落地场景
Recuris 的递归记忆演进架构适合长程、多轮、状态易丢失的智能体任务,如 电商售后客服(多轮退货 / 换货 / 投诉处理)、企业 IT 运维(跨系统故障排查与修复)、金融合规流程(多步审批与文档生成)、代码生成 agent(长上下文重构与调试)。其工作记忆跟踪任务进度,经验记忆提供技能选择,可在现有 agent harness 中作为记忆层增强。
商业价值
主要带来 降本 和 体验提升:长程任务成功率提升(在 tau-bench 上 GPT-5.6 Sol 增加 17.8 点,Claude Opus 5 提升到 87.9%),意味着更少的人工介入和重试。随着交互轮次增长,优势扩大(最长任务上 +32.2 点),直接降低单任务计算与人工成本。失败模式减少 80%,提升用户满意度,增强企业自动化流程的可靠性。
与现有产品 / 工作流的接口
Recuris 可作为 记忆与元学习模块 插入 LangGraph / AutoGen / Semantic Kernel 等编排框架。其结构化 trace 可用现有日志系统采集,Meta-Agent 的验证门控更新可对接 CI/CD 或评测流水线。不改变原有 agent 推理核心,只需在状态管理和技能检索处替换为 Recuris 的 EM-WM 耦合,并周期性运行 Meta-Agent 更新 Skill Memory。
具体用例
- 电商智能客服:处理多轮售后,如“商品破损→申请退款→上传凭证→选择补偿方案”,Recuris 工作记忆跟踪当前步骤,经验记忆匹配历史成功技能,Meta-Agent 根据失败 trace 更新某一步骤的话术或工具调用,减少客服升级率。
- 企业 IT 运维 agent:长程故障诊断流程(收集日志→定位组件→执行修复→验证),Recuris 可将失败的修复动作定位到具体技能记忆,验证后更新,使 agent 在多次相似事件后显著提升一次修复率。
局限
- **验证门控依赖外部验证器**。论文中 `validation-gated` 机制依赖可靠的任务反馈或自动验证器,但在开放域、稀疏奖励或主观任务中,高质量验证信号难以获得,可能导致错误补丁被采纳或有效更新被丢弃。论文未讨论验证器本身的构建成本与可靠性,也未分析其在对抗性噪声下的鲁棒性,这限制了该方法在缺乏明确奖励函数的环境中的实用性。
- **递归进化带来额外计算和上下文开销**。工作记忆的状态跟踪、经验记忆的检索、结构化证据的生成以及 Meta-Agent 的补丁生成均会增加 token 消耗和推理延迟。论文未报告与基线的推理成本对比,也未讨论长时程任务中记忆增长导致的上下文窗口压力。对于资源受限或实时性要求高的部署场景,这些开销可能成为瓶颈。
- **跨域泛化与持续进化能力尚不明确**。虽然实验表明进化后的技能记忆能在相似任务和不同模型间迁移,但所有评估均基于四个特定基准,缺乏对分布外领域或完全新颖任务的测试。此外,Meta-Agent 固定,其进化能力受限于初始知识,难以自主发现未预设的技能结构,长期递归进化可能陷入局部最优或产生灾难性遗忘。