Remember When It Matters: 面向长时程任务的主动记忆智能体
在长时程任务中,决策相关状态往往分散在日益增长的轨迹中,行为智能体必须将其提取并采取行动。随着轨迹增长,任务需求、环境事实、先前尝试、诊断和未完成的子目标可能被埋藏在上下文窗口内或超出窗口,导致在需要时无法影响决策。我们将这种失败模式称为行为状态衰减。 我们研究将记忆作为主动干预机制而非被动检索。一个独立的记忆智能体与未修改的行为智能体并行运行,从近期轨迹更新结构化记忆库,并决定是否注入基于记忆的提醒或保持沉默。该模块即插即用,适用于前沿行为智能体和现有智能体框架。 在Terminal-Bench 2.0和τ^2-Bench上,该方法在pass@1指标上同时对较弱和较强的行为智能体带来提升,Terminal-Bench提升+8.3个百分点,τ^2-Bench提升+6.8个百分点。消融实验表明,选择性干预优于被动记忆库暴露、始终注入、仅作为顾问指导以及通用检索。 作为迈向开放权重记忆策略的早期步骤,我们使用SFT和GRPO在SETA上训练Qwen3.5-27B,提升了验证奖励,并实现了向Terminal-Bench的部分迁移。
论文精读
TL;DR 针对长视界智能体的“行为状态衰退”,本文提出一个即插即用的主动记忆智能体,在关键时刻注入提示而非被动检索,显著提升 Terminal-Bench 和 τ²-Bench 上的 pass@1。
问题
问题背景
在长周期智能体(Long-Horizon Agent)任务中,agent 需进行数十甚至数百轮工具调用与环境交互,决策相关的关键状态(如任务约束、环境事实、历史尝试、错误诊断、未完成子目标)会分散在持续增长的轨迹中。业界正聚焦于如何防止 agent 性能随上下文扩张而衰减。
现有方法局限
当前记忆机制主要依赖 被动检索 或 无差别注入:
- 被动检索(如基于向量相似度)仅在显式查询时召回信息,缺乏自主判断何时需要提醒 agent 的能力,导致关键信息被错过;
- 全量注入 将记忆内容始终追加到上下文窗口,引入大量噪声,干扰 agent 对当前任务的专注;
- 反思/批评者模型 只提供高层级建议,不直接修改 agent 的行动流,无法解决 行为状态衰减(behavioral state decay)——即决策所需状态被掩埋或超窗口截断却未能及时干预的根本问题。
为什么这个问题难且重要
主动记忆的核心技术挑战在于:
- 结构化记忆构建:需从非结构化交互日志中提炼可交互的语义单元(如事实、子目标、失败诊断);
- 选择性介入决策:必须建模“何时沉默”,避免频繁干预破坏 agent 自主性,同时保证在关键时刻精确注入关键提醒。 随着 Terminal-Bench 2.0、τ²-Bench 等长周期基准的成熟,业界对 agent 鲁棒性的诉求从单轮正确率转向跨轮次决策连贯性,主动记忆正成为前沿 agent 架构的关键组件。
行业类比
类似于自动驾驶系统在遇到突发路况时需 主动唤起 之前在相似场景下的处理经验,而非依赖被动日志查询或全量回放历史帧,长周期 AI agent 同样需要一个主动、按需触发的记忆干预机制来维持长期任务中的决策连贯性。
核心洞察
- 记忆应从被动检索转为主动干预:该工作将记忆定义为一种可触发提醒的主动决策机制,而非事后检索。这不同于常见的 RAG 或直接暴露记忆库的方式,因为它由独立记忆代理根据当前轨迹与结构化记忆库动态判断是否需要注入信息。这种“何时沉默、何时提醒”的选择能力,有效缓解了长程任务中关键状态被遗忘的“行为状态衰减”问题,相比始终注入或仅提供建议的基线有显著提升。
- 即插即用的模块化设计降低集成成本:记忆代理与原有行动代理完全解耦,不需要修改后者内部逻辑,可适配任何前沿行动代理与现有框架。这种架构设计对工程落地极有价值,因为它允许团队独立迭代记忆策略,而无需改动已验证的行动代理。同时,训练记忆策略(如基于 Qwen3.5-27B 的 SFT+GRPO)的尝试也表明该组件可进一步自动化,形成可迁移的开放权重模型,为记忆能力的持续优化开辟了新路径。
方法
输入与问题设定
长周期任务中,动作代理(Action Agent)与环境交互生成不断增长的轨迹,包含任务需求、环境事实、历史尝试、诊断信息及开放子目标。随着上下文窗口膨胀,关键信息可能被埋没或超出窗口,导致决策时无法利用——作者称之为行为状态衰减(behavioral state decay)。为解决此问题,该方法引入独立的记忆代理(Memory Agent),与动作代理并行运行,且不修改动作代理本身。
关键模块:结构化记忆银行
记忆代理维护一个结构化记忆银行(Memory Bank),专门存储决策相关的重要状态。银行中的条目按类型组织(如目标、约束、失败诊断、环境事实等),并由记忆代理持续更新。
两阶段记忆代理运作
记忆代理的核心工作流分为两个阶段:
- 记忆管理:接收近期轨迹片段,从中抽取重要信息,对记忆银行进行添加、修改或删除操作,保持银行精简且最新。
- 干预选择与暂态注入:在动作代理即将执行下一步前,记忆代理判断当前是否需要介入。若需要,则从记忆银行检索相关条目并生成一条记忆锚定提醒(memory-grounded reminder),作为暂态信息注入动作代理的上下文窗口,否则保持沉默。
触发时机并非每一步都执行,而是基于轨迹步数或事件(如错误发生)周期性触发,避免过量干扰。
学习干预策略
记忆代理本身可基于语言模型实现。训练时,在合成环境SETA 上用 SFT(监督微调)和 GRPO(组相对策略优化)训练 Qwen3.5-27B,使记忆代理学会何时介入以及生成何种提醒,从而优化最终任务成功率。该开放权重策略在验证奖励上提升明显,并可部分迁移至 Terminal-Bench。
与同类方法的差异
不同于被动检索或始终注入上下文,本方法的核心在于选择性主动干预:记忆代理如同一个在关键时刻才发声的观察者,以最小干扰帮助动作代理克服行为状态衰减,在 Terminal-Bench 2.0 和 τ²-Bench 上分别带来 +8.3 pp 和 +6.8 pp 的 pass@1 提升。
实验
实验设计
实验在** Terminal-Bench 2.0 和 τ^2-Bench 两个长程智能体基准上评估主动记忆智能体的 plug-and-play 能力。测试环境覆盖命令行调试、多步机器学习工程、交互式工具使用等复杂场景。记忆智能体作为独立模块与未修改的行动智能体(如 GPT-4 等前沿模型)并行运行,通过两阶段流程**——先更新结构化记忆库,再决定是否注入提醒或保持沉默——主动干预行动上下文。消融实验对比了记忆库被动曝光、始终注入、仅顾问指导和通用检索等变体。此外,还在** SETA **数据集上使用 SFT 和 GRPO 训练开源记忆策略(Qwen3.5-27B),验证其泛化潜力。
关键发现
- 在 Terminal-Bench 2.0 上,pass@1 指标提升 +8.3 个百分点;在 τ^2-Bench 上提升 +6.8 个百分点,无论行动智能体强弱均能受益,证实记忆主动干预可有效缓解行为状态衰减。
- 选择性注入(仅当必要时才提醒)显著优于被动曝光、始终注入或外部顾问模式,表明主动且克制的上下文管理是长程任务成功的关键。
- 训练后的 Qwen3.5-27B 记忆策略在验证奖励上提升,并实现向 Terminal-Bench 的部分迁移,为开源记忆策略迈出早期一步。
基线对比解读
传统记忆方法多为被动检索(如 RAG 到记忆库)或无差别全量注入,容易在长上下文中淹没关键信息或引入噪音。本工作将记忆定位为主动干预机制,记忆智能体不仅维护结构化状态(任务需求、环境事实、历史尝试、开放子目标),还决策何时介入。消融实验明确显示,选择性注入比被动曝光和始终注入效果更好,验证了“在关键时刻提醒”的核心价值。与仅提供高层建议的 advisor 角色相比,带有结构化记忆的插入式提醒更贴合行动状态,能直接减少行动智能体的认知负荷,从而在需要持续上下文维护的长程任务中获得稳定增益。
行业影响
落地场景
主动记忆代理可直接嵌入各类长周期、多轮交互的 AI 智能体产品。典型场景包括:
- 代码调试与自动化运维:AI 在长时间调试过程中需记忆历史错误、修复尝试及环境状态,记忆代理在关键时刻注入提醒,避免重复失败路径。
- 复杂客户服务:涉及多步骤的售后、理赔或技术排障,记忆代理主动回顾之前的承诺、规则或未解决的子目标,提升一次性解决率。
- 金融合规审查:跨文档、长链条的案件分析中,记忆代理持续更新关键事实与矛盾点,在决策节点注入摘要,防止信息遗漏。
- 医疗辅助诊断:跨多轮问诊与检验的交互中,主动唤起已遗忘的早期症状或检查结果,辅助鉴别诊断。
商业价值
- 降本:显著减少因“行为状态衰减”导致的任务失败与重试,节省 LLM 调用成本和人工兜底成本。在 Terminal-Bench 上,pass@1 提升 +8.3 pp,意味着复杂任务的一次成功率大幅提升。
- 增收:在客户服务中,高首次解决率直接关联客户留存与转化率;在自动化流程中,更稳健的执行可支持更大规模的任务吞吐。
- 体验提升:主动提醒让交互更“聪明”,避免用户重复提供信息或经历无效循环,强化信任感。
与现有产品的集成
记忆代理是插件式模块,无需修改已有动作代理(action agent)或编排框架。集成方式:
- 作为独立服务并行运行,监听动作代理的轨迹(trajectory)。
- 通过 API 接收历史片段,更新结构化记忆库(Memory Bank),并决定是否注入提醒(inject reminder)。
- 支持主流代理框架(如 LangChain、AutoGen)的轻量适配,也可与现有 RAG 栈配合,但并非被动检索,而是选择性干预。
具体用例
- 电商售后客服:用户发起退换货并多次沟通。动作代理可能遗忘关键事实(如破损照片已上传、超时规则)。记忆代理在每次回复前注入“用户已提供破损证据,注意 7 天超时截止于明天”,确保服务一致性和合规性。
- 企业 DevOps 事故响应:AI 代理在排查服务器故障时,经历了重启、检查日志、回滚配置等多步操作。记忆代理维护一个“已排除原因”列表和“下一步检查项”,在运维人员介入或新命令执行前,主动提醒“磁盘空间已确认正常,重点检查网络策略”,避免无效回查。
局限
- - **实验验证范围有限**:目前仅在 `Terminal-Bench 2.0` 和 `τ^2-Bench` 两个长程 Agent 基准上评估,任务类型集中于命令行执行和工具交互。虽然提升显著,但泛化到其他领域(如具身智能、代码生成等)仍需验证。此外,两个基准的规模相对较小,统计显著性可能不够稳健。
- - **记忆策略学习仍不成熟**:论文尝试用 SFT 和 GRPO 训练 `Qwen3.5-27B` 作为记忆策略模型,但仅在验证集 reward 上提升,且迁移到 `Terminal-Bench` 时仅为部分有效。这表明学习何时介入、如何写提醒的策略仍然困难,记忆 agent 的性能高度依赖于手工设计的规则和提示词,自动学习尚未达到可靠水平。
- - **额外的推理开销**:方法引入一个单独的记忆 agent,需要定期处理最近轨迹、更新记忆库并决定是否介入。即使设计为触发式运行,实际推理成本仍高于单 agent 方案。对于延迟敏感或资源受限的应用,这种开销可能成为瓶颈。论文未提供与无记忆基线在推理耗时上的对比,也欠缺对记忆 agent 本身效率的优化讨论。