SAM: 状态自适应记忆用于长程推理智能体
长程智能体推理要求大型语言模型在包含思考、工具调用、观察和部分结论的漫长交互历史中持续决策。挑战不仅在于历史长度,更在于当前决策所需的信息可能分散在遥远步骤中,且仅在后阶段才变得相关。现有方法通过截断、压缩或检索部分历史来应对,但未能显式建模对过往信息的访问应如何适应智能体的状态变化。 本文提出 状态自适应记忆(SAM),一个独立框架,将持续交互压缩为紧凑的 记忆线索,同时保留原始 轨迹页面 用于 意图驱动召回。记忆线索并非历史替代,而是轻量级句柄,使智能体无需重训骨干模型即可根据当前需求重建遥远信息。进一步通过 专家引导监督 和 强化学习 优化记忆模块,使其与 轨迹级效用 对齐。 在 BrowseComp、BrowseComp-ZH、WideSearch 和 HLE 四个基准上,SAM 在多种骨干模型上一致超越强基线。结果表明,显式记忆建模为长程智能体推理提供了简单有效的基石。
论文精读
TL;DR SAM 将长时程智能体推理建模为状态自适应记忆问题,用轻量记忆线索按需召回历史信息,无需重训基座模型,在多基准上显著优于已有方法。
问题
问题背景
随着大型语言模型驱动的自主代理被用于复杂长程任务(如网页搜索、多步推理),管理长达数千 token 的交互历史成为瓶颈。代理需交错输出思考、工具调用与观察,而关键决策常依赖早期分散且暂时被埋没的信息。
现有方法局限
现有方案主要有三类缺陷:
- 截断(Truncation) 直接丢弃早期历史,易损失后来才显现相关性的重要线索。
- 压缩(Compression) 将历史概括为固定摘要或隐向量,但与当前查询无关,导致召回时细节丢失或偏差。
- 检索增强(Retrieval-augmented) 基于固定相似度检索片段,未随代理状态(当前推理进度、已排除假设)动态调整检索条件,无法捕捉“当前需要什么”的语境变化。
三者均未能将历史访问建模为与代理状态自适应同步的过程,导致长程信息利用效率低下。
为什么这个问题难/重要
长程推理中,信息的相关性呈现延迟显现与上下文依赖双重特性:早期观察可能仅在排除多个错误路径后才变得有价值;代理的当前目标与已知事实随时变化,要求记忆系统提供精细的、意图驱动的访问。从工程角度看,一个与模型无关、可即插即用的记忆模块,能直接提升现有代理的长程稳定性,无需重训底层模型。随着高可靠自主代理(如长时间调研、自动化开发)需求激增,高效记忆管理已成为左右代理能力上限的关键模块。
行业类比
就像自动驾驶规划模块需根据当前路况动态回忆此前感知到的交通标识,长程代理也需一种状态自适应记忆,以按需提取历史中的关键信息。
核心洞察
- 长程推理的难点不是序列长度,而是信息的时间分散性和延迟相关性:SAM 将交互历史建模为**状态自适应记忆**,使智能体能够根据当前决策需要动态访问过去信息,这与现有压缩或检索方法从根本上不同,后者忽视了智能体状态的演化。
- SAM 中的**记忆线索**(memory cues)并非历史的替代品,而是充当轻量级的索引把手,在保留原始轨迹页面的前提下支持意图驱动的回忆,这使得智能体可以在不修改底层模型的情况下,按需重建远距离的上下文信息,有效平衡了存储开销与信息保真度。
方法
输入与问题设定
长周期代理推理需要 LLM 在漫长的交互历史中行动,历史包含思考、工具调用、观察和部分结论。挑战并非仅仅历史变长,而是当前决策所需信息可能分散在远距离步骤中,且仅在后期才变得相关。传统方法或截断、压缩历史,或检索部分片段,但均未显式建模“如何根据代理的当前状态自适应访问过去信息”。
关键模块:State-Adaptive Memory (SAM)
SAM 将长周期推理视为状态自适应记忆问题,包含三个阶段:
Page-based Episodic Consolidation
将正在进行的交互以页为单位整合为紧凑的记忆线索(memory cues),同时保留原始轨迹页(trajectory pages)供后续检索。这些线索不替代历史,而是作为轻量级“抓手”,帮助代理按需重建远距离信息。Agent-guided Cue Selection
代理根据当前状态和需求,动态选择相关的记忆线索,而非被动全部加载。线索本身只占用极少上下文,从而在不显著增加计算开销的情况下保留全局视图。Intent-driven Episodic Recall
当代理需要特定信息时,通过意图驱动的机制从原始轨迹页中精确检索相关片段,而非盲目扫描全部历史。这保证了对关键证据的精准定位,避免无关内容干扰推理。
记忆模块优化
- Expert-guided Supervised Fine-Tuning (SFT):利用专家标注的轨迹数据对记忆模块进行监督微调,教会模型何时与如何写入线索、何时发起召回。
- OAT-GRPO:一种基于强化学习的优化目标,结合 Tree-structured Outcome Reward(将最终成败分解为树结构奖励)和 Oracle-anchored Recoverability Reward(评估从当前状态恢复到正确路径的可能性),在轨迹级别对齐记忆模块的效用,无需依赖稀疏的终点信号。
差异化要点
SAM 不是对历史的压缩或检索,而是显式记忆模型,能以极低的额外成本让代理根据演变状态智能调度过去信息;与之相比,常见方法(如 ReSum、迭代压缩)常将历史当作被动数据,缺乏状态自适应的主动回忆机制。
实验
实验设计
SAM 在四个长程 agent 推理基准上进行评估:BrowseComp、BrowseComp-ZH、WideSearch 和 HLE,覆盖多轮工具调用与信息检索场景。实验将 SAM 作为即插即用的记忆模块,集成到不同规模的基础 agent(如 Qwen 系列),与多种强基线对比,包括原生的截断/压缩策略以及开源的记忆管理系统(WebThinker、WebSailor、ReSum、IterResearcher、AgentFold)。评估指标主要为任务完成准确性或成功率。
关键发现
SAM 在所有基准上一致优于基线方法。核心机制——状态自适应记忆——通过生成紧凑的“记忆线索”(memory cues)并保留原始轨迹页,使 agent 能在需要时根据当前意图精确回忆远期信息,而非简单地压缩或截断历史。此外,结合专家监督微调和基于轨迹级效用的强化学习(OAT-GRPO,包含树状结构结果奖励与 oracle 锚定恢复度奖励)对记忆模块进行优化,进一步提升了记忆线索的质量。消融实验表明,意图驱动的片段回忆(intent-driven episodic recall) 是性能提升的关键,若移除该模块则效果明显下降。在超长程任务中,SAM 能有效避免早期关键信息因上下文窗口限制而丢失,并减少因压缩导致的信息失真。
与基线的深度对比
不同于 ReSum 等将历史整体压缩为固定摘要的方法,SAM 保留原始交互轨迹作为“事实库”,记忆线索仅作为轻量索引。这使其在信息需求动态变化时能够按需检索完整细节,避免了压缩过程中的细节丢失风险。与 WebThinker 等检索式方法相比,SAM 的记忆选择不是基于静态的相关性评分,而是由 agent 实时状态驱动,更具任务针对性。同时,SAM 无需修改基础语言模型,可直接部署于现有 agent 架构,工程实用性更强。在失败案例分析中,当 agent 陷入错误推理框架时,SAM 的记忆可能固化了该错误,提示未来可引入自我修正或冲突检测机制。
行业影响
落地场景
SAM 的记忆框架可嵌入任何需要长程多步推理的 AI Agent 产品,例如:
- 智能客服与对话系统:处理跨多轮、跨会话的复杂问题(退换货、投诉升级、保险理赔),维持状态一致性。
- AI 研究助手:在文献调研、数据收集等长任务中自动记住中间结果与失败路径,避免重复探索。
- 自动化测试与 DevOps:在持续集成管道中记录错误上下文,辅助后续定位。
- 企业流程自动化(RPA):财务对账、合同审核等长周期任务,Agent 可持久记忆操作历史。
商业价值
- 降本:模型无需反复处理全量历史,推理开销随交互轮次线性增长而非平方增长,可直接降低 API 调用成本;同时通过提升长任务成功率减少人工干预成本。
- 增收:在电商导购、内容推荐等场景,Agent 能更精准把握用户长期偏好,提高转化率与客单价。
- 体验提升:用户不会感到 Agent“失忆”,交互更自然,提升留存与 NPS。
与现有产品/工作流的接口
SAM 作为 即插即用 的记忆后端,不要求微调基座模型,可通过以下方式集成:
- Agent 框架中间件:在 LangChain、AutoGen 等框架中插入记忆管理模块,Agent 每步决策时同步更新
memory_cues并可选触发intent-driven recall。 - 微服务部署:将 SAM 封装为独立记忆服务,通过 gRPC/REST 提供
consolidate与recall接口,供 Agent 运行时调用。 - 数据飞轮:落地后积累的交互轨迹可作为领域专用 SFT 数据,持续优化记忆模型,形成正循环。
具体落地 Use Case
- 全球电商平台的购物助手:用户持续数日的选购过程(比价、看评测、咨询售后)被 SAM 压缩为紧凑线索。当用户说“之前看的那个红色的怎么样?”时,Agent 能快速召回相关商品与讨论历史,而非从头检索。
- 金融投研 Agent:分析师让 Agent 跟踪某行业动态,SAM 自动记录每次搜索的结论、未解决的疑问。数周后,Agent 能基于记忆自主更新行业报告,避免重复劳动,提升分析深度。
局限
- **额外训练成本与模块耦合**:SAM 需要额外训练一个记忆模块(包括监督微调和强化学习),这增加了计算开销和工程复杂度。该模块与特定的智能体骨干模型绑定,虽然声称不重训骨干,但实际部署时仍需根据数据集和任务进行适配调优,通用性受限。
- **仅验证于搜索类长程任务**:实验主要集中在 BrowseComp、WideSearch、HLE 等搜索/问答基准,未展示在更广泛的工具调用、对话式或规划密集型任务上的效果。该方法是否在其他长程推理场景(如代码调试、长期对话管理)中泛化,还有待验证。
- **记忆召回依赖生成质量**:意图驱动的回忆由智能体生成查询语句触发,若智能体当前推理存在偏差,生成的召回查询可能放大错误框架,论文附录中的失败案例(id=1058)已证实这一点。这一缺陷可能使记忆模块在关键决策时刻反而固化错误方向。