AgenticSTS: 长时域 LLM 智能体的有界记忆测试平台
长时域 LLM 智能体的记忆是一种关于每个未来决策允许看到什么的契约。最简单的契约是将过去的观测、工具调用和反思追加到每个提示中,这使得先前上下文易于访问,但也使其变成混杂的混合物,难以隔离任何单个记忆组件的影响。 我们引入并实现了一种替代的有界契约:每个决策由类型化检索组装的新用户消息作出,不附加原始的跨决策记录。因此,提示在任何长度的运行中保持有界,并且任何单一层可以被独立消融。我们在封闭规则的随机卡牌构建游戏 Slay the Spire 2 中实例化了该契约,该游戏的回合需要数百个战术和战略决策。一个公开的基准测试报告,前沿 LLM 在最低难度下五组配置的胜率为 0%,而开发者报告的人类胜率在相同难度下为 16%;任务困难但未饱和。 在我们的框架中,当启用触发式战略技能时,固定 A0 消融显示出最大的观察差异:无存储基线赢得 3/10 局,添加技能层后赢得 6/10 局。在此样本量下,比较是方向性的而非统计上决定性的(Fisher 精确检验 p≈0.37);跨骨干探测和公开累积上下文基线作为操作性比较报告,而非对契约变量本身的受控测试。 我们发布了一个可复现的测试平台:包含条件标签的 298 条已完成轨迹、冻结的记忆/技能快照、提示记录和分析脚本——一个智能体设计以及用于研究显式记忆层如何塑造长时域 LLM 智能体决策的经过验证的可复用方法论。
论文精读
TL;DR 通过**有界记忆合约**与**类型化检索组装提示**,隔离并强化 LLM 代理的长期策略技能,在《Slay the Spire 2》中将胜率从 3/10 提升至 6/10。
问题
LLM 智能体在长时域任务中的记忆管理 是当前研究热点。传统的全历史追加(append-all-history) 方法将每次决策前的全部观测、工具调用、反思拼接到提示中,虽然简单,但带来三个核心局限:
- 上下文膨胀:数百步后提示长度远超模型窗口,推理成本激增且易丢失早期关键信息。
- 信息混杂:不同时间步的记忆元素无序堆叠,难以分离和量化单个记忆来源的独立贡献。
- 不可消融:记忆组件紧耦合,无法进行精确的对照实验来验证某一模块的必要性。
这些局限使得有界记忆合同(bounded contract) 成为必需:每次决策从干净的用户消息开始,通过类型化检索(typed retrieval) 组装相关记忆,保持提示长度恒定。实现这种模块化记忆面临技术挑战:如何定义检索类型、如何确保信息完整且不冗余、如何在有界上下文中维持长期战略一致性。该问题在需要数百步决策的复杂场景中尤为尖锐——例如卡牌游戏 Slay the Spire 2,当前最前沿 LLM 在最低难度下胜率仍为 0%(人类玩家胜率 16%),任务难度高但远未饱和。
类比于软件架构的微服务化:单体式记忆如同一个巨大的全局变量,难以调试和扩展;而有界合同将记忆拆分为可插拔的独立层,允许工程师像组装微服务一样按需配置、独立测试和消融,加速长时域智能体的迭代开发。
核心洞察
- 有界合约(bounded contract)将 LLM 代理的记忆机制从无序的历史追加转变为基于类型化检索的提示组装,使每个决策的上下文清晰可溯源。与普通的长上下文代理(如将所有交互记录直接拼接)相比,这种方法不仅能保持提示长度固定,还能独立对记忆组件进行消融实验,从而精确评估各记忆层(如观察、技能、反思)对最终决策的贡献,为长程代理的可解释性工程提供了新范式。
- 在长程交互任务中,显式触发的战略技能层(triggered strategic skills)是提升代理胜率的关键因素,其作用类似于人类专家在关键时刻调用预先封装的知识模块。相比于仅依赖 LLM 内部推理链的 baseline,这种外部化的条件推理模块更容易调试和升级,且可以跨模型迁移。该发现启示我们在设计工业级代理时,应将领域知识以结构化技能库的方式注入,而非单纯依赖模型的涌现能力。
方法
AgenticSTS 提出一种有界合约 (bounded contract),用以控制长周期 LLM 智能体在每一步决策时可访问的上下文。其核心设计是:每个决策点都从一个空的用户消息开始,通过类型化检索 (typed retrieval) 逐步组装最终提示,而不附加任何原始的跨决策对话记录。
输入
- 当前游戏状态(在 Slay the Spire 2 中,包括手牌、敌方状态、遗物、地图等结构化信息)
- 历史决策中提取的结构化记忆(按类型存储于独立层,如 观测缓存、工具调用记录、反思笔记、策略技能)
关键模块
- 记忆分层存储:将智能体运行过程中产生的信息按功能划分为独立层,每层维护一个可检索的存储(如键值对或向量库),而非混合存储原始对话。例如:
observation_store:原始状态描述的摘要或结构化表达reflection_store:事后分析生成的文本反思skill_store:从成功/失败轨迹中提炼的战略技能(如“对抗某 Boss 应保持护盾优先”),可被触发激活
- 类型化提示组装:每一步决策时,系统根据当前决策需求从各存储层检索相关条目,将它们填入预定义的提示模板(作为不同的消息分区),最终生成一条不超过固定 token 预算的 user message。该过程完全由检索控制,历史长度不影响提示长度,从而实现跨任意长度运行的有界性。
- 可插拔消融 (ablation):由于各层独立,可直接添加/移除某类记忆(如禁用
skill_store)来测量其对决策的影响,无需改变其他层或整体流程。
输出
- LLM 基于组装后的单条消息输出行动选择(如出牌、跳过、使用药水等),进入下一决策循环。
与同类方法的差异
与传统**“全量追加历史”** 的开放上下文范式不同,AgenticSTS 的有界合约强制每次推理从零开始,通过分类检索构造输入,使得提示长度可预测、记忆影响可隔离,便于系统性研究长周期智能体中各记忆组件的作用。
实验
实验设计
在 Slay the Spire 2 环境中评测有界契约方法。该游戏为回合制卡牌构建游戏,每次运行需做出数百次战术与战略决策。设定最低难度,人类玩家胜率为16%。实验中,固定底层模型(fixed-A0),比较不同记忆层配置:no-store 基线(无商店记忆)与添加 triggered strategic skills 层的效果。每种配置运行10局,统计获胜次数。
关键发现
- no-store 基线获胜 3/10(胜率30%),启用技能层后获胜 6/10(胜率60%)。胜率提升一倍。
- 由于样本量小,差异在统计上未达到显著(Fisher 精确检验 p≈0.37),但方向性明显,提示记忆层对长程决策有正向影响。
- 其他消融实验(如跨骨干探针)作为操作性对照,表明方法在不同条件下保持可比性。
与基线深度对比
基线“no-store”通过去除存储组件来检验记忆必要性。添加技能层实质是引入类型化检索与条件推理,使智能体在决策时能灵活运用存储的战略知识。提升虽不显著,但考虑到任务难度(前沿LLM零胜,人类16%胜率),该增益表明此类显式记忆结构有助于处理复杂决策。对比公开基准中前沿LLM(GPT-4等)在该游戏最低难度零胜的表现,有界契约方法6/10的成绩显著优于单纯追加上下文的方案,印证了精心设计的记忆分层对长程智能体至关重要。
行业影响
落地场景
长时域 LLM agent 在虚拟客服、游戏 NPC、自动化工作流等场景中普遍存在记忆失控问题——随着交互轮次增加,原始上下文堆积导致 token 成本飙升且决策质量下降。AgenticSTS 提出的有界记忆契约与类型检索提示组装,天然适用于需要跨数百步决策的领域:
- 智能客服:多轮对话中需要引用历史工单、订单状态与用户偏好,有界提示可维持稳定延迟与成本。
- 企业级 RPA:处理跨系统的长流程任务(如采购审批),每一步仅拉取相关字段,避免全量日志污染推理。
- 游戏 AI:如叙事驱动或策略游戏,NPC 需记忆长期目标而不因过期信息行为失真。
商业价值
- 降本:提示词长度不再线性增长,直接削减 API 调用费用,尤其在 GPT-4 等按 token 计费模型上效果显著。
- 增效:可独立插拔的记忆层允许工程师快速定位“哪个记忆类型对任务贡献最大”,加速 agent 迭代周期,减少试错成本。
- 体验:有界记忆避免模型被过时信息干扰,提升决策一致性,例如客服不会因早期聊天记录而忘记当前诉求。
与现有工作流的集成接口
该方案可作为记忆中间件嵌入现有 agent 框架(如 LangChain、AutoGPT、CrewAI):
- 替换原有
append_history步骤,转为按类型检索记忆写入新提示。 - 定义
memory_schema(如观测、工具调用、技能),通过轻量向量库或结构化查询实现检索。 - 提供 ablation 接口,方便 A/B 测试不同记忆层的贡献。
具体落地场景举例
跨会话电商导购:用户可能中途切换话题、返回对比商品,agent 需记住购物车但丢弃无关闲聊。使用 AgenticSTS 的 retrieval 策略,仅将“商品 ID-价格-用户活跃心愿”等字段注入当前提示,避免历史比价细节污染决策,提升推荐准确度且降低 30%-50% token 消耗。
IT 运维助手:处理告警长流程时,agent 需缓存拓扑图、近 24 小时同类型告警等。有界记忆按“触发时间”“类型”压缩检索,让 agent 聚焦当前事件,而非全文复刻所有日志,加快平均处置时间(MTTR)。
局限
- **样本量有限,统计显著性不足**:核心消融实验仅基于 10 局游戏(无技能层 3/10 胜 vs 有技能层 6/10 胜),Fisher 精确检验 p≈0.37,方向性结论尚不稳固;更大规模重复实验与跨多种随机种子的验证是下一步必须的工作,目前结论仍停留在初步观察阶段。
- **任务与评估的单一性**:实验仅在《杀戮尖塔 2》一个游戏上进行,尽管该游戏融合战术与战略决策,但环境的高度特化使得有界契约方法在更通用的长周期决策任务(如代码生成、对话管理、科学推理)上的有效性未知;同时胜率指标未与人类或其他基线做严格统计校准,外部效度受限。
- **契约设计假设强且覆盖面窄**:bounded contract 通过类型化检索组装提示,完全摒弃原始对话转录,这可能过滤掉某些对决策有用的跨回合隐式上下文(如行动连贯性、风格适应);论文未与混合契约(部分转录 + 检索)对比,也未讨论契约在不同 LLM 规模或架构上的敏感性,影响了方法普适性。