计划不会持久:为什么上下文管理对 LLM 智能体至关重要
长周期智能体依赖上下文管理:系统压缩、总结并淘汰旧 token,使任务能够在有限窗口之外继续。这仅在丢弃的信息不再需要或被内化时才安全。计划是压力案例:它们编写较早,用于多个步骤,并且首先被淘汰。我们引入回放配对(replay pairing),一种诊断方法,在历史中有无计划的情况下运行相同轨迹,并测量隐藏状态的余弦距离。在 Llama-3.1-70B 上,计划信号在计划后一步达到 0.453,然后在单个动作-观察步骤中下降 4.1 倍;HotpotQA 下降 12.4 倍。这表明标准 LLM 智能体不会将计划作为持久状态向前传递,而是依赖计划保留在上下文中。层-L32 探针(layer-L32 probe)检测到这种衰减作为诊断,而非证明其读取计划内容本身。 推理模型引入了一个测量混淆:它们的 <think 痕迹重新推导计划内容,因此标准剥离会在剥离条件下留下计划证据。我们称之为推理痕迹混淆(reasoning-trace confound),并通过严格剥离来修复,该剥离仅从剥离运行中移除先前的 <think 块。它在样本内恢复了步骤+1 信号的 +163%,在样本外恢复了 +153%,同时未显著改变非推理的 Llama(+4.8%)。在 DeepSeek-R1-Distill-Llama-70B 上,Llama 训练的探针以 AUROC 0.748(p=6e-4)迁移,而 R1 特定的探针达到 1.000,表明 R1 以不同的隐藏状态方向编码计划信号。 最后,压缩压力测试显示了实际代价:简单计划淘汰使 ALFWorld 成功率下降 34.7 个百分点,而探针门控的重新浮现未能恢复。贡献是一个测量和压力测试框架,表明智能体关键信息可能是上下文驻留而非持久的。上下文管理至关重要,但仅计划保护是不够的。
论文精读
TL;DR 本论文通过“重放配对”诊断发现,LLM 代理并不持久保存计划,计划信号在上下文中迅速衰减,揭示了上下文管理的关键负载地位和计划淘汰的高昂代价。
问题
问题背景
大型语言模型(LLM)驱动的智能体在长时程任务中依赖上下文管理(context management)——系统需要压缩、摘要或驱逐旧token,以便在有限的上下文窗口内延续任务。当前领域关注: 如何安全地移除不再需要的信息,同时确保关键信息已被模型内化为持久状态。
现有方法局限
现有上下文管理策略(如滑动窗口、文本摘要、token重要性评分)大多基于启发式规则,假设被丢弃的信息已无后续价值或已被模型编码到参数/隐藏状态中。然而,计划(plan)这类在任务早期生成、贯穿多步执行的结构化信息,往往是第一批被驱逐的对象。实验表明,标准LLM智能体并不会将计划持久化到隐藏状态: 一旦计划从上下文中消失,对应信号在隐藏层余弦距离上迅速衰减——在Llama-3.1-70B上,计划后一步信号骤降至初始峰值的4.1倍以下,在HotpotQA等任务中更衰减12.4倍。缺乏对信息“驻留性”的细粒度测量,使得压缩策略沦为盲操作。
为什么这个问题难/重要
挑战在于: (1) LLM的隐藏状态并非显式的键值存储,计划信息可能分散在多个层与注意力头中,难以直接检测其存留; (2) 不同任务、不同模型层对计划的依赖模式差异巨大,且推理模型(如DeepSeek-R1)的<think>推理痕迹会重新推导计划内容,形成推理痕迹混淆(reasoning-trace confound),干扰测量; (3) 实际工程中,简单的计划驱逐会直接导致任务成功率大幅下降(例如ALFWorld中降低34.7个百分点),但仅靠基于探针(probe)的看守重提机制又无法恢复性能,说明仅保护计划信号不够。业界亟需可操作的诊断框架与压力测试方法来评估上下文管理策略是否“负重”。
行业类比
就像自动驾驶系统缓存了长距离路线规划,但一旦超出实时窗口,规划细节并未写入持久记忆,导致面对突发路况时无法回溯原始意图。
核心洞察
- LLM 智能体并不将计划作为持久隐藏状态携带,而是完全依赖它在上下文中的存在;一旦计划被驱逐,模型就立即丢失计划相关的信号。本文通过重放配对(replay pairing)测量隐藏状态余弦距离,首次直接量化了计划信号的衰减曲线,证明标准 agent 架构下上下文管理是实际承载计划记忆的唯一机制。这与普遍假设“模型会内化计划”形成鲜明对比,并暴露了长程任务中 token 淘汰策略的根本脆弱性。
- 推理模型(如 DeepSeek-R1)的 “think” 痕迹会重新推导计划内容,导致标准的计划剥离实验失效——即“推理痕迹混淆”(reasoning-trace confound)。作者提出严格剥离(strict stripping)来修复该测量缺陷,恢复了大量隐藏的计划信号。这表明推理模型可能将计划信息编码在不同于普通模型的方向上,且为评估推理 agent 的记忆机制设立了更严谨的实验标准。
- 即便用探针检测到计划信号衰减,基于探针门控重新引入计划上下文的保护策略(probe-gated re-surfacing)也无法恢复任务成功率(ALFWorld 上下降 34.7pp)。这说明上下文管理是负载关键,但单一的“计划保护”并不充分;智能体可能依赖上下文中的其他历史信息协同工作,单点记忆强化无法解决整体上下文压缩带来的性能退化,提示需要更全面的上下文编排策略。
方法
方法概述:测量与压力测试框架
本文构建了一套诊断框架,用于量化长程 LLM Agent 对计划上下文驻留的依赖程度,并揭示上下文管理的关键性。整体流程遵循“输入轨迹 → 重放对比 → 探针检测 → 压缩压力测试”的线索。
1. 计划诱发
对每个任务,要求 Agent 先在输出中生成显式计划,再逐步执行。计划作为后续所有步骤共用的一段文本,初始化于上下文窗口,天然成为最早被驱逐的候选 token。
2. Replay Pairing(重放配对)
这是核心诊断手段。对同一条轨迹,执行两次:
- 有计划回放:完整历史,包含计划;
- 无计划回放:从上下文移除计划及其直接后续,其余完全一致。 在两轮中,于相同位置提取模型隐藏状态,计算余弦距离。该距离即为计划信号:值越大,说明有/无计划时模型内部表示差异越显著,即计划信息仍被上下文携带。
3. 推理痕迹混淆与 Strict Stripping
推理模型会产生 <think> 块,其在回答前重新推导计划内容,导致标准剥离后“无计划”条件下仍残留计划信息。作者将此称为推理痕迹混淆。解决方案是 Strict Stripping:仅在无计划回放中移除所有先前的 <think> 块,而有计划回放保留。这样修正了计划信号测量:在步骤+1处信号恢复 +163%。
4. 探针训练与检测
在固定层(如 L32)训练线性探测器,输入隐藏状态,二分类判断计划是否在上下文中。探针作为衰减诊断器,而非证明模型真的“阅读”了计划内容。评估指标包括 AUROC、分层泛化性等。对推理模型,需单独训练探针(或跨模型迁移)。
5. 压缩压力测试
模拟真实上下文管理:当窗口溢出时,直接驱逐计划。在 ALFWorld 等基准上测试,计划驱逐导致成功率大幅下降(-34.7pp),而基于探针门控的重新注入策略未能恢复。这证明计划保护本身不足以弥补上下文驻留信息丢失。
与同类方法的差异:不同于仅分析注意力或提示工程的工作,本方法通过严格控制的重放对比和隐藏状态信号量化,首次系统测量出计划信息随上下文位置衰减的动力学,并隔离了推理模型的 <think> 混淆效应,为上下文管理设计提供了可检测的负载指标。
实验
实验设计
论文提出 replay pairing 诊断方法:对同一任务运行两条轨迹,一条在上下文中保留计划,一条移除计划,测量最后隐藏层的余弦距离作为 计划信号。实验在 Llama-3.1-70B 智能体上展开,任务涵盖 ALFWorld 和 HotpotQA。为检测信号衰减,训练 Layer-L₃₂ 线性探针,并引入 严格剥离(strict stripping) 解决推理模型的思维链混淆。最后进行上下文压缩压力测试,模拟计划被剔除后的性能变化。
关键发现
计划信号在规划步骤后一步骤达到峰值 0.453,随后急剧衰减,ALFWorld 单步衰减 4.1 倍,HotpotQA 衰减 12.4 倍,证明标准智能体不将计划内化为持久状态,而是依赖上下文中的计划文本。探针可检测衰减,Llama 训练探针迁移至 R1 模型仅得 AUROC 0.748,而 R1 专用探针可达 1.000,表明推理模型可能在不同方向编码计划信号。严格剥离恢复 +163% 步+1 信号,说明推理模型先前结果被污染。压缩压力测试中,简单计划剔除使 ALFWorld 成功率骤降 34.7 个百分点,而探针门控重浮现未能恢复该损失。
与基线对比解读
该工作并未提出新的上下文压缩算法,而是建立了一套测量与压力测试框架,揭示计划保护的必要性但不足以支撑长期智能体。相比于以往仅关注压缩率的工作,它从内部状态角度诊断信息丢失,指明上下文管理是负载关键(load bearing) 环节。这提示工程实践需超越简单计划保留,转向选择性记忆与状态持久化,例如学习哪些信息需内化到隐藏状态,而非全部依赖上下文窗口。
行业影响
落地场景
本论文发现LLM Agent 的长期规划信息高度依赖上下文驻留,而非持久化状态。一旦上下文管理(如 token 驱逐、摘要压缩)误删计划内容,任务成功率会显著下降。这一风险直接影响所有需要多步推理的 Agent 产品:
- 自动化客服与工单系统:Agent 需根据初始计划多轮调用工具、查询知识库,中途上下文压缩可能导致后续步骤偏离原定方案。
- 代码生成与调试助手:长会话中计划(如修复步骤)被截断,模型会重复错误或丢失目标。
- 自动驾驶与机器人规划:运行时上下文窗口有限,计划信号衰减会导致动作序列失稳。
商业价值
错误驱逐计划 token 可能直接造成任务失败,推高人工干预成本。以一个日均处理 10 万次会话的客服系统为例,若计划丢失导致 5% 的会话需要人工接管,按单次 2 美元成本计算,年损失可达 365 万美元。
从另一个方向看,精准的上下文管理可以延长 Agent 的有效运行窗口,减少因截断带来的重复推理,直接降低 LLM 调用 tokens 消耗(减少冗余重试)。同时,更稳健的计划保持能力可提升用户体验,在金融投顾、医疗问诊等高价值场景中降低合规风险。
与现有产品 / 工作流的接口
当前主流 Agent 框架(如 LangChain、Semantic Kernel、AutoGPT)普遍采用简单的滑动窗口或摘要式上下文管理,缺少对计划信息重要性的感知。本文提出的 replay pairing 诊断方法 和 layer-L32 探针 可以直接集成进这些框架的上下文压缩模块:
- 在压缩前,用探针评估当前隐藏状态是否已丧失计划信号,以此决定是否保留计划 token。
- 对于推理模型(如
DeepSeek-R1),用 strict stripping 清理<think>痕迹,避免计划信号稀释,同时防止探针误判。
具体落地用例
1. 电商大促客服机器人
大促期间用户问题复杂(订单修改、优惠叠加、物流追踪),Agent 需要按照初始计划顺序调用多个 API。若上下文压缩导致计划前半段被丢弃,机器人可能错误跳过优惠核验步骤,造成资损。集成探针后,系统可在发现计划信号衰减时自动暂停压缩,或重新注入计划内容,保障关键路径不中断。
2. 医疗病历摘要与分诊 Agent
多轮问诊后需生成分诊建议,计划可能包含“收集主诉→追问病史→建议科室”。若中途上下文窗口溢出,计划后半段丢失,可能导致分诊中断或错误。通过计划信号监测,系统可在临界点触发“计划回显”或人工确认,确保诊断链条完整。
局限
- - **模型与任务覆盖范围有限**:实验主要基于 Llama-3.1-70B 与 DeepSeek-R1-Distill-Llama-70B 两个模型,任务集中在 HotpotQA 与 ALFWorld。不同体量、不同架构的 agent(如 GPT-4 系列、Claude 等)及更开放、更长步数的环境(如 WebArena、SWE-bench)上计划信号衰减模式是否一致尚不明确,泛化结论有待验证。
- - **仅诊断问题未提供解决方案**:论文核心贡献是揭示计划信号在上下文中的快速衰减以及推理痕迹测量混淆,但未提出有效机制让计划真正持久化(如永久化记忆模块或训练期注入)。压缩压力测试中探针门控重投仅避免负面效果,未能恢复性能,表明仅靠保护计划上下文不足以解决根本问题。
- - **探针的因果性与泄漏风险**:尽管作者通过零次射击基线、逐层分析等方式验证探针不直接读取计划内容,但 L32 学习到的方向是否完全来自上下文差异而非其他混杂信号仍需更严格的因果干预实验(如直接在激活空间中擦除计划方向并观测行为变化)。对于实际部署,探针依赖于特定模型和数据集,部署成本较高。