论文

ContextPilot: 通过细粒度强化学习教授智能体进行主动上下文管理

ContextPilot: 通过细粒度强化学习教授智能体进行主动上下文管理

长程智能体任务要求大语言模型(LLM)在多轮交互中反复检索、整合并维护分散的信息,但记录全部交互历史会导致工作上下文持续膨胀。现有的主动上下文管理方法允许模型借助专用工具编辑自身上下文,但仍存在三个关键局限:1) 工具集受限,仅支持搜索、删除和摘要,缺乏对全局规划、长期记忆以及自适应压缩的支持;2) 探索效率低下,将不同类型的上下文管理动作一视同仁,忽视了它们对最终结果的异质性影响;3) 信用分配粗粒度,在强化学习中将最终轨迹级奖励平均分配给所有中间的上下文编辑动作。 为弥补上述不足,我们提出 ContextPilot,一个面向长程智能体推理的主动上下文管理框架。该框架系统性地扩展了工具集,新增了规划、长期记忆和软上下文卸载工具,并针对上下文管理任务定制了强化学习方法。具体而言,我们利用上下文和熵的变化来识别关键编辑决策,以此进行分支采样,并从所有经过对应上下文编辑动作的分支轨迹中估计动作级优势。 在长上下文问答和深度检索任务上的实验表明,ContextPilot 能够在更精简的工作上下文中取得更强的性能,稳定优于多种基础模型和基准上的现有方法。代码已开源至 https://github.com/Tencent/ContextPilot。

论文精读

TL;DR ContextPilot 为长程智能体引入规划、长期记忆、软卸载等上下文编辑工具,并用分支采样 RL 实现动作级信用分配,在更紧凑工作上下文中超越现有基线。

问题

长程 agentic 任务中,LLM 需在多轮交互中不断检索、整合分散信息,工作上下文随交互历史持续膨胀。

现有 主动上下文管理 方法让模型用专用工具编辑自身上下文,但存在三点局限:

  • 工具集仅支持搜索、删除、摘要,缺少 全局规划、长期记忆 与 自适应压缩;
  • 探索阶段对所有上下文编辑动作同等采样,忽略不同编辑决策对最终结果影响的异质性;
  • RL 训练采用轨迹级奖励,将整体得分直接分配给所有中间编辑步骤,信用分配 粗糙,导致有价值编辑与无关编辑混淆。

该问题难在:上下文编辑属于离散动作空间,决策后果在长程任务中延迟显现;窗口内信息保留与丢弃之间需动态权衡,过度压缩会丢失关键线索,过度保留则消耗推理预算并引入噪声。业界对长程推理、深度搜索等场景的上下文效率关注度持续上升,亟需可学习、细粒度的管理策略。

类比个人知识管理:用户需实时决定哪些笔记留在临时缓存、哪些归档到长期记忆,而非简单删除或全量保存。

核心洞察

  • 上下文编辑动作的异质性影响被纳入信用分配,通过**分支采样**估计动作级优势,突破以往轨迹级奖励平均分配的做法。传统 RL 方法(如 ReSum、SUPO)将最终奖励均匀回传给所有上下文管理动作,忽略了不同编辑决策对最终答案的影响差异。ContextPilot 从同一状态分支多个轨迹,仅对经过特定编辑动作的轨迹估计优势,实现更准确的策略梯度,提升工具使用的正确性和任务成功率。
  • 利用上下文与熵的变化量识别关键编辑决策,驱动分支采样,在探索效率上显著优于均匀采样。已有工作对所有上下文管理动作等同对待,导致大量低效探索。ContextPilot 通过监测上下文信息量和模型置信度的变化,定位对最终表现影响最大的编辑步骤,将有限的采样预算集中在关键分支上。这种方法在长程任务中减少无效样本,加速 RL 收敛,同时保持紧凑的上下文。

方法

ContextPilot 的输入是多轮交互中不断增长的工作上下文(working context),LLM agent 需要从中检索、整合分散信息以完成长时程任务。其方法核心分为两部分:工具集扩展与定制化 RL 训练。

工具集设计

  • 保留搜索、删除、摘要等基础操作,新增三类工具:
    • 全局规划(planning):对上下文管理进行前瞻性安排;
    • 长期记忆(long-term memory):将关键信息存入持久存储,避免工作上下文过载;
    • 软上下文卸载(soft context offloading):自适应压缩或转移内容,而非仅硬删除。

这些工具使模型能更灵活地维护上下文。

RL 训练设计

  • 上下文感知部分展开(Context-Aware Partial Rollout):利用上下文和熵的变化识别哪些上下文编辑动作是“关键决策”,对这些关键点进行分支采样,避免均匀探索;
  • 细粒度信用分配(Fine-Grained Credit Assignment):从所有经过某个上下文编辑动作的分支轨迹中估计动作级优势(action-level advantage),而非将最终轨迹奖励粗糙地分配给所有中间动作。

输出是训练后的 policy,能够在长上下文 QA 和深度搜索任务中以更紧凑的上下文取得更强性能。代码与模型见 GitHub 与 项目主页。

与同类工作(如 ReSum、SUPO 等)相比,差异点在于:ContextPilot 不仅扩展了工具集,还专门针对上下文管理动作的异质性设计了高效探索与信用分配机制。

实验

实验设计

论文在长上下文问答和深度搜索两类任务上评估 ContextPilot,并在多个基础模型上验证泛化性。基线包括 ReSum、SUPO 等现有主动上下文管理方法,以及被动上下文管理基线。训练过程分为两个阶段:先通过数据合成得到监督微调(SFT)数据,再使用提出的 RL 方法进行训练,该 RL 方法利用上下文和熵变化识别关键编辑决策,并基于经过相应编辑动作的分支轨迹估计动作级优势。

关键发现

  • 性能与上下文紧凑性兼得:ContextPilot 在更紧凑的工作上下文下取得更强性能,一致优于现有基线。
  • RL 重塑工具使用策略:通过 RL 训练,模型对规划、长时记忆、软上下文卸载等扩展工具的使用更合理,工具使用正确性与任务成功率协同提升。
  • 消融实验验证设计有效性:工具集扩展和细粒度信用分配各自带来增益,移除任一组件会导致性能下降。

与基线对比解读

现有主动上下文管理方法受限于工具集狭窄(仅搜索、删除、摘要)、探索效率低(均匀对待异构动作)以及粗粒度信用分配(轨迹级奖励赋给所有中间动作)。ContextPilot 通过引入规划、长时记忆和软卸载工具,并设计针对上下文管理的 RL 训练方法,显著缓解了上述问题。对比结果说明,在长程智能体推理中,工具集的系统扩展与动作级信用分配对上下文编辑策略的优化至关重要。但论文未给出具体量化指标,趋势性结论需结合代码复现进一步验证。

行业影响

落地场景

ContextPilot 适合需要长时间多轮推理的智能体产品,例如:

  • 电商智能导购:用户在多轮对话中比较商品、咨询参数、议价时,上下文会快速膨胀。ContextPilot 主动做全局规划、提取长期偏好,并把非关键信息软卸载,保持回复准确且延迟可控。
  • 企业知识库检索助手:面向客服、技术支持等场景,跨多文档抽取信息时,模型需要反复检索并整合。ContextPilot 的规划与记忆工具可以显著降低无效检索,让工作上下文更紧凑。

商业价值

主要落在降本和体验提升两条线:

  • 降本:更紧凑的上下文直接减少 token 消耗,同时保持或提高任务成功率。在 deep search、长文档 QA 等高频调用场景,单次推理成本可明显下降。
  • 体验提升:通过细粒度信用分配与分支采样,模型学会在关键节点做上下文编辑,避免丢失重要信息,最终输出一致性更强,用户信任度提高。

与现有产品/工作流的接口

集成方式相对直接:ContextPilot 提供了一组上下文编辑工具和对应的 RL 训练流程,可以嵌入已有的 agent 框架(如 LangGraph、AutoGen)。实际工程中:

  1. 将工具集注册到现有 agent 的工具列表;
  2. 使用 ContextPilot 的 SFT 数据合成方式生成训练样本,再用其 RL 方法微调 base model;
  3. 部署时只需替换模型权重,无需改动上层业务逻辑。

GitHub 仓库 ContextPilot 提供了代码与模型权重,便于快速验证。

对实际工程的启示:上下文管理不应只靠 summarization 或 deletion,而是需要规划、记忆与软卸载的组合;RL 训练中要识别关键编辑决策,否则会引入噪声。

局限

  • **RL 训练计算开销较高**:方法采用部分 rollout 与分支采样,需要为多个上下文编辑决策生成分支轨迹来估计动作级优势,采样数量与训练时间显著增加;同时依赖上下文与熵变化识别关键决策,其准确性受超参数和任务特性影响,可能遗漏关键编辑点或引入噪声分支,导致训练不稳定。
  • **工具集扩展带来的学习复杂性**:新增的全局规划、长期记忆与软上下文卸载工具要求模型具备更强的工具选择与协调能力,SFT 数据合成依赖于模板或启发式,可能无法覆盖真实场景的多样性;此外这些工具的联合使用可能增加上下文管理策略的复杂度,在小模型或简单任务上可能产生冗余操作,影响 token 效率。
  • **实验范围相对有限**:论文在长上下文 QA 与深度搜索两个任务上验证,尚未涵盖更广泛的 agentic 场景(如多步工具调用、交互式环境);与 ReSum、SUPO 等基线对比虽一致提升,但提升幅度取决于具体基准和模型规模,跨领域泛化性有待进一步检验;另外 GitHub stars 较少,社区验证与第三方复现尚未充分。
论文Zhuoshi Pan2026-08-28原文

相关内容