ACC: 编译智能体轨迹用于长上下文训练
近期智能体的发展重新激发了对大语言模型长上下文推理能力的需求。然而,训练这一能力需要昂贵的长文档整理或启发式上下文合成。 问题:智能体在解决问题时产生大量轨迹,涉及多轮工具调用和环境观察。回答原始问题所需的证据分散在这些轮次中,需要整合远距离上下文片段。但标准智能体SFT 仅掩码工具响应并训练轮次级工具选择,造成监督盲区,使得这些分散信号未被利用。 方法:我们提出Agent Context Compilation (ACC),将来自搜索、软件工程和数据库查询智能体的轨迹转换为长上下文问答对。这些对将原始问题与多轮工具响应和环境观察结合,训练模型直接回答而不需工具使用。这使得问题与证据之间的依赖关系显式化,无需额外标注即可直接监督远距离段的长上下文推理。 实验:在MRCR和GraphWalks基准上验证,这两个基准分别挑战跨轮指代消解和图遍历。用ACC 训练Qwen3-30B-A3B,在MRCR上达68.3(+18.1),在GraphWalks上达77.5(+7.6),结果与Qwen3-235B-A22B相当,同时保持GPQA、MMLU-Pro、AIME和IFEval上的通用能力。 结论:ACC 是一种简单有效的长上下文监督微调方法,可配合现有长上下文扩展或训练方法,提供可扩展数据。进一步机制分析表明,ACC 训练的模型展现出任务自适应注意力重构和专家专业化。
论文精读
TL;DR ACC 将 Agent 多轮轨迹编译为长上下文 QA 对,直接监督远距离证据整合,显著提升长程推理,使 30B 模型媲美 235B 模型。
问题
问题背景
LLM 的长上下文推理能力是 AI Agent 落地的基础——Agent 往往需要跨越多轮工具调用与环境反馈,才能整合分散在长上下文中关键证据。然而,让模型掌握这种远距离依赖整合能力的高质量训练数据,长期受限于 昂贵的长文档管理或启发式上下文合成。
现有方法的局限
标准 Agent SFT 主要训练轮级别的工具选择,并通常 屏蔽工具响应 ,这导致一个“监督盲点”:模型从未学习如何利用散布在多轮中的响应信号来直接回答原始问题。现有的长上下文训练方案,如长文档续写或位置插值,要么依赖难以大规模获取的天然长文本,要么仅改变位置编码而未引入真正的多跳推理监督。这造成两个工程痛点:
- 人工构造长上下文 QA 对的成本极高,难以规模化
- 从 Agent 轨迹中自然产生的长程依赖被浪费,未能转化为训练信号
难点与重要性
核心挑战在于 如何零成本地从现有 Agent 轨迹中解耦出长距离依赖的显式监督,让模型直接建立问题与远距离证据之间的映射,而不增加标注负担。这类能力直接决定了 搜索代理、软件工程助手、数据库查询 Agent 等系统的决策质量:若模型无法跨越数十轮历史定位线索,就会反复调用工具或给出错误答案。业界对长上下文窗口的军备竞赛已证明容量并非瓶颈,但缺乏与推理目标对齐的训练范式,使得窗口越大反而越容易引入噪声。
行业类比
这好比 代码补全工具 需要根据多个文件中的 API 定义直接生成调用代码,而不必逐一查找文档——ACC 将多步 Agent 交互编译为端到端问答,使模型内化长上下文推理,提升自动化层级。
方法
方法核心:轨迹编译与长上下文监督
输入:Agent 在解决复杂问题(搜索、软件工程、数据库查询)时产生的多轮轨迹,每轮包含工具调用(Tool Call)与环境观察(Tool Response)。这些轨迹中,回答原问题所需的证据分散在不同轮次,形成远距离依赖。
关键模块:Agent Context Compilation (ACC) 将轨迹转化为直接监督长上下文推理的 QA 对,分三步:
- 证据抽取与对齐:从完整轨迹中识别原始问题(Original Question)及所有相关的工具响应与环境观察,按轮次顺序保留信息,构成长上下文(Context)。此时,不再保留工具调用的动作序列,而是将所有观察结果拼接为纯文本证据集。
- 答案生成:利用原始问题与编译后的全部证据,通过人工或强模型推导出最终答案(Answer)。该答案必须基于证据整合得出,且不依赖任何工具调用步骤。
- 样本构造:得到三元组
{长上下文, 原始问题, 答案},上下文长度可达数千至数万 token,答案通常为简短的结论或数字。
训练:直接将上述三元组作为监督微调(SFT)样本,模型输入完整上下文与问题后,自回归生成答案。损失仅作用于答案部分的 token,上下文部分不计算损失。此过程强制模型学习从互不相邻的证据片段中进行跨段推理与指代消解,显式监督远距离依赖的整合能力,而无需额外标注长文档或合成启发式上下文。
与同类方法的差异:传统长上下文训练依赖昂贵的长文档策展或启发式片段拼接,ACC 利用已有 Agent 轨迹自动生产高质量、多头绪的监督数据,将 Agent 能力训练中的“盲区”(被屏蔽的工具响应)转化为长上下文推理的直接训练信号。
实验
实验设计
ACC 实验围绕 长程依赖建模 展开,核心评估基准为 MRCR(跨轮指代消解)与 GraphWalks(扩展上下文图遍历)。基座模型选用 Qwen3-30B-A3B,将其 agent 轨迹经 ACC 转换为长上下文 QA 对进行监督微调,并与原始 agent SFT 基线及更大规模模型 Qwen3-235B-A22B 对比。通用能力保留验证在 GPQA、MMLU-Pro、AIME、IFEval 上完成。消融研究探索 agent 类型(搜索、软件工程、数据库查询)与干扰项的影响,机制分析则聚焦 注意力重构 与 专家专业化。
关键发现
- 长上下文推理大幅提升:ACC 训练后,Qwen3-30B-A3B 在 MRCR 达到 68.3(+18.1),GraphWalks 达 77.5(+7.6),性能堪比参数量大 7 倍的 Qwen3-235B-A22B。
- 通用能力无损:在 GPQA、MMLU-Pro、AIME、IFEval 等数据集上,分数未见明显退化,表明 ACC 不会挤出原有知识。
- 注意力模式自适应:模型学会针对任务动态重组注意力,将更多权重分配到与问题相关的远距离证据片段。
- 专家路由专精化:混合专家模型中,不同 token 组的路由分布出现任务依赖性变化,部分专家对长程依赖证据的处理贡献增强。
与基线对比的深度解读
相比标准 agent SFT(仅训练工具选择,掩码工具响应),ACC 直接监督远距离依赖的整合,消除了“监督盲区”。这种 零额外标注 的数据增强方式,使 30B 模型在长上下文推理上逼近 235B 模型,同时保持通用能力不降,说明长上下文能力的关键在于明确建模证据-问题依赖关系,而非简单扩大模型规模。消融实验进一步证实,多类 agent 混合与合理干扰项设置能稳定增益,避免过拟合单一轨迹模式。注意力与专家的分析揭示 ACC 引入了更结构化的内部表示,这为长上下文 LLM 的训练提供了一种轻量、可扩展且可解释的改进路径。
行业影响
ACC 通过将 Agent 多轮交互轨迹转换为长上下文 QA 对,为工业界提供了一种低成本、高可扩展的长上下文推理能力增强方案。
落地场景
- 智能客服与知识助手:用户问题往往需整合跨文档、跨会话的离散信息。ACC 训练后的模型可一步到位生成综合答案,无需逐步调用工具。
- 代码与工程辅助:在复杂代码库或软件工程任务中,模型能直接基于长上下文(如全仓库代码、多轮指令历史)输出解决方案。
- 数据分析与商业智能:从多步数据库查询、多表关联中直接总结洞察,避免人工拼接中间结果。
- 金融与医疗问答:整合分散在多个报告、病历或研究中的证据,提供直接且可回溯的结论。
商业价值
- 模型降本与推理提效:ACC 让小模型(如 30B)的长上下文能力逼近大模型(235B),大幅降低部署成本;同时省去多轮工具调用的延迟,提升用户体验。
- 零额外标注数据扩展:复用现有 Agent SFT 日志中被忽略的工具响应与环境观察,自动编译高质量训练数据,边际成本几乎为零。
- 通用能力无损:在 GPQA、MMLU-Pro 等基准上保持原有水平,可直接叠加现有微调流程,无替换风险。
与现有产品/工作流的接口
ACC 本质是一种数据增强方法,可无缝嵌入现有 LLM 训练栈:
- 数据准备:从已部署的 Agent 系统(如搜索、代码执行)的轨迹存储中抽取多轮交互。
- 编译为长上下文 QA:按 ACC 规则拼接原始问题、工具调用结果、环境观测,形成单轮问答对。
- SFT / 偏好对齐:将编译数据混入监督微调或 DPO 训练集,无需改动模型架构或损失函数。
- 评估:在 MRCR、GraphWalks 等长依赖任务上验证提升,同时监控通用基准以防退化。
具体落地 Use Case
- 电商平台智能导购:用户提问“结合我上次购买的咖啡机和本周食谱,推荐一款能打奶泡的平价咖啡豆”,模型需从用户的历史订单、食谱文档和商品数据库等多源上下文中整合信息。ACC 训练的模型可直接输出推荐及解释,无需多次搜索调用。
- 在线教育个性化辅导:学生问“我三次数学测验都错在几何证明,能总结我的薄弱点并出三道同类题吗?”,模型需关联三次测验的详细错题、知识图谱和题库。ACC 使其直接基于长上下文生成诊断与定制化练习。
整个方案无需额外人工标注,与现有 Agent 系统共生,可被全球 AI 从业者快速集成到主流模型训练管线中。
局限
- 1. **依赖源数据质量与多样性**:ACC 将 agent SFT 轨迹编译为长上下文 QA,其效果高度依赖原始数据的覆盖度和噪声水平。若源轨迹仅来自搜索、软件工程或数据库查询等限定的 agent 类型,则编译出的训练数据可能缺乏其他长程依赖模式,导致泛化性受限。此外,轨迹中的工具响应和环境观察未经筛选,可能包含冗余或误导信息,直接影响模型学习信号。
- 2. **训练后丧失工具使用能力**:ACC 的目标是让模型在无工具的情况下直接回答原始问题,这牺牲了 agent 原本的工具调用与交互能力。实际部署中,若任务需要动态访问外部工具(如实时 API、数据库查询),则 ACC 训练的模型无法胜任,需与保留工具调用的训练方案结合。
- 3. **评估基准狭窄、对比不充分**:论文主要在 **MRCR** 和 **GraphWalks** 两个合成基准上验证,尽管提升显著,但未覆盖通用长上下文推理任务(如长文档 QA、多跳推理)。同时,与最新长上下文后训练方法(如长上下文继续预训练、利用长文档的 SFT)的对比有限,难以判断 ACC 在不同基座模型和任务上的增益稳定性。