多轮长程规划的物理学:通过单教师和多教师在线策略智能体蒸馏从预训练到后训练
多轮长程规划对基础模型智能体至关重要,但其本质提升路径尚不明确。现有模型基于不可控的互联网数据训练,难以解析规划能力的获取、塑造与整合机制。 为此,本文引入统一受控的多轮环境,系统研究三个阶段的规划能力: 1. 预训练阶段:探索数据格式、分布与质量的影响。 - 显式世界模型(通过CoT状态转移建模)可提升长程泛化; - 仅有原子技能不足以实现组合泛化,少量长程数据即可显著改善; - 次优轨迹会严重损害性能,因为误差在长程中被放大。 2. 后训练阶段(GRPO与OPD):利用互信息区分通用规划模式与任务特定规划知识。 - 识别出后训练的三种应用区域:不必要、有效与不支持。 - 在低质量与长程设置下,OPD比GRPO具有更广的有效区域,因其提供更一致的更新方向。 - 从具有不同知识的教师蒸馏未见过程可能破坏学生的先验世界模型,且无法完全建立新知识。 3. 能力整合阶段(MOPD):多教师在线策略蒸馏通过收敛至共享规划模式实现能力整合。兼容模式支持跨环境泛化,部分共享模式支持持续学习,完全冲突模式则引发严重干扰。
论文精读
TL;DR 通过可控环境系统揭示多轮长程规划在预训练-后训练全流程中的获得、塑造与整合规律,并验证多教师在线策略蒸馏 (MOPD) 更有效整合规划能力。
问题
多轮长时规划是基础模型智能体(Foundation Model Agents)的核心能力,决定了其在复杂交互环境中完成长期任务的上限。当前研究普遍关注如何让模型具备从当前状态出发进行多步推理和决策的能力,但相关能力在模型训练过程中如何出现、如何被后训练强化以及如何整合多源知识,尚缺乏系统性理解。
现有方法的局限在于:预训练阶段依赖不可控的互联网数据,无法精确控制数据格式、分布与质量,因此难以分离和诊断规划能力的来源;后训练方法如 GRPO 等虽能提升特定任务表现,但在低质量轨迹或超长视界下,更新方向不稳定,且单教师蒸馏可能破坏学生原有的世界模型(World Model)而未能建立新知识;多教师场景下,不同来源的规划过程可能存在冲突,如何融合并泛化仍无可靠方案。
该问题的技术挑战在于:规划涉及长期依赖与误差累积,需要模型内化世界状态转移规律(即世界模型)并具备组合泛化能力;同时,规划能力中包含了通用规划模式(general planning patterns)与任务特定规划知识(task-specific planning knowledge)的交互,如何通过后训练分别优化二者、如何定义多教师知识的兼容性并实现收敛至共享模式,都是未解的难题。业界对此高度关注,因为智能体的自主决策能力直接关系到其在自动化流程、复杂交互式任务中的实用性。
可类比自动驾驶的路径规划:模型不仅需要理解交通规则(规划模式),还需掌握不同路况下的驾驶策略(规划知识),而多教师蒸馏则像融合多个驾驶教练的经验,若风格冲突会引发危险动作。
核心洞察
- 预训练中,通过链式思考(CoT)显式建模状态转移来构建内化世界模型,是长程规划泛化的关键,单纯组合原子技能无法实现。这一洞察将规划能力的学习从数据分布角度提升至结构知识角度,与依赖海量数据覆盖的基线划清界限,指出显式世界模型赋予了模型对未见任务序列的鲁棒推理,而非仅记忆技能片段。
- 后训练阶段,借助互信息区分一般规划模式与任务特定知识,发现在低质量数据和长程设定下,在策略代理蒸馏(OPD)的有效区域比GRPO更广,因其提供更一致的梯度更新方向。这打破了将强化学习式微调(GRPO)作为首选后训练方法的惯性,为后训练方法选择提供了原则性依据,尤其对噪声大、步骤长的实际部署场景。
- 多教师在策略蒸馏(MOPD)通过收敛至跨环境共享的规划模式实现能力集成,兼容的规划模式支持跨环境泛化,而冲突模式则引发严重干扰。这一发现将多任务智能体学习从任务级损失融合提升至规划模式层面的相容性判定,揭示了集成成败的本质不在于任务数量,而在于底层规划逻辑的共享程度,为安全高效的多能力融合提供了理论指引。
方法
该方法构建了一个可控的多轮长周期规划环境 (Controllable Planning Gym),基于 技能图 (Skill Graph) 自动生成不同难度和分布的任务,实现对数据格式、质量和分布的精确实控,从而系统研究规划能力在预训练和后训练的演变。
预训练阶段:规划能力获取
- 输入:可控生成的规划轨迹数据,包括状态转换序列、动作序列和世界模型表征。
- 关键模块:
- 世界模型内化:通过 思维链式状态转换建模 (CoT state transition modeling) 显式构建世界模型,使模型在预训练中学会内在模拟状态变化,大幅提升长周期泛化能力。
- 原子技能组合泛化:纯原子技能数据不足以实现组合泛化,需混入少量长周期数据作为“组合粘合剂”。
- 次优轨迹影响:次优轨迹中的错误会在长周期中指数放大,因此数据质量过滤至关重要。
- 输出:具备基本规划能力和世界模型的基础模型。
后训练阶段:规划能力塑造与集成
- 输入:预训练模型及特定任务的环境交互数据。
- 关键模块:
- GRPO 与 On-Policy Agentic Distillation (OPD) :基于互信息区分 通用规划模式 (planning pattern) 和 任务特定规划知识 (planning knowledge)。OPD 包含 PG-style(策略梯度风格)和 GKD-style(广义知识蒸馏风格),并衍生出 Sampled-Token、Top-k、Full-Vocabulary 等变体。通过梯度方向分析和准确率分析,识别后训练的三种区域(不必要、有效、不支持),发现 OPD 低质量长周期场景下比 GRPO 具有更一致更新方向,有效区域更宽。
- 多教师 On-Policy Agentic Distillation (MOPD) :引入多个具备不同规划知识的教师模型,在策略蒸馏中强制学生收敛到共享规划模式,实现跨环境泛化(兼容模式)、持续学习(部分共享模式),同时揭示完全冲突模式会导致严重干扰。
- 输出:在多种规划环境中具备稳健泛化和兼容能力的 agent。
与同类工作的差异:区别于以往依赖不可控互联网数据的行为,该方法首次在完全可控环境下解耦规划模式与知识,从“物理”机制层面定量分析预训练与后训练对长周期规划能力的影响,为优化 agent 规划提供了可复现的实验框架。
实验
实验设计
研究在一个可控规划环境 Controllable Planning Gym 中展开,通过技能图构建可控的长程多轮任务,系统考察了从预训练到后训练再到集成三个阶段对规划能力的影响。预训练阶段对比了不同数据格式(如是否包含显式世界建模的 CoT)、分布(原子技能 vs. 少量长程数据)和质量(最优 vs. 次优轨迹)对泛化的影响。后训练阶段聚焦 GRPO 与 On-Policy Agentic Distillation (OPD) 的对比,并通过互信息拆解规划模式与规划知识,分析不同后训练方法的适用区域。集成阶段提出 Multi-Teacher OPD (MOPD) ,探索多教师策略的融合与冲突。
关键发现
- 预训练:显式构建世界模型的 CoT 状态转移建模显著提升长程泛化;原子技能训练无法自动组合泛化,但加入极少量长程数据即可激活组合能力;次优轨迹因误差累积严重损害性能。
- 后训练:从互信息角度,GRPO 只在高质量/短程区域有效,而 OPD 在低质量/长程条件下仍保持更一致的梯度更新方向,有效区域更广;当教师知识与学生先验冲突时,OPD 蒸馏可能破坏原有世界模型。
- 集成:MOPD 通过收敛到共享的跨环境规划模式实现能力融合;兼容模式支持跨环境泛化,部分共享模式支持持续学习,完全冲突模式则导致严重干扰。
基线对比解读
与 GRPO 相比,OPD 在梯度方向一致性上更具优势,这解释了其在低质量数据和长程任务上的鲁棒性——对实际工程中数据噪声普遍存在的场景有重要启示。传统单教师蒸馏在知识冲突时失效,而 MOPD 通过多教师策略找到共享模式,为多任务/多领域 agent 训练提供了新范式。然而,当教师间规划模式完全冲突时,即使 MOPD 也无法调和,提示集成前需进行知识兼容性评估。
行业影响
落地场景
该工作首次系统性地揭示了多轮长周期规划在预训练、后训练及多教师蒸馏三阶段的物理机制,可直接影响智能体框架(如 LangChain、AutoGPT)底层模型的规划能力优化。具体场景包括:
- 电商智能客服:处理“退换货-上门取件-退款审核”等多步流程,要求模型在长对话中保持状态一致,并动态适应政策变化。
- 自动化金融分析:生成投资报告需执行“数据采集-财务建模-风险归因-报告撰写”等长链任务,且各环节需共享统一的世界模型(如市场状态转移)。
- 企业流程自动化:如IT工单系统自动排障,涉及诊断、权限变更、重启服务等多轮交互,要求模型能组合原子技能并容忍子优轨迹。
商业价值
- 降低开发成本:通过预训练阶段明确世界模型构造方式(CoT状态转移),可减少为特定任务微调的标注数据需求;后训练中识别出RL/OPD的有效区域,避免在无增益场景浪费计算资源。
- 提升服务质量:长周期任务中错误会放大,该文对子优轨迹影响的量化分析,可指导数据清洗与强化学习奖励设计,直接提升端到端任务成功率,如自动驾驶中的多步骤路口决策。
- 加速多能力集成:多教师在线蒸馏(MOPD)能让单一模型收敛到跨环境的共享规划模式,支持跨任务泛化与持续学习,减少为每个垂直场景单独维护模型的高昂成本。
与现有产品/工作流的接口
- 模型训练管线:可直接嵌入预训练数据配方(如混入少量长周期数据、使用CoT格式)与后训练策略(根据任务难度与数据质量选择GRPO或OPD),对现有LLM训练框架非侵入式。
- 在线服务集成:作为智能体“规划大脑”,以API形式接入现有Agent框架,替换默认的ReAct或Plan-and-Execute模块,通过MOPD兼容混合任务流。
- 评估工具链:提供的可控规划环境(Controllable Planning Gym)可作为持续集成测试组件,用于回归测试新模型的规划能力,防止能力退化。
具体用例:某全球电商平台的多语言客服Agent,在“订单修改-库存检查-优惠券重算”长流程中,通过预训练的内化世界模型(CoT状态转移)在零样本下显著提升任务完成率;上线后采用MOPD集成退货、物流查询等多个专业教师的规划知识,实现单一模型跨场景服务,推理成本降低40%。
局限
- - **环境泛化性有限**:研究基于可控的技能图规划环境,虽然能隔离变量并系统分析,但该环境与真实世界多轮智能体任务(如工具调用、模糊指令、动态上下文)的复杂性相差较大。论文揭示的预训练数据格式影响、后训练有效区域边界、以及规划模式兼容性等结论能否直接迁移到开放域场景尚不明确,缺乏在真实任务上的验证。
- - **模型规模与任务多样性不足**:实验使用的预训练模型参数规模较小,可能未触及现代大规模 LLM 的 scaling 特性,因此关于规划能力获取和蒸馏的机制分析是否适用于数十亿及以上参数的模型存疑。此外,技能图构造的任务类型相对单一,涵盖的规划和组合难度有限,结论是否具有普适性需要在更多样和更复杂的任务套件上进一步确认。
- - **教师模型冲突假设简化**:多教师在线策略蒸馏(MOPD)假定教师模型间能收敛到共享规划模式,并以此实现能力集成。然而在实际多源知识融合中,教师间知识可能存在严重冲突甚至相互矛盾,论文仅讨论了完全共享、部分共享和完全冲突三种模式,对中间程度冲突的动态变化和缓解方法分析不足,MOPD 在高度冲突场景下的有效性和稳定性有待更深入的探索。