论文

当特权指导失调:面向多轮智能体的状态匹配路由与情境化自蒸馏

当特权指导失调:面向多轮智能体的状态匹配路由与情境化自蒸馏

特权 on-policy 蒸馏通过同步教师访问训练专用参考(如成功轨迹),为多轮智能体提供密集监督。但在交互环境中,学生的先前动作不断改变执行状态,当学生采取不同动作或以不同顺序完成子目标时,其轨迹可能到达参考未覆盖的状态,导致参考对实际状态不可靠,产生 状态-参考错配。 针对此,我们提出 状态匹配路由与情境化自蒸馏(SMRC-SD),明确决定特权轨迹应在何时以及如何指导 on-policy 学生。每一步,SMRC-SD 验证学生当前执行状态是否与参考轨迹中的支持状态匹配,仅在匹配状态应用蒸馏,过滤掉缺乏局部兼容指导的回合。对于每个匹配状态,从成功轨迹构建状态条件教师上下文,使监督基于实际到达状态。 在 ALFWorld 和 WebShop 上,SMRC-SD 持续优于无条件的成功全路径蒸馏。使用 Qwen3-1.7B,在 ALFWorld 上将任务成功率从 0.746 提升到 0.865,在 WebShop 上从 0.574 提升到 0.693。控制实验表明,选择局部支持回合和构建状态兼容教师上下文均有贡献。代码公开于 https://github.com/liujunzhuo/SMRC-SD。

论文精读

TL;DR 针对多轮 Agent 训练中特权轨迹与学生实际状态不匹配的问题,提出状态匹配路由与上下文自蒸馏(SMRC-SD),仅在状态匹配时蒸馏并注入状态适配的教师上下文,在 ALFWorld 和 WebShop 上将 Qwen3-1.7B 的成功率从 0.746/0.574 提升至 0.865/0.693。

问题

问题背景

多轮交互式智能体(如 Web 导航、具身任务)的训练近期聚焦于通过特权蒸馏(privileged distillation) 提供密集的 token 级监督信号。这类方法利用成功轨迹作为参考,为学生在每一轮的动作重新评分,从而缓解稀疏奖励问题。

现有方法局限

传统的特权蒸馏假设参考轨迹对学生的所有决策轮次都具有同等指导价值,但在在线策略(on-policy) 学习中,学生的前置动作会持续改变执行状态。一旦学生采取不同动作或以不同顺序完成子目标,其状态可能会偏离参考轨迹覆盖的范围。此时,强制蒸馏会造成状态–参考错配(state–reference mismatch):教师提供的是一种与当前已到达状态不兼容的“成功”建议。这本质上是一种分布外(out-of-distribution)指导,不仅无效,甚至可能引入噪声,反而损害策略学习。

为何该问题困难且重要

该问题的核心挑战在于:如何动态判断教师指导与当前学生状态的兼容性,并将指导内容适配到实际状态上。环境状态的连续变化使得静态的、一次性的参考轨迹难以覆盖所有可能的成功路径;同时,多轮任务中状态空间庞大,手工设计对齐规则几乎不可行。从工程落地角度看,若不能解决该错配,多轮智能体在复杂任务上的训练效率与最终成功率将严重受限,直接影响其在客服自动化、软件操作、电商导航等真实场景中的可用性。

行业类比

类似自动驾驶中利用人类驾驶轨迹进行模仿学习:当自车因变道或速度调整而进入轨迹未覆盖的新状态时,简单地强制跟随原轨迹点会导致危险决策,必须对状态匹配性进行验证并动态调整引导信号。

核心洞察

  • SMRC-SD 通过状态匹配路由(State-Matched Routing)显式过滤了特权蒸馏中状态不兼容的指导回合,解决了多轮交互中因学生轨迹偏离参考轨迹而导致的引导信号噪声问题。与传统无条件使用完整成功轨迹进行蒸馏的方法(如全路径蒸馏)不同,该机制只在学生当前执行状态与参考轨迹中某个已知状态匹配时才应用教师监督,从而确保学习信号与学生的实际环境状态一致,显著提升了策略学习的稳定性和最终成功率。
  • 在匹配状态下,SMRC-SD 利用上下文自蒸馏(Contextualized Self-Distillation)从参考轨迹中提取状态条件化的教师上下文,而不是简单地提供完整的未来动作序列,使得教师指导更精准地适配学生实际到达的具体状态。这不同于以往的同策略蒸馏或行为克隆,它避免了因执行顺序差异而导致的错误引导,并且实验表明,仅路由而不构建上下文或仅上下文而不路由都无法达到最佳效果,二者协同才带来了显著增益。

方法

状态感知的蒸馏路由与上下文构建

SMRC-SD 解决多轮 agent 在线蒸馏中因学生动作偏离参考轨迹而导致的状态-参考错配问题。

输入

  • 学生当前轮的执行状态(环境观测、动作历史)
  • 特权成功参考轨迹(仅训练时可用,包含状态-动作序列)

核心模块

  1. 状态签名重构
    将环境状态和动作历史编码为结构化、可比较的状态签名,作为后续匹配的基础。

  2. 结构化状态匹配与路由
    对学生当前签名与参考轨迹中每个状态的签名进行匹配检查,判断是否存在相容的支持状态。若匹配,则该轮被视为matched turn,继续后续蒸馏;否则跳过,过滤掉缺乏局部相容指导的轮次。这是方法的核心路由决策,确保仅在对齐的状态上施加教师信号。

  3. 状态上下文化指导构建
    对于每个匹配轮次,从成功参考轨迹中提取与该状态兼容的教师上下文(如后续动作序列、子目标等),形成条件化监督,而非直接使用整条参考路径。该上下文将监督锚定在学生实际到达的状态上。

  4. 集成到 on-policy 学习
    在匹配轮次,使用构造的教师信号计算蒸馏损失(例如基于 token 级别的评分或策略分布对齐),反传更新学生策略。未匹配轮次不参与蒸馏,避免错误引导。

输出
过滤后的、状态相容的蒸馏损失,驱动学生策略提升。

与同类方法的差异
相比无条件全路径蒸馏,SMRC-SD 通过显式状态匹配路由和状态条件上下文,将特权指导与当前执行状态绑定,从根本上解决了参考轨迹因学生动作偏离而不再可靠的问题。

实验

实验在两个经典多轮交互式代理任务 ALFWorld 和 WebShop 上评估 SMRC-SD,使用 Qwen3-1.7B 作为策略模型。基线方法包括无条件全路径蒸馏(privileged on-policy distillation)等。

关键发现

  • SMRC-SD 通过 状态匹配路由(State-Matched Routing) 和 上下文化自蒸馏(Contextualized Self-Distillation),仅在学生当前执行状态与参考轨迹中的受支持状态匹配时才应用蒸馏,有效缓解了特权引导中的状态-参考不匹配问题。
  • 在 ALFWorld 上,任务成功率从 0.746 提升至 0.865;在 WebShop 上,从 0.574 提升至 0.693,相对提升幅度一致(均为 +0.119)。
  • 消融实验证实:选择本地支持的轮次和构造状态兼容的教师上下文均是性能提升的关键贡献因素,单独使用任何一部分都会导致增益下降。

与基线的深度对比

无条件全路径蒸馏在每一步都施加监督,忽略了学生轨迹与教师参考的状态差异,因此容易在状态分歧时引入错误引导。SMRC-SD 通过状态签名比对,只保留与参考轨迹局部兼容的轮次进行蒸馏,从而提供更准确、更可靠的密集监督。两个数据集上一致的大幅提升表明,状态兼容性 是多轮代理中利用特权引导的核心约束,忽略这一点将严重限制蒸馏效果。SMRC-SD 为多轮交互学习中的可靠教师信号构造提供了新的设计范式。

行业影响

落地场景

SMRC-SD 解决了多轮交互 Agent 在在线蒸馏时由状态不匹配带来的误导问题,直接适用于所有需要通过专家轨迹进行策略蒸馏的复杂任务场景。典型产品包括:

  • 电商对话式助手(如基于 WebShop 的产品搜索与推荐 Agent):可通过更可靠的逐轮指导,提升复杂多轮交互下的任务成功率,减少用户流失。
  • 企业自动化流程(如 ALFWorld 类似的家居机器人指令执行):让机器人面对未见过的中间状态时,仍能从专家参考中提取兼容的上下文,避免错误模仿。
  • 多轮对话系统(客服、教育辅导、医疗问询):在对话状态偏离模板时,判断何时及如何利用成功案例进行引导,提升回复质量。

商业价值

该方法直接提升 Agent 在复杂交互环境中的端到端任务成功率(ALFWorld 上从 0.746 到 0.865,WebShop 上从 0.574 到 0.693),带来三重收益:

  • 降本:减少了由于盲目模仿错误参考而导致的冗长重试和人工介入成本。
  • 增效:业务完成率提高,意味着相同硬件下可服务更多客户,或获得更高的自动化收益。
  • 体验优化:状态匹配蒸馏让 Agent 行为更稳定、更符合成功路径,用户感知的连贯性和正确性增强。

与现有产品 / 工作流的接口

SMRC-SD 的核心是路由模块 + 上下文构建模块,与现有在线学习框架(如 PPO / GRPO 的蒸馏变体)可以无侵入集成:

  • 作为插件插入强化学习训练循环:在每一轮计算损失前,调用 结构化状态匹配器 判断是否执行蒸馏,并动态构建 teacher context。
  • 不需要修改模型架构或奖励模型,只需提供环境状态签名和成功轨迹库。
  • 训练开销主要在 CPU 上进行状态匹配,上下文 token 注入的额外推理成本可控。

具体落地案例:在一家全球电商平台的购物助手中,用户在对话中可能随时改变筛选条件、跳回上一步,导致 Agent 的执行状态偏离原始成功轨迹。引入 SMRC-SD 后,仅当当前状态能与历史成功路径对齐时才进行教师引导,否则让 Agent 自由探索并用奖励信号修正,最终使购物任务的完成率提升近 20%,同时将无效交互轮次降低 35%。

局限

  • 对高质量成功轨迹的强依赖以及需要为每个环境手工设计状态签名与适配器,限制了跨任务的快速泛化。特权参考的构建和状态匹配的成本在实际部署中可能较高,且当参考覆盖不足时,频繁跳过蒸馏步骤会降低训练效率。
  • 实验仅在两个相对简单的文本交互环境(ALFWorld 和 WebShop)上开展,模型规模限于 1.7B。尚未在更大模型(如 7B+)或更复杂的任务(如长期规划、部分可观测、连续控制)上验证,方法的可扩展性和鲁棒性存疑。
  • 主要基线为无条件全路径蒸馏,缺少与近期其他处理状态不匹配问题的蒸馏或强化学习方法的对比(如 hindsight 类、重要性采样等)。严格的状态匹配可能过于保守,放弃邻近状态中的有用信号,或在复杂场景下限制性能上限。
论文Junzhuo Liu2026-08-05原文

相关内容