论文

Latent On-Policy Self-Distillation

Latent On-Policy Self-Distillation

让智能体从经验中学习并将其内化为策略,已成为自进化 AI 的核心问题。On-Policy Self-Distillation (OPSD) 通过利用特权自教师(privileged self-teacher)在智能体自身轨迹上提供密集监督,提供了一条有效路径;然而,现有方法仍高度依赖设计者指定的特权产物(如答案、反馈、技能或轨迹),限制了持续自我改进所需的端到端可学习性与可扩展性。 本文提出 Latent On-Policy Self-Distillation (LOPD),其核心创新在于:不是提出另一种手工设计的 OPSD 变体,而是让教师的特权上下文本身从经验中端到端可学习。技术上,LOPD 检索相关经验并将其组合为连续潜在 token,用于条件化自教师;学生则从任务与交互历史中生成轨迹,并在每个访问前缀接收密集的 token 级监督。进一步引入 特权间隔目标(privileged-margin objective) 来稳定并调节潜在上下文的学习。 实验表明,LOPD 具有以下优势: - 强性能:在智能体工具使用与代码生成任务上,均优于 RLVR 及代表性 OPSD 方法(OPSD、SDPO、Skill-SD); - 高学习效率:在不到 GRPO 与 Skill-SD 30% 的 rollout 预算下即可超越它们。 消融研究进一步直接证明:使特权上下文可学习是实现上述收益的必要条件。这些结果将 LOPD 定位为迈向更可扩展、更自主的智能体进化范式的一步。

论文精读

TL;DR LOPD 让 privileged context 可端到端学习,通过检索经验生成 latent tokens 提供密集监督,在 agentic 任务上以 <30% roll-out 预算超越 RLVR 和代表性 OPSD 方法。

问题

问题背景

当前 self-evolving AI 的核心问题之一是让 agent 从自身经验中学习并将知识内化到 policy。On-Policy Self-Distillation (OPSD) 通过特权自教师对 student 自身轨迹提供稠密监督,成为一条有效路径。

现有方法局限

现有 OPSD 变体(如 OPSD、SDPO、Skill-SD)仍依赖手工设计的特权 artifacts——答案、反馈、技能或轨迹等。这些 artifacts 需要针对具体任务预定义,无法端到端学习;不同任务需要不同形式的特权上下文,设计者很难覆盖所有场景,导致方法难以扩展到持续自改进的开放环境。此外,手工设计往往引入归纳偏置,可能限制 agent 对更优内部表示的探索。

为什么这个问题难/重要

让特权上下文本身可学习是一项技术挑战:需要从高维、稀疏的交互经验中检索并组合出稳定、可泛化的连续 latent tokens,同时保证训练过程的稳定性和收敛性。论文提出的 privileged-margin objective 正是为了稳定 latent context 的学习。业界对 RLVR 和 self-distillation 的关注度持续上升,因为其有望减少对人工 reward 或特权信息的依赖,提升 agent 的学习效率与自动化程度。

行业类比

类似于从手工设计 reward function 到直接学习隐式 reward model 的演进,LOPD 将特权上下文的构造从人工特征工程转向端到端 latent 表示学习,为 agent 的规模化自进化提供了一种更通用的范式。

核心洞察

  • 将 OPSD 中 self-teacher 依赖的 privileged context 设计为可端到端学习的连续 latent tokens,替代以往手工指定的答案、反馈、技能或轨迹,从根本上移除了对人工设计特权信息的依赖。与 OPSD、SDPO、Skill-SD 等需要为每个任务或领域预先定义 privileged artifacts 的变体不同,LOPD 让模型从检索到的相关经验中自行组合出指导信号,因此具备更好的跨任务泛化和持续自改进潜力,这符合自进化智能体对可扩展性与端到端学习的要求。
  • 通过检索经验并合成 latent context 来条件化 self-teacher,并在每个 visited prefix 上施加 token 级稠密监督,LOPD 实现了比稀疏奖励方法(如 RLVR、GRPO)更高效的策略内化。其引入的 privileged-margin 约束防止 latent context 在训练中退化或坍缩,从而稳定学习过程。实验表明,LOPD 在 agentic tool use 和 code generation 上不仅超越各代表性 OPSD 基线,而且仅用不足 30% 的 rollout budget 即可超过 GRPO 与 Skill-SD,证明可学习的潜在特权上下文能显著提升在线学习的样本效率。

方法

输入与任务定义

LOPD 的核心思路是端到端学习特权上下文,替代手工设计。输入包括:当前任务描述与交互历史、来自经验池的相关经验片段。学生模型基于任务和历史生成轨迹,即序列决策过程。

关键模块:检索与潜在组合

  1. 经验检索:从经验池中检索与当前任务相关的历史经验。
  2. 潜在作曲家 (Composer):将检索到的经验编码为连续 latent tokens,作为 self-teacher 的条件上下文。这些 tokens 不显式对应语义标签,而是通过训练自动学习如何编码有用信息。
  3. 特权自蒸馏:self-teacher 以 latent tokens 为条件,对学生的每个前缀状态提供 token 级密集监督(dense token-level supervision),而非仅对最终答案或轨迹整体评估。

输出与训练目标

  • 学生输出:学生生成动作或代码,与 RLVR 策略优化类似。
  • 特权边际目标 (privileged-margin objective):为 latent 上下文学习提供稳定与正则化,防止 latent tokens 退化或过度影响教师。
  • 联合优化:学生策略与 composer / teacher 端到端联合优化,提升策略内部化效率。

与同类方法差异:LOPD 不依赖设计者指定的答案、反馈、技能或轨迹作为特权上下文,而是让特权上下文本身从经验中可学习,增强可扩展性与自改进能力。

实验

实验设计

LOPD 在两个代表性领域上进行验证:Agentic Tool Use 与 Code Generation。评估协议包括 EnvScaler、BFCL-v3、ACEBench、LiveCodeBench 和 EvalPlus 等基准。基线覆盖 RLVR、OPSD、SDPO、Skill-SD 和 GRPO。训练侧利用 Qwen3-8B 与 Olmo3-7B 作为基座模型,对比不同 self-distillation 变体在性能与采样效率上的表现。

关键发现

  • 性能优势:LOPD 在 Agentic Tool Use 和 Code Generation 两个任务上均超越 RLVR、OPSD、SDPO、Skill-SD。
  • 学习效率:LOPD 仅需低于 30% 的 rollout 预算即可超越 GRPO 与 Skill-SD,展现出显著的数据效率。
  • 消融证据:使得特权上下文可学习是获得这些增益的关键,进一步验证了端到端学习特权 token 的必要性。

与基线的深度解读

与依赖手工设计特权信号(如答案、反馈、技能或轨迹)的 OPSD 变体相比,LOPD 通过从经验中检索并组合连续 latent token 来条件 teacher,避免了人为指定特权上下文的局限性。这一差异带来了两方面的好处:一是更强的泛化能力,因为 latent context 可自适应不同任务经验;二是更高的端到端可扩展性,使自我进化不再受限于特定形式的人工先验。同时,LOPD 的高样本效率表明 latent 蒸馏信号可能比传统 RL 稀疏奖励或显式蒸馏目标提供更稠密、更稳定的学习梯度。

行业影响

落地场景

LOPD 可应用于需要持续自我改进的 AI Agent 产品,如多步骤工具调用、代码生成、自动化客服与运维助手。其核心能力在于让 agent 从自身轨迹中端到端学习 privileged context,避免人工设计特权信息,适合需要快速迭代、任务复杂且反馈密集的业务。

商业价值

  • 降本:相比 GRPO 和 Skill-SD,LOPD 以不到 30% 的 rollout 预算达到更优效果,显著降低训练与推理成本。
  • 增收与体验:在 agentic tool use 和 code generation 上超越 RLVR、OPSD、SDPO 等 baseline,提升任务成功率与用户满意度。
  • 工程效率:去除人工设计 privileged artifacts(如 answer、feedback、skills)的环节,减少专家标注与规则维护成本。

跟现有产品/工作流的接口

LOPD 可作为现有 on-policy distillation 或 RLHF/RLAIF 流程中的蒸馏模块替换。集成时需接入:

  1. 经验检索模块(如向量数据库或 replay buffer),用于提取相关历史轨迹。
  2. 可学习的 composer,将检索结果编码为连续 latent tokens。
  3. 现有的 policy 训练框架(如 GRPO 或 PPO),将 latent context 注入 teacher 与学生模型。

具体落地 Use Case

  • 代码生成平台:在内部代码助手或 CI/CD 工具中,利用历史成功代码提交与工具调用轨迹作为经验,LOPD 使模型学会生成更可靠的代码补全与调试步骤,减少 token 消耗与失败重试。
  • 电商智能客服 Agent:多步骤订单查询、退换货流程中,模型根据历史成功对话与工具调用序列学习 latent context,显著提高首次解决率,降低人工转接率,提升整体服务效率与客户体验。

与同类工作差异:LOPD 不是新增一种手工设计的 privileged context 变体,而是将特权上下文本身变为可学习参数,使 agent 的自我进化更端到端、可扩展,更贴合大规模部署场景。

局限

  • **训练与推理架构更复杂**: LOPD 引入经验检索、composer 与 latent token 注入,相比 vanilla RLVR 或 GRPO 增加了额外组件和多阶段训练流程,包括冷启动初始化与 privileged-margin constraint 等。这带来更多超参数和工程链路,对资源敏感或追求极简管线的小型团队不够友好,实际部署时需要额外计算与存储开销。
  • **可解释性与可控性下降**: privileged context 被压缩为连续 latent tokens,虽然获得可学习性,但丢失了显式技能、反馈或轨迹的语义可读性。当策略出现异常时,难以人工审计教师注入的先验内容,不利于安全敏感场景下的调试与对齐审计,也降低了人类介入调整的便捷性。
  • **验证域较窄**: 实验集中在 agentic tool use 与 code generation,主要对比 RLVR、OPSD、SDPO、Skill-SD、GRPO 等方法。尚未覆盖数学推理、多模态、长程规划等异构任务,latent context 在这些领域能否保持稳定与泛化仍需进一步检验,外部生态的适用性也有待观察。
论文Guibin Zhang2026-08-13原文

相关内容