论文

UniSkill: 为演化中的策略学习与 Actor 对齐的技能提案

UniSkill: 为演化中的策略学习与 Actor 对齐的技能提案

大语言模型 agent 可通过保留从先前交互蒸馏出的可复用技能来跨任务提升。近期工作联合优化任务执行与技能抽取,使策略与 skillbank 协同演化。但 actor 持续学习时,靠技能在后续训练中被复用来给奖励,会混淆技能收益与 actor 自身改进;而直接测试每个提案又需昂贵的额外 actor rollout。 本文提出 UniSkill:用共享策略与环境交互,并从所得轨迹中提出 skillbank 编辑(Add、Update 或 No Edit)。actor 从环境奖励学习,对比式动作反馈 引导技能提案学习——通过测量用提案技能替换检索技能后,当前 actor 在同一任务历史成功 / 失败轨迹间的动作对数似然差变化,提供 actor 对齐信号,避免为每个提案新开 rollout。由于提案级反馈可能在内容得分偏低时压制本应合适的编辑操作,进一步引入 skill-edit support 正则化 以保持探索。 实验上,UniSkill 在 ALFWorld 达到 98.4% 成功率、WebShop 达 84.7%,并保持稳定的联合训练;在更小 backbone 的共享策略下依然有效。代码已开源。

论文精读

TL;DR UniSkill 提出 actor 对齐技能提议学习:用对比动作反馈(衡量替换技能后 actor 在成败轨迹上的动作对数似然差变化)替代 rollout 评估,并加支持正则化稳定探索,在 ALFWorld/WebShop 上达 98.4%/84.7% 成功率。

问题

问题背景

LLM agent 的终身学习场景中,近年工作聚焦于联合优化任务执行与技能提取,让策略网络(actor)和技能库共同进化,从而在跨任务上持续提升成功率。

现有方法局限

现有方法以“技能在后续训练中被重用”作为奖励信号来训练技能提案器,但存在两个关键缺陷:

  • 信用分配混淆:actor 本身也在不断学习,技能被重用带来的性能提升可能源于 actor 的进步,而非技能内容本身的质量。这导致提案器收到模糊的奖励,无法准确判断一次技能编辑(Add / Update / No Edit)的真实价值。
  • 评估成本高:若要直接验证每个提议的技能,需要为每个提案额外执行 actor 的 rollout,这在交互昂贵的环境中(如 WebShop、ALFWorld)几乎不可行,严重限制了技能空间的探索效率。

为什么这个问题难 / 重要

挑战在于如何在策略持续演化的非平稳环境下,为技能提案提供低成本、无偏的评估信号。论文提出的 actor-aligned contrastive feedback 通过比较替换技能前后 actor 在历史成功 / 失败轨迹上的动作对数似然差距变化,避免了新增 rollout,同时显式对齐当前 actor 的行为偏好。此外,由于提案级反馈可能惩罚内容较差但编辑方向正确的提案,还需要支持正则化来维持编辑操作的探索多样性。

业界对这类问题关注度高:LLM agent 在真实场景中交互成本高、反馈稀疏,技能库的在线更新需要同时解决信用分配、评估效率和探索保持三个相互耦合的问题,这直接关系到 agent 能否在部署后持续自我改进。

行业类比

类比推荐系统的在线学习 + 离线评估:模型频繁更新,难以区分收益来自新特征还是新数据,必须借助离线代理指标(如 counterfactual 评估)替代昂贵的线上 A/B 测试,这与 UniSkill 用对比动作反馈替代额外 rollouts 的思路一致。

核心洞察

  • UniSkill 的核心思想是用 actor-aligned contrastive action feedback 来评估 skill proposal:比较将检索到的 skill 替换为 proposal 后,actor 在历史成功/失败轨迹上的 action log-likelihood 差值变化,作为 proposal 奖励,无需额外 rollout。与以往使用重用奖励的方法不同,该信号直接对齐当前 actor 的能力,避免了 skill 收益与 actor 自身进步混淆;与直接测试每个 proposal 的方法相比,大幅降低了计算成本,使 skill 库与 actor 的联合进化更加高效稳定。
  • skill-edit support regularization 解决了 proposal 级别反馈可能过度压制有效编辑操作的问题。当 proposal 内容暂时打分较低时,常规对齐奖励会抑制该次编辑,导致 skill 库探索不足。该正则项鼓励 proposer 保持对添加、更新等编辑空间的探索,即使当前 proposal 质量不高也不完全丢弃,从而确保在联合训练中 skill proposer 能持续提出有价值的编辑,防止 skill 库停滞。

方法

输入与流程

输入包括:共享策略与环境交互产生的轨迹、当前技能库、以及历史收集的成功/失败轨迹。共享策略同时承担两个角色:执行任务的 actor 和从轨迹中提议技能编辑的 proposer。

关键模块

  • 技能增强 Actor:从技能库检索相关技能,辅助动作决策,通过环境奖励(如任务成功率)优化策略。
  • 轨迹条件技能提议器:以当前轨迹为条件,输出技能库编辑操作:Add / Update / No Edit,并生成候选技能内容。
  • 对比动作反馈(核心创新):利用预先存储的成功与失败轨迹,计算将检索到的技能替换为提议技能后,当前 actor 在成功与失败轨迹上的动作对数似然差距变化。该变化作为提议技能的奖励信号,度量提议技能与当前 actor 的对齐程度,无需为每个提议执行额外环境 rollout。
  • 技能编辑支持正则化:防止因提议技能内容暂时得分较低而完全抑制编辑操作,维持编辑动作的探索性。

输出与训练

  • 输出为更新后的技能库(新增或修改技能)和更新后的 actor 策略。
  • Actor 使用环境奖励进行强化学习优化;技能提议器使用对比动作反馈作为奖励,并加入支持正则化进行联合训练。

与同类工作差异

与先前依赖技能重用奖励或需对每个提议技能额外 rollout 的方法不同,UniSkill 的对比动作反馈直接利用历史轨迹评估 actor 对齐度,避免了昂贵采样,并通过支持正则化保持编辑探索。

实验

实验设计

UniSkill 在 ALFWorld 和 WebShop 两个交互式决策基准上进行评估,并与现有技能增强代理及联合训练方法对比。实验考察了主策略在完整与更小骨干网络下的表现,验证联合训练稳定性。任务型指标采用成功率。

关键发现

  • 在 ALFWorld 上取得了 98.4% 的成功率,在 WebShop 上取得了 84.7% 的成功率,达到强竞争力水平。
  • 联合训练过程稳定,技能提出器与执行策略能够协同演化而不出现性能崩塌。
  • 当共享策略使用更小的骨干网络时,UniSkill 仍保持有效,展示了方法对模型规模的鲁棒性。

与基线对比解读

由于论文未在摘要中直接给出基线具体数值,仅能从相对表述推断:UniSkill 的核心机制——actor-aligned contrastive action feedback 与 skill-edit support regularization——避免了为每个技能提案进行额外 rollout,并通过修正技能收益与行动者改进的混淆,实现了更优或相当的性能。相比直接基于任务奖励来学习技能提案的方法,UniSkill 的重用信号不与行动者后续改进耦合,这可能是其稳定性和小模型适配性的来源。

行业影响

落地场景

UniSkill 的技能提案与 Actor 对齐机制适用于需要持续学习和技能复用的多步 Agent 系统。典型场景包括:电商购物助手(类似 WebShop 的商品搜索、筛选、下单流程)、客服工单自动化(分类、路由、回复生成)、以及企业内部 RPA(跨系统数据录入与审批流转)。这些场景中的 Agent 可通过技能库的 Add/Update 操作,从成功和失败轨迹中提炼可复用经验,无需每次重新规划。

商业价值

  • 降本:自动维护技能库,减少人工编写提示词或规则的投入;实验显示较小 backbone 仍有效,可降低模型推理成本。
  • 增收/体验:在 ALFWorld 上达 98.4%、WebShop 上达 84.7% 的成功率意味着更高的任务完成度和用户转化,减少因失败导致的客户流失。
  • 稳定性:联合训练过程稳定,适合生产环境长期迭代。

跟现有产品/工作流的接口

  • 可与 LangChain / AutoGPT 等 Agent 框架的技能选择模块集成,替换静态技能库为动态演化的 skillbank。
  • 通过 Add/Update/No Edit 编辑信号对接向量数据库,支持异步离线更新,无需在线 rollout。
  • 训练阶段利用历史轨迹,可融入现有 RLHF 或偏好学习管道。

局限

  • 实验环境仅限于 ALFWorld 和 WebShop 两个模拟基准,尽管在这两个任务上达到高成功率(98.4% 和 84.7%),但二者均为文本交互的有限动作空间环境,缺乏对更复杂、开放域或真实世界任务(如多步工具调用、持续学习场景)的验证。方法依赖从历史轨迹中划分成功与失败样本,对于稀疏奖励或非二元成功定义的任务,可能难以获得可靠的对比样本,从而限制对比动作反馈的有效性和方法的泛化能力。
  • 技能编辑操作仅支持 Add、Update 和 No Edit 三种类型,无法处理技能删除、合并或拆分等更细粒度的技能库维护需求。随着训练进行,技能库可能积累冗余或过时技能,而当前框架缺乏自动清理机制,长期演化下可能影响检索效率和 actor 性能。此外,对比动作反馈通过比较动作对数似然差异来近似 actor 对齐,该信号依赖于当前策略对历史轨迹的重新评估,若策略发生较大变化,历史轨迹的似然计算可能引入噪声或偏差,导致对技能提案的评分不稳定。
  • 方法引入多个关键超参数(如对比反馈中的温度系数、支持正则化强度 η、最小编辑概率 p_min 等),论文仅报告了选定配置下的结果,未系统分析参数敏感性。实际部署时,针对不同任务和环境可能需要大量调参,增加工程成本。另外,虽然方法避免了为每个技能提案执行新的 actor rollout,但仍需保存并处理大量历史轨迹以构造对比反馈,存储和计算开销随训练步数线性增长,在超大规模技能库或长周期训练中可能成为瓶颈。
论文Yifei Lu2026-10-07原文

相关内容