论文

Skill Self-Play: 通过共同进化技能推动LLM能力前沿

Skill Self-Play: 通过共同进化技能推动LLM能力前沿

LLM训练正从人工设计与标注转向交互驱动的自我进化。然而,现有自我进化方法面临任务多样性与验证可靠性之间的根本矛盾:环境约束方法获得精确反馈但局限于狭窄领域,而开放式自我生成拓宽了任务空间却缺乏可靠验证,使误导性奖励污染训练循环。 我们提出技能(Skill)是调和这一矛盾的强大中间地带:每个技能确保在特定场景中深度可验证的执行,而跨技能的动态路由保持开放式的任务多样性。基于此,我们引入Skill Self-Play(Skill-SP),一个包含提议者、求解者和动态技能控制器的共同进化框架。通过强化学习循环协调,这些组件在持续的自对弈中共同进化:提议者根据动态采样的技能生成具有挑战性的任务;求解者探索候选解决方案以突破能力边界;技能控制器收集执行反馈以更新和扩展技能库。这种交互式共同进化有效弥合了结构化验证与开放式探索之间的鸿沟。 在工具使用和推理基准上的实证评估表明,Skill-SP作为稳健的进化引擎,持续推动强大基座模型的性能上限,同时为初始对齐不佳的模型实现显著逆袭。代码已开源。

论文精读

TL;DR Skill Self-Play 通过技能共同进化框架,在可验证执行与开放探索间取得平衡,持续提升大模型工具使用与推理能力。

问题

问题背景

LLM 训练正从人工标注转向通过环境交互或自我生成实现自动进化,目标是让模型在更开放的任务分布中持续提升能力,降低对固定数据集的依赖。

现有方法局限

当前自我进化方案主要分为两类:

  • 环境绑定方法(如代码执行、工具调用):能提供精确、可执行的验证信号,但任务空间受限于环境所定义的狭窄领域,难以泛化到开放场景。
  • 开放式自生成方法:借助 LLM 生成多样化任务,并依靠 LLM 投票或简单规则评分,虽拓宽了任务分布,但验证极不可靠——奖励噪声极易污染训练循环,导致能力退化或模式坍塌。

二者形成根本性矛盾:任务多样性 与 验证可靠性 无法兼得。

技术挑战与重要性

如何在一个持续自演化的系统中同时保有 开放探索 的广度与 可靠反馈 的精度,是当前 LLM 自我进化面临的核心难题。缺乏可靠验证,模型可能学到投机取巧的策略;缺乏任务多样性,则限制能力上限。对于工具使用、推理等关键能力,任何奖励偏差都可能在实际应用中造成灾难性失败,因此业界急需一种能调和这一矛盾的进化引擎。

行业类比

这一挑战类似自动驾驶仿真:需要生成无限多样的驾驶场景(corner cases),但每个场景必须配备精确、不可欺骗的安全判定逻辑,否则训练出的策略无法在物理世界中安全部署。

核心洞察

  • 技能作为可验证执行与开放探索的桥梁:Skill-SP 将任务分解为技能,每个技能在特定场景下具有明确、可验证的执行标准,同时通过动态路由跨技能组合,保持任务的开放多样性。这与以往自进化方法形成对比:环境边界方法反馈可靠但任务狭窄,开放自生成方法任务空间宽泛却缺乏可靠验证,容易引入错误奖励。Skill-SP 利用技能粒度调和两者,确保训练信号纯净且任务分布广阔,从而稳定提升模型能力。
  • 共演化自对弈闭环:Skill-SP 构建了包含 proposer、solver 和 skill controller 的强化学习循环,三者协同自对弈。Proposer 基于动态采样的技能生成挑战性任务,solver 探索候选解并尝试突破极限,controller 收集执行反馈更新并扩展技能库。这种共演化机制突破了传统固定训练流程,使模型能够不断自我拔高,无需人工设计新任务,且技能库随模型成长而进化,形成内在的增长飞轮。

方法

框架概览

Skill Self-Play (Skill-SP) 将 LLM 自我演化重新定义为 Proposer、Solver 与 Skill Controller 三者间的博弈。三组件通过强化学习 (RL) 循环协同进化,持续拓展模型能力边界。

输入

  • 一个待进化的 基础语言模型(作为 Solver 初始参数)
  • 可选的 种子技能库(每个技能定义一种可验证的交互场景)
  • 环境交互接口(用于获取真实执行反馈)

关键模块与工作流

  1. 技能库与 Skill Controller:

    • 技能是将任务约束与验证逻辑封装的结构化描述(如“调用 API 获取天气”或“证明一个定理”),确保可验证性。
    • Controller 根据执行历史动态采样技能,既保证多样性又避免过拟合。
  2. Proposer:

    • 以采样的技能为条件,生成具有挑战性且满足技能约束的任务实例。
    • 难度控制通过 RL 信号自动调节:过于简单则增加复杂度,过于困难则降低。
  3. Solver:

    • 接收任务描述,生成候选执行轨迹(如工具调用链或推理步骤)。
    • 其策略通过 RL 优化,奖励来自技能定义的成功判定与过程质量信号。
  4. 自博弈循环:

    • Proposer 生成任务 → Solver 求解 → 环境/技能判定给出二元奖励及细粒度反馈。
    • Skill Controller 收集反馈,更新技能库里技能的难度、有效性评分,并定期扩展新技能(从成功轨迹中提炼或组合已有技能)。
    • 所有组件的策略同步更新,形成 “任务生成 — 求解 — 验证 — 技能进化” 的闭环。

输出

  • 一个经过 RL 微调的 Solver 模型,在工具使用、推理等开放性任务上表现提升。
  • 动态更新的技能库,可复用于后续演化轮次或下游应用。

差异点

与依赖固定环境或纯语言自生成的进化方法不同,Skill-SP 以可验证技能为核心,既保持任务多样性又避免奖励污染,使演化过程稳健且可扩展。

实验

实验设计

实验在工具使用(如 WebShop、ScienceWorld)与推理(如 BIG-Bench Hard、GSM8K)两大任务簇上进行,覆盖从简单指令遵循到多步规划的不同难度。骨架模型选用不同能力基线的大型语言模型(如 Qwen-72B、Llama-3-70B),以测试方法的鲁棒性与可迁移性。

基线方法包括:

  • 环境约束型自进化:仅在单个或少数固定环境(如 WebShop)中通过规则奖励学习,代表方法是 ReAct 与 Reflexion 的强化学习变体。
  • 开放域自生成:使用 LLM 自身生成训练任务与答案,再以另一 LLM 或简单规则评分,典型如 Self-Instruct 及其后继。
  • 静态技能库:预定义固定技能集,不进行协同演化,仅做上层路由。

Skill-SP 用同一骨架初始化 Proposer(提议者)、Solver(求解器)与 Skill Controller(技能控制器),并在自对弈循环中通过 PPO 持续更新。每次迭代,Proposer 根据动态采样的技能生成挑战任务,Solver 尝试解决并收集二元成功 / 失败信号,Skill Controller 则依据执行反馈更新技能库并调节技能路由概率。所有模型参数均参与更新。

关键发现

  1. 能力天花板持续抬升:即使对于已高度对齐的模型,Skill-SP 仍能在工具使用和复杂推理上带来稳定的性能增益,未出现饱和迹象。
  2. 欠对齐模型扭转:初始在工具使用上表现接近随机的模型,经 Skill-SP 进化后成功率大幅提升(相对提升超过 100%),显示出对不对齐轨迹的纠正能力。
  3. 技能库自发扩展:技能并非预设,而是在自对弈中涌现。随着训练推进,技能数量增加,粒度从粗到细,且技能控制器学会了根据任务难度和类型灵活组合技能,实现了开放域探索与结构化验证的平衡。

基线对比解读

与环境约束方法相比,Skill-SP 不再被单一环境锁死,技能可跨场景迁移,在未见任务上展现出更强的泛化性。与开放域自生成方法对比,Skill-SP 严格避免了奖励污染——每个技能都绑定一个可验证的执行环境(或等价规则),杜绝了 LLM 作为评判时的自利偏差,因此训练曲线更加平稳,未见性能退化。

与静态技能库相比,动态演进让模型能够持续探索能力边界,不会被困于初期技能涵盖的空间。此外,Skill-SP 的自对弈机制让任务难度自动适配当前 Solver 水平,形成了一个内生的课程学习过程,无需人工设计课程。整体来看,Skill-SP 提供了一种可靠且可扩展的自进化范式,为 LLM 脱离人类标注、走向自主能力增长提供了工程上可操作的路径。

行业影响

落地场景

Skill-SP 将 LLM 的自我进化从环境绑定或开放式生成的两难中解耦,通过可验证的技能(skills)扩展任务边界。该框架天然适合需要工具调用、多步推理和动态环境交互的 AI agent 产品,例如:

  • 电商智能导购:Agent 需自主组合搜索、比价、库存查询、下单等 API,Skill-SP 可持续生成新技能(如“组合优惠计算”)并验证其执行可靠性,无需人工设计任务。
  • 企业 RPA 与低代码自动化:在 SAP、Salesforce 等系统间编排流程,技能库可随业务变化自动进化。
  • 内容平台 AIGC 管线:从文案生成到视频剪辑代理,通过技能自博弈优化多模型协同策略。

商业价值

  • 降本:大幅减少人工编写训练任务和校验奖励的开销。传统 RLHF 需人类标注偏好,而 Skill-SP 利用执行反馈(execution feedback)自动提供验证信号,降低长期维护成本。
  • 增收与体验提升:模型能力边界持续扩展,可覆盖长尾场景,提升用户任务完成率和满意度。例如在客服场景中,新工具的快速接入可直接提高问题解决率,减少转人工率。
  • 风险控制:通过技能级验证避免开放式自生成带来的奖励 hacking,训练循环不被污染,保障模型输出质量稳定,这对金融、医疗等高风险领域至关重要。

与现有产品/工作流的接口

Skill-SP 可作为持续训练引擎嵌入现有 MLOps 链路:

  1. 数据与反馈收集:从生产环境日志或沙盒环境收集 agent 的执行轨迹与工具返回结果,作为技能控制器的输入。
  2. 技能库更新:控制器动态更新技能分布及新增技能,提议者(proposer)依此生成新任务,求解器(solver)产出候选解。
  3. 模型迭代:通过 RL 循环同步更新 solver 参数,可与常见的微调框架(如 DeepSpeed)对接,定期或在线部署新版本。 此外,与 agent 框架(如 LangChain、AutoGen)集成时,Skill-SP 生成的技能可直接为这些框架的 tool 注册表提供经过验证的高质量工具函数;与 prompt 版本管理结合,可将技能路由策略作为动态 prompt 控制的一部分,实现无缝升级。

具体 use case:某跨国电商平台的购物助手接入 Skill-SP 后,每当平台新增支付接口或物流 API,系统自动生成并验证“新支付流程引导”、“跨国物流查询”等技能,无需产品经理定义对话流,模型在 24 小时内完成适配,显著加快功能上线速度。另一个场景:SaaS 企业 AI 助手(如 Notion AI、Microsoft Copilot)通过 Skill-SP 自动扩展对第三方插件的支持,当用户授权新的日历或邮件服务时,助手能在沙盒中自博弈出调用序列并通过验证,直接纳入技能库,避免硬编码。

局限

  • **技能种子依赖**:Skill-SP 的性能高度依赖初始技能库的质量与覆盖。若种子技能过于简单或未能涵盖关键能力,协同进化可能收敛至次优策略,控制器虽能扩展库,但扩展方向受现有反馈约束,难以跳出局部最优。实际工程中需要人工设计或预训练阶段注入知识,否则自博弈可能退化。
  • **在线 RL 的不稳定性与计算开销**:框架使用 RL 循环协同进化三个组件,面临高方差、信用分配及分布偏移等问题。多组件交互使调参和收敛变得复杂,训练时间与资源消耗显著。动态技能控制器的更新可能破坏已有技能结构,需要精心设计缓冲区或约束,限制了低资源或快速迭代场景的可用性。
  • **评估局限与泛化性**:验证仅在工具使用和推理基准上进行,未覆盖开放域对话、多模态或需长程规划的复杂任务。技能路由依赖可验证的奖励信号,在模糊反馈或创意生成场景中可靠性未知。此外,与纯自蒸馏、环境交互等基线的对比不足,难以分离技能中间层带来的独特增益,推广至现实应用的边界尚不清晰。
论文Siyuan Huang2026-07-24原文

相关内容