论文

SKILLER: 面向小语言模型可复用技能提取的语言级强化学习

SKILLER: 面向小语言模型可复用技能提取的语言级强化学习

Agent技能 是一种将程序性知识与领域专长标准化封装的形式,在Agent系统中作为关键机制,持续约束语言模型的行为空间,以实现可重复的高质量任务执行。然而,由于强闭源模型推理成本高昂,当前流行的Agent框架(如 Codex 和 OpenClaw)在部署技能处理真实任务时成本过高。可在消费级GPU上运行的开源模型能力快速提升,为利用技能化行为约束大幅降低成本提供了机遇,但为这类小模型自动生成高效技能仍是重大实践挑战。 为此,我们提出 SKILLER,一个自然语言驱动的强化学习框架,用于为小模型自动生成执行器专属技能。该框架以强模型作为 actor 与 critic,将小模型Agent系统视为环境,所有强化学习信号完全通过自然语言传播。在 Qwen3.5-9B 和 Qwen3.5-4B 上,基于五个相关基准的广泛实验表明:SKILLER 优于三种开源和一种闭源技能生成/进化方法,在 9B 模型 上取得 4.3 至 20.4 个百分点、在 4B 模型 上取得 1.8 至 13.3 个百分点的绝对提升,并在 SkillsBench 的单一技能任务上媲美强闭源模型。项目代码已开源:https://github.com/DANG-ai/SKILLER。

论文精读

TL;DR SKILLER 将技能生成建模为强化学习,以强模型为 actor/critic、小模型 agent 为环境,纯自然语言传递信号,自动产出定制技能;在 Qwen3.5 系列上性能提升 4–20 个百分点,逼近闭源模型,显著降低推理成本。

问题

问题背景

自主智能体(autonomous agents)领域正将 Agent Skills 作为封装过程性知识、工具使用约定和领域专长的标准化原语,通过技能约束语言模型的行为空间,实现可重复、高质量的任务执行。

现有方法局限

当前流行的 agent harness(如 Codex 和 OpenClaw)依赖强闭源模型作为技能执行器,虽然技能约束能带来稳定行为,但推理成本极高,难以规模化用于真实任务。开源小模型可在消费级 GPU 上运行,成本低,但直接套用为强模型设计的技能往往效果不佳,因为小模型在指令遵循、上下文理解和推理深度上均有局限。现有自动技能生成或进化方法(如基于提示工程或进化算法)大多以大模型为优化目标,生成的技能过于复杂或隐含依赖大模型能力,移植到小模型后容易出现技能不可用、行为漂移或结果退化,缺乏针对小模型特性的定制化生成机制。

为什么这个问题难且重要

小模型的能力边界差异巨大,技能必须高度执行器特定(executor-specific),需考虑模型的参数规模、预训练分布和微调状态。同时,如何在不修改小模型权重的情况下,通过外部技能约束有效提升任务表现,需解决强化学习信号传递问题:小模型作为环境,其反馈稀疏且噪声大,难以直接优化技能文本。SKILLER 采用自然语言驱动的 actor-critic 框架,将强模型作为 actor 和 critic,把技能生成转化为语言层面的策略优化,为低成本部署高性能智能体提供了新路径,在边缘计算、私有化部署和实时响应等场景下极具价值。

行业类比

类似在端侧设备部署 AI 助手 时,需要为轻量级模型生成精简且高效的技能库,以同时满足推理延迟、成本和任务完成质量的要求,SKILLER 的方法可类比为“为小模型定制技能编译器”。

核心洞察

  • 技能提取应当被建模为对特定 executor 的闭环行为优化,而非一次性生成通用指令模板。SKILLER 将小模型 agent 系统作为环境,强模型 actor/critic 通过自然语言观察轨迹并迭代更新技能,使技能与执行模型的能力边界对齐。与现有技能生成或演化方法只面向通用大模型的单次产出不同,该方法把 executor 的真实表现作为奖励信号,因此能在 4B/9B 小模型上获得 1.8–20.4 个百分点的提升,并在单技能任务上匹配闭源模型性能。
  • 自然语言作为 RL 信号通道,使技能优化变成一种无需访问底层参数的文本级黑盒优化。这为部署在消费级 GPU 上的小型开源模型提供了实用路径:actor 和 critic 均可使用强模型,而小模型只需可执行文本技能,不要求内部梯度或专门封装,显著降低适配成本。该设计避开了小模型端到端 RL 训练的不稳定性,同时把专家反馈与自动 critic 结合,为 agent harness 在多任务场景下持续扩展技能库提供了可操作的协议。

方法

框架概览

SKILLER 将技能生成建模为自然语言驱动的强化学习问题。输入是目标小模型(executor)与任务描述,输出为该小模型定制的自然语言技能文本。框架以强模型同时充当 actor 和 critic,小模型 agent 系统作为环境,所有 RL 信号通过自然语言传播。

环境交互

  • 状态:由当前技能、任务上下文、历史执行反馈拼接成的自然语言序列。
  • 动作:actor 生成的新技能文本或对现有技能的修改。
  • 奖励:环境执行动作后返回标量 reward,反映小模型在验证任务上的表现提升。

Critic 与 Replay Memory

  • Critic:强模型基于当前状态和动作,输出自然语言形式的评估与改进建议,而非数值价值函数。
  • Replay Memory:存储历史状态、动作、奖励、critic 评论,供 actor-critic 采样训练,提升样本效率。

Actor 更新

Actor 接收环境状态与 critic 反馈,生成下一轮技能文本。更新信号完全通过自然语言表达,不涉及对 executor 内部参数的梯度访问,因此小模型可以完全黑盒。

关键设计

  • 自然语言作为唯一信号通道,使强模型能够跨模态引导小模型行为约束。
  • 技能根据 executor 实际失败模式迭代优化,而非通用最佳实践。

与同类方法差异点

不同于基于提示工程或进化算法一次性生成技能,SKILLER 显式采用 actor-critic 结构,将小模型执行器视为环境,利用自然语言批评与重放机制进行多轮策略搜索,实现更稳定的任务针对性优化。

实验

实验设计

SKILLER 在 Qwen3.5-9B 和 Qwen3.5-4B 两个小模型上评估,覆盖五个基准(包括 SkillsBench)。对比方法包括三个开源和一个闭源的技能生成或进化方法。框架将强模型作为 actor 和 critic,把小模型 agent 系统视为环境,所有 RL 信号通过自然语言传递。

关键发现

  • 在 9B 模型上,SKILLER 带来 4.3 至 20.4 个百分点 的绝对提升。
  • 在 4B 模型上,提升范围为 1.8 至 13.3 个百分点。
  • 在 SkillsBench 的单技能任务上,SKILLER 性能匹配强闭源模型。

基线对比解读

SKILLER 通过自然语言驱动的 RL 优化技能生成过程,相比传统 prompt 工程或静态技能库,能针对特定 executor 自适应地提取可复用技能,显著提升小模型的任务执行质量,降低对昂贵闭源模型的依赖。

行业影响

落地场景

SKILLER 适用于需要低成本、高可控智能体技能的部署场景,尤其适合在 消费级 GPU 或边缘设备上运行小型模型(Qwen3.5-4B/9B)。

  • 电商智能客服:为 4B 模型自动生成退货、物流、推荐等技能,替代大模型 API 调用,支持高并发低延迟。
  • 内容平台审核:生成内容安全与标签技能,让 9B 模型在本地完成审核,兼顾隐私与成本。
  • 企业 RAG 助手:将内部流程知识封装为技能,部署在本地小模型,满足数据合规要求。

与人工编写 skill 或通用 prompt 相比,SKILLER 生成的技能针对特定 executor 模型优化,避免“大模型能跑通、小模型跑崩”的迁移问题。

商业价值

主要降本线在推理成本:用 4B/9B 替代闭源大模型,单次请求成本可降低一个数量级;同时 SKILLER 让小模型在 SkillsBench 单技能任务上匹配强闭源模型,性能不缩水。

由于 RL 信号完全通过自然语言传递,不修改模型权重,技能可像配置文件一样版本管理、快速回滚,降低线上更新风险。

与现有工作流集成

SKILLER 产出的 agent skills 遵循标准化格式(对齐 Anthropic 等定义的技能规范),可直接接入 LangChain / LlamaIndex 等 agent harness,或放入企业 skill registry。

集成方式建议:

  1. 将 SKILLER 作为离线技能生成器,定期根据失败样本重训技能,输出新版本。
  2. 在线服务仅加载技能文本 + 小模型,无需额外 RL 基础设施,保持低延迟。
  3. 结合 CI/CD 流水线,在新任务出现时自动触发技能进化,形成闭环。

局限

  • - 该方法训练阶段需要**强模型**作为 actor 和 critic,每次迭代都涉及对强模型 API 的多次调用,推理成本并未完全消除;同时强模型自身的知识偏差或幻觉可能被注入生成的 skill 中,影响下游小模型执行的一致性和可靠性。论文未报告训练阶段的 token 消耗或 API 费用,实际部署时可能超过小模型推理节省的成本。
  • - 实验仅在 `Qwen3.5-9B` 和 `Qwen3.5-4B` 两个模型上进行,缺乏对 **Llama**、**Mistral** 等其他主流开源小模型家族的跨架构验证,泛化性存疑;且评估覆盖的技能任务主要来自五个相关基准,可能偏向特定的工具调用和短流程场景,对长程、多步骤或需要复杂工具组合的任务,生成技能的质量和稳定性尚未得到验证。摘要中仅强调单技能任务匹配闭源模型,多技能任务表现未被充分探讨。
  • - 所有强化学习信号完全通过自然语言文本传递,可能导致奖励塑形不够精细、梯度信息缺失,训练过程中收敛速度较慢或容易陷入次优;同时 critic 的文本评价本身可能包含噪声或主观偏差,若 critic 误判则直接误导 actor 的策略更新。论文未与数值化奖励的 RL 基线(如 PPO 或 GRPO 等在大模型上常见的微调方案)进行对比,无法证明语言级 RL 在样本效率或最终效果上优于 token-level 的优化方法。
论文Chenhao Dang2026-08-11原文

相关内容