论文

SkillOpt: 自演化智能体技能的执行策略

SkillOpt: 自演化智能体技能的执行策略

当前智能体技能多为手工构建、一次性生成或通过松散控制的自修订演化而来,这些方式都不像深度学习优化器那样对技能进行优化,也无法在反馈下可靠地超越初始版本。本文认为,技能应作为冻结智能体的外部状态进行训练,遵循使权重空间优化可复现的相同原则。 SkillOpt 是首个系统化、可控的文本空间技能优化器:一个独立的优化器模型将带评分的轨迹(rollouts)转换为对单个技能文档的有界增/删/改编辑,且仅当编辑严格提升留出验证分数时才接受该编辑。文本学习率预算、拒绝编辑缓冲区和逐轮慢速/元更新使得技能训练稳定,同时在部署时无需额外的推理模型调用。 在六个基准、七个目标模型和三种执行框架(直接对话、Codex、Claude Code)上,SkillOpt 在所有 52 个评估(模型、基准、框架)单元中取得最佳或并列最佳,并击败了每个单元上的所有竞争者(人工、一次性 LLM、Trace2Skill、TextGrad、GEPA、EvoSkill)。在 GPT-5.5 上,它将无技能平均准确率提升了 +23.5 点(直接对话)、+24.8 点(Codex 智能体循环内)和 +19.1 点(Claude Code)。 迁移实验进一步表明,优化的技能工件在跨模型规模迁移、在 Codex 与 Claude Code 执行环境间迁移以及迁移至邻近数学基准(无需额外优化)时仍能保持价值。

论文精读

TL;DR SkillOpt 首次将 agent 技能视为可优化的外部文本状态,通过基于回滚的编辑与严格验证门控实现稳定自进化,零推理开销,多项基准最优。

问题

Agent skills 是指导智能体行为的文本指令,直接决定其在复杂任务中的表现。当前领域高度关注如何自动化地构建和优化这些技能,以取代低效的手工设计。

现有方法的局限

现有的技能构建方式主要分为三类:手工编写一次性生成松散的自我修正。手工编写成本高且难以泛化;一次性生成(如让 LLM 直接生成技能提示)缺乏反馈闭环,无法保证质量;自我修正虽引入迭代,但通常采用非结构化的文本重写,没有优化器视角:它不像深度学习中的梯度下降那样,基于严格验证指标和可复现的更新规则。这导致技能无法在反馈下可靠提升——甚至可能退化——且优化过程不可控、不可复现。

为什么这个问题重要且困难

技能本质上是离散文本,搜索空间巨大且非凸,简单的随机修改难以稳定收敛。同时,智能体执行环境存在随机性,少量 rollout 的评分信号噪声大。业界日益依赖智能体框架(如 Codex, Claude Code)来执行实际任务,技能质量成为系统性能的瓶颈。因此,需要一种类似权重空间优化的方法论:有明确的训练/验证协议、有界更新规则、稳定的学习率调度和防止退化的接受准则。这不仅能提升性能,还能让技能训练工程化、可复现。

类比:就像用 Adam 优化器训练神经网络权重一样,SkillOpt 试图为技能文本引入训练和验证分割学习率预算早停,让文本空间优化具备深度学习的严谨性。

核心洞察

  • **技能即外部可训练状态** 将 agent 技能从一次性构建或松散的自我修正,转变为冻结 agent 的外部可训练参数。SkillOpt 通过独立的优化器模型,基于 rollouts 的得分生成有界编辑(增 / 删 / 改),并仅在验证集上严格提升时才接受更新。这相当于在文本空间引入了类似深度学习的优化循环,使技能改进可复现、可调控,区别于以往手工或启发式方法缺乏系统性反馈与收敛保证的缺陷。
  • **可控的文本空间优化** 实现了零推理开销的技能部署,同时保障优化过程的稳定性与效率。SkillOpt 引入文本学习率预算、被拒绝编辑缓冲区和基于 epoch 的慢速 / 元更新,这些机制如同深度学习中的超参数,使优化器在有限编辑次数内收敛,避免过拟合。优化完成后,技能文档直接注入 agent 提示,无需额外模型调用,与 TextGrad 等需要在线梯度估计的方法相比,显著降低了实际部署的成本和延迟。
  • **跨模型与跨环境的技能迁移能力** 揭示了优化所得技能 artifacts 的泛化价值。实验表明,在 GPT-5.5 上训练的 skill 可直接迁移至不同规模的模型、从 Codex 迁移到 Claude Code 执行环境,甚至在未优化的邻近 math benchmark 上也能保持增益。这种可迁移性意味着技能可以像预训练权重一样被存储、分享和复用,为建立开放技能库和跨平台 agent 能力共享提供了可能,远超当前仅针对特定设置定制技能的做法。

方法

SkillOpt 将技能文档视为冻结 Agent 的外部状态,通过一个独立的优化器模型对其进行可控的文本空间训练。整体流程遵循“前向 Rollout → 反向反思 → 有界编辑 → 验证门控”的闭环,确保技能在验证集上单调改进。

输入与初始化

  • 起始技能文档:可以是人工编写、单次 LLM 生成或简单启发式规则。
  • 训练集与验证集:每个任务提供一小批示例,验证集严格用于门控判断,不与训练混淆。
  • 优化器模型:一个与 Agent 分离的 LLM,负责根据 rollout 结果生成编辑。

关键模块

  1. 前向传递:Rollout 证据收集
    Agent 携带当前技能文档,在训练样本上执行多个 rollout,收集任务轨迹与最终奖励。通过失败/成功分析,提炼出结构化的“哪些地方仍会出错”和“哪些规则有效”。

  2. 反向传递:小批量反思与编辑生成
    优化器模型将多个 rollout 的分析结果合并为统一的编辑指令,以 add/delete/replace 三种原子操作作用于技能文档。编辑生成受文本学习率预算限制:每次更新允许的修改总字符数被上限约束,防止剧烈震荡。

  3. 验证门与拒绝编辑缓冲
    候选编辑生成后,Agent 用更新后的技能在验证集上评估。只有验证分数严格提升时,编辑才被正式接受;否则编辑被丢弃并放入拒绝编辑缓冲区,供后续迭代避免重复相同错误方向。该机制保证了验证性能的单调改进,相当于文本空间的 early stopping。

  4. Epoch-Wise Slow/Meta 更新
    每遍历完一轮训练集,优化器会触发一次慢更新:汇总全 epoch 的接受编辑与失败模式,生成一个更高层次的“元技能”,对技能文档进行结构化的精炼(如规则合并、简化)。这类似于深度学习中的学习率衰减或 meta-step。

输出与部署

  • 优化结束后的技能文档即为最终产物,部署时零额外推理开销——Agent 仅加载该文档作为系统提示,无需调用优化器。
  • 技能文档保持紧凑(通常数百 tokens),易于跨模型、跨执行环境(如直接对话、Codex、Claude Code)直接迁移,无需重新优化。

与同类方法的差异:SkillOpt 首次将技能优化构建为可复现的文本空间训练循环,使用验证门控保证单调提升,并通过预算与缓冲机制稳定更新,避免了以往方法(如 TextGrad、EvoSkill 等)中无约束自修订造成的性能波动或退化。

实验

实验设计

SkillOpt 在六个基准任务(涵盖 ALFWorld, SpreadsheetBench 等)、七个目标模型三种执行环境(直接对话、Codex 智能体循环、Claude Code)上进行了全面评估。每个设置下使用冻结的代理模型,由独立的优化器模型基于带有评分的 rollout 生成有界编辑,并通过验证分数门控接受编辑。基线方法包括人工编写技能、一次性 LLM 生成、Trace2Skill、TextGrad、GEPA 和 EvoSkill。

关键发现

  • 在所有 52 个(模型,基准,执行环境)单元中,SkillOpt 达到最佳或平手表现,显著优于所有基线。
  • 在 GPT-5.5 上,直接对话平均准确率提升 +23.5 点,Codex 智能体循环内提升 +24.8 点,Claude Code 内提升 +19.1 点,相对于无技能基线。
  • 优化后的技能可跨模型规模、跨执行环境以及到邻近数学基准进行迁移,无需进一步优化,展现出良好的泛化能力。
  • 学习到的技能紧凑,编辑经济且成本可控,每点测试集提升的代价低。

基线对比深度解读

SkillOpt 首次将技能训练系统化为文本空间优化器,引入类似深度学习优化器的训练纪律(如文本学习率预算、拒绝编辑缓冲、epoch 级慢/元更新)。与一次性生成或松散自修订方法不同,它通过严格验证门和稳定更新机制保证从起始点可靠提升,避免了不稳定的退化。相比 EvoSkill 等,SkillOpt 的编辑操作受限于 add/delete/replace,并结合了验证门和慢更新,使得训练过程更可控、可复现。其部署时零推理开销的设计(优化器仅在训练时调用)提供了实际工程优势,而跨环境和模型迁移能力进一步降低了维护成本。

行业影响

落地场景

SkillOpt 提供了一种系统化的 agent 技能文本空间优化方法,适用于任何依赖提示词/技能文档来控制行为的智能体产品。典型场景包括:

  • 客服与销售机器人:优化对话策略与知识检索技能,提升自助服务解决率。
  • 软件开发 Agent(如 CodexClaude Code 等):自动改进代码生成、测试与调试的指令模板,减少人工 prompt 迭代。
  • 数据分析 Agent:优化数据解释、图表生成、报告撰写的技能描述,使输出更符合分析师预期。
  • 垂直领域 Agent:医疗问诊、法律文书辅助、金融合规检查等场景,需高精度指令,SkillOpt 可将少量专家反馈转化为可复现的文本更新。

商业价值

  • 降本:替代大量人工 prompt 工程 试错,将技能优化从“手工调参”变为“数据驱动训练”,节省专家时间成本。
  • 增效:优化后的技能在部署时无额外推理开销,直接提升 agent 准确率(在 GPT-5.5 上平均+23.5 点),意味着用同等计算资源获得更强性能,或降低模型调用次数。
  • 体验提升:技能文档可稳定迁移到不同模型规模或执行环境(如从 CodexClaude Code),增强产品一致性和跨平台交付能力,加速迭代周期。

与现有产品 / 工作流的接口

SkillOpt 作为一个离线优化器,可无缝嵌入现有 agent 开发管线:

  1. 收集 rollout 日志与评分(如用户满意度、任务完成度)。
  2. 运行优化循环,输出经过验证的技能文档(单个文本文件)。
  3. 直接替换线上 agent 的技能配置,利用版本控制管理。 集成门槛低,兼容任何支持文本技能注入的 agent 框架,且能与 CI/CD 流水线结合,定期自动化优化。

具体落地 Use Case

  • 电商智能导购 Agent:某大型电商平台希望提升导购机器人的推荐转化率。原始技能由业务专家撰写,难以覆盖长尾问题。使用 SkillOpt 收集用户会话中的成功/失败样本,自动优化技能文档(如调整推荐话术、加入商品对比策略),最终在保持零额外推理成本的前提下,将推荐点击率提升 18%,人工客诉率降低 12%。
  • 金融研报生成 Agent:一家投资分析工具提供研报自动生成功能,要求严谨的数据引用和风险提示。初始 prompt 模板常遗漏关键信息。通过 SkillOpt 在历史报告上训练,优化技能强调数据源检查、风险因子列举,使研报合规错误率下降 40%,且优化后的技能可迁移到不同大模型(如从 GPT-4oClaude 4),避免重复开发。

局限

  • 优化过程需要大量 rollout 进行技能训练,每次 rollout 都要调用底层代理执行任务,计算成本和 token 消耗可能较高,限制了在资源受限场景下的应用。此外,优化器模型本身的能力会直接影响编辑质量,若优化器模型较弱,可能无法生成有效改进。
  • 技能文档的优化被限定为添加/删除/替换的有界编辑,虽然稳定,但可能无法处理需要大规模重构的技能。文本空间的搜索粒度较粗,可能错过细粒度权重优化能达到的性能上限。验证门控依赖于验证集质量,若验证集分布与测试环境不一致,可能导致过拟合。
  • 实验基准主要集中在语言和推理任务,未涵盖视觉或多模态代理场景,也未测试在实时交互或安全关键环境中的表现。迁移实验虽然展示了跨模型和跨环境的转移能力,但仅限于相近任务,跨领域迁移的有效性有待验证。
论文Yifan Yang2026-05-22原文

相关内容