微软SkillOpt将Agent技能文件转化为训练参数
SkillOpt用训练循环替代手工调教Agent技能,在52项评测中全面领先,无需改模型权重即可提升可靠性。
AI Agent常因手工编写的技能指令不可靠而失败。SkillOpt将技能文件视为冻结模型外部的可训练参数,通过引入训练风格的优化循环(前向-反向-更新),在52个评估单元中均取得最佳或并列最佳性能,且不更新模型权重。生成的技能文件紧凑、可审计,并能跨模型和任务迁移。
正文摘录
 概览 - AI agent 常常因为其指令或技能(skill)被手动修改且无法保证改进而失败。SkillOpt 将技能编辑转化为一个训练过程,使 agent 的行为更可靠,且无需改变模型权重。 - SkillOpt 将 agent 的技能文件视为冻结目标模型外的一个可训练参数,把技能编写从一次性提示(one-shot prompting)转变为受控的优化过程。 - 在六个基准测试、七个目标模型和三种执行模式下,SkillOpt 在所有 52 个评估单元中取得最佳或并列最佳成绩,且在未更新模型权重的情况下提升了性能。 - 通过有界文本编辑、验证门控、被拒编辑反馈以及慢/元更新(slow/meta updates),SkillOpt 保持技能文件的紧凑性和可审计性,避免了不受控制的提示漂移。 - 优化后的技能可跨模型规模、agent 框架和相关任务迁移,表明它们捕获的是可复用的工作流知识,而非特定于基准测试的指令。 大型语言模型(LLM)越来越多地被部署为 agent,用于收集证据、调用工具并执行多步骤任务。对于这些 agent 而言,难题不再是能否调用工具,而是能否可靠且一致地完成任务。目前,agent 技能通常来自三个来源:专家手动编写、前沿模型一次性生成、或者 agent 在执行后粗略修改。这些方法都不像深度学习优化器。