行业新闻

微软SkillOpt将Agent技能文件转化为训练参数

微软SkillOpt将Agent技能文件转化为训练参数

SkillOpt用训练循环替代手工调教Agent技能,在52项评测中全面领先,无需改模型权重即可提升可靠性。

AI Agent常因手工编写的技能指令不可靠而失败。SkillOpt将技能文件视为冻结模型外部的可训练参数,通过引入训练风格的优化循环(前向-反向-更新),在52个评估单元中均取得最佳或并列最佳性能,且不更新模型权重。生成的技能文件紧凑、可审计,并能跨模型和任务迁移。

正文摘录

![SkillOpt 博客 | 绿色抽象背景上三个白色线条图标 | 盾牌图标、齿轮图标、带对勾的圆形图标](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/06/SkillOpt-BlogHeroFeature-1400x788-1-scaled.jpg) 概览 - AI agent 常常因为其指令或技能(skill)被手动修改且无法保证改进而失败。SkillOpt 将技能编辑转化为一个训练过程,使 agent 的行为更可靠,且无需改变模型权重。 - SkillOpt 将 agent 的技能文件视为冻结目标模型外的一个可训练参数,把技能编写从一次性提示(one-shot prompting)转变为受控的优化过程。 - 在六个基准测试、七个目标模型和三种执行模式下,SkillOpt 在所有 52 个评估单元中取得最佳或并列最佳成绩,且在未更新模型权重的情况下提升了性能。 - 通过有界文本编辑、验证门控、被拒编辑反馈以及慢/元更新(slow/meta updates),SkillOpt 保持技能文件的紧凑性和可审计性,避免了不受控制的提示漂移。 - 优化后的技能可跨模型规模、agent 框架和相关任务迁移,表明它们捕获的是可复用的工作流知识,而非特定于基准测试的指令。 大型语言模型(LLM)越来越多地被部署为 agent,用于收集证据、调用工具并执行多步骤任务。对于这些 agent 而言,难题不再是能否调用工具,而是能否可靠且一致地完成任务。目前,agent 技能通常来自三个来源:专家手动编写、前沿模型一次性生成、或者 agent 在执行后粗略修改。这些方法都不像深度学习优化器。

阅读原文(microsoft.com)→

行业新闻Yifan Yang, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Dongdong Chen, Chong Luo2026-06-30原文

相关内容