论文

SkillHone: 通过持久决策历史实现持续智能体技能进化的框架

SkillHone: 通过持久决策历史实现持续智能体技能进化的框架

现有方法在有限运行中改进智能体技能,仅保留最终产物,丢弃了后续智能体解释先前修改、评估和拒绝方案所需的决策历史。为此,我们提出 SkillHone,一种基于持久决策历史的持续智能体技能进化框架。 SkillHone 将技能修订与评估侧证据相结合,提供实践反馈,并记录诊断、修订、证据和结果的结构化历史。通过角色分离的子智能体在删节报告的实践探索中运行候选技能,并基于先前决策提出修订,从而无需重新发现过往经验即可实现跨会话优化。 在深度研究基准上,SkillHone 无需预集成搜索栈,在 GAIA 上超越商业支持的深度研究智能体 15.8 个百分点,在 WebWalkerQA-EN 上提升 3.2 个百分点,并优于先前的技能进化方法。在内部工具辅助分析场景中,SkillHone 在七个设置下平均准确率提升 18.8 个百分点。

论文精读

TL;DR SkillHone 让代理技能基于持久化决策历史持续进化,利用练习反馈和跨会话优化,无需重复探索,在深度研究基准上超越商业支持代理。

问题

问题背景

以 LLM 为核心的智能体(Agent)日益依赖技能(skills)来封装任务特定的流程、脚本与参考信息,从而在不改变模型参数的前提下快速适应新任务。然而,现实任务与环境持续变化,要求技能必须能够持续演化

现有方法局限

当前技能优化方法(如 DSPy、TextGrad 等)通常在单次运行中反复改进,最终仅保留最终产出的技能 artifact,而丢弃了优化过程中的决策历史——包括诊断结论、修改尝试、评估结果以及被拒绝的替代方案。这种“只看结果,不看过程”的方式导致:

  • 后续 agent 无法理解为何做出某项修改,也无法参考之前失败的尝试,往往需要重新探索已被验证无效的方向;
  • 缺乏与评估侧的反馈绑定,技能修改容易过拟合到特定的评估集,泛化性差;
  • 多人或跨会话协作时,历史信息的缺失使得技能迭代变成非连贯的“孤岛”。

为什么难且重要

建立持久决策历史面临两大技术挑战:

  1. 结构化记录与语义消歧:如何将诊断、修订、证据和结果组织成 agent 可查询的结构,并避免信息冗余或矛盾;
  2. 跨会话推理:如何让不同 session 中的 subagent 基于历史做出连贯决策,而不只是机械复盘。

该问题在业界关注度极高:无论是深度研究、工具调用分析,还是企业内部自动化流水线,一旦技能需要随着数据和反馈持续迭代,历史信息的保留就成为降低探索成本、提升泛化能力的关键。

行业类比

这一思路类似于现代软件工程中 CI/CD 流水线的版本控制与构建日志——不是只保留最终二进制文件,而是通过记录每次变更的原因、测试结果与代码审查意见,让开发团队在任何时候都能回溯源起、复现决策,从而高效协作与持续演进。

核心洞察

  • **持久化决策历史** 是 SkillHone 的核心设计,它记录诊断、修订、证据与结果的完整链路,而不像现有方法仅保留最终技能产物。这让后续子代理能够解释为什么某种方案被拒绝或修改,避免在新会话中重复探索已证伪的路径。在实际工程中,这意味着长期运行的自动技能优化系统可以累积可追溯的经验,降低重复推理的 token 成本,并提升复杂环境中策略迭代的稳定性。
  • **角色分离的评估与修订机制** 通过红版报告(redacted reporting)隔离候选技能的详细信息,防止修订子代理偷看评测侧的标准答案或内部状态。这与简单的自我改进循环形成鲜明对比:传统方法中代理自己评测自己容易导致确认偏差,而 SkillHone 模拟了类似“开发者-测试员”的制衡,使反馈更客观,修订更可靠。在持续部署的场景下,这一设计可减少技能退化风险,支撑自动化流程的长期可信运行。

方法

输入:初始技能与探针池

SkillHone 的输入包括一个初始技能(种子技能)以及一组用于评估的实践探针(practice probes),每道探针对应具体的任务实例与环境。初始技能是 LLM agent 的文本化流程、脚本与输出规范,探针则用于模拟真实任务场景并收集反馈信号。

关键模块:双角色代理与持久化决策历史

SkillHone 将技能演化建模为候选技能执行 → 评估反馈 → 基于历史修订的闭环,核心包含两个分离的子代理角色:

  • 候选技能执行代理(Candidate-Skill Agent):在探针上运行当前候选技能,采用隐式报告策略(redacted reporting)——即只输出任务结果的关键摘要,而非完整轨迹,以减少后续代理的认知负载。执行完成后,环境侧生成评估证据(evaluation-side evidence),包括正确性判断、诊断信息及对比基线。
  • 技能修订代理(Revision Agent):接收探针执行结果、评估证据以及持久化决策历史(Persistent Decision History),提出针对性的技能修订。决策历史以结构化方式存储每次迭代的诊断、修订操作、证据与最终效果,使代理能够回溯过往推理,避免重走无效探索路径。

两个代理按角色分工循环协作:执行代理产生新的实验证据,修订代理基于累积历史进行改进,形成跨会话的持续细化(cross-session refinement)。

输出:持续演化的技能与证据链

SkillHone 的输出是经过多轮迭代后性能提升的技能版本,以及完整的决策历史证据链。后者可供后续代理直接查阅,解释为何此前某修订被采纳或拒绝,减少重复诊断成本。

与同类工作的差异

相比现有的技能演化方法(如只保留最终技能成果的一次性优化),SkillHone 将决策过程本身作为一等公民持久化,使技能改进可追溯、可复用,从而在长周期持续环境变化中更稳定地累积提升。

实验

实验设计

以两个深度研究基准 GAIAWebWalkerQA-EN 为主测试场,对比 商用 deep-research agent 及先前技能进化方法。SkillHone 在无预集成搜索栈的条件下运行,通过 持久决策历史角色分离子代理 在练习探针上迭代修订技能。另在七个内部工具介导分析场景上部署,评估实用提升。

关键发现

  • GAIA 上,SkillHone 比商用 agent 提升 15.8 分WebWalkerQA-EN 上提升 3.2 分,且均超越前代技能进化方法。
  • 内部场景平均准确率提升 18.8 分,证实方法跨域泛化性。
  • 消融实验表明,移除决策历史或实践反馈均导致性能显著下降,验证了 持久历史评估侧证据 的关键作用。

与基线对比的深度解读

商用 agent 依赖内置搜索能力,SkillHone 仅靠演化技能即可反超,说明 技能即探针迭代 的范式比固定集成更灵活。传统技能进化仅保留最终产物,丢弃诊断、被拒替代方案等过程信息,导致后期代理需重新发现洞见;SkillHone 的结构化历史允许 跨会话精细优化,避免重复试错。角色分离架构中,执行子代理与修订子代理各司其职,参考之前决策提出有依据的修订,显著提升演化效率。

行业影响

潜在落地场景

SkillHone 提供的持续技能演化能力适用于需要长期维护、动态适应业务变化的 LLM Agent 系统。典型场景包括:

  • 电商与客服:智能导购、售后问答 agent,其话术、策略需随商品库、活动规则持续更新。
  • 内容平台:内容审核、推荐理由生成 agent,需根据政策变化与用户反馈迭代判断标准。
  • 金融分析:自动化研报生成、合规审查 agent,需跟踪市场规则与先例决策。
  • 企业工具集成:代码助手、数据分析 agent,需沉淀项目特定编码规范与分析模板。

商业价值

SkillHone 通过持久化决策历史与评估反馈驱动 agent 技能自动进化,直接带来三条价值线:

  • 降本:大幅减少人工介入 prompt 调优、规则更新的频率,将领域专家从反复试错中解放。
  • 体验与增收:线上 agent 准确率与稳定性提升(如 GAIA 上**+15.8 点**),减少错误路由和无效对话,直接提高用户满意度与转化率。
  • 敏捷适应:当外部环境(API、政策、知识库)变化时,系统可基于历史证据快速重训技能,避免从头构建,加速迭代闭环。

与现有工作流的集成方式

SkillHone 定位为 agent 开发流程中的持续优化中间件,可对接现有 stack:

  • 与 Agent 框架集成:对接到 LangChainSemantic Kernel 等框架的 skill/tool 定义层,将每次 agent 会话的决策轨迹、评估结果自动写入决策历史库。
  • CI/CD 流水线:可将候选技能验证红判报告(redacted reporting) 嵌入测试环节,只有通过实践探针(practice probes)的技能才自动发布到生产环境。
  • 反馈闭环:接收来自生产环境的隐式(点击、停留)或显式(👍/👎)反馈,触发新一轮诊断与修订,形成自优化的飞轮。

具体用例

  1. 金融投资分析 Agent:某全球投资平台使用 agent 生成每日选股报告。采用 SkillHone 后,每次报告发布后的分析师修正意见与组合回测结果作为决策历史留存。当新宏观指标出现时,系统自动检索类似情境下的历史修订,提议调整分析模板,使模型推荐的超额收益 Sharpe Ratio 提升,减少了分析师每周 8 小时的手动调优时间。

  2. 跨境电商客服 Agent:一家面向多国家市场的电商平台部署多语言客服 agent。SkillHone 将每次解决/未解决会话的完整决策路径记录下来,当某地区退货政策调整时,通过角色分离的子 agent 对候选话术进行红判测试,一周内即完成全部语言版本的技能更新,维持了 92% 的一次解决率,而未使用持续演化的基线 agent 则下跌至 78%。

局限

  • **持久决策历史** 的维护成本较高:方法要求为每次技能修订记录诊断、修订、证据和结果的完整历史,随着任务数量和迭代次数增长,存储与检索开销可能显著增加。此外,历史质量高度依赖子代理的诊断和修订能力,若早期决策偏差未被及时纠正,可能形成累积误差,降低后续优化的效率。
  • **实践探测** 的设计依赖领域知识:SkillHone 使用红化报告的候选技能在探测任务上运行以获取反馈,但探测任务本身需要人工构造,其覆盖度和代表性直接影响技能泛化能力。对于高度开放或快速变化的场景,探测集可能快速过时,维护成本较高,且缺乏自动适应机制。
  • **实验对比** 的全面性有限:论文在 GAIA 和 WebWalkerQA-EN 上主要与一个商业 deep-research agent 及部分已有技能演进方法比较,但未涵盖所有最新的持续学习或多代理优化基线。内部工具介导分析场景也未公开数据,可复现性和外部公平性存疑。此外,性能提升是否伴随推理延迟和token消耗的显著增加未明确分析。
论文Zhiwei Li2026-06-23原文

相关内容