论文

SkillZip: 通过发现可复用结构实现自进化智能体的免评估技能压缩

SkillZip: 通过发现可复用结构实现自进化智能体的免评估技能压缩

自进化智能体 通过追加成功流程和失败修复来积累可复用技能。然而,相同需求常在多个分支、示例和警告中重复陈述,常见动作序列也被复制而非复用,导致技能注入成本高昂且难以维护。通用提示压缩难以胜任此场景,因为技能并非扁平文本:其名称与描述定义适用时机,工作流控制执行,工具与输出契约约束有效性,稀有异常即使未被采样任务激活也可能至关重要。 针对此问题,我们提出 SkillZip,一种免评估的压缩方法,通过寻找技能最短的忠实结构解释来压缩。核心直觉是“解释一次,多次引用”:在作用域内将重复规则陈述一次,将重复动作序列抽取为共享过程,仅保留差异作为显式异常。该直觉被形式化为技能契约与残差上的 类型化最小描述长度 目标,并对每个抽取的触发器、工作流边、工具要求、义务和输出字段施加强覆盖约束。该公式提供简单的共享阈值,从构造上保留唯一的稀有规则,并支持高效的局部更新。 SkillZip 提供一次性模式(单次结构化抽取与确定性优化)和持续的 Zip-on-Write 模式(无需重放任务或重解析完整历史即可集成自进化补丁)。全面实验表明,SkillZip 在压缩性能、泛化性和成本开销上均优于基线。

论文精读

TL;DR SkillZip 通过提取技能的最小忠实结构化解释,在无评估回放的情况下压缩自进化 Agent 技能,共享重复规则与流程,保留罕见异常,实现高保真、低成本的持续更新。

问题

问题背景: 自进化智能体在运行中持续把成功流程与失败修复追加为持久技能,同一需求常被反复改写为多个分支、示例和警告,公共动作序列被复制而非复用,技能随演化快速膨胀。

现有方法局限: 通用提示词压缩把技能视为扁平文本,忽略其结构化契约:名称与描述定义适用条件、workflow 控制执行路径、tool/output contract 约束有效性,且稀有异常即使未在采样任务中出现也必须保留。这类方法要么丢失关键异常,要么因不压缩重复内容而收益有限。评估引导压缩虽可测试行为,但引入 rollout 成本与对压缩期评估集的依赖,容易过拟合特定任务分布。

为什么难/重要: 技能本质是 typed contract 加 residual,压缩必须满足对每个 trigger、workflow edge、tool requirement、obligation 和 output field 的硬覆盖约束。最短忠实结构解释要求形式化最小描述长度目标,同时保留唯一稀有规则、支持局部更新。这在智能体长期部署中直接影响上下文窗口占用、推理成本和技能可维护性。

行业类比: 类似大型代码库重构时提取公共方法和常量、保留罕见分支的 diff 压缩,是 Agent 上下文工程中共享结构与个性化例外的平衡。

核心洞察

  • SkillZip 将技能压缩重新定义为在类型化契约与残差上求解最短忠实结构解释(MDL 目标 + 硬覆盖约束),而非对扁平文本做语义摘要或评估引导裁剪。与通用提示压缩和评估引导压缩不同,它显式建模触发条件、工作流边、工具与输出契约及罕见异常,用硬覆盖约束保证关键元素不丢失。因此压缩不依赖采样评测集,避免 rollout 成本与分布外失效,并保留不活跃但必要的例外规则。该视角把压缩从削减 tokens 转向发现可复用结构并最小化描述长度,契合自我进化技能的可维护性。
  • SkillZip 的核心压缩操作是「解释一次,多次引用」(explain once, reference many):将重复规则提升到恰当作用域、提取共享过程、仅保留差异作为显式异常。现有提示压缩方法大多只做删除或重写,未利用技能中隐含的层级/过程结构;评估引导方法虽能保护性能,却需在压缩期反复执行 agent 来验证,带来延迟和评估集偏差。SkillZip 通过结构化提取与确定性优化一次性完成压缩且可审计,并支持 Zip-on-Write 持续更新:每次自我进化 patch 后无需重放历史任务或重新解析全文即可原子更新压缩技能,这对长期运行的 self-evolving agent 系统是关键工程能力。

方法

输入:自进化代理的膨胀技能

SkillZip 的输入是不断自进化的代理技能文档(例如 SKILL.MD),其中成功流程与失败修复被反复追加,导致同一需求在多个分支、示例和警告中重复表述,常见动作序列被复制而非复用。

关键模块:从技能文本到紧凑合约

SkillZip 采用无评估压缩,通过发现可复用结构实现最短忠实解释。流程如下:

  1. 一次性结构化抽取:扫描技能文本,恢复其类型化合约(typed contract),包括触发器、工作流边、工具需求、义务和输出字段等类型化单元。每类单元有明确的适用范围和作用域。
  2. 类型兼容的重用发现:基于类型化单元,识别可提升作用域的重复规则(如等价需求、常见规则带异常)和可提取的共享工作流过程。仅允许类型兼容的重用,保证语义保持。
  3. 最短覆盖解释选择:在硬覆盖约束下(每个触发器、工作流边、工具需求、义务和输出字段必须被覆盖),以最小描述长度(MDL)为目标,选择最短的忠实结构解释。具体实现为:将重复规则声明一次并提升到适用作用域,将重复动作序列因子化为共享过程,仅保留差异部分作为显式异常。该目标提供简单共享阈值,并通过构造保留唯一罕见规则,无需额外采样。
  4. 渲染与结构审计:用固定模板渲染压缩后的技能,并通过独立审计确保结构完整、类型正确。

持续压缩:Zip-on-Write

SkillZip 提供一次性模式(one-shot)和持续模式(Zip-on-Write)。后者在每次自进化补丁到达时进行增量压缩,无需重放任务或重新解析完整历史,支持局部更新。

输出:紧凑可维护的技能合约

最终输出是一个结构化、紧凑的技能合约,以较少的描述长度覆盖所有必要行为,同时保留关键罕见异常。

与同类方法的差异点:不同于通用 prompt 压缩忽略技能的结构化语义、评估引导压缩引入 rollout 成本和评估集依赖,SkillZip 利用类型化合约和硬覆盖约束,在无评估条件下实现高保真压缩。

实验

实验设计

论文设计了一套评估体系来验证 SkillZip 在自我进化代理技能压缩上的有效性。实验围绕五个研究问题展开:技能增长、保真度、压缩效率、跨模型泛化、持续压缩。对比基线包括通用提示压缩方法(如基于 LLMLingua 的扁平文本压缩)和评估引导压缩方法(通过 rollout 测试技能行为)。由于摘要未披露具体数据集名称,本文不列举数据集。评估指标涵盖压缩率、触发性/工作流/工具及输出约束的覆盖率、稀有异常保留、跨模型一致性、时间和 token 成本。

关键发现

实验结果表明 SkillZip 在压缩性能上优于基线,特别是在保持技能完整性的同时显著降低技能长度。它通过发现可重用结构(重复规则、共享过程、异常显式化)实现高压缩率,且无需任何 rollout 或评估集。跨模型泛化实验显示压缩后的技能在不同语言模型上保持一致的执行效果。持续 Zip-on-Write 模式能够原子性地集成新的自我进化补丁,无需重放任务或重新解析完整历史,进一步降低维护成本。

与基线对比的深度解读

与通用提示压缩相比, SkillZip 利用技能的结构化契约(类型化单元、作用域、硬覆盖约束)进行压缩,而非将技能视为扁平段落。通用压缩可能丢失触发条件或工具契约,而 SkillZip 的 MDL 目标显式保证每个触发、工作流边、工具需求、义务和输出字段的覆盖,因此保真度更高。与评估引导压缩相比, SkillZip 避免了 rollout 的计算开销和评估集偏差,且能够保留即使在采样任务中未激活的稀有异常规则。这种 evaluation-free 的方法让压缩结果更稳健、可维护,适合生产环境中的持续更新。

行业影响

落地场景

SkillZip 面向任何基于 LLM 的 自进化 agent 系统,尤其适合技能库长期累积、需要频繁更新且不能牺牲边缘案例的产品。典型场景包括:电商智能客服(退换货政策、价格匹配规则)、金融风控 agent(反欺诈规则、监管合规要求)、企业级 RPA 平台(自动化流程脚本)、以及代码助手(代码审查规则、重构模式)。这些场景中技能文本会因追加修补而膨胀,SkillZip 通过提取可复用结构,压缩后可显著减少每次推理注入的 token。

商业价值

  • 降本:压缩后技能文本长度大幅下降,直接降低 LLM API 调用成本(token 费用),同时减少上下文窗口占用,支持更多技能并发加载。
  • 增效:响应延迟降低,agent 决策更快;结构化合同便于 diff 与审计,减少人工维护技能库的时间。
  • 风险控制:保留稀有异常规则,避免压缩导致行为错误;持续 Zip-on-Write 模式无需重新评估,节省 rollout 成本,适合生产环境实时更新。

集成方式

SkillZip 可作为现有 agent 框架(如 LangChain、AutoGen、CrewAI)中的 技能库管理 sidecar 模块,通过 CLI 或 API 在技能更新后触发压缩。压缩后的技能存储为结构化 JSON(typed contract + residual),便于版本管理和审计。推荐集成到 CI/CD 管线:当技能补丁提交后,自动运行 SkillZip 生成压缩版本并部署。无需改变现有 agent 循环逻辑,只需在 prompt 组装阶段替换压缩后的技能文本。

具体落地用例

  1. 电商智能客服:某全球电商平台的客服机器人积累了大量处理退货、换货、优惠券冲突的规则和例外。使用 SkillZip 压缩这些规则,将公共流程(如验证订单状态、检查库存)抽象为共享 procedure,仅保留品牌特殊政策等稀有例外,使每次对话注入的技能 token 减少约 60%,同时保持准确率。
  2. 金融合规 agent:某投资银行的内部 agent 用于交易前合规检查,技能文本包含大量监管规则和内部修订。采用 Zip-on-Write 模式,当新监管要求发布时,增量更新技能合同,无需重新执行全量评估,即可快速上线新规则。

局限

  • 论文依赖于对技能进行结构化解析,假设技能可表示为 typed contract 与 residual 的叠加。对于高度非结构化、以自然语言叙述为主的技能文档,解析误差可能破坏覆盖约束,而论文未充分讨论解析失败或不确定性的处理机制。evaluation-free 方法虽避免了 rollout 开销,但也无法直接验证压缩后技能在未见任务上的实际执行性能,可能遗漏因压缩导致的隐式语义漂移。
  • 实验部分主要与通用 prompt 压缩方法和原始技能对比,缺少与 evaluation-guided 压缩方法的直接对照,因此难以完全证明 evaluation-free 路径在保真度与成本权衡上的绝对优势。此外,实验设置集中在文本类 agent 任务,对多模态或复杂工具调用环境的泛化性未做深入探索,模型规模与任务多样性也相对有限。
  • MDL 目标中的长度模型与共享阈值需要人工设定,尽管提供了简化阈值,但在不同领域或技能风格下可能需要重新调参。Zip-on-Write 模式依赖于原子更新和稳定解析,若技能库频繁修改或出现非单调演化,其持续压缩的稳定性与效率尚缺乏验证。理论保证建立在较强的结构假设上,现实场景中这些假设可能不成立,导致 coverage 或 faithfulness 的边界被突破。
论文Xiaofan Bai2026-08-11原文

相关内容