CaSKG: 面向可扩展智能体技能检索的反事实因果技能图
可复用技能库使大语言模型(LLM)智能体能够跨任务复用程序性知识,但同时也将记忆访问转化为一项具有挑战性的检索问题。全库提示虽能保留覆盖率却带来高昂的上下文开销;向量检索返回紧凑邻域,却将技能视为独立文本;基于图的检索虽能恢复工作流上下文,但仅在承载相关性的边可靠时有效。 为此,本文提出 CaSKG ——一种反事实因果技能图框架,在检索之前校准程序性关系。它首先基于语义、词汇、输入/输出及结构证据构建高召回率的有向候选图,并利用修复证据与可选的 LLM 裁判进一步优化候选评分;随后通过方向条件的文本反事实探针对技能对进行删除、替换和重排,利用贝叶斯平滑聚合证据,最终发布状态过滤的加权图以支持任务条件扩展。该图离线构建,使用时无需改动下游智能体策略或任务接口。 在六个 LLM 骨干及 ALFWorld ID-140、ScienceWorld U211 上的实验表明,CaSKG 在全部十二种模型与基准组合中取得最高任务分数。与 Graph-of-Skills (GoS) 相比,它将六模型宏观平均 ScienceWorld 分数从 72.62 提升至 80.50,ALFWorld 成功率从 80.01% 提升至 86.79%,同时在两个基准上均减少了平均环境步数。定性与消融分析进一步显示,校准后的边有助于检索保留前置条件、状态改变动作、验证例程及最终完成步骤。 这些结果将边置信度校准定位为一种在大规模下实现紧凑且可执行技能检索的有效途径。代码已开源:https://github.com/ZhiyuanLi218/Caskg 。
论文精读
TL;DR CaSKG 用反事实因果探针和贝叶斯平滑校准技能图中的流程边,为 LLM 智能体提供可扩展且可靠的技能检索,在 ALFWorld 与 ScienceWorld 上取得六模型中最优成功率和更少环境步数。
问题
问题背景
可复用技能库让 LLM agent 跨任务复用过程性知识,但技能检索成为关键瓶颈。业界关注在有限上下文下同时保持覆盖与压缩。
现有方法局限
- 全库提示:覆盖全,但上下文成本过高,不可扩展;
- 向量检索:返回紧凑邻域,但将技能视为独立文本,丢失工作流上下文;
- 图结构检索:可恢复工作流上下文,但依赖可靠的边。现有图构建多基于语义相似度或共现,对“先做 A 再做 B”“A 改变状态使 B 可行”等过程性因果边置信度不足,导致检索时引入噪声边或漏掉关键边。
为什么这个问题难且重要
技能间过程性关系往往是有向、非对称、状态依赖的,静态文本相似度无法捕获。要校准这类边,需要在离线阶段构造反事实探针(删除、替换、重排技能对),并聚合多种证据进行贝叶斯平滑。同时,图必须在离线完成且不影响下游 agent 策略或任务接口,这对可扩展性和即插即用性提出高要求。随着 agent 技能库规模增长,边置信度校准是紧凑且可执行检索的核心挑战,直接决定 agent 能否稳定复用过程知识。
行业类比
类似软件工程中包依赖图需要精确解析模块间调用与副作用,否则依赖解析会引入错误版本或循环;技能图同样需要可靠因果边才能实现可靠的模块化复用。
核心洞察
- 反事实因果校准将技能图构建从相关性驱动转向因果验证。以往图检索方法(如 Graph-of-Skills)依赖共现或语义相似度连边,边权重不可靠,导致检索传递错误上下文。CaSKG 对每对技能施加方向条件文本反事实探针(移除、替换、重排),并用贝叶斯平滑聚合证据,估计边作为因果依赖的置信度。这使得发布的图保留了前置条件、状态更改和验证步骤,解决了检索中“上下文相关但程序不可执行”的痛点。
- 状态过滤加权图与方向条件探针联合建模了技能间顺序和状态依赖。纯语义检索把技能当独立文本,无法捕捉“先冷却再放置”这类顺序约束;而 CaSKG 通过状态门控发布边,只在满足前置状态时保留连接。这使检索结果更紧凑且可执行,在 ALFWorld 和 ScienceWorld 上减少平均环境步数,表明图校准直接转化为交互效率。
- 离线图构建与在线检索解耦赋予框架工程可扩展性。CaSKG 在离线阶段完成高召回候选图诱导、反事实探针和贝叶斯校准,在线阶段仅做查询条件扩散,不改变下游 agent 策略或任务接口。相比 full-library prompting 的高上下文成本,它提供紧凑邻域;相比向量检索,它保留工作流上下文。这种设计使方法能无缝嵌入现有 LLM agent 系统,无需重新训练或修改策略网络。
方法
CaSKG 的输入是可复用技能库 与目标任务查询,输出是经过任务条件扩散的紧凑技能子集,用于下游 LLM agent 的策略执行。
关键模块
候选技能图归纳
首先从语义、词汇、输入/输出和结构等多源证据构建高召回有向候选图,节点为技能,边表示潜在程序关系。利用修复证据和可选 LLM judge 进一步细化候选边分数,确保候选图覆盖足够的相关技能对。反事实边探测
对每个候选有向边,生成方向条件化的文本反事实探测,包括移除、替换和重排技能对。通过观察 LLM 对反事实扰动的响应变化,估计边的因果必要性。该步骤将边的存在与否与任务性能变化关联。贝叶斯边校准与图发布
将多源证据与反事实探测结果用 Bayesian smoothing 聚合,得到每条边的可靠性估计。随后发布一个状态过滤加权图,仅保留高置信度边,并支持后续任务条件扩展。任务条件技能检索
对给定任务,利用加权图进行查询条件扩散,从任务初始技能出发,沿高置信度边扩展相关技能,输出紧凑且可执行的技能子集。
整个图构建过程离线完成,不改变下游 agent 策略或任务接口。
与 Graph-of-Skills 等图检索方法不同,CaSKG 在检索前通过反事实因果探测校准边置信度,避免依赖不可靠的预定义边。
实验
实验设计
CaSKG 在两个基准 ALFWorld ID-140 和 ScienceWorld U211 上,使用六个 LLM 骨干模型进行评测,对比基线包括 full-library prompting、vector retrieval 以及图检索方法 Graph-of-Skills (GoS)。评估指标涵盖任务得分、成功率与环境交互步数。
关键发现
- 最高任务得分:在全部 12 个模型-基准组合中,CaSKG 均取得最高任务得分。
- ScienceWorld 宏平均分数:从 72.62 提升至 80.50,相对 GoS 提升 7.88 分。
- ALFWorld 成功率:从 80.01% 提升至 86.79%。
- 环境步数:两个基准上的平均环境步数均减少。
与基线对比解读
CaSKG 通过反事实因果边校准,为检索保留了前提条件、状态改变动作、验证例程与最终完成步骤,解决了图检索中边不可靠的问题。
相比 full-library prompting,CaSKG 显著降低上下文成本;相比 vector retrieval,它不把技能当作独立文本,而是恢复工作流上下文。离线构建状态过滤加权图,使用时无需修改下游 agent policy 或任务接口,具备良好的工程集成性。
行业影响
落地场景
CaSKG 适用于需要维护大规模可复用技能库的 LLM agent 系统,典型场景包括:
- 电商平台的智能客服自动处理退换货、物流异常等流程化任务,从数百个售后 SOP 技能中检索下一步动作;
- 企业服务中的 IT 运维 agent、RPA 流程自动化,按技能依赖关系选择正确操作;
- 内容平台或教育产品的个性化学习路径规划,基于技能前置关系推荐知识点。
商业价值
- 降本:CaSKG 离线构建状态过滤加权图,在线检索时仅返回高置信子图,相比全库注入 prompt 可显著降低 token 成本与推理延迟。
- 提效:在 ALFWorld 和 ScienceWorld 上六模型平均成功率分别提升 6.78 和 7.88 个百分点,同时减少环境交互步数,直接降低 agent 运行成本。
- 体验提升:校准后的边保留前置条件、状态变更、验证与收尾步骤,减少 agent 漏步或错序,提升任务完成一致性。
与现有工作流集成
CaSKG 不修改下游 agent 策略或任务接口,可作为 检索中间件 嵌入现有 stack:
- 离线阶段:用语义、词汇、I/O、结构证据构建候选图,再用反事实探针和贝叶斯平滑校准边权重,发布状态过滤图。
- 在线阶段:接收任务查询,通过 query-conditioned diffusion 返回紧凑技能子图,直接拼入 prompt 或作为 memory 上下文。
- 代码已开源 CaSKG,可替换现有 vector DB 或 graph memory 组件,无需改动 agent 逻辑。
局限
- **离线构图成本高**:CaSKG 需要为每对候选技能执行方向条件反事实探针(移除、替换、重排),每次探针均需调用 LLM,且多源证据融合与可选 LLM judge 进一步增加计算量。对于包含数千技能的大规模库,离线构图时间与 token 开销可能难以接受,论文未给出复杂度分析或近似加速方案,限制了其在超大规模场景的实用性。
- **评估环境有限**:实验仅在 ALFWorld 和 ScienceWorld 两个文本交互模拟环境上验证,任务以步骤型操作为主,技能边界清晰。未覆盖真实开放域环境(如多模态感知、工具调用、代码执行、长期规划),也未测试跨领域迁移能力,因此无法判断反事实校准在复杂、噪声技能库上的鲁棒性。
- **静态技能库假设**:方法假设技能库预先定义且相对静态,未讨论技能更新、删除或增量添加时如何高效重构图与重新校准边。相比 Graph-of-Skills,CaSKG 的图谱构建管线更复杂,部署时需额外维护校准状态和加权图,在持续学习的动态环境下可能引入较高维护成本。