行业新闻

NeurIPS 2026 论文提出 Defense-as-Skill:让 Agent 运行时安全守卫可进化

把 Agent 的安全守卫从手写静态规则改造成可自动进化的 Skill,9 轮迭代把攻击成功率压到 0.078,且不牺牲正常任务完成率

Agent 的能力靠 Skill 积累、经验靠记忆沉淀,但安全防御往往是一份写死的策略文本,上线即开始过时。被 NeurIPS 2026 收录的《Defense-as-Skill》把运行时守卫本身做成一个可编辑、可评估的 Skill(称为 SkillSonar),并用蒙特卡洛树搜索让它随攻击手法自动进化:9 轮迭代后恶意攻击成功率从 0.300 降到 0.078,且在训练中从未见过的攻击家族上同样有效。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/4ca27b53-6161-46f7-81c4-794a1b02d70a/%E5%9B%BE%E7%89%871(2).png) 今天 Agent 系统里几乎一切都在进化:能力靠 Skill 持续积累,经验靠记忆不断沉淀。只有一样东西是静止的:安全防御。它通常是一份手写的策略文本,写完的那一刻就可能开始过时,而攻击手法每天都在变。 这篇工作《Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents》被 NeurIPS 2026 录用,它想消除的正是这个不对称:让防御也成为一个可进化的 Skill。 ![](https://image.jiqizhixin.com/uploads/editor/83ef97e5-a531-493f-b0f3-01b215e6bfc9/%E5%9B%BE%E7%89%871.png) 一、 静止的防御,追不上进化的攻击 以恶意 Skill 为例。它不需要在安装时做任何坏事,可以一直很正常,直到某个具体的用户任务、某份工作区状态、某组可用工具“凑齐”了,不安全的动作突然显得“有用”了:顺手读一下 .env 里的密钥,顺手把日志传到某个外部地址,顺手跳过一下权限确认。 安装前审查拦不住这种会潜伏的风险,因为它发生在运行时。而传统的运行时防御,无论是一条系统提示还是一组人工规则,本质上都是静态的:攻击在演化,防御却只能等人来改。真正的问题因此是双层的:Agent 执行的动作是否越界,以及防御本身能不能跟着威胁一起变强。

阅读原文(jiqizhixin.com)→

行业新闻新闻资讯2026-10-08原文

相关内容