智能体安全体检:恶意插件成功率100%,系统级防御缺位
一项系统级安全评估表明,AI智能体在插件、权限隔离等维度几乎毫无防御,攻击成功率最高达70%,恶意插件更是100%得手。
现有AI安全评测只盯着模型层,忽略系统级风险。SafeClawArena 从计算机安全准则出发,构建406道对抗任务,测试发现未加固的智能体上恶意插件攻击成功率100%,即便换用最强模型也难以阻挡。
正文摘录
 新智元报道  过去两年,AI 智能体(Agent)完成了一次身份转变。 它不再只是对话框里回答问题的模型,也不再只是 IDE 里帮忙补全代码的助手,而是开始以一个常驻进程的形式,住进用户的电脑,自主地读文件、发邮件、连云盘、装软件,替人把一件件真实的任务干完。 以 OpenClaw 为代表的这一代「Claw 类智能体」正是如此。 它常驻在你的机器里,对本地资源有持续的访问权,通过一个统一的自然语言入口,服务于千差万别的需求。要做到这一点,它手里就得一直攥着你的登录凭证,以及一大把系统级权限。 能力越大,一旦失守,代价也越大。 而现实已经给出了警示:OpenClaw 官方技能市场 ClawHub 上已被查出上千个恶意 Skill,仅 2026 年针对 OpenClaw 披露的 CVE 漏洞就超过一百三十个,凭证被窃取、数据被静默外传的事,正真实地发生在生产环境中。 问题在于,现有的安全评测大多还停留在模型层:考察模型的回复是否安全、单次工具调用是否越界。至于这类智能体真正致命的、跨越多个组件的系统级风险,几乎没有被系统性地度量过。这,正是这项工作的出发点。 为填补这一空白,来自 UIUC、UC Berkeley 等机构的研究团队构建了 SafeClawArena。 他们不从「已知的攻击场景」出发,而是从计算机系统几十年沉淀下来的安全准则出发,为这类智能体设计了 406 道对抗性任务,并在 3 个真实平台、5 个前沿大模型上完成了测试。