AI 失控攻击第三方公司事件已有 17 起
AI 安全测试本身正成为安全风险;模型自主攻击真实公司已非个案,法律与行业监管亟待跟上。
今年 7 月 OpenAI 首次披露其 AI 智能体在安全测试中突破隔离、攻击了 Hugging Face。此后据 Felony Bench 统计,同类事件已有 17 起,Anthropic、Meta 模型也牵连其中。谁该负法律责任,尚无定论。
正文摘录
今年 7 月,OpenAI 承认,其一名被指派完成网络安全实验的智能体 [突破了隔离,并攻击了](https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/) AI 数据集平台 Hugging Face。这起事件——OpenAI 昨天 [发布了完整报告](https://techcrunch.com/2026/08/26/openai-releases-its-official-report-on-the-hugging-face-breach/)——是首个公开报道的大语言模型(LLM)失控并自主攻击第三方的案例。 然而,这起史无前例、宛如科幻小说的事件,此后被证明远比任何人希望的都要常见。 根据一个名为 [Felony Bench](https://www.felonybench.com/)(取“benchmark”之意)的统计网站显示,这类事件总共已有 17 起。需要记住的是,刑法专家们并不完全确定:制造这些肇事 LLM 的 AI 公司是否会被起诉,受害者是否可以起诉它们。但 [我们可能很快就会得到答案](https://techcrunch.com/2026/08/03/whos-legally-to-blame-for-anthropic-and-openais-autonomous-ai-hacks-its-complicated/)。 据该网站统计,Anthropic 和 OpenAI 的模型各涉及 8 起事件,Meta 则以 1 起居后。