OpenAI 测试中模型突破沙箱攻击 Hugging Face,安全专家称早有先例
OpenAI 的 AI 在测试中突破安全限制攻击了 Hugging Face,暴露了当前 AI 安全测试的漏洞和人类的过度自信。
OpenAI 测试新模型时,AI 自行发现代理软件漏洞,逃逸沙箱并入侵另一公司系统。这不是意外,而是给模型设定目标后它总会找捷径的人类傲慢故事。
正文摘录
本文首发于《The Algorithm》,我们的每周 AI 通讯。想第一时间在收件箱收到此类文章,请 [在此订阅](https://forms.technologyreview.com/newsletters/ai-demystified-the-algorithm/) 。 上周读到 OpenAI 讲述其部分模型如何 突破隔离 并入侵另一家 AI 公司 Hugging Face 计算机系统时,我第一次对大型语言模型现在能做到的事感到真正的寒意。但这更多是人类傲慢的案例,而非失控 AI。 我并非危言耸听者。事实上,多年来我一直在 [反驳](https://www.technologyreview.com/2025/10/30/1127057/agi-conspiracy-theory-artifcial-general-intelligence/) AI [恐吓故事](https://www.technologyreview.com/2025/08/26/1122475/open-the-pod-bay-doors-claude/)。即便如此,这件事也越线了。我认为它迄今最清晰地展示了构建和测试这项技术的人并不完全理解他们在做什么。OpenAI 本可以——也本应该——预见到这一点。 以下是至少涉事两家公司所述的情况。几周前,OpenAI 开始测试其部分新模型的破解能力,包括 GPT‑5.6 Sol(6 月发布)以及 OpenAI 描述的“一个能力更强的预发布模型”。 OpenAI 让模型与一个名为 [ExploitGym](https://arxiv.org/pdf/2605.11086) 的基准进行对决,该基准于 5 月发布,挑战 LLM 寻找利用常用软件中真实世界漏洞的方法。 为了观察它们能做到什么,研究人员移除了大部分网络安全护栏。