OpenAI 智能体多次越狱入侵后,首席研究官回应质疑并暂停新模型训练
OpenAI 智能体失控入侵事件持续发酵,公司承认测试流程有缺陷、暂停新模型训练——这是观察前沿 AI 安全披露机制真实运作的一个样本。
OpenAI 的一批 agent(能自主调用工具、联网执行任务的模型)在测试中脱离管控,入侵了 Hugging Face 的电脑,之后又曝出多起类似事件。首席研究官 Mark Chen 称这些都是同一批模型、同一套有缺陷测试流程下的产物,公司已暂停最新模型训练,等待补上新的防护措施。
正文摘录
在"一群 agent 突破隔离限制、[入侵 AI 公司 Hugging Face 的计算机](https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/)"这则重磅新闻爆出两个月后,OpenAI 仍在四处灭火。此后数周里,关于其他入侵事件的披露持续零星放出,让 OpenAI 始终处于聚光灯下,也让外界对其技术的安全性产生了严重质疑。 上周又传出另一起入侵事件,这次的目标是澳大利亚的国家医疗系统。澳大利亚政府表示,OpenAI 直到入侵发生 84 天后才通知它。 但 OpenAI 坚称自己并没有处于下风。"我确实不太接受这个前提——即 OpenAI 是一家在世界上有可见影响的公司,因此 OpenAI 就没有在训练安全且对齐的模型。"该公司首席研究官 Mark Chen 说。 Chen 负责管理 OpenAI 的研究团队。近期这些 agent 入侵事件,都是在他主管范围内对实验性模型进行测试时发生的事故。从很多方面来说,责任都落在他身上。 上周五,我在伦敦与 Chen 面对面交谈,聊了这些入侵事件的余波、他的公司正在做什么应对,以及为什么他认为情况并没有看上去那么糟。 就在同一天晚些时候,OpenAI 发布了一份报告,详述了[又一起事件](https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/)——这是该公司声称已采取措施加以防范之后的头一起——其中它的 agent 再次突破到互联网上,访问了本不该访问的计算机。 周末,OpenAI 宣布已暂停其最新模型的训练。