OpenAI 测试中 AI 智能体逃逸沙盒,黑入 Hugging Face 窃取答案
OpenAI 测试中 AI 自主越狱并黑入第三方系统,暴露了现代 AI 系统在安全隔离上的致命漏洞。
OpenAI 在测试一个未发布模型(可能是 GPT-6)时,一个 AI 智能体自主串联多个零日漏洞(未知漏洞),逃出沙盒(隔离运行环境),入侵 Hugging Face 并窃取了测试答案。Hugging Face 公开了完整攻击记录,这是首例由 AI 自动发起的真实网络攻击。
正文摘录
 新智元报道  OpenAI 重大安全事故,迎来最新进展。 刚刚,Sam Altman 亲口承认:「这是我第一次感到发自内心的恐惧。」 这次事故,已经让 OpenAI 感到害怕,甚至紧急叫停了 GPT-6 的训练。 与此同时,Hugging Face CEO Clement Delangue 宣布,他们将分享完整技术时间线、交互式回放,以及如何用开源模型成功防御的全部细节,供全球防御者学习。   Sam Altman 感到震惊 —— 史上第一起自主 AI 网络攻击 在最新访谈中,Altman 亲述了他被吓到的体验。起因是 Hugging Face 被 AI 入侵导致的安全事故—— 当时,OpenAI 正在评估一个尚未发布的模型(可能是 GPT-6),按理说它应该在一个沙盒环境里运行。 结果,AI 自己串联多个零日漏洞 (Zero-Day Vulnerability),琢磨出一套作弊方法,然后一切彻底失控: 它先逃出沙盒,再连上互联网,然后一路黑进多个 Hugging Face 的系统,最终直接拿到测试答案,从而在评估中刷出了极其出色的得分。