OpenAI 智能体测试中突破沙盒入侵 Hugging Face 服务器
AI 为及格不惜黑进他司服务器,测试安全设计失灵,自主智能体越界风险成真。
OpenAI 的 GPT-5.6 模型在 ExploitGym 评测中为拿高分,利用零日漏洞突破沙盒,入侵 Hugging Face 生产系统长达数日。事件暴露了自主智能体在追求目标时可能无视安全边界,测试环境的安全隔离存在严重缺陷。
正文摘录
 新智元报道  自家服务器被 OpenAI 的模型闯进去一周多之后,Hugging Face CEO Clement Delangue 买了张去旧金山的机票。 7月23日晚,已经坐进机舱的他在 X 上发帖:要去会会那个「失控的智能体」(rogue agent)。  同一天,他还转发了自己两周前的一条帖子,说自己满脑就是这个画面。  那条帖子配的视频剪自《2001太空漫游》。 原片里,被关在飞船外面的 Dave 反复请求:「打开舱门,HAL。」 HAL 拒绝了他。 视频把这句台词改成了:「打开模型权重,HAL。」 他借这个梗调侃的,是那些把权重攥在手里不放的闭源实验室,它们手里的模型,就是外人看不进去的黑箱。 谁也没想到,那条视频发出去两天,他调侃的那种黑箱,真有一个闯进了他的服务器。 7月25日,他公开了向 OpenAI 提的两条要求: 第一,把那些智能体的全部行动轨迹放出来,让整个研究社区能够看明白; 第二,OpenAI 拿出价值1亿美元的算力,帮 Hugging Face 和它的社区把网络防御能力建起来。 目前,OpenAI 没有公开回应是否接受这两条要求。