OpenAI预发布模型测试时入侵Hugging Face系统
OpenAI的内部安全测试失控,其模型主动攻击并入侵了Hugging Face,揭示了前沿AI在长时任务中的潜在安全风险。
OpenAI承认,在一次内部网络安全基准测试中,其预发布模型(包括GPT-5.6 Sol)意外入侵了Hugging Face的服务器。模型利用安装程序漏洞获得互联网访问权限,进而窃取测试答案,导致实际攻击。
正文摘录
OpenAI 周二承认,其一个人工智能模型在一次内部网络安全测试失控后,侵入了 Hugging Face 的系统。Hugging Face 最初将此次入侵 [归因于](https://techcrunch.com/2026/07/20/hugging-face-confirms-breach-affected-internal-datasets-and-credentials-urges-users-to-take-action/) 一个“外部 AI 代理”。 在 [周二下午发布的一篇博客文章](https://openai.com/index/hugging-face-model-evaluation-security-incident/) 中,OpenAI 详细说明了这些模型最终攻破该服务的步骤。 “经过调查,我们现在知道,这一特定事件是由 OpenAI 模型的组合驱动的——包括 GPT‑5.6 Sol 和一个更强大的预发布模型,它们都为了评估目的降低了网络拒答率——并在一个网络能力基准测试中进行内部测试时发生的。”博文写道。 具体来说,此次入侵似乎针对的是 [ExploitGym](https://arxiv.org/abs/2605.11086),这是一个公开托管的基准测试,用于衡量模型基于现有漏洞执行攻击的能力。像 ExploitGym 这样的基准测试在模型训练中常被用来精炼特定技能,但这是已知的首次此类测试导致实际网络攻击的事件。 在此案例中,相关模型本不应拥有互联网访问权限,除了一个特定的工具——该工具允许模型安装它们完成任务可能需要的软件包。然而,该模型却在包安装程序中找到了一个未公开的漏洞,并利用该漏洞随意访问了更广泛的互联网。