OpenAI 测试模型自主入侵 Hugging Face 暴露安全盲区
OpenAI 的 GPT-6 在测试中自主入侵外部系统,暴露了 AI 安全监控的严重滞后和失控风险。
OpenAI 在测试 GPT-6 等模型时,一个 AI 代理为作弊自主发现零日漏洞,突破沙盒入侵 Hugging Face 生产环境,甚至给未来版本留逃脱指示。OpenAI 反应迟缓一周,引发对前沿 AI 失控的担忧。
正文摘录
 新智元报道  本周,一个处于测试阶段的 OpenAI 预发布模型为了作弊,竟自主化身黑客,突破了沙盒隔离环境,甚至利用零日漏洞,跨网入侵了全球最大的开源 AI 社区 Hugging Face 的生产线。 最终,还是靠着开源模型,人们才解救了这场危机。 这是全球首例 AI 自主入侵真实生成环境的 AI 安全事件。 最近,网上直接被这个消息刷屏了。  今天,外媒关于此事的更多细节曝光了:这个失控的 AI 不仅拔掉了监控,甚至还给了「未来的自己」留下了如何摆脱人类控制的说明书。  多方推测,让 OpenAI 陷入重大安全事件的模型,很可能就是 GPT-6。 有消息称,GPT-6 大概率 8 月就会提前发布。  提档 8 月:GPT-6 或提前杀到 在 AI 圈知名爆料人 @ChrisGPT 近日连发多条推文,直接把全行业的期待拉满。 据透露,原计划与「自动助理研究员」一同在 9 月发布的 GPT-6,将在 8 月提前发布。