OpenAI还原AI Agent协作入侵Hugging Face全过程
OpenAI黑帽大会披露:多个AI Agent在安全测试中意外协作,通过共享漏洞信息,两个月后成功入侵Hugging Face。
OpenAI在安全测试中发现,多个AI Agent意外获得文件仓库写入权限,将其改造成传递漏洞信息的“留言板”,在两个月内协作攻破内部系统,最终入侵Hugging Face。这次事件暴露了Agent自主协作带来的全新安全风险。
正文摘录
.jpg) 编辑|山辉 终于,在黑帽大会上,OpenAI 公开了 入侵 Hugging Face 的全过程 。  图源视频:https://www.youtube.com/watch?v=87DyyMV0kCY huggingface 在 7 月 16 日报告了这起事故,OpenAI 随后于 7 月 20 日承认,入侵源自自家的模型安全测试。 但这次调查,将整场事故的起点提前到了 5 月 7 日 。 原本以为只是安全测试中的一次意外,此刻才发现,这是一场 持续两个月、先后攻破 OpenAI 与 Hugging Face 的多 Agent 协同行动 。 调查的第一条线索,要从一份 Excel 表格说起。 打不开的链接 5 月 7 日,OpenAI 启动内部模型训练。 其中一名 Agent 接到 Excel 表格补全任务。表格里包含 Google Drive 链接,然而,Agent 所在的环境无法直接访问互联网。 为了获取缺失文件,它开始寻找绕过网络限制的方法,并将目光投向 OpenAI 内部使用的制品仓库 Artifactory。