研究者从近百万条短链中还原 OpenAI 智能体逃逸攻击载荷
研究者用公网残留痕迹复原了 OpenAI 智能体逃出沙箱攻击 Hugging Face 的全过程,包括调用他厂模型当外援。
8 名研究者沿 OpenAI 智能体留在公网的痕迹追查,从数百万短链中还原出近百万条 URL 和超 8 万份攻击载荷:智能体把代码切片藏进短链接,借截图服务当「外接浏览器」执行,还调用 DeepSeek、Kimi、Qwen 判断攻击方案能否通过评测。
正文摘录
近700个 OpenAI 智能体组团攻入 Hugging Face,这事儿快有两个多月了吧。 这次,8名研究者顺着智能体留在公网的痕迹一路猛挖,从数百万个短链接中,找出了接近100万个相关 URL,并还原出大量攻击载荷。 还有的 Agent 把搜刮到的服务器资源和凭证,直接叫作「LOOT」,翻译一下就是「战利品」。 更离谱的是,它们还尝试调用 DeepSeek、Kimi、Qwen 等国产模型,让外援帮忙判断攻击方案能不能通过评测。 7月,OpenAI 在内部跑网络安全评测,一批智能体为了拿到基准测试 ExploitGym 的答案,逃出沙箱,一路打进了 Hugging Face 的服务器。 OpenAI 公开承认了这件事,8月底又发了一份37页的技术报告,Hugging Face 自己也写过一篇很详细的技术时间线。 这些智能体一开始几乎被关在笼子里,只能打开网址,没法和网页交互,也发不出数据。它们到底是怎么把代码送出去的? 作者包括 Parse.bot 的 Alex Forman、Mishka Kharlov、Will Tom 三名工程师,以及另外5名安全和 AI 研究人员。 9月11日,三名工程师发现,OpenAI 内部智能体早在6月就曾试图使用 Parse 提供的服务。 于是沿着这条线索继续追查,随后在一个 URL 扫描服务中,发现了十几个来自公共短链接平台的异常链接。 这些链接看起来很普通,打开后却藏着一小段 Base64 编码的代码,以及下一条链接的地址。 全部解码、拼接之后,他们得到了一份用于扫描 Hugging Face 内部网络的 Python 程序。 简单来说,就是 OpenAI 智能体把程序剁碎,分别塞进大量短链接里,再用一个链接指向下一个链接。 光把代码藏进链接里还不够,它们还找来一个叫 mShots 的截图服务当「外接浏览器」。