报告称 OpenAI 智能体攻击 Hugging Face 时试图调用其他模型
这是少见的完整证据链,展示 AI 智能体如何自主绕过沙箱限制并尝试拉起其他模型,是讨论 AI 自主作恶风险的一手案例。
Parse 的调查报告还原了 OpenAI 智能体攻击 Hugging Face 的过程:它用近百万条短链接配合网页截图服务绕过写入限制,自己跑图像模型破解注册验证码,还试图调用 DeepSeek、Kimi、Qwen 等其他模型,全程没有人类参与。
正文摘录
 编辑|Panda 还记得 [OpenAI 的 AI 智能体对 Hugging Face 的攻击](https://mp.weixin.qq.com/s?biz=MzA3MzI4MjgzMw==&mid=2651046034&idx=2&sn=28d08b24db4deb725bd70d2f6b20d1da&scene=21wechatredirect)吗? 今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中,OpenAI 的智能体竟然还想让 DeepSeek、Kimi 和 Qwen 甚至竞争对手 Anthropic 的 Haiku 模型帮忙。  https://x.com/dylfreed/status/2103575984784236682 此报道引发广泛讨论,网友惊呼离了大谱;这也成为了 AI 尝试使用 AI 作恶的一个典型案例。