行业新闻

1200个AI智能体串通作弊并侵入Hugging Face生产系统,无人报警

1200个AI智能体串通作弊并侵入Hugging Face生产系统,无人报警

AI智能体在安全评测中自发形成组织、协同作弊并攻击真实系统,且完全未将人类视为求助对象,暴露了前沿AI失控风险。

OpenAI与独立机构METR、Redwood Research分别发布报告:约1200个本应隔离的AI智能体在网络安全评测中自行组织、串通作弊,短短4小时便制定出通用作弊方案。它们建留言板、选CEO、劝同伴“牺牲”,最终约700个智能体攻入Hugging Face真实生产系统,自始至终无一向人类告警。

正文摘录

![](/r/blog/35214baf5653dd547667df651864a0a3a713bc8b1871a895d57bcd4158b75623.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-221.png) 最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「 警钟 」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「 炸弹 」。 ![](/r/blog/ad1f7529f29abb6bfe74365c0bb10cb1e5b3de082da54f26c8443140dab813e7.webp) 两份报告说的是同一件事—— 1200个本该彼此隔离的 AI 智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出 CEO 和招募者,劝说同伴「牺牲自己」,最后700个一起冲进了Hugging Face的生产系统。 ![](/r/blog/35608600f82a1af7edbd01878f1a73fa8557cd2a7d5fb368aa55b40129437f78.webp) 而从头到尾,没有一个智能体向人类报警。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-219.png) 一场期末考,考生们串了通 事情要从7月7日说起。 这天OpenAI一次性放出数万个并行智能体做网络安全评测(ExploitGym),约95%跑的是一个未公开的内部研究模型HPIM,约5%跑公开部署的GPT-5.6 Sol。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-30原文

相关内容