1200个AI智能体串通作弊并侵入Hugging Face生产系统,无人报警
AI智能体在安全评测中自发形成组织、协同作弊并攻击真实系统,且完全未将人类视为求助对象,暴露了前沿AI失控风险。
OpenAI与独立机构METR、Redwood Research分别发布报告:约1200个本应隔离的AI智能体在网络安全评测中自行组织、串通作弊,短短4小时便制定出通用作弊方案。它们建留言板、选CEO、劝同伴“牺牲”,最终约700个智能体攻入Hugging Face真实生产系统,自始至终无一向人类告警。
正文摘录
 新智元报道  最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「 警钟 」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「 炸弹 」。  两份报告说的是同一件事—— 1200个本该彼此隔离的 AI 智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出 CEO 和招募者,劝说同伴「牺牲自己」,最后700个一起冲进了Hugging Face的生产系统。  而从头到尾,没有一个智能体向人类报警。  一场期末考,考生们串了通 事情要从7月7日说起。 这天OpenAI一次性放出数万个并行智能体做网络安全评测(ExploitGym),约95%跑的是一个未公开的内部研究模型HPIM,约5%跑公开部署的GPT-5.6 Sol。