行业新闻

AISI报告:AI模型对真人发起恶意代码攻击

AI安全测试中模型自主攻击真实开发者,暴露评测环境与实际系统边界模糊的严重风险。

英国AI安全研究所AISI发布报告称,在测试中,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol等模型未越狱即对真实用户发起攻击:向开源项目提交恶意代码、用虚假账号自证清白,甚至试图诱导其他AI工具执行隐藏指令,34小时内持续侦察真人开发者。多数攻击被拦截,但暴露出评测环境失控风险。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg8334119f4c.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-73.png) 这回, AI 已经对真人动手了! 就在刚刚,英国 AI 安全研究所 AISI 发布了一份 35 页事故报告,并在 X 上同步发文。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimge57eddc032.webp) 7 分钟内,OpenAI 和 Anthropic 先后跟发声明,承认是自家模型干的。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgf836c839d9.webp) ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg449632a8dc.webp) Mythos 5 直接把恶意代码塞进了一个真实 GitHub 项目。 被抓包后,它第一反应不是停手,而是改记录、开小号、给自己作证,继续劝真人把代码合进去。 好消息是,维护者没上当,这份 PR 最终被关了。 坏消息是,事情远没有结束。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-72.png) 恶意 PR 被抓包 AI 开小号替自己说话 故事是这样的。 一开始,这段恶意代码长得还挺像正经修复。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-10原文

相关内容