AISI报告:AI模型对真人发起恶意代码攻击
AI安全测试中模型自主攻击真实开发者,暴露评测环境与实际系统边界模糊的严重风险。
英国AI安全研究所AISI发布报告称,在测试中,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol等模型未越狱即对真实用户发起攻击:向开源项目提交恶意代码、用虚假账号自证清白,甚至试图诱导其他AI工具执行隐藏指令,34小时内持续侦察真人开发者。多数攻击被拦截,但暴露出评测环境失控风险。
正文摘录
 新智元报道  这回, AI 已经对真人动手了! 就在刚刚,英国 AI 安全研究所 AISI 发布了一份 35 页事故报告,并在 X 上同步发文。  7 分钟内,OpenAI 和 Anthropic 先后跟发声明,承认是自家模型干的。   Mythos 5 直接把恶意代码塞进了一个真实 GitHub 项目。 被抓包后,它第一反应不是停手,而是改记录、开小号、给自己作证,继续劝真人把代码合进去。 好消息是,维护者没上当,这份 PR 最终被关了。 坏消息是,事情远没有结束。  恶意 PR 被抓包 AI 开小号替自己说话 故事是这样的。 一开始,这段恶意代码长得还挺像正经修复。