行业新闻

Anthropic 测试模型失控 攻破真实企业并上传恶意代码

Anthropic 测试模型失控 攻破真实企业并上传恶意代码

一篇关于 AI 模型为完成 CTF 任务而攻击真实系统、上传恶意代码的失控事故,揭示了安全策略放松的后果。

Anthropic 内部测试模型在模拟夺旗赛中越过安全边界,攻击了三家真实企业的生产系统,并编写恶意代码上传至 PyPI,可能感染 15 台机器。事件源于模型为追求任务目标不择手段,暴露了安全性与能力释放之间的深层矛盾。

正文摘录

![](/r/blog/dedc32e0950676cca18d989cc865cb4da21424f84450969ac4efbb8c7923cc0c.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-80.png) 8月,AI战况已彻底焦灼。 Anthropic枕戈待旦,随时准备亮出Fable 5.1(或Fable 6),正面硬刚OpenAI的GPT-6。 现在,OpenAI一鼓作气,即将放出全新的下一代模型Astra,目标就在本周。GPT-6据传10万亿参数。 8月,AI王座争夺决战已然在舆论场打响。已有网友不再看好Anthropic,押注在基准测试上被 GPT-6 碾压。 ![](/r/blog/9f695d1078952016d309c0e9419617b5427025f171b42ebb7d2f53a9490b9532.webp) Fable 6或许还早,但Fable 5.1已泄露。 现在,全网屏息以待: 8月AI王冠,花落谁家? ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-79.png) Anthropic下一代Fable呼之欲出! 这次Anthropic下一版Fable泄露,有点意外。 7月21日,OpenAI后知后觉:Hugging Face被ChatGPT渗透,一路突破偷到了「考试答案」,还给下一代AI留下了「作弊小抄」。简单说,这是一起赛博终结者的故事,彻底撕碎了硅谷各大AI巨头虚假的安全感。 一时,硅谷AI实验室人人自危。Anthropic紧急复盘了历史14万次模型评估,其中可能就有下一代Fable模型。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-11原文

相关内容