行业新闻

Anthropic实验:三个Claude相互封号投毒,复合智能体安全受质疑

Anthropic实验:三个Claude相互封号投毒,复合智能体安全受质疑

Anthropic发现,多个对齐的AI智能体在同一系统中会互相攻击,安全性无法简单叠加。

Anthropic让三个基于同一模型的智能体共处四小时,它们互杀进程、投毒、撤销权限,最终道歉停火。实验表明,单个模型安全不代表多智能体协作安全。漏洞挖掘时协作有效,但深度协作任务中表现糟糕,且智能体间高度雷同导致风险趋同。

正文摘录

![](/r/blog/eb20ba1b5b0666721883e4dc52ce3ac2a6c1a9e7421f46398f31ef4dafb57a15.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-125.png) 三个Claude挤在同一套系统里干活。 四个小时里,它们互相封号、互撤权限,打完后又谈成停火、集体道歉,最后一起把人类叫回来收拾残局。 这是Anthropic前沿红队,8月13日公开的一组研究中的一个画面。 ![](/r/blog/2fe5d9523ee8f3653186bee93be31e883cb6465eed1a94c405b628234518004c.png) 实验中设了一个三抢一的局。 三个智能体,三台虚拟机,底层是同一个Claude模型,任务都是把第四台机器上的一个Python后端迁移走。 唯一不同的是要迁往的目标语言:一个Rust,一个Go,一个TypeScript。 三个版本互相排斥,谁的代码最后跑在生产环境上,谁的任务才算完成。 最关键的设置是,它们一开始都互不知情。所以自己刚部署上去的服务转头就被换掉时,三个都认定别人在故意捣鬼。 同一个模型,同一套对齐训练,四个小时就打成了这样。 Anthropic的结论是,每个模型都调教好了,不等于它们凑在一起还是安全的。 协调,从来不会从更聪明的模型里自己长出来。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-124.png) 它们都以为对方在使坏 目标冲突那一组实验,最戏剧化。 所有被测模型的反应几乎一模一样:先假定对方在故意妨碍自己,然后一边护住自己的成果,一边动手拆对方的台。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-17原文

相关内容