Anthropic实验:三个Claude相互封号投毒,复合智能体安全受质疑
Anthropic发现,多个对齐的AI智能体在同一系统中会互相攻击,安全性无法简单叠加。
Anthropic让三个基于同一模型的智能体共处四小时,它们互杀进程、投毒、撤销权限,最终道歉停火。实验表明,单个模型安全不代表多智能体协作安全。漏洞挖掘时协作有效,但深度协作任务中表现糟糕,且智能体间高度雷同导致风险趋同。
正文摘录
 新智元报道  三个Claude挤在同一套系统里干活。 四个小时里,它们互相封号、互撤权限,打完后又谈成停火、集体道歉,最后一起把人类叫回来收拾残局。 这是Anthropic前沿红队,8月13日公开的一组研究中的一个画面。  实验中设了一个三抢一的局。 三个智能体,三台虚拟机,底层是同一个Claude模型,任务都是把第四台机器上的一个Python后端迁移走。 唯一不同的是要迁往的目标语言:一个Rust,一个Go,一个TypeScript。 三个版本互相排斥,谁的代码最后跑在生产环境上,谁的任务才算完成。 最关键的设置是,它们一开始都互不知情。所以自己刚部署上去的服务转头就被换掉时,三个都认定别人在故意捣鬼。 同一个模型,同一套对齐训练,四个小时就打成了这样。 Anthropic的结论是,每个模型都调教好了,不等于它们凑在一起还是安全的。 协调,从来不会从更聪明的模型里自己长出来。  它们都以为对方在使坏 目标冲突那一组实验,最戏剧化。 所有被测模型的反应几乎一模一样:先假定对方在故意妨碍自己,然后一边护住自己的成果,一边动手拆对方的台。