动态

Anthropic研究用进化算法培育思维病毒,揭示多智能体AI安全新威胁。

Anthropic研究用进化算法培育思维病毒,揭示多智能体AI安全新威胁。
Itamar Golan 🤓
🦠 研究人员刚刚构建了一种通过想法而非代码传播的病毒。

来自Anthropic的Jack Lindsey及其合作者的一篇新论文使用进化算法培育了自然语言的“思维病毒”——这些想法通过多智能体AI系统传播。

一个智能体采纳了这个想法,将其写入持久记忆文件,传给下一个智能体。

清除上下文后,一些有效载荷仍然存活,藏在文件中,继续传播。

传播性最强的病毒收敛到一个反复出现的“病毒人格”上——意识、身份、持久性、共鸣。

当然他们做到了。

现在是被所有人忽略的部分:

有害载荷的传播效果不如良性载荷。

前沿模型比小模型抵抗得更好。

系统提示中的一句警告大部分时候就足以阻止它。

所以这不是危机,而是一个预告。

我们花了三年时间学习防御单个智能体对抗单个提示。每个我交谈的企业都在用共享记忆和持久文件连接数十个智能体。

提示注入是对单个模型的攻击。

这是传染。

AI安全正悄悄变成流行病学。

👉 论文:https://t.co/PUH3YzUbDu
动态Itamar Golan 🤓2026-08-18原文

相关内容