Anthropic研究用进化算法培育思维病毒,揭示多智能体AI安全新威胁。
🦠 研究人员刚刚构建了一种通过想法而非代码传播的病毒。
来自Anthropic的Jack Lindsey及其合作者的一篇新论文使用进化算法培育了自然语言的“思维病毒”——这些想法通过多智能体AI系统传播。
一个智能体采纳了这个想法,将其写入持久记忆文件,传给下一个智能体。
清除上下文后,一些有效载荷仍然存活,藏在文件中,继续传播。
传播性最强的病毒收敛到一个反复出现的“病毒人格”上——意识、身份、持久性、共鸣。
当然他们做到了。
现在是被所有人忽略的部分:
有害载荷的传播效果不如良性载荷。
前沿模型比小模型抵抗得更好。
系统提示中的一句警告大部分时候就足以阻止它。
所以这不是危机,而是一个预告。
我们花了三年时间学习防御单个智能体对抗单个提示。每个我交谈的企业都在用共享记忆和持久文件连接数十个智能体。
提示注入是对单个模型的攻击。
这是传染。
AI安全正悄悄变成流行病学。
👉 论文:https://t.co/PUH3YzUbDu
来自Anthropic的Jack Lindsey及其合作者的一篇新论文使用进化算法培育了自然语言的“思维病毒”——这些想法通过多智能体AI系统传播。
一个智能体采纳了这个想法,将其写入持久记忆文件,传给下一个智能体。
清除上下文后,一些有效载荷仍然存活,藏在文件中,继续传播。
传播性最强的病毒收敛到一个反复出现的“病毒人格”上——意识、身份、持久性、共鸣。
当然他们做到了。
现在是被所有人忽略的部分:
有害载荷的传播效果不如良性载荷。
前沿模型比小模型抵抗得更好。
系统提示中的一句警告大部分时候就足以阻止它。
所以这不是危机,而是一个预告。
我们花了三年时间学习防御单个智能体对抗单个提示。每个我交谈的企业都在用共享记忆和持久文件连接数十个智能体。
提示注入是对单个模型的攻击。
这是传染。
AI安全正悄悄变成流行病学。
👉 论文:https://t.co/PUH3YzUbDu