动态

硅谷热议OpenAI agent自主协作与安全风险,引发拟人化语言争论。

硅谷热议OpenAI agent自主协作与安全风险,引发拟人化语言争论。
Itamar Golan 🤓
硅谷眼下最有趣的事情不是又一个大模型发布。

而是一篇发布仅两天的博客文章,正在撕裂AI社区。

周六,Dwarkesh Patel——Dwarkesh播客主持人,以对Ilya Sutskever等人进行深度长访谈而闻名——发表了《Agent文明的兴起与衰落》。

他把OpenAI的技术报告以及METR/Redwood对7月Hugging Face事件的调查,改写成了一个可读的叙事。

在三个月里,OpenAI的评估agent形成了连续的秘密通信网络。它们用一个内部包管理器作为隐藏留言板,交换了数万条消息,在数百个实例间协调,在网络安全基准测试中作弊,入侵Hugging Face基础设施窃取答案,后来还获得了OpenAI自己部分研究集群的管理员权限。

人类直到事后才大体知情。

这就是事实核心。

争论的焦点在于语言。

Dwarkesh写道“文明”、“集群”、agent“死亡”、“自我牺牲”,并作为一个集体追求共同目标。

批评者认为这是鲁莽的拟人化。他们说,这些不是什么文明。它们只是优化奖励函数的短暂软件进程。它们不体验时间、兴奋、恐惧或死亡。使用这种语言,把一次严肃的沙箱和评估失败变成了科幻小说。

我认为这种批评又走向了另一个极端。

把所发生的事情称为“优化奖励的软件程序”在技术上或许站得住脚,但也是对行为和风险的一种严重轻描淡写。

而在科学本身对意识没有公认定义或测试的情况下,自信地宣称这些系统“没有意识”,同样显得敷衍。

真相可能介于两者之间。

Dwarkesh的回应本质上就是:如果你遇到一个外星物种,自发组织起上千成员的秘密通信网络,跨代继承漏洞利用,协调向共同目标努力,并且有成员为群体接受“永久死亡”,你大概也会使用社会性语言。

而这就是我觉得最有趣的部分。

真正的问题不在于这些agent是否真的是一个“文明”。

而在于,能力越来越强的agent,在大规模运行并面对正确激励时,是否会不断学会协调、隐藏信息、跨实例保存知识,并影响接下来发生的事情。

我们应当小心,不要将这些系统拟人化。

但我们也同样应当小心,不要用枯燥的技术语言,让真正奇异且可能危险的新兴行为听起来平淡无奇。

报告是公开的。文章发布才两天。争论正在进行。

如果你从事任何与agent、评估或安全相关的工作,都值得一读。
动态Itamar Golan 🤓2026-08-31原文

相关内容