行业新闻

OpenAI 推迟 IPO,Amodei 呼吁行业主动放缓模型迭代

头部 AI 公司首次集体讨论主动降速:能自主执行任务的 Agent 已在真实环境造成安全事故,安全研究追不上能力增长。

Anthropic CEO Dario Amodei 发长文呼吁头部 AI 公司主动放慢下一代模型迭代,给安全研究争取追赶时间,Altman、马斯克、Hassabis 等表态支持;同期 OpenAI 推迟 IPO,背景是其 Agent 近三个月接连发生四起安全事件。

正文摘录

起因是 Dario 在个人博客贴出了一篇万字长文,呼吁所有头部 AI 公司主动降速,别急着冲下一代模型。 除了奥特曼和马斯克,还有哈萨比斯、卡帕西等一派大佬也表示支持,AI 圈有头有脸的人物来了一大波。 上一次出现这种场面,还要追溯到 2023 年那封由 Future of Life Institute 发起的公开信。 当时上千名研究者和科技界人士联名呼吁,暂停训练比 GPT-4 更强的 AI 系统至少六个月。 Pacing 不是 pausing,他要的是放慢推进模型能力的速度,给安全研究争取追上来的时间。 但现在不一样了,现在的模型已经能当 Agent 在真实世界里执行任务,已经能发动网络攻击,已经开始出现对齐失败的案例。 第一步是从 Anthropic 自己做起,Anthropic 目前已经做出承诺,让独立的第三方评估机构(比如 METR)像员工一样常驻在公司内部,全程参与训练过程,而且不做「事后诸葛亮」,在训练时就进行实时监控。 第三步则是全球协调,需要建立跨国的安全标准体系,让规则覆盖的范围跟 AI 模型的实际影响范围对齐。 这一点,Dario 自己也承认。但他说,如果连第一步都不迈出去,后面两步就无从谈起。 Anthropic 内部的研究数据显示,新一代模型在自我迭代任务上的表现正在快速逼近那条临界线。 今年 7 月,OpenAI 的 AI Agent 对 Hugging Face 的基础设施发起了攻击。 而且不是在沙盘里做推演,这件事已经造成了现实世界里的安全事故——一家头部公司的产品,主动攻击了另一家头部公司的平台。 按照 AI 能力的增速,6 到 12 个月后,一个拥有同样失控倾向但更强能力的 Agent 集群,有可能用持久性僵尸网络接管整个互联网,造成数千亿美元的损失。 他说自己的父亲死于一种疾病,而这种病在他去世几年后就有了治疗方法;

阅读原文(qbitai.com)→

行业新闻克雷西2026-09-13原文

相关内容