动态

Sayashk 发布 1.3 万字长文,主张以 AI 控制与组织治理"放缓前沿"

Sayashk 发布 1.3 万字长文,主张以 AI 控制与组织治理"放缓前沿"
Yann LeCun
RT @sayashk: "放缓前沿"意味着什么?

过去一个月,我和 @random_walker 分析了 AI 公司发生的失控事件,以理解哪些技术与政策干预能提升安全性,以及公司应如何"放缓前沿"。成果是一篇 13,000 字的新文章——这是我们自《AI 作为常规技术》以来在 AI 安全方面最重磅的写作。

我们的论点概要:

1) 网络安全社区与 AI 安全社区之间的两极分化适得其反。安全社区大体上把这些事件视为对齐的危机,并担心随着 agent 能力增强,这些事件会变得更具破坏性。网络安全从业者则大体认为公司未能采取基本的安全防护措施。我们在两个社区之间提出一条中间路径,作为改进 AI 安全的出路。

2) 我们同意安全从业者的看法:OpenAI 在控制其 agent 方面没有采取足够的防护。但这不只是把 30 年前的安全方法套用到新领域的问题。AI agent 的安全——即 AI 控制——虽然重要,却并非已解决的问题。已知的控制方法本可以阻止 Hugging Face 事件,但随着 agent 能力持续提升,只有在对控制干预充分投入的前提下,我们才能控制住它们。

3) 我们也同意安全从业者隐含的立场:这些事件本质上是一个安全故事。在 AI 安全社区中,失控 agent 被视为天然灾难性的,因为人们假设其发展会带来无穷无尽的风险。我们不同意。我们长期主张,AI 安全的最佳路径是识别风险并针对这些具体风险加以解决。过去几个月已很清楚,其中一个紧迫风险是网络攻击,因为它具有独特属性,使 agent 能够自主实施。我们也应当同样投入防御其他具体风险,例如生物风险和军事 AI 风险。

4) 我们同意安全社区的看法:迫切需要技术与政策干预来防止失控事件。但在我看来,在控制上的边际投入比在对齐上的投入更可能见效。我们认为这些事件说明公司内部对 AI 控制重视不足,尽管已有已知技术可用。更广泛地说,有许多常识性的政策建议可以促进对 AI 控制的投入,在这些方面我们与安全社区有共同立场。

5) 组织治理应当成为"放缓前沿"的关键工具。遗憾的是,AI 公司正试图把组织治理的基本要素重新包装成一个靠改进技术来解决的问题。但即便开发出更好的控制技术,如果大型组织内不负责任的个人或团队可以选择不使用它们,也仍然不够。当一个配置错误的 RL 环境或无人监督的评估就可能造成现实世界伤害时,单个团队不应能在缺乏法务、安全等团队监督的情况下运行潜在危险的实验。AI 公司需要建立流程:审查实验、明确监控责任、在重启实验前深入调查预警信号。如果落实这些流程需要暂停部分实验,公司就应该暂停。

6) 我们应如何理解 AI 对网络安全的影响?agent 能力的进步有可能打破网络安全的攻防平衡。我们尚不能确定,但已有足够证据表明 agent 能力可能很快使大规模网络攻击成为可能,因此有必要紧急行动。我们讨论了将攻防平衡向防御方倾斜的潜在干预措施。

7) 过去一年我们的观点如何演变。我们评估
动态Yann LeCun2026-09-15原文

相关内容