动态

扎克伯格谈 AI 对齐与安全:信任与对齐将成模型核心差异化能力

Matt Wolfe
RT @finkd:上个月我写了一篇文章,谈我们如何为所有人构建一个积极且安全的未来:https://t.co/eoLGVY8yad

每个实验室都有责任和动力,以安全训练其模型所需的速度推进,也有能力自行采取行动来确保这一点实现。

现实情况是:

- 人们不会愿意使用与自己价值观不一致、不按要求行事的 agent,因此实验室有很强的内在动力让自己的模型更加对齐。

关于是否应放缓能力进步、等对齐跟上,有很多争论。我的看法是,信任和对齐正迅速成为区分 agent 与模型的最重要能力。任何不重视对齐的实验室都会落后。

- 如果模型造成伤害,实验室将面临重大法律责任,因此他们同样有很强的动力去防止这种情况发生。

Meta 为了让 Muse 专注于安全与保障,推迟了数月才发布。我们并没有要求其他所有人先这样做,我们才做。我们只是把它当作日常工作的一部分,因为这对用户和对我们自己显然都是正确的做法。我为我们打下的安全基础感到自豪。

- 引入独立评估方和顾问是行业最佳实践。MSL 目前已在多个领域这样做,因为这有助于产出更好的工作。其他实验室也完全可以这样做。总体而言,拥有一个更大、更多元的评估者生态会很有帮助。

- 将绝大多数算力投入到服务人们,而不是竞相追逐递归式自我改进,是确保我们安全地发展这项技术的最佳方式之一。Meta 已做出这一承诺,其他实验室也可以这样做。

我相信,为所有人构建积极未来的关键在于保持恰当的权力平衡。这在我们能力所及的范围之内。
动态Matt Wolfe2026-09-16原文

相关内容