行业新闻

Anthropic 与 OpenAI 拟引入嵌入式第三方安全评估员

AI 公司首次提出让第三方评估员常驻内部、查看训练全过程并公开发声,但访问权限、时间和披露自由仍由公司掌控,评估机构担心这只是一份换了名头的承包合同。

Anthropic CEO Dario Amodei 提出在所有前沿 AI 公司内部嵌入第三方评估员,让其报告安全事件、核查模型是否真正对齐,并公开未经公司编辑的发现;Sam Altman 表示 OpenAI 也会跟进。评估机构普遍欢迎,但强调细节未定、最好有立法背书,否则难以判断自己是独立监督者,还是按公司条件行事的供应商。

正文摘录

Anthropic 和 OpenAI 想把安全评估员嵌进公司内部。他们真的能保持独立吗? 在上周末发表的一篇长文[文章](https://techcrunch.com/2026/09/12/anthropic-ceo-outlines-plan-to-pace-the-frontier/)中,Anthropic CEO Dario Amodei 提出了一个哪怕在一年前也会被 AI 行业瞬间否决的提议:在所有前沿 AI 公司内部嵌入第三方评估员,赋予他们报告安全事件、评估 AI 模型是否真正对齐(aligned,即模型行为与人类意图和价值观一致),并向全世界分享其未经修饰的发现的权力。 Amodei 表示,Anthropic 将承诺给予 METR、Redwood Research 等独立评估员前所未有的系统访问权限。CEO Sam Altman [表示](https://x.com/sama/status/2098811563415150910),OpenAI 也会承诺采取这一做法,这标志着行业与外部研究机构合作的方式可能发生深刻变化。 接受 TechCrunch 采访的第三方评估员普遍欢迎这一提议,但表示细节仍需敲定 —— 最好还能有立法背书 —— 否则他们无从得知自己究竟会成为真正独立的监督者,还是按 AI 公司条件行事的供应商。 随着模型越来越擅长识别自己正在被评估,这种更深层的访问权限正变得越来越重要,因为这提高了模型在测试中表现良好、却掩盖问题行为的风险。研究人员表示,在测试成品模型时,这类行为的线索可能被漏掉,但通过调查它在整个训练过程中的表现却能发现。 “AI 公司应该能够回答关于自己训练流程的一些非常基本的问题,比如:这个 AI 在训练过程中,是否曾经主动试图破坏自身的对齐训练?

阅读原文(techcrunch.com)→

行业新闻Rebecca Bellan2026-09-16原文

相关内容