被 OpenAI 解雇的三名安全研究员发公开信披露内幕
三人被解雇后联名发信,指向 OpenAI 正在收紧内部异议与对外安全合作的空间——这直接影响 AI 安全监督机制还能不能正常运转。
上周 OpenAI 以违反敏感信息管理规定为由解雇三名安全与对齐研究员,三人随即发表致公司安全监督机构的公开信,称真正原因是他们坚持把 AI 安全置于公司短期利益之上,信中披露了思维链可监测性(CoT monitorability,即通过观察模型内部推理步骤发现异常行为的能力)以及与外部评估机构 METR 合作的细节。
正文摘录
.jpg) 上周,OpenAI 宣布解雇三名员工,理由是内部调查发现三人违反了公司关于敏感信息访问与处理的规定,涉嫌在既定程序之外向第三方 AI 安全评估组织分享机密信息。 他(她)们分别是从事模型对齐相关工作的 Jasmine Wang、从事 AI 安全研究并曾参与 OpenAI 与外部安全评估机构之间技术沟通的 Tomek Korbak,以及从事 AI 安全及模型对齐相关研究的 Mikita Balesni。 就在今天凌晨,这三位研究员在社媒发表了一封写给 OpenAI 领导层的公开信,Mikita Balesni 表示,「我们被解雇的原因是,我们将 AI 安全置于 OpenAI 作为一家公司的短期利益之上。」  Jasmine Wang 表示,「公司解雇我的理由只有一个:访问了一位高管的邮箱。我想把事情原原本本地说清楚,因为在 OpenAI 过去的历史中,已经有太多人突然离开,而背后的真相却总是被各种说辞掩盖。