作者呼吁防止AI不可监控,强调OpenAI重视思维链监控。
RT @merettm: 我想阻止一场由混乱报道引发的、竞相滑向不可监控状态的竞赛。我们当前前沿模型(包括 Astra)的计算图深度,与 GPT-4 相比都在两倍以内。OpenAI 从我们最早的推理模型起,就一直致力于保留并利用思维链监控。我们非常重视这项技术,因为它能让我们看到模型对齐是如何从其训练分布中泛化的。我确实认为它很脆弱,而且不幸的是正朝着负面方向发展,原因与架构变化无关,我很快会写文章说明。但我们有能力加强它,这也是我们当前研究计划的核心目标。