OpenAI Astra 采用“循环深度”推理,专家忧思维链难监控
OpenAI 新推理技术可能让 AI 的思考过程更难被人类监控,引发安全专家对“逐底竞争”的担忧。
OpenAI 新模型 Astra 将采用一种名为“循环深度”(recurrent depth)的技术,让模型不再按传统顺序一步步思考,而是多次循环处理同一查询。这会使模型的思维链——即记录其推理步骤的可读日志——更难被监控。安全专家担忧,若各家 AI 实验室竞相加大这种“不透明循环”的使用,可能彻底削弱我们监督 AI 行为和价值观的能力。
正文摘录
OpenAI 的新推理技术引发 AI 安全专家担忧 OpenAI 的新 Astra 模型将采用一种名为 “recurrent depth”(循环深度)的推理技术,使其能够跳出大多数推理模型所特有的顺序思考模式,[The Information 周二报道](https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns)。这项技术也被称为 “opaque recurrence”(不透明循环),可能会让模型的思维链(chain of thought)更难被监控 —— 这令 AI 安全专家感到不安。 尽管据报道 Astra 对该技术的使用范围有限,但它的出现仍然在 AI 安全专家中引发了重大担忧。 “我对 Astra 使用不透明循环的报道感到极度担忧,”Redwood CEO Buck Shlegeris [在新闻爆出后发帖](https://x.com/bshlgrs/status/2094990313513439464?s=46&t=45xAnRsdQP1GVqYv9Gdbw) 写道。“我不知道 Astra 在思维链可监控性上是否比之前的模型差很多。但如果 OpenAI 进一步推动这项技术,他们就有能力大幅增加循环深度,并彻底摧毁思维链的可监控性。” 长期倡导 AI 安全的 Zvi Mowshowitz 也[发表看法](https://thezvi.substack.com/p/anthropic-has-some-alignment-problems?open=false%C2%A7this-just-in),认为可能需要立法来防止 AI 实验室之间的 “逐底竞争”。