Sebastian Raschka 详解 GPT-6 Astra:循环 Transformer 与思维链变短的真实原因
技术博主 Sebastian Raschka 拆解 GPT-6 Astra 的循环 Transformer 架构,指出「模型隐藏思维链」的说法缺乏证据,思维链变短更可能只是模型变强、少犯错。
GPT-6 Astra 发布前后,The Information 称它用了 recurrent depth(循环深度,即让同一组层反复执行多轮的设计),会让部分推理过程变得不可见。Sebastian Raschka 拆解了这种架构的来龙去脉,并给出了否定结论:思维链变短不是循环架构的锅,更可能是模型犯错少、回溯少,所以不需要那么长的草稿纸。
正文摘录
万字详解 GPT-6 Astra,Sebastian Raschka 带你读懂循环 Transformer 与隐藏的思维链 .jpg) 过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。 起因是 OpenAI 新旗舰模型 GPT-6 Astra 发布前两天,The Information 援引内部消息称,Astra 用上了一种叫 recurrent depth(循环深度) 、也就是 looped transformer(循环 Transformer) 的设计,而这种设计「会让模型的部分乃至全部推理过程变得不可见」。  模型正式上线后,争议进一步升温,OpenAI 首席科学家 Jakub Pachocki 亲自出面澄清,说他想避免「一场由混乱的报道引发的、奔向不可监控性的竞赛」,并强调包括 Astra 在内的当前前沿模型,其计算图深度与 GPT-4 的差距仍在两倍以内。