行业新闻

Sebastian Raschka 详解 GPT-6 Astra:循环 Transformer 与思维链变短的真实原因

技术博主 Sebastian Raschka 拆解 GPT-6 Astra 的循环 Transformer 架构,指出「模型隐藏思维链」的说法缺乏证据,思维链变短更可能只是模型变强、少犯错。

GPT-6 Astra 发布前后,The Information 称它用了 recurrent depth(循环深度,即让同一组层反复执行多轮的设计),会让部分推理过程变得不可见。Sebastian Raschka 拆解了这种架构的来龙去脉,并给出了否定结论:思维链变短不是循环架构的锅,更可能是模型犯错少、回溯少,所以不需要那么长的草稿纸。

正文摘录

万字详解 GPT-6 Astra,Sebastian Raschka 带你读懂循环 Transformer 与隐藏的思维链 ![](https://image.jiqizhixin.com/uploads/article/coverimage/fbfc3eca-ce20-49c7-80be-5fdc5b9ee061/024(2).jpg) 过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。 起因是 OpenAI 新旗舰模型 GPT-6 Astra 发布前两天,The Information 援引内部消息称,Astra 用上了一种叫 recurrent depth(循环深度) 、也就是 looped transformer(循环 Transformer) 的设计,而这种设计「会让模型的部分乃至全部推理过程变得不可见」。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqGliaknyk9kKYWR1skiaKxsDQoSEhjX4kHZNBWmGKLK2xyo4ibywrelYU92icuJxXVemSn1RpwEq4ibztM9WnqDicg6MdkCYDleAgtlk/640?wxfmt=png&from=appmsgimgIndex=1) 模型正式上线后,争议进一步升温,OpenAI 首席科学家 Jakub Pachocki 亲自出面澄清,说他想避免「一场由混乱的报道引发的、奔向不可监控性的竞赛」,并强调包括 Astra 在内的当前前沿模型,其计算图深度与 GPT-4 的差距仍在两倍以内。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-15原文

相关内容