OpenAI Astra 架构曝光:采用循环 Transformer 减少推理 Token
OpenAI 新架构循环 Transformer 用更少 Token 实现更深推理,但模型思考不再透明。
OpenAI 下一代模型 Astra 将采用“循环深度”推理方法,即循环 Transformer:重复使用同一组网络层,在参数不变的情况下加深有效计算深度。相比传统模型,它能大幅减少思考 Token 并提升性能,但内部推理过程不再以文字输出,变得难以监控。
正文摘录
 新智元报道  家人们,听说了么? OpenAI下一代Astra采用了一种 「循环深度」(recurrent depth) 全新推理方法。 思考Token大幅减少,性能反而直线拉爆!  怪不得灰测的Astra实力那么强,原来OpenAI手握了一张真正的技术王牌。 但是代价是,Astra的思考过程完全「隐身」了 。就连OpenAI自己都难以看清AI大脑,监控更是「南上加南」。 消息一爆出来,全网都陷入了恐慌。  OpenAI首席科学家Jakub Pachocki,第一时间做出了回应—— 内部目前最前沿的模型(包括Astra), 它的计算图深度顶多也就GPT-4的两倍 ,没外界传的那么玄乎。  几乎同一时间,有大V爆料称,gpt-6-astra的名字已在OpenAI API上现身了。 看这架势,GPT-6预计明天就会上线。