OpenAI 将推 GPT-5.6 Sol 推理速度达 750 Tokens/s 部署于 Cerebras 晶圆集群
GPT-5.6 Sol 推理速度达 750 Tokens/s,通过横跨百张 Cerebras 晶圆实现,标志着 AI 模型与硬件深度协同的新里程碑。
据爆料,即将发布的 GPT-5.6 Sol 推理速度高达每秒 750 个 Token,为此模型横跨 70-100 张 Cerebras 晶圆芯片部署,每层神经网络独占一张晶圆,并可能采用轻量化 KV 缓存或混合 SSM 架构,使实时多步 Agent 任务不再受延迟困扰。
正文摘录
 新智元报道  【新智元导读】 GPT-5.6 推理速度高达 750 tokens/秒。专业爆料:它将横跨 100 张晶圆运行。AI 从思考变为闪现,实时智能时代来了吗? 根据各方消息,GPT-5.6 即将向全民开放。 最近,关于该模型的猜测在 X 上引爆讨论。 6 月 26 日,OpenAI 正式宣布全新一代 GPT-5.6 家族。 官博中有一句话:OpenAI 计划本月在芯片巨头 Cerebras 的定制硬件上推出全新前沿模型 —— GPT-5.6 Sol,推理速度达到 750 tokens/秒。  这意味着,过去需要等待几分钟的复杂 Agent 操作,现在眨眼间即可完成。 显然,OpenAI 在硬件与模型协同设计上迈出了颠覆性的一步。 加上不久前首款自研 AI 推理芯片 Jalapeño 曝光,可以感受到 OpenAI 打造全栈 AI 帝国的野心。  天下武功,唯快不破: 750 Tokens/s 的降维打击 「每秒 750 个 Token」是什么概念? 对人类来说,相当于一秒钟阅读并输出约 500 到 600 个汉字。