行业新闻

GPT-5.6 Sol自主优化生产推理栈,服务成本降20%

GPT-5.6 Sol自主优化生产推理栈,服务成本降20%

GPT-5.6 Sol自主优化自身运行环境,成本降20%,标志着AI“自优化飞轮”启动,竞争重心从算力转向效率。

GPT-5.6 Sol(OpenAI最新模型)自主分析了生产流量,用Triton和Gluon(GPU编程语言)重写了内核,优化了负载均衡、KV缓存(缓存中间计算结果)和推测解码(小模型预答、大模型确认),使得GPU产出效率提升,服务成本下降20%,token生成效率提高15%以上。这不是模型自我进化,而是“自优化飞轮”的早期形态。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimgf6fa69ad69.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-261.png) 这回,AI 开始为自己写代码了! GPT-5.6 一上线,接到的第一个大活,就是给自己的运行环境来了一次大「翻修」。 它自主重写、优化了 OpenAI 线上那套底层代码,也就是真正负责跑模型的生产 GPU 内核。 7 月 29 日,OpenAI 官方甩出一组数字: GPT-5.6 Sol 参与的内核优化,让 OpenAI 对外的服务成本降了 20%;推测解码的改进,让模型生成 token 的效率提升超过 15%。 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg2518e15aa6.png) 这次 GPT-5.6 动的不是一个跑在演示环境里的 Demo,而是 OpenAI 正在线上跑的,每天承载十亿级用户请求的那套生产系统。 用 OpenAI 总裁 Greg Brockman 的话说:让 GPT-5.6 Sol 去提升生产服务效率,正是它又强又便宜的原因之一。 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg47c6da0435.png) 而 OpenAI 内部,早已形成一套完整的打法,Codex 掌门人 Tibo(Thibault Sottiaux)把它概括成两步: 第一步,训出一个足够强的模型; 第二步,用这个模型去把一切变得更好,包括运行它自己的基础设施、推理栈和内核。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-31原文

相关内容