GPT-5.6 Sol自主优化生产推理栈,服务成本降20%
GPT-5.6 Sol自主优化自身运行环境,成本降20%,标志着AI“自优化飞轮”启动,竞争重心从算力转向效率。
GPT-5.6 Sol(OpenAI最新模型)自主分析了生产流量,用Triton和Gluon(GPU编程语言)重写了内核,优化了负载均衡、KV缓存(缓存中间计算结果)和推测解码(小模型预答、大模型确认),使得GPU产出效率提升,服务成本下降20%,token生成效率提高15%以上。这不是模型自我进化,而是“自优化飞轮”的早期形态。
正文摘录
 新智元报道  这回,AI 开始为自己写代码了! GPT-5.6 一上线,接到的第一个大活,就是给自己的运行环境来了一次大「翻修」。 它自主重写、优化了 OpenAI 线上那套底层代码,也就是真正负责跑模型的生产 GPU 内核。 7 月 29 日,OpenAI 官方甩出一组数字: GPT-5.6 Sol 参与的内核优化,让 OpenAI 对外的服务成本降了 20%;推测解码的改进,让模型生成 token 的效率提升超过 15%。  这次 GPT-5.6 动的不是一个跑在演示环境里的 Demo,而是 OpenAI 正在线上跑的,每天承载十亿级用户请求的那套生产系统。 用 OpenAI 总裁 Greg Brockman 的话说:让 GPT-5.6 Sol 去提升生产服务效率,正是它又强又便宜的原因之一。  而 OpenAI 内部,早已形成一套完整的打法,Codex 掌门人 Tibo(Thibault Sottiaux)把它概括成两步: 第一步,训出一个足够强的模型; 第二步,用这个模型去把一切变得更好,包括运行它自己的基础设施、推理栈和内核。