GPT-5.6 参与优化自身推理与基础设施,OpenAI 成本降低 20%
GPT-5.6 通过分析生产系统瓶颈和自我优化,将 OpenAI 服务成本降低 20%,标志着 AI 开始进入自我改进反馈回路。
OpenAI 将 GPT-5.6 投入生产环境,用于分析流量、调整路由、改写底层 Kernel(GPU 核心代码)并优化推测解码模型(一种加速生成的辅助模型)。这一自我优化循环使端到端服务成本降低 20%,Token 生成效率提升 15% 以上。人类仍保留最终控制权,但模型已开始参与改进自身运行系统。
正文摘录
GPT-5.6 自己优化自己实锤了,新的左脚踩右脚已经出现 据报告透露,GPT-5.6 已经被投入 OpenAI 的真实生产环境,用来分析线上流量、调整请求路由,甚至亲自下场改写底层 Kernel(内核)、优化推测解码模型。 一套小连招下来,OpenAI 的端到端服务成本降低了 20% ,Token 生成效率也提升了 15% 以上 。 而且,值得一提的是,在披露这套工程的五名作者里,还有大名鼎鼎的 Triton 之父 Philippe Tillet 。 2021 年,OpenAI 发布 Triton 1.0 时,目标还是让不懂 CUDA 的人也能写出接近专家水平的 GPU 程序。 让 AI 进入一个“改进 AI”的反馈回路——这一轮能力变强之后,再反过来加速下一轮升级。 但它已经开始参与优化自己的运行环境:模型不仅是被工程师部署和调用的工具,也逐渐变成了改造模型系统本身的工程师。 - GPT-5.6 会寻找不同机器和服务节点之间的负载不均,并测试新的路由策略,把请求分配到更合适的位置。 - GPT-5.6 会深入模型的 forward pass,寻找可以提前计算、省略或并行执行的部分,再通过 Codex 改写生产环境中的 Triton 和 Gluon Kernel。 - GPT-5.6 为自己的 draft model 设计方案,并自动运行数百次实验,测试不同的模型大小、结构和特征。 - 面对短对话、长上下文、代码任务等不同负载,GPT-5.6 会自动搜索 batching、sharding 和 KV Cache 管理的更优组合。 四件事连起来,GPT-5.6 参与的已经不再是某个孤立的代码任务,而是一条真实的工程反馈回路: 观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再把有效改进部署回承载自己运行的系统。