GPT-5.6的上线为OpenAI的生产系统带来了显著变革——这款新模型不仅参与日常服务,还主动承担起优化自身运行环境的重任。通过自主重写底层代码,GPT-5.6对OpenAI的GPU内核进行了深度改造,直接推动服务成本下降20%,模型生成token的效率提升超15%。这一成果并非实验性尝试,而是直接应用于每日处理十亿级用户请求的核心生产系统。
优化过程涉及多个关键技术环节。在负载均衡方面,模型通过分析真实流量数据,识别出此前被忽视的硬件资源分配不均问题,并测试新的路由策略;针对GPU内核,它重新编写了用Triton和Gluon编写的代码,专注于优化计算任务的预处理、跳过冗余步骤及并行化执行;在推测解码环节,模型为配套的draft模型设计了数百次架构实验,自动管理训练流程并处理硬件故障。这些改进共同减少了网络传输量、CPU开销,同时提升了GPU利用率。
OpenAI内部已形成一套完整的优化闭环:模型从分析流量数据起步,经过代码编写、实验验证、故障处理,最终用生产指标检验成果。以推测解码为例,传统方式需工程师手动调整模型参数,耗时数月且难以覆盖所有可能性;而GPT-5.6通过快速迭代实验,在短时间内探索了更多配置方案,使团队能更灵活地应对动态变化的负载需求。这种效率提升直接反映在数据上——内测阶段研究员日均token输出量较前代模型翻倍,内部代码推理算力占比增长100倍,智能体token使用量激增22倍。
尽管OpenAI用"自主"描述模型的部分行为,但强调关键决策仍由人类工程体系把控。例如,模型编写的内核代码需通过FpSan工具进行结构验证,确保数据流正确后方可部署。这种"人机协作"模式既发挥了模型在优化效率上的优势,又规避了完全自动化可能带来的风险。内部数据显示,GPT-5.6在自我改进能力评估指标RSI Index上得分较前代提升16.2分,且在同等性能下成本更低,显示出优化飞轮的初步成效。
这一变革正在重塑AI行业的竞争逻辑。过去企业比拼的是GPU采购规模,如今推理效率成为同等重要的指标——同样的硬件资源,谁能输出更多token,谁就能在市场竞争中占据优势。GPT-5.6通过分档设计(Sol、Terra、Luna)强化了这一策略,在保持模型智能水平的同时,将效率提升转化为实际成本优势。当模型开始主动优化自身运行环境,AI发展的底层逻辑已悄然改变:从单纯依赖硬件堆砌,转向通过智能优化释放硬件潜力。










