该模型于7月9日发布后接入生产环境,通过重写GPU内核与优化推测解码实现降本增效,随后官方宣布下调GPT-5.6 Luna等型号调用价格。
OpenAI在2026年7月发布GPT-5.6系列模型后,利用其中代号为GPT-5.6 Sol的变体对内部生产系统进行了实质性改造。该模型于7月29日被确认自主重写了负责运行大模型的核心GPU内核代码,优化对象覆盖了负载均衡、推测解码及KV缓存等关键组件。此次调整并非停留在测试环境,而是直接应用于每日处理十亿级请求的线上基础设施。通过重新分配计算任务与减少网络传输开销,OpenAI官方数据显示对外服务成本降低了20%,模型生成Token的效率提升超过15%。
在具体技术路径上,GPT-5.6 Sol基于Codex框架深度介入推理栈,利用对Triton和Gluon编程语言的掌握能力,识别并并行化原本可优化的计算模块。优化过程包括分析真实流量以改进路由策略,避免硬件资源闲置;在推测解码环节,模型自动设计了数十次架构实验来调整配套草稿模型的尺寸与结构,从而减少主模型的验证负担。为确保代码修改的数学正确性,研发团队引入了开源工具FpSan进行浮点运算校验,将数值误差控制在极低量级。内部测试显示,经过三轮迭代后,推理阶段的资源浪费率从12%降至3%以下。
此次事件标志着AI系统从单纯的工具使用者转变为基础设施的优化参与者,形成了“训练模型-利用模型优化自身”的闭环。虽然核心代码合并需经人工审核与验证,但GPT-5.6在自动处理硬件故障、调整部署参数等方面的能力显著提升了研发效率。作为技术优化的市场反馈,OpenAI于7月31日宣布下调GPT-5.6 Luna模型的调用费用,其输入端每百万Token价格从1美元降至0.2美元,输出端从6美元降至1.2美元,降幅达到80%;同时GPT-5.6 Terra模型也进行了20%的降价调整。这一系列举措意在通过降低成本推动通用人工智能技术的普及应用。