(相關資料圖)
IT之家 7 月 30 日消息,OpenAI 公司昨日(7 月 29 日)發布博文,宣布通過 GPT-5.6 Sol 模型,來優化 GPT-5.6 系列模型本身 AI 推理鏈路,端到端服務成本最多降低 20%。
OpenAI 于 7 月 9 日推出其最強 AI 模型 GPT-5.6 系列,在后續的架構優化過程中,官方團隊利用 GPT-5.6 Sol 模型來優化自身運行效率,降低計算成本、提高 GPU 利用效率。
OpenAI 公司稱,系統會按地域、可用容量和加速器類型分配請求;集群內部還會參考負載、上下文長度、緩存可用性等因素分發任務。GPT?5.6 Sol 通過 Codex 分析生產流量、識別負載失衡來源、測試路由策略并調整啟發式規則。
在模型前向傳播環節,GPT?5.6 Sol 識別可預計算、可避免或可并行的工作,并通過 Codex 自主改寫和優化生產環境中的 GPU 內核。IT之家附上相關截圖如下:
團隊讓 GPT-5.6 Sol 模型學習 Triton 和 Gluon 兩種編程語言,讓模型據此優化推理引擎內核,使生產環境 GPU 內核帶來的端到端服務成本最多降低 20%。
OpenAI 還使用開源工具 FpSan(浮點數清理器)驗證 GPT?5.6 Sol 編寫內核的正確性。
OpenAI 還讓 GPT-5.6 Sol 優化推測性解碼(speculative decoding)。這項推理加速技術由較小的草稿模型預測下一個 token,再由主模型驗證或修正預測結果。OpenAI 在 2026 年 7 月 29 日的公開帖文中稱,改進后 token 生成效率提升超過 15%。