GPT-5.6降价技术拆解:蒸馏与自优化驱动
OpenAI详解GPT-5.6通过模型蒸馏和递归自优化实现20%-80%成本下降的技术方案。
OpenAI详解GPT-5.6通过模型蒸馏和递归自优化实现20%-80%成本下降的技术方案。
2026 年 7 月 30 日 · 链接博客
OpenAI 今天大幅降价:GPT-5.6 Terra 的价格降低了 20%,GPT-5.6 Luna 更是大降 80%。
OpenAI 将这一成果归功于 5.6 Sol。在《GPT‑5.6 如何融合前沿智能与前沿效率》中,他们介绍了如何使用 5.6 Sol 优化负载均衡;更令人印象深刻的是,他们还用它优化了推理过程本身:
我们还使用 GPT‑5.6 Sol 优化了模型的 forward pass,也就是将输入转换为下一个 token 预测的计算过程。即使单项操作已经很快,过多的内存搬运、同步操作和低效的数据布局,仍可能让 GPU 处于闲置状态。为避免这种情况,GPT‑5.6 Sol 找出了可以预先计算、省略或并行执行的工作。借助 Codex,GPT‑5.6 Sol 自主重写并优化了我们的生产级 kernel,也就是负责执行构成模型的数学运算的核心代码。这之所以能够实现,部分原因在于我们训练 GPT‑5.6,使其能够高效地使用 Triton 和 Gluon 编写及改进 kernel。这两种开源 GPU 编程语言均由 OpenAI 维护。这些工作与 GPT‑5.6 Sol 带来的更广泛 kernel 改进相结合,使端到端服务成本降低了 20%。
Luna 的这次降价彻底改变了低价模型市场的格局。Luna 的输入价格为每百万 token 0.20 美元,输出价格为每百万 token 1.20 美元,现在已经比 Google 的 Gemini 3.1 Flash-Lite(0.025 美元/1.50 美元)更便宜。
Anthropic 目前最便宜的模型是 Claude Haiku 4.5,价格为 1 美元/5 美元。Luna 的输入价格现在只有它的五分之一,而此前两者价格相同。
我的 agent.datasette.io 演示网站之前运行在 Gemini 3.1 Flash-Lite 上。我已经把它切换到了 Luna。
OpenAI 对 Hugging Face 发起的意外网络攻击,是已经成为现实的科幻故事——2026 年 7 月 22 日
与 Claude Code 团队的 Cat 和 Thariq 炉边对谈——2026 年 7 月 21 日
Kimi K3,以及我们仍能从 pelican benchmark 中学到什么——2026 年 7 月 16 日
这是一篇由 Simon Willison 发布的链接文章,发布于 2026 年 7 月 30 日。
每月赞助我 10 美元,即可收到一封精选邮件摘要,汇总当月最重要的 LLM 进展。
付钱让我少给你发点东西!