OpenAI 推出 GPT-6 Sol 与 Luna,token 价格较 Astra 腰斩,缓存机制是本次降价的关键技术手段。
OpenAI 于周二发布了 GPT-6 Sol 和 Luna,本质上是更实惠的 GPT-6 Astra 版本,在对齐能力上比 GPT-5.6 Sol 更接近 Astra,但仍不及旗舰模型。
最值得注意的是,这家人工智能公司大幅下调了 token 价格,使新的 GPT-6 模型使用成本显著降低。不过,除了 token 价格之外,OpenAI 还表示,更好的缓存机制也能帮助开发者进一步压低成本。
根据 OpenAI 的说法:"缓存和推理方面的改进使我们能够以更低的成本提供这些模型",Sol 和 Luna 的 API 价格比其 GPT-5.6 对应版本低了 50%(Luna 输出 token 低 58%)。
有哪些改进?主要是:默认情况下更高的缓存命中率、在推理 effort 和工具可用性变化时保留早期上下文的能力,以及用于监控和诊断缓存性能的新工具。
当然,Prompt caching 对于新的 GPT-6 模型本身而言并非新事物。但升级后的 Sol 和 Luna 带来了改进,旨在让更多已处理的上下文在 agent 推进任务时保持可复用。
"我们为 GPT‑6 改进了 prompt caching,以提供更高的默认缓存命中率,帮助 agents 复用更多上下文、响应更快,并享受缓存输入 token 读取 90% 的折扣。"
这为压低本就低廉的 API 价格增添了又一个机会,不过 90% 的缓存输入折扣与 GPT-5.6 定价一致;新奇之处在于缓存被命中的频率。通过利用缓存上下文复用已完成的工作,模型无需在每次调用时都从头重新处理相同上下文,从而降低延迟和 token 成本。
除了更高的默认缓存命中率,OpenAI 还表示新的 GPT-6 模型提供了更大的灵活性来优化缓存性能。
新模型允许开发者调整推理 effort 和工具可用性,而无需破坏缓存。这样,agent 可以根据步骤难度动态调整推理 effort,然后根据任务需求启用不同工具,而不破坏之前缓存的上下文——这对于速度和成本而言同样是利好。
GPT-6 Sol 和 Luna 还带来了 Prompt Caching Dashboard,OpenAI 称开发者可以在此查看缓存性能,了解有多少上下文被复用。
具体来说,他们可以看到有多少输入被缓存以及该数量如何随时间变化。诊断工具随后会标记错失的缓存机会,帮助开发者了解哪些内容可以使用更高效的缓存。
这个思路不是将缓存性能隐藏在幕后,而是使其更加透明,让开发者能够主动衡量和优化缓存复用。
总体而言,OpenAI 表示这些缓存改进已经见效。根据这家 AI 公司的数据,GitHub 报告"在过去几个月里,这些改进将使需要新鲜处理的 prompt token 占比降低了超过 50%,涉及对 OpenAI 模型的数十亿次请求"。
OpenAI 为 GPT-6 Sol 和 Luna 做出的定价调整掀起了最大波澜——这家 AI 公司从 GPT-5.6 水平大幅下调了 API 价格。
与 GPT-5.6 Sol 和 Luna 当前的定价相比——分别为每百万输入 token 4 美元和 0.20 美元,每百万输出 token 20 美元和 1.20 美元(GPT-5.6 Sol 的费率为促销价)——新的 GPT-6 模型仅为每百万输入 token 2 美元和 0.10 美元,每百万输出 token 10 美元和 0.50 美元。
凭借 GPT-6 Sol 和 Luna 的缓存改进和更低的 token 定价,OpenAI 正在从两方面着手解决 agent 成本问题:减少新鲜处理的收费,以及降低相同上下文需要重新处理的频率。
但随着更多 AI 模型提供商在定价上激烈竞争,越来越明显的是,仅靠更便宜的模型并不能拯救你的 AI 预算——而更低的 token 价格也不是让 agents 更便宜的唯一途径。
随着 agents 继续处理更长更复杂的任务,两方面同时发力可能会面临更大压力。