前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • Claude Code部署到Lizard平台实战指南
  • Claude Opus 5.5降价却破坏四个Agent依赖项
  • OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆
  • treg:聚合 3000+ Agent 工具的统一网关
  • 向量检索权限校验应内嵌到 pgvector 查询中
  • Univer:面向 AI Agent 的开源办公套件 SDK
  • DeepSeek公开Agent训练新论文,梁文锋署名
  • 为 AI 编程 Agent 构建可复用技能系统的实践
  • DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
  • Google AX:开源Agent编排运行时
  • 阿里千问发布Qwen-Audio-3.1:TTS降价70%、ASR降价95%
  • 诺基亚开源AnyJev:无训练即可将任意开源LLM转为校准决策模型
  • 2026年AI网关横评:Bifrost领跑,多路 failover 哪家强
  • GPT-6 Sol/Luna 发布:准确率翻倍、成本减半,价格战开启
  • Claude Opus 5.5 登场,AI 模型价格普降 40-50%
  • Kyutai开源语音模型Voice of Reason,口算GSM8K准确率从27%升至77%
  • 微软Copilot大促:10万席最高半价,向超级AI应用转型
  • OpenAI GPT-6 Sol/Luna:API价格腰斩,长任务Prompt缓存优化
  • AI 编码 Agent 在移动端多久“看”一次才够用
  • GPT-6 Astra 引领 3D 生成技术,竞争格局生变
  • Claude Opus 5.5 缓存读取降价 60%,68 万行代码迁移攻略
  • 用 AI 辅助求职的工程实践:诚实原则与确定性设计
  • Agent 补丁评分卡:防止测试被悄悄弱化的 CI 策略
  • Opus 5.5 缓存降价后 text-to-SQL 成本重算分析
  • Slack推出Code Channels:团队对话内集成AI编程助手
  • GPT-6 Sol/Luna 登场:价格腰斩,定位细分
  • TypeSafe Jev:让AI返回结构化决策而非段落文本
  • Text-to-SQL访问控制:身份决定Schema可见性
  • Jev 1.13实测:工单分类精度达100%,对比规则引擎和本地LLM
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • Copilot for JetBrains新增工具审批和Agent控制功能
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • 已加载 51 / 8836
8.0
热点
AI SCORE
模型发布2026-09-23 19:00

OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆

The New Stack#OpenAI#GPT-6#API降价
Editor brief · 编辑速览

OpenAI 推出 GPT-6 Sol 与 Luna,token 价格较 Astra 腰斩,缓存机制是本次降价的关键技术手段。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

OpenAI 于周二发布了 GPT-6 Sol 和 Luna,本质上是更实惠的 GPT-6 Astra 版本,在对齐能力上比 GPT-5.6 Sol 更接近 Astra,但仍不及旗舰模型。

最值得注意的是,这家人工智能公司大幅下调了 token 价格,使新的 GPT-6 模型使用成本显著降低。不过,除了 token 价格之外,OpenAI 还表示,更好的缓存机制也能帮助开发者进一步压低成本。

根据 OpenAI 的说法:"缓存和推理方面的改进使我们能够以更低的成本提供这些模型",Sol 和 Luna 的 API 价格比其 GPT-5.6 对应版本低了 50%(Luna 输出 token 低 58%)。

有哪些改进?主要是:默认情况下更高的缓存命中率、在推理 effort 和工具可用性变化时保留早期上下文的能力,以及用于监控和诊断缓存性能的新工具。

不重置地复用上下文

当然,Prompt caching 对于新的 GPT-6 模型本身而言并非新事物。但升级后的 Sol 和 Luna 带来了改进,旨在让更多已处理的上下文在 agent 推进任务时保持可复用。

"我们为 GPT‑6 改进了 prompt caching,以提供更高的默认缓存命中率,帮助 agents 复用更多上下文、响应更快,并享受缓存输入 token 读取 90% 的折扣。"

这为压低本就低廉的 API 价格增添了又一个机会,不过 90% 的缓存输入折扣与 GPT-5.6 定价一致;新奇之处在于缓存被命中的频率。通过利用缓存上下文复用已完成的工作,模型无需在每次调用时都从头重新处理相同上下文,从而降低延迟和 token 成本。

除了更高的默认缓存命中率,OpenAI 还表示新的 GPT-6 模型提供了更大的灵活性来优化缓存性能。

新模型允许开发者调整推理 effort 和工具可用性,而无需破坏缓存。这样,agent 可以根据步骤难度动态调整推理 effort,然后根据任务需求启用不同工具,而不破坏之前缓存的上下文——这对于速度和成本而言同样是利好。

查看缓存了什么、没缓存什么

GPT-6 Sol 和 Luna 还带来了 Prompt Caching Dashboard,OpenAI 称开发者可以在此查看缓存性能,了解有多少上下文被复用。

具体来说,他们可以看到有多少输入被缓存以及该数量如何随时间变化。诊断工具随后会标记错失的缓存机会,帮助开发者了解哪些内容可以使用更高效的缓存。

这个思路不是将缓存性能隐藏在幕后,而是使其更加透明,让开发者能够主动衡量和优化缓存复用。

总体而言,OpenAI 表示这些缓存改进已经见效。根据这家 AI 公司的数据,GitHub 报告"在过去几个月里,这些改进将使需要新鲜处理的 prompt token 占比降低了超过 50%,涉及对 OpenAI 模型的数十亿次请求"。

Token 价格并非让 agents 更便宜的唯一途径

OpenAI 为 GPT-6 Sol 和 Luna 做出的定价调整掀起了最大波澜——这家 AI 公司从 GPT-5.6 水平大幅下调了 API 价格。

与 GPT-5.6 Sol 和 Luna 当前的定价相比——分别为每百万输入 token 4 美元和 0.20 美元,每百万输出 token 20 美元和 1.20 美元(GPT-5.6 Sol 的费率为促销价)——新的 GPT-6 模型仅为每百万输入 token 2 美元和 0.10 美元,每百万输出 token 10 美元和 0.50 美元。

凭借 GPT-6 Sol 和 Luna 的缓存改进和更低的 token 定价,OpenAI 正在从两方面着手解决 agent 成本问题:减少新鲜处理的收费,以及降低相同上下文需要重新处理的频率。

但随着更多 AI 模型提供商在定价上激烈竞争,越来越明显的是,仅靠更便宜的模型并不能拯救你的 AI 预算——而更低的 token 价格也不是让 agents 更便宜的唯一途径。

随着 agents 继续处理更长更复杂的任务,两方面同时发力可能会面临更大压力。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Opus 5.5降价却破坏四个Agent依赖项
下一篇
treg:聚合 3000+ Agent 工具的统一网关