前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • Claude Code部署到Lizard平台实战指南
  • Claude Opus 5.5降价却破坏四个Agent依赖项
  • OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆
  • treg:聚合 3000+ Agent 工具的统一网关
  • 向量检索权限校验应内嵌到 pgvector 查询中
  • Univer:面向 AI Agent 的开源办公套件 SDK
  • DeepSeek公开Agent训练新论文,梁文锋署名
  • 为 AI 编程 Agent 构建可复用技能系统的实践
  • DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
  • Google AX:开源Agent编排运行时
  • 阿里千问发布Qwen-Audio-3.1:TTS降价70%、ASR降价95%
  • 诺基亚开源AnyJev:无训练即可将任意开源LLM转为校准决策模型
  • 2026年AI网关横评:Bifrost领跑,多路 failover 哪家强
  • GPT-6 Sol/Luna 发布:准确率翻倍、成本减半,价格战开启
  • Claude Opus 5.5 登场,AI 模型价格普降 40-50%
  • Kyutai开源语音模型Voice of Reason,口算GSM8K准确率从27%升至77%
  • 微软Copilot大促:10万席最高半价,向超级AI应用转型
  • OpenAI GPT-6 Sol/Luna:API价格腰斩,长任务Prompt缓存优化
  • 已加载 51 / 8836
8.0
热点
AI SCORE
模型发布2026-09-24 00:32

OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%

dev.to · AI#OpenAI#Anthropic#大模型降价
Editor brief · 编辑速览

同一天 OpenAI 和 Anthropic 双双推出低价前沿模型:GPT-6 Sol 输入 $2/输出 $10,Claude Opus 5.5 比 Opus 5 便宜 40%,推理成本竞争加剧。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Photo by Taylor Vick on Unsplash

Server rack with bundled network cables

本周二,OpenAI 和 Anthropic 在数小时内先后推出了更便宜的前沿级模型。OpenAI 在旗舰款 Astra 之下新增了 GPT-6 Sol 和 GPT-6 Luna,Anthropic 则发布了 Claude Opus 5.5。同一周,阿里巴巴的芯片部门也展示了一款新的训练和推理加速器。综合来看,这些事件指向同一个方向:"足够智能"的模型调用成本正在快速下降,而真正有意思的工程问题正在转向别处。

以下是我的解读:实际发生了什么,以及开发者应该怎么做。

OpenAI 表示,将 Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价下调 50%。按每百万 token 计费,Sol 从 $4 输入 / $20 输出降至 $2 / $10,Luna 从 $0.20 / $1.20 降至 $0.10 / $0.50。公司将原因归功于"缓存和推理层面的改进",并表示将把节省的成本让渡给用户。

Anthropic 对 Opus 5.5 的定位是:在大多数工作中"达到 Claude Fable 5.1 的水平",且在典型工作负载下运行成本比 Opus 5 低约 40%。列表价格为每百万 token $4 输入 / $20 输出,比 Opus 5 低 20%。更值得关注的是缓存定价:缓存读取为每百万 token $0.20,比 Opus 5 低 60%,Anthropic 指出"缓存读取占 Agent 任务和编码工作成本的大部分"。

CNBC 将两家公司的发布定性为应对来自阿里巴巴、Moonshot AI 和 DeepSeek 等公司更便宜的开源权重模型的压力。这个判断我认同。前沿实验室降价并非出于自愿,而是因为"最佳模型"和"足够好的开源模型"之间的差距,在很多日常工作中正在不断收窄。

缓存定价才是真正的重点

如果你在跑 Agent,大部分 token 并不是新的。同样的系统提示词、工具定义、仓库上下文和对话历史,在每一步都会被重新发送。这就是为什么 Anthropic 突出缓存读取比标题输入价格更有意义。一个 Agent 循环如果重新读取大上下文 30 次,它主要支付的是缓存费率,而非列表费率。

OpenAI 从另一个角度做了同样的布局:它表示自己的降价部分来自基础设施层面更好的缓存。

实践要点:如果你的应用没有将提示词结构化——让稳定部分排在前面、且每次调用时字节完全一致——那你就是在把大部分节省拱手让出。把系统提示词、工具 schema 和长期上下文放在顶部,把变化的部分(最新的用户消息、最新的工具结果)放在末尾。这是老生常谈的建议,但在本周它变得值钱多了。

慎用厂商基准测试

两家公司的发布公告都附有大篇幅基准测试表格,且都拿对方实验室的模型做对比。OpenAI 表示 GPT-6 Sol 在最高 effort 级别下,以"仅 Opus 5 单任务成本 9%"的表现超越了 AutomationBench 上的 Claude Opus 5。Anthropic 自己的表格则显示 Opus 5.5 在 Terminal-Bench 4.0 等 Agent 编码基准测试中领先。

这些数字是自报数据,在各厂商自选的设置下运行,而且往往拿自己的最新款对比对方的上一代。值得肯定的是,Anthropic 说得坦白:"在这种能力水平上,我们发现基准测试的差距对现实世界差异的指引已经不那么可靠了。"

我认为这是两份公告中最有用的一句话。当两个模型如此接近时,唯一重要的基准是你的任务集。如果你没有从产品中提取的真实提示词小评估集,没有可以自动校验的预期输出,这是一个好时机去建一套。价格下调到这个程度正是切换模型的收益开始显现的时候,而没有评估你就无法安全切换。

按任务成本计,而非按 Token 计费

两份发布都做对了一件事:谈论按任务计费,而不仅仅是按 Token 计费。一个更便宜的模型如果需要三次重试,或者思考时间翻倍,最终可能更贵。OpenAI 报告 Luna 在 AutomationBench 上以"比上一代低 58% 的单任务成本"提升了 5.4 个百分点。Anthropic 表示 Opus 5.5 根据 effort 级别使用更少 token。

对开发者而言,这意味着定价页上的 Token 单价只是图的一半。记录每个完成任务的 Token 消耗、重试次数、以及人工介入的频率。这才是决定一个模型对你来说是否真的更便宜的数字。

在供给侧,阿里巴巴芯片子公司 T-Head 在杭州云栖大会上发布了 Zhenwu V900。据 TechNode 报道,公司声称性能是前代的三倍,216GB 内存,1,200GB/s 的芯片间带宽,原生支持 FP8 和 FP4。声称 1,000 颗以上芯片可协同作为单一系统,集群规模可达 50 万个加速器。量产预计在 2027 年第一季度。这些都是厂商自述,目前尚无独立基准验证。

让我印象深刻的是重点所在——不是原始 FLOPS,而是内存、互联和低精度格式,这些才是向大量 Agent 提供大模型服务时降低成本的关键。这与 API 价格中呈现的压力一脉相承:推理成本已成为主战场。

本周可以做的事

在新档位上重新跑你的评估。一款价格现在只要一半的中档模型,可能已经能覆盖你目前发给顶配模型的很多任务。

为缓存重组提示词结构。稳定内容在前,变化内容在后。

按任务追踪成本。Token 数、重试次数、人工介入次数。

不要锁定。在价格变动如此剧烈的时期,一层能让您切换供应商的薄抽象,其价值已经超过了搭建它所需的几个小时。

更便宜的模型不会让精心工程变得不再重要。它们只是把成本决策的战场——评估、缓存和路由——推到了模型调用之外那些地方。

你在自己的使用中看到了什么?缓存真的占据了你账单的最大头吗?

本文由 AI 辅助撰写,发布前经过事实核查(来源和链接已验证)。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
下一篇
AI 工具循环必须显式传递 Retry-After 头否则必死循环