前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8742
  • Jev 1.13实测:工单分类精度达100%,对比规则引擎和本地LLM
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • AI 审查同一 PR 给出不同结论:确定性判定器来解决
  • AI计量工具审计启示:独立交易ref是防重复计费的关键
  • OpenAI发布GPT-6 Sol/Luna:API价格下调50%
  • GPT-6/Claude 5.5 同日发布:价格战开打,Luna 成本腰斩
  • GitHub Copilot 大幅提升C++代码索引速度
  • Anthropic和OpenAI同时推出性价比新模型
  • GPT-6 提示缓存重大升级:更高命中率与可诊断性
  • 六边形架构的端口在撒谎:HTTP 不等于业务语义
  • GPT-5.6 价格策略解读:Luna 降价 80%,多版本差异化定位
  • 高通骁龙8 Gen6端侧跑300亿参数MoE模型,吞吐330 Token/s
  • Claude Opus 5.5评测:智商极高但费用惊人
  • 小米开源 MiMo-V2.6:万亿参数开源模型登顶榜
  • AI Agent 工具 API 设计指南
  • 一个浏览器扩展权限即可劫持五大 AI Agent
  • Claude Opus 5.5 主打端到端代码补全而非起步
  • GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一
  • GPT-6 Sol/Luna编程能力比肩Claude,成本降80%
  • Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%
  • Claude Opus 5.5:编程修复成功率达97.5%,成本降40%
  • 开源工具llm 0.36支持GPT-6 Sol/Luna
  • JetBrains押注Agent开发:称其为26年最重要一步
  • 为 AI 代理添加预算守卫的实战方案
  • OpenAI GPT-6 Sol和Luna模型上线Amazon Bedrock
  • OpenAI发布GPT-6 Sol和Luna,API价格减半
  • OpenAI 发布 GPT-6 Sol/Luna 模型,Token 价格减半
  • GPT-6 Sol/Luna 正式发布:成本更低、错误更少
  • OpenAI 发布 GPT-6 Sol/Luna,主打低成本低幻觉
  • Claude Opus 5.5 登陆 Google Cloud,在 Model Garden 可用
  • Claude Opus 5.5 现已在 AWS Bedrock 可用
  • Strands Evals + Bedrock AgentCore:Agent 技能选择评估指南
  • llm-anthropic 0.29支持Claude Opus 5.5
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • Meta Muse macOS 应用零日漏洞遭修复
  • 小米6天烧2000万训练开源模型MiMo,跃居开放模型榜首
  • 已加载 51 / 8742
9.0
重磅
AI SCORE
模型发布2026-09-23 03:25

GPT-6 Sol/Luna编程能力比肩Claude,成本降80%

IT之家#OpenAI#GPT-6#AI编程
Editor brief · 编辑速览

GPT-6 Sol在软件工程测试中与Claude Fable 5差距仅1.1个百分点,单任务成本低约80%;API价格较GPT-5.6降低50%。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

IT之家 9 月 23 日消息,OpenAI 今日发布 GPT-6 系列模型的最新成员 GPT-6 Sol 和 GPT-6 Luna。

OpenAI 官方表示,两款模型采用与 GPT-6 Astra 类似的方法进行训练,将 Astra 在专业工作、事实性、编码、计算机使用和对齐等方面最先进的性能带入更快、更经济的模型。

文章配图

GPT-6 Sol 和 Luna 模型的 API 价格相比 GPT-5.6 促销价降低 50%。不过 OpenAI 官方也表示,GPT-6 Astra 依然是其整体上最优秀的模型,如果你想要最佳效果和无妥协的体验,还是建议选择 GPT-6 Astra。

文章配图

性能方面,在 AutomationBench 的跨应用业务流程测试中,GPT-6 Sol 在 xhigh 强度下表现优于 Claude Opus 5,成本仅为 Opus 5 每任务成本的 9%。在 high 强度下,GPT-6 Luna 比前代提升了 5.4%,且每项任务成本降低了 58%。

文章配图

文章配图

在评估智能体的 Last Exam 测试中,GPT-6 Sol 在 max effort 状态下得分为 56.4%,高于 Claude Opus 5 在评估中的最高分,每任务成本也降低 60%。

文章配图

在事实可靠性方面,GPT-6 Sol 和 Luna 模型也取得进展。在 OpenAI 基于去标识化的真实世界对话中,GPT-6 Sol 的错误率约为前代的一半,接近 Astra 级可靠性且成本更低。GPT-6 Luna 的事实可靠性也迎来大幅提升,同时成本更低。

文章配图

编程方面,GPT-6 Sol 和 Luna 均针对 AI Coding Agent 工作负载进行了优化。在 FrontierCode 1.1 Main 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到与 Claude Fable 5.1 xhigh 相当的水平。

文章配图

在 DeepSWE v1.1 软件工程测试中,GPT-6 Sol 在 max effort 下取得 68.8% 的成绩,距离 Claude Fable 5 的最高成绩 69.9% 仅差 1.1 个百分点,而单任务成本低约 80%。GPT-6 Luna 在 max effort 下取得 66.6%,表现接近 Opus 5 和 Fable 5 的 medium effort,同时单任务成本分别低约 93% 和 96%。

文章配图

计算机操作能力方面,OpenAI 表示 GPT-6 Astra 仍然是其在计算机操作方面最强的模型,但 Sol 和 Luna 相比上一代模型能够以更低成本完成相关任务。

在 OSWorld 2.0 offline 测试中,GPT-6 Sol 在 xhigh effort 下取得 60.5% 的成绩,与 Claude Opus 5 medium effort 的 60.3% 接近,而单任务成本约低 80%。GPT-6 Luna max effort 则超过 GPT-5.6 Sol medium effort,同时成本约为后者的十分之一。

文章配图

OpenAI 还将 GPT-6 Astra 改进后的沟通风格带到了 Sol 和 Luna。官方认为新模型在技术和编程对话中会更清晰、使用更少的术语、更少奇怪的措辞、更少的低价值细节,以及缩短整体回答,同时不会失去实质内容。

除了价格降低,OpenAI 还帮助基于 GPT-6 的开发者在应用重复利用的上下文部分节省更多费用。官方改进了 GPT-6 的提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,实现更快响应。

此外,GPT-6 Sol 和 Luna 在价值对齐方面也有提升,在 OpenAI 官方的对齐评估中,Sol 和 Luna 都相较于 GPT-5.6 版本有所改进,包括关于其编码工作的误导性声明发生率降低。

文章配图

IT之家从 OpenAI 公告获悉,GPT-6 Sol 和 GPT-6 Luna 自今日起已在 ChatGPT Work 和 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。免费用户和 Go 用户可以在桌面应用中使用 GPT-6 Luna。这些模型目前还没有在 Chat 中提供。在 OpenAI API 中,它们以 gpt-6-sol 和 gpt-6-luna 的形式提供。

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一
下一篇
Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%