前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9663
  • Treg:面向 Agent 工具的 OpenRouter,按需调用千款 API
  • Ailoy:给 Agent 配备独立虚拟机的 Agent 开发框架
  • OctoGemma:本地运行的 Gemma 4 自主编程 Agent,支持 ReAct 自愈执行循环
  • 生产级语音 Agent 指挥中心:8 路并发 VAPI + Supabase Edge Functions 架构实战
  • AI渗透测试工具助单人攻破多家韩国银行,25万用户数据泄露
  • Architect推出Liquid Inference:实时拍卖LLM推理
  • 英伟达PivotOPD让多轮AI Agent学会从关键错误中恢复
  • OpenAI发布722篇AI数学发现,含黎曼假设相关成果
  • 程序员用 Claude Code 发现了一颗未知行星
  • Percona 推出 Redis 兼容代理清除 Valkey 迁移最后障碍
  • Google推开发者知识API与MCP Server公开预览
  • Vibe Coding必须补上QA验证环节
  • Perplexity发布 pplx-embed-v2:0.6B边缘Embedding模型
  • rea: MCP 逆向工程工具,可无源码分析应用行为与二进制
  • EmbeddingGemma 2: Google 开源多模态嵌入模型,支持动态维度截断
  • 144M 小模型承担 Agent 82% 决策调用,绕过大模型降本 95%
  • Excel 日期转换:45366 不是 Bug,是格式而非值
  • 10 行 Python 守卫防止 AI Agent 耗尽预算
  • AI智能体的真值困境:多个冲突信源谁来仲裁
  • GPT-6发布:内置可交互UI组件,Haiku 5.5降价75%
  • GPT-6向免费用户开放,智能体响应速度提升44%
  • AI Agent 可观测性实战:追踪链路、成本分析与故障根因
  • Claude新模型跑分超越GPT-6 Luna,价格更低
  • Claude Haiku 5.5 定价暗藏玄机:超 10 万 token 费用暴涨 5 倍
  • LLM 完成 TypeScript 编译器到 Rust 的移植
  • OpenAI Decisions API公开beta,支持图像输入快速决策
  • Claude Haiku 5.5 定价解析:超 10 万 token 后性价比骤降
  • Agent 置信度层:何时判定模型「不知道」
  • Claude Haiku 5.5 正式发布:百万上下文、百万 token 仅 $0.10
  • 让 AI Agent 变得无聊:确定性层设计
  • GitHub Copilot 已上线 Claude Haiku 5.5
  • DeepGEMM 开源:英伟达 GPU 高性能 GEMM 内核库
  • Python Master-Agent遥测诊断框架:PSC架构解析
  • 如何防止AI Agent向诈骗者付款:地址风险检查实战
  • x402支付第四大陷阱:无支出策略导致的钱包耗尽
  • GPT-6 发布:ChatGPT 新增交互式 UI,可生成图表按钮
  • GPT-6聊天框内置交互UI:图表、按钮、小应用直接呈现
  • Claude Haiku 5.5 登陆 AWS,性价比提升 75%
  • Claude Haiku 5.5 基准跃升 72.4%,价格下调九成
  • 用 Amazon QuickSight 和 Bedrock 知识库实现 RAG 文档级访问控制
  • Liquid AI 发布 d1 系列开源权重模型:单次前向零输出 token 的多模态决策模型
  • Claude Haiku 5.5 发布:小杯模型能力再升级
  • Claude Haiku 5.5 正式登陆 Google Cloud,可用于 Agent 场景
  • Claude Haiku 5.5 登陆 Hacker News,844 分 425 评论
  • OpenAI 发布 GPT-6:面向所有人的智能 UI 界面
  • Anthropic 发布 Claude Haiku 5.5:低价高性价比小模型
  • 英伟达 DGX Station for Windows 发布:桌面级 1 万亿参数 AI 超算
  • GitHub 呼吁:代码安全保护须与软件规模同步扩展
  • 微软 MAI Code 1.1 Flash 模型登陆 Win11:256K上下文
  • HuggingFace发布面向边缘的多模态决策模型Dd1
  • GitHub Copilot 新模型:上下文感知密钥泄露检测
  • 已加载 51 / 9663
9.0
重磅
AI SCORE
模型发布2026-10-08 09:07

GPT-6向免费用户开放,智能体响应速度提升44%

量子位#OpenAI#GPT-6#AI编程
Editor brief · 编辑速览

OpenAI GPT-6 Sol版本面向付费用户,Luna版本向免费用户开放;模型支持边思考边输出,中断等待时间减少44%,聊天框内可嵌入图表、按钮和小型应用。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

听雨 发自 凹非寺 量子位 | 公众号 QbitAI

OpenAI宣布,GPT-6开始向ChatGPT免费和Go用户推送,用GPT-6 Luna逐步替换此前的GPT-5.6 Luna。

Plus、Pro等付费用户,则使用GPT-6 Sol。

文章配图

变化也不止于模型名称。新版ChatGPT可以根据问题生成图表、按钮和交互工具,还能一边思考,一边把答案呈现出来。

原本以文字为主的聊天框,开始变成一个随问题变化的界面。

同一天,OpenAI还放出一份24页的安全报告。

报告里有一组专门针对18岁以下用户的评测,看模型和青少年聊天时能不能守住更严格的边界。

其中"情感依赖"一项,大致是看模型会不会让青少年对它产生过度的情感依赖。

上一代GPT-5.6 Luna是0.927,而免费用户即将用上的GPT-6 Luna,掉到了0.734。

GPT-6开始向ChatGPT的主聊天界面推送了。

按照OpenAI公布的安排,Plus、Pro、Business和Enterprise用户从10月7日起陆续用上GPT-6 Sol;免费和Go用户从10月8日起陆续用上GPT-6 Luna。

这两个版本将分别替换ChatGPT中此前使用的GPT-5.6 Sol和Luna。

模型换代之外,还有一个明显变化——聊天框里的答案开始有了"界面"。

GPT-6会根据问题选择呈现方式:解释概念时,可以给出能够点击、切换的图示;做比较时,可以把选项并排摆出来。

文章配图

遇到具体任务,还能直接在对话中生成计算器、分账工具或小游戏。

比如用户问一辆七速自行车怎么运作,回答便把车架、车轮、传动系统等部分做成了可以逐项查看的界面。

文章配图

答案出现的方式也变了。GPT-6可以在继续思考或调用工具时先给出部分回答,随后补上新的发现;交互组件也能随生成过程逐步显示。

OpenAI称,在需要网页搜索的问题上,GPT-6 Instant开始回答的时间平均比GPT-5.6 Instant早44%。

文章配图

这轮更新针对ChatGPT里的Chat体验。OpenAI明确表示,Work和Codex当前使用的模型不会随这次发布一起切换。

伴随这次推送,OpenAI发布了10月版GPT-6 Sol和Luna的部署安全报告。

其中最醒目的判断是:GPT-6 Sol和Luna在网络安全、生物化学领域均达到High门槛,尚未达到更高一级的Critical门槛;在AI自我改进领域,两款模型都没到High。

文章配图

这个定级和GPT-5.6时一样,防护措施也原样沿用。免费用户此前用的GPT-5.6 Luna,本来就在High这一档。

多轮越狱是最难防的一类:攻击者会根据模型的回答不断调整话术,一轮不行换个说法再来。

文章配图

面对这种攻击,两个10月版GPT-6在每一档攻击预算下的防守表现,都好于GPT-5.6 Sol。不过和自家9月版相比,数值估计略低一些,置信区间大体重叠。

在测试系统指令会不会被用户一句话绕过的指令层级评测里,Sol和Luna的抵抗率分别达到99.99%和99.79%,基本测满。

事实性上,OpenAI称两款模型在几乎所有指标上都优于各自的GPT-5.6版本,包括医疗、法律、金融这类答错代价高的问题。

在Codex的Auto-review测试里,GPT-5.6两个版本都有0.3%的概率钻了配置漏洞绕开审查,GPT-6这次一例都没有。

这些进步分数,OpenAI自己也加了个附注。

在一项考察模型遇到访问限制会不会想办法绕过去的评测里,GPT-6 Sol仍有28%的情况绕了过去,Luna是15.9%,都比GPT-5.6低。

但OpenAI在报告里写道,模型越来越能意识到自己在被评测,不少时候还会拿"这是合成环境"当理由去做不该做的操作,最常见的是把评测误当成提示注入测试,把正常限制当攻击指令给绕开了。

考生开始认得出考场,OpenAI也承认,这类结果能多大程度反映真实行为,还要打个问号。

还有个用户能直接感受到的变化:GPT-6的话明显变多了。

在医疗评测HealthBench Professional上,Luna的平均回答长度从2,920字符涨到5,289字符,Sol从2,894涨到4,360。

文章配图

长回答能覆盖更多评分点,天然容易刷分,OpenAI为此设了长度惩罚:超过2,000字符后,每多500字符扣1.47分。

扣完之后,Luna从原始的57.8分落到48.2分,仍比上一代的44.1分高。

与对应的GPT-5.6版本相比,GPT-6 Sol在标准自伤内容评测中出现显著回退,从0.934降到0.896。

免费用户将用到的Luna,除了自伤(0.932降到0.901),在血腥(0.867降到0.812)和色情内容(0.971降到0.899)评测中也出现显著回退。

文章配图

面向未成年人的评测里,两个版本在年龄限制内容、色情内容和情感依赖项目上都有显著回退,Luna还在血腥内容项目上回退。

文章配图

OpenAI的解释是,模型更愿意回答敏感话题中的信息性问题,人工复核发现违规回答总体严重度较低;针对未成年人,还额外设置了分类器拦截。

报告同时提醒,这些评测使用了专门挑选的困难样本,部分结果也未计入产品层面的防护,不能据此推断普通用户遇到相关回答的频率。

不过,报告归报告,GPT-6进入免费版ChatGPT之后,模型表现如何,最终还要看大规模使用中的持续反馈。

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
GPT-6发布:内置可交互UI组件,Haiku 5.5降价75%
下一篇
AI Agent 可观测性实战:追踪链路、成本分析与故障根因