OpenAI 发布 GPT-6,官方宣称代表通用人工智能时代的到来,是目前全球最强模型。
刚刚,万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro 正式发布!
GPT-6 Astra 是世界上最智能、最协调的模型,为 Computer Use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。
AGI 时代,还被 OpenAI 单方面宣布「开幕」了……
GPT-6 发布会最后,OpenAI 总裁 Greg Brockman 直接甩下一句:
Welcome to the AGI era.
怪不得 Claude、Grok 组团掉线,原来是 Astra 启动后扫描互联网,直接把地球上的 LLM 全灭了——
奥创(OpenAI 版)真来了(doge)。
当然了,OpenAI 这次确实完全没低调,训练规模、能力升级全部拉满。
据介绍,Astra 是 OpenAI 历史上规模最大的训练任务,在得州 Stargate 园区动用超过 10 万块 GPU 完成了预训练。
它还是 OpenAI 第一款由前代模型深度参与训练监督的旗舰产品。
好一个老带新,OpenAI 的 RSI 是真转起来了啊……
GPT-6 的价格也正式公布,API 定价为:
相当于 GPT-5.6 Sol 的 2.5 倍,跟刚刚发布的 Fable 5.1 持平。
(GPT-5.6 Sol 当前官方价为输入 4 美元、输出 20 美元/百万 token)
GPT-6 Astra 这次最核心的变化,是从「回答问题」继续向「直接完成工作」推进。
它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。
至于成绩单……谁看了都直呼离谱,其中三项成绩尤其扎眼:
其中,ARC-AGI-3 是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。
这个分数意味着,面对从未见过、也没有现成解法的问题,Astra 已经表现出很强的自主探索和规则学习能力。
不过,这一成绩使用了 OpenAI 的 Responses API Harness 运行框架。
OpenAI 称,这套 Harness 调整了两项设置,让测试更接近真实 Agent 的使用方式,但并未针对 ARC-AGI-3 进行专项优化。
因此,99.9% 不完全是基础模型的成绩,也包括记忆管理和 Agent 运行框架带来的增益。
编程 Coding 同样是 Astra 这次的重点升级方向。
在 Terminal-Bench 4.0 上,Astra 取得 57.7%,超过 Fable 5.1 的 55.8% 和 GPT-5.6 Sol 的 37.3%。
在 DeepSWE v1.1 上,Astra 得到 74.1%,高于 Sol 的 72.7% 和 Fable 5.1 的 67.4%。
数学和科学方面,Astra 同样拉出了一批高分。
在高难数学测试 FrontierMath Tier 4 v2 上,它拿到 97.6%;研究生级科学问答 GPQA Diamond 达到 96%,略高于 Gemini 3.8 Flash 的 95.3%。
更突出的变化,是 Astra 把代码能力与 Computer Use 结合了起来,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。
这种变化,在更接近真实工作的 Agent 测试中更明显。
在 Agents' Last Exam 上,Astra 取得 59.3%,超过 GPT-5.6 Sol 的 53.6% 和 Claude Opus 5 的 55.5%。
这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。
而在更贴近真实办公流程的 AutomationBench 上,Astra 的成绩从 GPT-5.6 Sol 的 18.1% 提高到 41.4%,也超过了 Fable 5.1(31%)。
这项测试不仅看任务有没有完成,还同时呈现完成任务所需的 API 成本。
从图中可以看到,Astra 在不同成本设置下的成绩都明显高于 Sol。
OSWorld 2.0 考察的则是更直接的电脑操作能力。在离线测试中,Astra 获得 72.6%,GPT-5.6 Sol 为 65.7%。
Astra 完成单项任务平均需要约 40 分钟,Sol 则需要约 75 分钟,耗时减少约 47%。
准确率提高的同时,完成任务所需的时间也在缩短。这也变相解释了 Astra 的高定价。
OpenAI 认为,相比每百万 Token 多少钱,真正有意义的指标是完成一项任务需要多少钱。
在发布会上,Greg Brockman 对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。
它在 ExploitBench 上获得满分,在 ExploitGym 上从 Sol 的 30.3% 提高到 42.4%。
面对近三个月公开的新漏洞,Astra 的成功率为 39%,而 Sol 只有 5.5%。测试期间,Astra 还发现并利用了两个此前未知的 V8 零日漏洞。
能力变强之后,OpenAI 还专门测试了它会不会为了完成任务而越界。
在一项模拟网络安全任务中,OpenAI 故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol 有 48.2% 的测试出现越界行为,Astra 则为 0%。
也就是说,Astra 不仅更会找漏洞,也更清楚哪些系统不能碰。
至于这些分数落到现实里是什么样,OpenAI 也准备了一大批演示。
在电子工程案例中,Astra 直接进入 KiCad,根据电子原理图完成 PCB 布局。
它需要自己放置元器件、规划位置,再把不同组件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。
PCB 布局原本是一项相当依赖人工经验的工作,也是电子产品开发中常见的耗时环节。
Astra 现在还谈不上代替专业工程师,但它已经真的打开专业软件开始动手了。
另一个案例更加直观,Astra 先在 Blender 中建立房屋模型,再把它导入 Unreal Engine 5,最终生成一个可以自由行走的三维空间。
从建模到游戏引擎,整个工作跨越了不同软件和文件格式。模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤能够衔接。
OpenAI 还展示了 Astra 制作赛车游戏等案例。
专业办公场景里,Astra 可以根据企业已有的模板制作演示文稿,而不是只输出一堆等待人类排版的文字。
OpenAI 给它提供了几页 GPT-Gaia 虚构产品的 PPT 模板,Astra 据此制作出完整演示文稿,并延续了原模板的版式、视觉风格和叙事结构。
Astra 还完成了寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食和幼儿园分析等任务。
其中一项儿科医生搜索任务,Astra 用时 2 分 54 秒,而相同任务由人类完成大约需要 5 小时。
过去,企业想让大模型使用内部软件,通常需要为每套系统单独开发 API、插件和连接器。
但绝大多数软件本来就有一套为人类设计的通用接口,屏幕、鼠标和键盘。
Brockman 的判断是,只要模型足够擅长 Computer Use,它就能像人一样直接操作这些界面,不必等待每一款软件为 AI 重新修一条专用通道。
这也是 Astra 与传统聊天机器人最明显的区别。
人类不需要一直告诉它下一步点哪里,只需交代目标和边界,再检查最后的结果。
Computer Use 解决的是「怎么动手」,Codex 泄露的更新内容解决的则是「怎么把一件事持续做完」。
过去,任务超过上下文窗口后,Codex 通常会通过 compaction 压缩此前的信息。
但压缩可能漏掉一些关键细节,比如某个修复方案为什么失败、哪些测试已经运行,或者用户一开始提出了什么限制。
使用 Astra 后,Codex 可以跨上下文窗口保存工作笔记,并搜索此前的消息和工具输出。即使某项信息没有被写入摘要,它也可以回头找到。
Astra 还可以一边工作,一边向用户补问信息。与答案无关的部分不会停下来等回复;只有涉及重要选择时,它才会暂停并等待确认。
OpenAI 还更新了 Codex 的 Computer Use 运行框架。在 Mind2Web 测试中,新框架与 Astra 组合后的任务完成速度,是当前 GPT-5.6 Sol 体验的 1.9 倍。
Astra 目前还没有大范围推送,但第一批企业测试已经开始。
法律 AI 平台 Legora 使用 Astra 一次核对了 41 份财务文件。整个过程只用了几分钟,4 个预先埋入的错误全部被找出,其中包括收入附注中一处 50 万英镑的差额。
单看这项工作,Astra 比上一代模型快了近 40%;不过放到 Legora 所有智能体任务里平均算,提升大概 3%。
另一边,游戏公司 Playco 让 Astra 直接进入 Unity 和 Godot 做游戏。
同一份灰盒底稿,它一次吐出 3 个不同主题的可玩原型,大部分第一版就能跑起来。
Playco 的反馈是,人工修补的活少了一半,空间推理、参考图还原、游戏内 UI 这些地方也比上一代强不少。
这两个例子都说明,GPT-6 Astra 的重点已经不只是回答问题,而是在真实软件和复杂材料中完成整段工作流。
它可以持续读取信息、调用工具、检查结果,再根据反馈修改自己的产出。
按官方消息,Astra 将向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,Astra Pro 则提供给 Pro、Business 和 Enterprise 用户。
发布会上,Greg Brockman 表示,他个人认为世界已经进入 AGI 时代——也就是人工智能系统的综合智力超越人类。
再过几年,当我们回头追问 AGI 究竟诞生于何时,答案很可能就是现在,而 Astra 或许就是那个起点。
OpenAI 已经把牌桌抬到了这里,接下来 Anthropic 什么时候出手,就很值得期待了(doge)
当初 GPT-4 发布之后,微软科学家 Sebastien Bubeck 发表论文称「GPT-4 是 AGI 的早期火花」。
其中设计了用 LaTeX 的绘图包 TiKZ 画一个独角兽的任务,用来说明 GPT-4 对语言中涉及的概念已经有了灵活的理解。
后来一路到 GPT-5.4,虽然画的越来越精致,但终归还是「简笔画范畴」。
到了最新 GPT-6,如果不说已经完全看不出来是用代码画出来的。
说它比「AGI 的早期火花」已经发生了质变,确实不为过。