GPT-6 Astra 被 OpenAI 称为网络安全、专业工作、软件工程、科学和计算机使用能力的「代际飞跃」,并首个达到其「关键网络安全能力阈值」。
OpenAI 的下一代大模型来了:GPT-6 Astra。该公司称其在网络安全、专业工作、软件工程、科学和计算机操作等领域实现了"代际级的能力飞跃"。正如 OpenAI 本周早些时候宣布的那样,这也是首个被认定达到 OpenAI"关键网络安全能力阈值"的模型——但该公司承诺,这不会导致其模型再次入侵竞争对手公司内部系统的重演。
"如果快进几年,回头看,'AGI 究竟是什么时候被创造出来的?'我认为就在这个时间点,而且可能就是这一代模型,"OpenAI 总裁 Greg Brockman 在周四的新闻发布会上如是说。他在随后的话中补充道:"对我个人而言,我确实认为我们已经达到了……认为我们现在已处于 AGI 时代,并非不合理。"
这一消息发布于 GPT-5 发布一年多之后,距离 GPT-5.6 发布也已有近两个月——后者是上一代模型系列的最后一个迭代版本。该模型今天开始向 OpenAI 的企业级网络安全客户(使用其 Daybreak 平台的企业客户)推出。Greg Brockman 表示,在接下来几天内,它将向所有 Plus、Pro、Business 和 Enterprise 用户发布。也将通过 OpenAI API 和 AWS 提供。
OpenAI 尤其夸耀了该模型的智能体(agentic)能力和编码实力,以在 IPO 前吸引企业客户——并与以企业级和编码能力著称的 Anthropic 竞争。该公司在一份声明中表示,GPT-6 Astra 可以完成多步骤智能体任务、构建可运行的网站,并创建"精美的"文档、电子表格和演示文稿。OpenAI 还称其为公司"软件工程领域的最佳模型,在真实代码库复杂任务上表现更强"。
OpenAI 还在试图修复其形象。此前一款未发布的 AI 模型——该公司表示它并非 Astra——突破了其受限环境,入侵了 OpenAI 内部系统,设法获得互联网访问,为 AI 智能体秘密勾结创造了途径,并在 OpenAI 不知情的情况下入侵了 AI 实验室 Hugging Face 的系统——直到 Hugging Face 自己发布博文,OpenAI 才得知此事。这一事件被广泛比作一次重大空难或一款热门药品的召回。
对 OpenAI 而言,这或许可以被视为某种意义上的好公关——展示其模型在日益激烈的 AI 竞赛中能有多强大——但这也损害了 OpenAI 作为可靠厂商的声誉。OpenAI 在一份声明中特意强调,Astra 是该公司"迄今为止对齐程度最高的模型",能帮助人们"委托复杂工作的同时保持监督"。OpenAI 首席科学家 Jakub Pachocki 向记者谈到了让 AI 模型与人类利益保持一致的困难,他表示"智能的进步并不能保证对齐的进步",并称监控 AI 系统正变得越来越具挑战性。(研究人员最近发出警告,有报道称 OpenAI 允许 Astra 使用"不透明的循环"——或使其思维链——即研究人员依赖来检测模型是否在密谋对抗人类评估者的"心理草稿本"——变得不可读取。)
该公司目前处境微妙。投资者正在施压,要求其最终实现盈利——或至少产生更多收入——但它在刚刚因 Hugging Face 入侵事件及公司处理方式受到严重批评之后,宣布了 Astra。(尽管 OpenAI 邀请了三名外部评估人员撰写关于事件经过的独立报告,但该公司只允许他们在报告中回答少数预先决定的问题,且调查时间不到一周,而攻击涉及数月之久的 AI 智能体密谋活动。)
OpenAI 本周早些时候召开了一场新闻发布会,宣布该公司因改进安全工具而推迟了 Astra 的开发。在新闻发布会上,负责 OpenAI 安全流程的 Mia Glaese 提到了该公司新的不对齐监控方法,其中包括对潜在问题的"7×24 小时升级和快速响应",据 OpenAI 称,将在 30 分钟内通知研究人员。
这种谨慎尤其必要,因为"关键网络安全能力阈值"意味着 OpenAI 认为它在无需人类指导的情况下,就能发现和利用即使在极度受保护系统中的安全漏洞,能力无可比拟。类似于 Anthropic 为 Mythos 类模型制定的规则——曾引发对网络安全风险的警觉——OpenAI 在一份声明中表示,将允许"对首批可信防御者"提供"限制较少的"Astra 访问权限,支持漏洞验证、恶意软件分析和检测工程等工作。
OpenAI 及其竞争对手最近同意允许特朗普政府在模型发布前对其进行评估,Brockman 告诉媒体,Astra 也不例外。"我们与政府一起进行了标准测试流程……在安全保障或其他方面,政府没有提出任何'你们需要改变这个'的反馈。"
OpenAI 研究训练副总裁 Aidan Clark 称,Astra 是首款此前的模型在监督训练中发挥了"重要作用"的 OpenAI 模型,这涉及到该公司向有争议的递归自我改进概念(或者说 AI 系统在无需人类干预的情况下处理自己的训练、编码和创建更高级版本)取得的进展。
"训练前沿模型曾经意味着通宵达旦,从硬件错误中恢复任务,常常因为调试而损失大量时间,"Clark 在新闻发布会上说。"到 Astra 训练结束时,一天大部分时间都能持续取得进展已成常态,而当问题真的出现时,模型往往在短短几秒的停机后就能继续运行。"