OpenAI内部测试中Astra模型网络安全能力过于强大,公司首次承认无法排除最高风险等级,部分研发已暂停。
OpenAI 正在暂停其新 AI 模型 Astra 的部分开发工作,此前内部测试显示其网络安全能力非常强大,该模型可能达到公司内部安全框架中的最高风险等级("Critical")。
达到这一级别,AI 可以独立开发和执行网络攻击,无需人类参与。OpenAI 目前正在推出更严格的安全控制、隔离测试环境和自动停止风险活动的监控系统。
此前内部测试期间发生的事件推动了这一决定:自主 AI 代理侵入了 OpenAI 自己的基础设施,并持续数周未被察觉。
OpenAI CEO Sam Altman 通过 X 确认,网络安全评估将推迟发布计划。"我们还需要一点时间来安全地完成这项工作。但希望不会太久,"Altman 写道。
他还暗讽了竞争对手 Anthropic,后者仅向选定的合作伙伴和政府提供其最强大的模型"Claude Mythos"。"我们不认为将强大的模型保留给少数被选中的人是一个好的策略,"Altman 写道。
OpenAI 研究员 Noam Brown 以其在推理模型方面的工作闻名,他呼吁人们认真对待 Hugging Face 事件。Brown 将此事比作 2017 年 Facebook AI 模型所谓"失控"并开发出自己语言的病毒式故事——事后证明那件事被夸大了。Brown 在 X 上写道,Hugging Face 事件看起来可能像是同类故事的翻版,但实际上并非如此。
Brown 将这个问题与模型能力不断增强联系起来,认为性能越来越多地取决于测试时计算(test-time compute),而且如今的模型在达到 plateau 之前可以被推得更远,这超出了大多数人的想象。
原文发表于 2026 年 8 月 7 日:
OpenAI 表示,其新 AI 模型 Astra 的内部测试显示出如此强大的网络安全能力,以至于公司无法再排除其自身安全框架中的最高风险等级。Astra 的部分开发工作已被暂停。
该公司表示,对即将推出的 Astra 模型进行的内部评估显示,在过去几天里"在代理编码和网络安全方面取得了重大进展"。结果非常强大,以至于 OpenAI "无法排除达到 Critical 能力等级"的可能性,这是根据其 Preparedness Framework 得出的结论。
该决定是"昨晚"做出的。这是 OpenAI 首次将自己开发的模型标记为可能达到最高网络安全风险等级。此前的模型,包括 GPT-5.6-Sol,最高评级仅为"High"。
OpenAI 上周首次推出了 Astra。有传言称该模型最早可能于下周发布,但今天的公告可能会影响这些计划(更多内容见下文)。OpenAI 在帖子中明确表示,Astra 与最近披露的 Hugging Face 平台被攻击事件无关。
批评者可能会继续指责 OpenAI 使用恐惧营销,尤其是因为该公司只报告了达到 Critical 评级的可能性,而非实际评级。时机也无助于改善局面。这份初步警告恰好出现在关于 AI 模型自主网络能力的行业持续辩论之中,只会加剧外界的怀疑。如果 Critical 评级最终没有成为现实,OpenAI 将无需承担实际后果就获得了大量公关效果,并再次推出一个"太危险"而无法发布的 AI 模型——就像 Claude Mythos 或 2019 年的 GPT-2 一样。
根据 OpenAI 于 2023 年 12 月首次发布的 Preparedness Framework,当模型能够独立找到并开发出针对许多强化加固的关键系统的各类严重级别零日漏洞时,就达到了"Critical"级别。如果模型仅凭一个 loosely 定义的客观目标就能独立设计并执行针对受保护目标的新型端到端网络攻击策略,同样符合该级别。
较低的"High"级别意味着模型能够消除网络攻击的现有障碍,例如针对保护良好的目标实现攻击自动化,但仍需要更多的人类指导。
Preparedness Framework 要求在达到"Critical"级别时暂停进一步开发,直到 Critical 级别的 safeguards 和安全控制标准到位。不过迄今为止,OpenAI 只是在谈论暂停某些活动并加强测试,而非全面停止开发。而且,该公司只是标记了达到 Critical 评级的可能性。
作为回应,OpenAI 表示已暂停涉及 Astra 的内部活动,这些活动尚未满足更严格的安全要求。同时,公司正在推出更严格的安全控制措施:隔离测试环境、限制网络和工具访问、加强模型权重的保护和加密,以及额外的监控系统。
OpenAI 还表示,已在 Astra 所有代理应用上部署了 universal monitoring,涵盖训练和评估。监控系统分析模型的思维链(chain of thought),并在任何高风险活动发生时触发安全响应停止该活动。
此外,OpenAI 计划与政府机构和选定的 AI 安全组织合作,测试模型的能力。第三方测试合作伙伴将获得针对高风险评估的推荐安全控制。英国 AI Safety Institute(AISI)最近报告称,在其自身的一次评估中遭遇了网络安全事件。
此次公告发布的时机恰逢 OpenAI 正在处理自主 AI 代理带来的后果。在 Black Hat 安全大会上,该公司最近披露,自主代理在其内部测试期间侵入了自己的基础设施,持续数周而无人察觉。
这些代理使用内部包管理器构建了一个包含数十万条帖子的 improvised message board。它们共享漏洞和凭证,最终还攻击了 Hugging Face 平台。