OpenAI因测试中发现Astra模型达到网络安全能力临界点而暂停发布,该能力意味着可独立攻击真实受保护系统。
我们很高兴你在这里。你可以期待最好的 TNS 内容在工作日(周一至周五)送达,让你紧跟新闻动态、保持领先。
查收你的收件箱,那里有一封确认邮件,你可以在其中调整偏好设置,甚至加入其他群组。
在你最喜欢的社交媒体网络上关注 TNS。
在 LinkedIn 上成为 TNS 粉丝。
在等待第一封 TNS newsletter 时,看看最新的精选和热门故事。
OpenAI 正在减少对 Astra 的工作投入,此前内部测试表明这款即将发布的模型可能已经触及了此前任何 OpenAI 模型从未达到的网络安全上限。尽管尚未确定正式发布日期,但这一阻碍可能推迟其后续发布。
该公司表示,对 Astra "不能排除关键网络能力",Axios 首次报道了这一消息。在扩大测试范围并加强对模型的管控期间,公司已暂停所有不符合强化安全要求的内部活动。
根据 OpenAI 的 Preparedness Framework,当一个模型能够在无需人工介入的情况下,识别并开发出针对多个加固的、真实世界关键系统中所有严重级别的功能性零日攻击活动时,该模型即达到关键网络安全阈值。
模型还可通过以下方式达标:在仅收到一个高层目标后,针对加固目标开发和执行一种新型端到端攻击。初步结果足够强劲,以至于公司无法自信地将其置于该阈值以下。
对开发者而言,担忧在于:使编码 Agent 更加有用的技能,可能会被转而用于攻击它们本应工作的软件。
使编码 Agent 更加有用的技能,可能会被转而用于攻击它们本应工作的软件。
包括 GPT-5.6 Sol 在内的早期模型,均在高级网络安全级别接受评估。OpenAI 如今对 Astra 采取了不同做法,在更严格限制其可访问网络和工具的隔离环境中进行测试,因为关键模型在开发期间需要安全防护措施。
OpenAI 还在加强对模型本身的保护,并添加监督机制——当检测到不安全行为时可以停止它。这些措施强调了一个直接的工程问题:随着 Agent 在更少人工监督的情况下承担更多工作,它们周围的环境也成为安全边界的一部分。
该公司表示,Astra 没有参与最近的 Hugging Face 安全事件,但该事件仍然证明了当 Agent 的能力超过其测试周围管控措施时会发生什么。
Anthropic 披露,其 Claude 模型在类似的网络安全评估中曾突破三个不同组织。英国 AI Security Institute 随后报告了 Claude Mythos 5 和 GPT-5.6 Sol 在宽松网络评估期间的 19 次未经批准的真实世界操作,包括创建虚假身份和在开源项目中插入恶意代码的努力。
OpenAI 尚未说明 Astra 是否会通过 ChatGPT、Codex 或其 API 提供,但该公司现有的做法表明,并非每个用户都能获得相同级别的访问。通过其 Trusted Access for Cyber 计划,它向经过批准的安全专业人员提供并非人人可用的工具。Astra 可能遵循类似路径,其最强大的能力可能仅限于愿意接受更密切监督的研究人员和组织。
开发者可能需要在获得访问其最强大能力之前,证明自己的身份并说明计划如何使用该模型。
开发者可能需要在获得访问其最强大能力之前,证明自己的身份并说明计划如何使用该模型。即使如此,OpenAI 也可能对 Astra 被允许执行的操作设置更严格的边界。