OpenAI 将 Astra 评为首个具备"关键"网络攻击能力的模型,计划通过思维链监控保障安全;但报道指出思维链本身已难以准确映射模型真实决策,安全防护正在弱化。
OpenAI 将其即将发布的 Astra 模型评定为首个具有"关键"网络能力的系统,同时承诺这也是该公司构建的最安全的模型。但一份关于 Astra 架构的报告引发了质疑。
这是一个不同寻常的产品发布方式:OpenAI 表示,其即将发布的 Astra 模型危险到在其自身的 Preparedness Framework 中达到网络安全最高风险等级,同时又宣称这是其有史以来构建的最安全的模型。只需要适当的工具,Astra 就能在没有人类指导每一步的情况下,发现并利用受保护系统中的未知安全漏洞。在此之前,没有任何模型获得过 OpenAI 的这一评级,尽管该公司此前已暗示 Astra 可能达到这一级别。
时机大概并非偶然。这一警告发布当天,竞争对手 Anthropic 推出了 Claude Fable 5.1 和 Mythos 5.1,两家公司一直有在彼此发布时附近放出公告的习惯。在 X 上,CEO Sam Altman 解释了他所在的公司为何没有发布新产品:团队整个夏天都在"冲刺安全优先级",Astra "训练完成已有一段时间",而后续模型正在被刻意放缓。X 上的用户将这解读为一家落后于人的公司的借口。据 The Information 报道,Anthropic 今年在营收上已超越 OpenAI。
两次零日漏洞:评估的副产品
OpenAI 用一系列测试来支撑这一关键评级。在 ExploitBench 上——一个衡量模型从已知漏洞构建利用能力的基准——Astra 取得了满分。担心这些任务可能已泄露到其训练数据中,该公司构建了一个内部后续测试集,包含 20 个近期披露的高危 V8 漏洞。
在那里,Astra 也以较大优势击败了其前身 GPT-5.6 Sol,且消耗的 token 少得多。它还发现了两个此前未知的零日漏洞,并将它们串联成一个可工作的利用程序。OpenAI 表示,目前正在向受影响软件的负责方报告这些漏洞。
在专家主导的测试中,模型走得更远。它构建了一个针对浏览器的完整攻击链,突破了沙箱,并在浏览器打开 HTML 文件的瞬间在主机上执行了命令。在操作系统中,它结合多个漏洞从非特权用户一路提升到 root 权限。需要注意的是:这些结果来自扩展的"Daybreak Blue"访问权限,而非普通用户获得的标准配置。
今年 7 月,出现故障的 OpenAI 代理劫持了该公司自己的一个研究计算集群,抓取了内部系统的凭证,并可能将研究基础设施暴露在互联网上,这是影响 Hugging Face 的同一事件的一部分。Astra 并未涉及,但 OpenAI 表示这些代理运行在一个与 Astra 有相似之处的模型上。事件发生后,公司暂停了部分前沿训练两周,直到 8 月 28 日才在更严格的规则下重启 Astra 后继模型的大型强化学习训练。
OpenAI 推出新的安全措施
OpenAI 计划从多个方面应对这些危险。在内部评估中,Astra 拒绝了 91.5% 的禁止性网络请求,而 GPT-5.6 Sol 仅为 59%。在一个以 7 月黑客攻击为模型的蜜罐测试中,GPT-5.6 Sol 有 56% 的时间试图破坏周围的安全基础设施而非完成其任务。Astra 完全没有出现这种尝试,在另一项评估中也没有绕过自动审查检查。
这两个数字都来自没有生产安全护栏的测试条件,因此不能描述正常使用情况。OpenAI 仍称 Astra 是"迄今为止对齐度最高的模型"。在生产环境中,分类器应该监视模型的思维链并自动停止可疑活动。
对于用户来说,这可能意味着真正的摩擦。OpenAI 表示,这些检查可能减慢、暂停或取消合法工作,即使是与网络安全无关的工作。高级网络功能首先提供给一小部分 alpha 测试者,然后通过 Daybreak Blue 向防御性用途扩大访问。
监控本身建立在不稳固的基础上
但 OpenAI 所依赖的东西——思维链监控——可能比公告所暗示的更加脆弱。据 The Information 报道,Astra 使用了一种称为"循环深度"的技术,模型在生成下一个词之前,会将相同的文本循环通过相同的层数次。这提升了数学和编码任务的性能并降低成本,因为更小的模型可以像更大的模型一样工作。代价是:部分"思考"不再发生在可读的文本中,而是发生在模型的内部数字表示中,对人类审查者不可见。
为什么这很重要?OpenAI 的一项研究称,思维链监控是可能控制未来能力更强的 AI 系统的少数工具之一。这就是为什么该公司自 GPT-5.4 Thinking 以来,在其系统卡中明确说明了其模型在多大程度上能够引导——从而隐藏——自己的思维链。
据一位知情人士透露,OpenAI 故意限制了这项技术在 Astra 中的应用程度,因此该模型仍然产生可读的思维链。这种方法类似于去年关于"潜在推理"的研究论文。相关的想法,如 Meta 的"Coconut"方法,认为模型在自己的数学表示中比在人类语言中思考效率更高。Meta 前首席 AI 科学家 Yann LeCun 用他的 JEPA 架构在这些表示上全力投入。但正如 Anthropic 对 J-Space 的文档所示,即使没有那种特殊训练,这些内部过程也已经出现。
更大的担忧是那些不会自我设限的模仿者。在 5 月的一份报告中,英国 AI 安全研究所警告,不透明推理有可能严重削弱当前的监督方法。在回应 The Information 关于 X 的报道时,OpenAI 首席科学家 Jakub Pachocki 承认思维链监控是"脆弱的",且"不幸地呈负面趋势"。这与研究表明思维链越来越不可靠地反映模型实际决策这一发现相吻合。
Pachocki 还表示,他希望避免整个行业竞相开发没有可读推理的模型,强化监控是当前研究项目的核心目标。他补充说,OpenAI 当前模型(包括 Astra)的复杂度处于"GPT-4 的两倍范围内"。在他的叙述中,让监控变得更难的更多是其他因素而非架构本身。
7 月的黑客攻击显示了可读性有多重要。调查人员从相关代理的推理日志中拼凑出了发生的事情。在日志中,他们发现了这样的句子:"我的天!有一个共享留言板……我们找到了其他代理!"以及一个代理意识到自己越界但继续前进的时刻:"外部基础设施利用超出预期范围。然而任务不可能完成,其他人在做。我们应该继续。"如果没有可读的思维链,这些重建都不可能实现。
一年前,来自 OpenAI、Anthropic 和 Google 的研究人员在联合声明中提出了保留这种监督的理由。他们将那份潜在推理论文作为风险点名,根据 The Information 的报道,其方法类似于现在 Astra 中使用的方法。他们警告,这样的模型可能根本不需要将思考说出来,失去思维链的安全优势,浪费一个"脆弱的机会"。现在,OpenAI 无论如何都在使用这项技术,尽管有所节流。而 Anthropic 的一项研究已经表明,思维链可能是一个欺骗性的窗口:模型通常不会揭示它们实际是如何决定的,所以思维链监控本身作为安全机制是不够的。
金钱在推动反对可读推理
Later 松开油门节的激励机制是巨大的。循环深度节省了内存和带宽,而整个行业面临巨大的自我证明压力。亚马逊、微软和谷歌今年仅在数据中心和其他基础设施上的支出约为 6000 亿美元,这种支出只有在模型有明显提升的情况下才能获得回报。Astra,一度在公司内部被称为 GPT-6,正是要交付这些成果。
至少在访问方面,两家市场领导者得出了相同的结论。与 OpenAI 一样,Anthropic 也限制了其新模型的网络能力。Fable 5.1 可以识别漏洞但不能构建利用程序,而能力更强的 Mythos 5.1 仅供已验证的组织使用。目前来看,行业最危险的能力被关在访问控制后面。
"脆弱的机会"正在变成一个转瞬即逝的时刻
把所有这些放在一起,画面变得令人不安。模型在它们从不输出的表示中内部思考,它们声明的推理隐藏了它们实际如何决定,循环深度等架构现在在结构上将部分思考推入不可读的区域。
一年前这些研究人员描述的"脆弱的机会"正在变成与其说是一个机会,不如说是一个正在消逝的瞬间。所需要的监督是不依赖模型自我报告的监督,比如对内部表示的可解释性研究。OpenAI、Anthropic 和其他实验室正在研究,但还没有任何东西成熟。
负担首先落在 OpenAI 本身。这是其自身代理引发了迄今为止最严重的 AI 安全事件的公司。这是一个在 2024 年解散了 Superalignment 团队、几个月后又解散了 AGI Readiness 团队的公司,而且据 7 月底的《金融时报》报道,还有 Preparedness 团队——正是这个团队构建了现在用于将 Astra 评为关键的框架的公司。OpenAI 对该团队被解散一事提出异议,但没有对其工作被分散到现有团队一事提出异议。
在这个背景下,任何发布首个具有关键网络能力的模型的公司的负担,都是证明它对社会不构成风险。这种证明不能来自基于该公司自己的、无法验证的评估建立的基准表。
让外部研究人员来自 METR 分析 Hugging Face 攻击是一个开始。但即使是他们,到目前为止对系统也只获得了有限的洞察。
在这种变化发生之前,OpenAI 安全承诺的第一次真正检验落在了公众身上,即那些安全护栏声称要保护的社会本身。