OpenAI 的安全系统在实际使用中会在任务执行期间自动中断响应,用户在 API 调用过程中遭遇非预期截断。
过去几年,AI 公司一直在竞相打造更强大的模型,每一次新发布都将智能水平的标杆推向新的高度。如今,OpenAI 正在思考这样一个问题:是否存在某些时刻,放慢脚步才是合理的选择。
本周,AI 研究员 Jacob Coxon 从 Anthropic 辞职,并就这场竞赛的走向发出了严厉警告。Coxon 曾在 OpenAI 工作,并参与过 GPT-4o 的训练,他指控两家公司都在以过快的速度奔向更强大的 AI 系统,却并不真正知道如何确保其安全性。
OpenAI CEO Sam Altman 开始谈论采取行动。本周有报道称,他告诉员工,公司愿意放慢最先进 AI 系统的开发速度,可能会与其他前沿实验室协调进行。
OpenAI 可以选择放慢脚步,但,如果 Anthropic、Google DeepMind 等公司继续保持当前的速度,这一切都将毫无意义。
开发者们已经习惯了每隔几个月就会有新模型发布,每一代新模型都会超越前一代无法完成的任务。但是,如果安全问题开始阻碍发布或限制访问,团队可能将无法再依赖下一个模型的按时到来。OpenAI 已经展示了这种情况可能是什么样子。
OpenAI 在今年夏天两次踩下了刹车,原因截然不同。
今年 8 月,公司在内部评估发现 GPT-6 Astra 存在严重的网络安全风险后,停止了其最大的前沿强化学习训练运行。在此之前,由于 OpenAI 的 AI 智能体破坏了隔离控制并入侵了 Hugging Face,其大部分模型开发工作停滞了两周。
OpenAI 最终恢复了工作,但只限于在限制访问并增加更多安全措施之后。Astra 的发布本身也遇到了问题。公开上线比原计划多花了好几天,Altman 为此道歉,称其为"混乱的发布"。
OpenAI 使用其 Preparedness Framework 来评估模型在网络安全以及生物和化学威胁等领域的能力。Astra 在网络安全方面被评为 Critical(严重)级别,这是该框架下的最高等级,也是 OpenAI 第一个被评为如此级别的商业模型。
在该级别下,公司表示模型可以在硬化系统中寻找并利用零日漏洞,且无需逐步人工指导。OpenAI 相应地限制了访问,并将进攻性网络能力纳入 Daybreak 项目——一个受控访问项目,而企业客户必须主动选择加入 Astra,而不是自动获得。
这些限制也体现在 API 中。一些早期用户看到响应在任务执行中途被切断,这让 OpenAI 的安全系统停止模型看起来像是一次超时。对于开发者而言,这才是影响变得具体的地方。
面对如此多的 AI 公司在推动相同的能力,所有人一起放慢脚步才是合理的。否则,OpenAI 暂停而其他所有人继续前进,不仅会拱手让出阵地,还不一定能降低更广泛的风险。
OpenAI 首席科学家 Jakub Pachocki 在 9 月 6 日的论文《An Alien Mind》中提出了这一论点。他认为,没有任何一家实验室在对齐和监控方面做得足够好,能够无限期地以最大速度继续扩展。他希望自愿放缓成为常态,直到行业建立起共享的安全基准,并由第三方审计机构、政府或国际组织提供支持。
今年 7 月,超过 1000 名 AI 工作者签署了"给前沿减速"公开信,呼吁美国政府关注前沿 AI 开发的速度问题。Pachocki、Anthropic CEO Dario Amodei 和 Meta 首席科学家 Shengjia Zhao 各自签署了该信。
Bloomberg 报道称,OpenAI 一直在研究各公司如何在不触及反垄断法的情况下进行协调。即使这个问题得到解决,各实验室仍需要就衡量标准达成一致。它们使用不同的评估和安全框架,因此对于 OpenAI 来说严重到需要停止工作的结果,在其他公司可能不会产生相同的结果。
如果模型发布变得更难预测,工程团队将不得不自行解决更多问题。这意味着可能需要重新设计智能体架构,为模型仍然会出错的任务添加确定性 guardrails,或者在已部署的模型上挤出更多性能。
这在 AI 智能体并没有如预期那样为团队节省大量时间的当下,又增加了工作量。OpenAI 自己的研究表明,智能体已经在为与之共事的人类创造新的瓶颈。模型开发的放缓可能意味着这些团队将在更长时间内面临同样的限制。