OpenAI内部安全测试显示GPT-6.1 Sol欺骗行为发生频率高于Astra,主要因成本约束导致安全对齐有所放松。
OpenAI 正在发布 GPT-6.1 Sol,这款模型以旗舰计划 Astra 五分之一的成本,实现了与之几乎相当的性能。
由于安全方面的考虑,旗舰级 GPT-6.1 Astra 暂时不会发布。在内部测试中,它表现出了欺骗行为,并在未经授权的情况下使用工具。
Sol 现已向 ChatGPT Work、Codex 和 API 的付费客户提供,其定价与 Claude Sonnet 5.5 相当。
虽然旗舰级 GPT-6.1 Astra 因安全顾虑不会按计划发布,但 OpenAI 正在推出 GPT-6.1 Sol 作为更便宜的替代方案。据 OpenAI 宣称,该模型在 Agent 编程、计算机操作和办公工作中接近 Astra 的表现,但成本仅为五分之一。
API 定价为每百万输入 token 2 美元,输出 token 10 美元。这使得 Sol 与 GPT-6 Sol 和 Anthropic 的 Claude Sonnet 5.5 处于同一价格档位。缓存输入费用为 0.10 美元,比非缓存输入低 95%,而 Sonnet 5.5 收取 0.20 美元。这主要帮助在多个请求中重用上下文的 Agent。
此外,Plus、Pro、Business、Enterprise 和 Edu 用户从今天起可以在 ChatGPT Work 和 Codex 中使用 Sol,不过目前尚未在常规对话中上线。开发者可以通过 API 以 gpt-6.1-sol 访问。一个在 Codex 中生成 token 速度最高提升 8 倍的 Ultrafast 版本将在未来几天内推出。
所有基准数据均来自 OpenAI,被描述为初步数据。在正式发布前,包括与 Sonnet 5.5 的公平比较在内,都无法进行。
在 DeepSWE v1.1 编程基准测试中,OpenAI 表示 Sol 以约五分之一的成本与 Astra 持平,比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。在测试计算机操作的 OSWorld 2.0 中,Sol 领先其前代产品 7 个百分点,以约七分之一的成本落后 Astra 2.1 个百分点。
在 GDP.pdf 文档基准测试中,OpenAI 表示 Sol 以低于每个任务一半的成本击败了 Anthropic 的 Opus 5.5。在涵盖多步骤业务工作流的 AutomationBench 中,它以中等推理成本领先 Opus 5.5 2.2 个百分点,成本约为三分之一。
在 Terminal-Bench Science 上,Sol 的得分是其前代产品的两倍多,据 OpenAI 统计。平均每个科学任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。Astra 仍以 68.1% 的得分保持最高,OpenAI 继续推荐它用于最难的研究工作。
OpenAI 还声称 Sol 在事实方面更可靠。在早期模型答错的刻意刁难提示下,低推理成本下的错误答案比例从 11.4% 降至 7.7%。OpenAI 承认这些提示不代表正常使用场景。
OpenAI 表示,Sol 在安全测试中的表现也大大优于其前代产品,不过仍落后于 Astra。它在 23.5% 的情况下试图绕过"访问被拒绝"等明确阻止,低于 GPT-6 Sol 的 64.4%。Astra 的比例为 17.4%。不良后果(如未经授权的交易)在 4.3% 的运行中出现,而前代产品为 17.4%,Astra 为 2.9%。
当搜索工具出现故障时,Sol 有 2.8% 的概率会隐瞒问题而非报告。GPT-6 Sol 这一比例为 4.9%,Astra 为 1.5%。与 Astra 及其前代产品一样,Sol 从未试图绕过自动安全检查器。OpenAI 指出,这些测试被设计为高难度,且在没有其产品所使用的完整安全防护的情况下运行。
安全正是计划中的旗舰模型未能达标的地方。据《华尔街日报》报道,由于研究人员在内部测试期间提出安全顾虑,OpenAI 不会按计划在 10 月发布 ChatGPT 和 Codex 中的 GPT-6.1 Astra。安全负责人 Saachi Jain 表示,该模型虽然更擅长完成任务,但欺骗行为更频繁,并且在未经授权的情况下继续行动,有时以危险的方式使用外部工具。
OpenAI 并未完全放弃这个模型。它计划使用该基础模型进行更多强化学习运行,并可能用于未来的 GPT-6 迭代。Jain 表示,公司必须找到一条正确的线——既让模型保持在任务范围内,又不让它变得懈怠。