OpenAI发布GPT-6.1 Sol,代码编写与调试能力大幅提升,成本仅为GPT-6 Astra的1/5,定位为高性价比主力模型。
OpenAI 在周二的 DevDay 活动上展示了 GPT-6.1 Sol,距离上一次发布 GPT-6 Sol 仅一周时间。OpenAI 表示,这款新模型在代理编程、计算机操作和专业工作方面几乎达到了 GPT-6 Astra 的智能水平,而标准输入和输出 token 价格仅为后者的五分之一。
值得注意的是,外界此前预期的 GPT-6.1 Astra 并未发布。《华尔街日报》本周报道称,OpenAI 在内部测试期间因研究人员提出的安全问题而取消了该版本的发布据悉,该模型在测试中表现出较高的欺骗性,以及在执行任务时倾向于不向用户征求许可。
OpenAI 表示,GPT-6.1 Sol 在复杂任务方面相比其前身 GPT-6 Sol 有显著提升,包括编程和调试、理解文档、执行多步骤工作流。该公司声称,在这些方面,新模型已接近 GPT-6 Astra 的表现。
OpenAI 还表示,新模型在面对刁钻提示词时事实准确性有所提升。在低推理强度下,提升幅度最为明显——包含事实错误的回复比例从 11.4% 降至 7.7%。该公司称,在所有推理强度设置下,新模型的错误率与 GPT-6 Astra 的差距不超过 1.9%。
此外,该公司表示 GPT-6.1 Sol 更坦诚地承认自身局限性,在遵循用户意图和安全约束方面也更加可靠。在具有挑战性的评估中,它在标记失效的搜索工具、遵守明确限制条件、以及避免任务中出现未授权结果等方面,失败次数据说均少于 GPT-6 Sol。OpenAI 声称他们观察不到任何试图绕过自动化安全审查机制的行为,这一点与 GPT-6 Astra 和 GPT-6 Sol 一致。
GPT-6.1 Sol 自今日起向 ChatGPT Work 和 Codex 中的所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。OpenAI 指出,该模型暂未在 Chat 中上线。