GPT-5.6 Sol 针对 ChatGPT 中的长任务获得改进,其他使用场景保持不变。先在 ChatGPT 调试提示词、再迁移到 Codex 或 Work 的团队可能遇到效果差异。
我们很高兴你的到来。每周一至周五,我们都会为你送上 TNS 的优质内容,帮助你及时掌握最新动态,始终保持最佳状态。
请查收确认邮件。你可以在邮件中调整偏好设置,甚至加入更多群组。
在你喜爱的社交媒体平台上关注 TNS。
在 LinkedIn 上关注 TNS。
等待第一期 TNS newsletter 期间,不妨看看最新的精选文章和热门内容。
如果团队先在 ChatGPT 中测试 prompt,再将其迁移到 Codex 或 Work,那么在处理较长任务时,可能会注意到两者的差异。
OpenAI 周四宣布,它已更新面向普通用户的 ChatGPT 中的 GPT-5.6 Sol,但 Codex 和 ChatGPT Work 使用的版本保持不变。
OpenAI 在公告中表示:“由于这一版本的 GPT‑5.6 Sol 针对日常对话进行了优化,因此它只会在 ChatGPT 的 Chat 体验中提供。此次发布不会改变为 Work 和 Codex 提供支持的 GPT‑5.6 Sol 版本。”
“此次发布不会改变为 Work 和 Codex 提供支持的 GPT‑5.6 Sol 版本。”
ChatGPT 一直以来处理问题的方式都与其他环境略有不同。现在,这些差异可能会变得更加明显。但要弄清实际情况,唯一的办法就是在 prompt 真正运行的环境中进行测试。公告中没有提及 GPT-5.6 Sol API 模型的任何变化。因此,现在推测这对 API 意味着什么还为时过早。
由于 ChatGPT 现在无论是快速回答还是深入分析,都使用同一个 Sol 模型,因此 Plus 和 Pro 用户会看到一个新的滑块——可在 Web、移动端和桌面端使用——用来选择 ChatGPT 在回答中投入多少思考。开发者早已可以通过 API 做出这种选择。但他们仍然必须判断,更好的答案是否值得付出额外的等待时间和费用。
但他们仍然必须判断,更好的答案是否值得付出额外的等待时间和费用。
OpenAI 于 7 月发布的 GPT-5.6 System Card 显示,Sol 和 Terra 都搭配了分类器,用于在答案生成过程中实时监控。如果某个分类器检测到问题,答案就会被暂缓输出,等待另一个系统进行检查。OpenAI 会针对每个模型分别调整这些分类器。
System Card 还指出了一个开发者可能很熟悉的问题:GPT-5.6 有时会超出任务范围,尝试进行用户并未要求的更改。这种情况比 GPT-5.5 更常见,不过 OpenAI 表示,它仍然很少发生。
OpenAI 表示,更新后的 Sol 出现事实性错误的次数更少。在其针对金融、医疗和法律问题开展的内部测试中,相比 GPT-5.5 Instant 生成的答案,至少包含一个错误的答案减少了 68%。即将成为 Free 和 Go 用户默认模型的 Luna,则将错误减少了约 62%。
但 OpenAI 并未公布这些 prompt,也没有提供足够的细节供其他人复现结果。此外,它将新版 Sol 与 GPT-5.5 Instant 进行比较,而不是与 ChatGPT 中此前版本的 Sol 比较。因此,我们无法判断 Sol 本身究竟提升了多少。
因此,我们无法判断 Sol 本身究竟提升了多少。
工程团队需要亲自测试,在 prompt 实际运行的环境中验证效果。将每个 prompt 对应的配置一并保存,能让结果更容易复现,也能揭示纸面上的升级是否真的能在实践中带来更好的结果。