多位开发者晒出 GPT-5.6 Sol 上手体验:代码生成能力令人惊叹,但有时会过度设计解决方案,实际生产仍需人工 review。
OpenAI 于 7 月初向全球的应用和 API 用户开放了 GPT-5.6 系列模型。
自发布以来,用户可以在三个模型版本中选择:Sol 作为最强版本;Terra 面向主流场景;Luna 则是快速、高效的日常任务选项。
Sol 源自拉丁语"太阳"一词,OpenAI 最初将 GPT-5.6 Sol 定位于更高的成本效益,能够"从每个 token 中获取更多有用工作",并配备了该公司迄今发布的最强大的安全防护体系。公司宣布了对高风险活动和敏感网络请求的更强保护,并"花费了数周时间寻找弱点",以针对真实攻击对系统进行压力测试。
然而,尽管做了这些充分的准备,开发者们似乎最感兴趣的还是 GPT-5.6 Sol 的核心功能和解决问题能力。
位于达拉斯-沃斯堡的内容自动化平台公司 BlogBuster 的 AI 研发负责人 Russell Twilligear 告诉 The New Stack,他一直在使用 GPT-5.6 Sol,并与 Anthropic 的 Claude Opus 5 的结果进行直接性能对比。
"Sol 在为我创建内容以及发现 Anthropic 模型错误方面做得更好;这简直让我震惊,"Twilligear 表示。
"我正在创建一个包含超过 300 万条记录的全国性数据库(美国),Sol 不断发现 Opus 犯下的错误并加以纠正。所以我做了一个角色互换:我让 Sol 创建数据库,然后让 Claude Opus 5 来检查,结果它并没有真正发现什么问题(只有一些非常微小的事项,不会产生影响)……所以目前来说,这个市场中各条线的划分还挺有挑战性的,"Twilligear 补充道。
"Sol 在为我创建内容以及发现 Anthropic 模型错误方面做得更好;这简直让我震惊。"
Twilligear 的对比很有趣,尽管它并不是一个完全对等的苹果对苹果的模型测试。用一个模型作为生成器、另一个作为审查器,并不一定意味着一个模型就比另一个"更好";它确实表明,在这些特定的生成或审计工作流中,两者的表现是不同的。
虽然这可能不是对模型评估的最终衡量标准,但它确实为我们提供了真实的开发者体验,这无疑是有价值的。
AI 驱动战略和技能公司 Concepts in Success 创始人、AI 治理与模型评估独立研究员 Joshua Estrin 博士告诉 The New Stack,在他看来,这种数据库对比场景确实是对开发者体验的一个有力洞察,但他认为"仅凭这一点还不足以"确定哪个模型更准确,"还需要将两个输出与真相的基准进行核对"。
"用一个模型生成工作、用另一个模型审查,它所衡量的是比整体模型质量更窄的东西,"Estrin 表示。"如果一个模型没有标记出另一个模型数据库中的错误,这可能更多说明的是它被提示或被配备来查找什么,而不是原始模型是否犯了更少的错误。在宣布赢家之前,我希望两个输出都能被对照 ground truth 检查——而不是简单地相互对照。"
"我使用 GPT-5.6 Sol 搭配 ultra 推理努力……它在更广泛的问题范围内都很有效果,在维持长时间、严谨的数学搜索方面也好得多。"
六个 Erdős 开放问题
位于纽约的哥伦比亚商学院博士候选人 Shouqiao Wang 在 X 上发帖称,他"在五天内解决了六个开放的 Erdős 问题",全部使用 OpenAI GPT-5.6 Sol 完成。正如所有中心欧洲逼近理论和离散数学爱好者所知,Erdős 问题是匈牙利数学家 Paul Erdős 提出的未解决的数学假设和问题。
"我有数学背景,但我使用的 Codex 工作流不需要深厚的数学知识,"Wang 发帖称。"[但] 秘诀在于模型选择。我使用 GPT-5.6 Sol 搭配 ultra 推理努力。与早期模型相比,它在更广泛的问题范围内都很有效果,在维持长时间、严谨的数学搜索方面也好得多。"
GPT-5.6 Sol ultra 推理级别高一级
让我们暂停一下,注意 OpenAI 将'ultra'定义为其最高能力级别,在并行工作流中协调多个 agent 以更快地完成复杂任务,这意味着多个子 agent 能够并行处理更大问题的不同部分。
在 low、medium、high、extra high 和 max 之后,ultra 高一级,因为它以更高的 token 消耗换取更强的结果和更快的 demanding 任务完成时间。虽然 OpenAI 在其最新的产品公告中列出了这六个级别,但该公司的其他页面也指定了六个级别,只是从'none'开始到 max 结束。不考虑这些 cosmetic 的标签分类约定,我们可以推断 Sol 有一个六速变速箱。
"然后我把提示粘贴到 Codex 中,设置为目标,然后让它运行,"Wang 详细说道。"原因是 Codex 可以长时间运行,保留完整的研究上下文,并使用本地文件,无需进一步交互。你需要耐心,给它足够的时间去探索,"他补充道。
"也许我发现的主要问题关于 Sol 5.6 是,它有一点过度工程的倾向。对于一些前端任务,我偶尔还是会跳到 Claude 或 Gemini 去解决较小的问题。"
言出必行,一位预订系统开发者的体验
位于苏格兰爱丁堡的旅游预订系统自动化软件公司 Viamki 创始人 Jean Bustinza 告诉 The New Stack,GPT-5.6 Sol 是他"现在首选的模型",而且理由充分。
"有时候,在要求它输出任何代码之前,我发现自己会就更高层次的任务进行长时间对话,这些任务过去感觉超出了这些模型的范围,比如更广泛的架构问题,"Bustinza 表示。
他将其比作在现实生活中"有点像在和一位高级软件开发者交谈"(但要注意的是,它偶尔会说一些毫无意义的话),Bustinza 热情地表示,总体而言,他从 GPT-5.6 Sol 获得的信息和推理非常有价值。
"也许我发现的主要问题关于 Sol 5.6 是,它有一点过度工程的倾向。对于一些前端任务,我偶尔还是会跳到 Claude 或 Gemini 去解决较小的问题,"Bustinza 补充道。
谁真正赢得了模型竞赛?
如果我们在寻找模型性能竞赛中的赢家,那么总体共识倾向于基于任何个体开发者正在努力将模型功能应用于什么的"这取决于"答案。
我们需要记住,一个人的前沿模型长时间跨度多日自主任务分析不一定等于另一个人的多轮任务完成和复杂科学网络研究工作负载——而且这还没有开始考虑每 token 成本和性价比。
让我们继续倾听开发者们怎么说。