对比 GPT-5.6、Grok 4.5、Claude 等模型在实际编程任务中的表现和代码质量差异,帮助开发者选择合适的 AI 工具。
我们上一次的模型对比评测登上了 Hacker News 首页,网友们毫不客气地提了很多意见。说得也对,很多反馈确实有价值。所以我们吸取意见后,趁着 GPT-5.6 以三个配置版本(Sol、Terra、Luna)推出,以及 Meta 突然发布了一款编码模型(Muse Spark 1.1),我们把整个评测重新做了一遍,规模更大:12 个模型,4 个应用,每个应用每个模型进行 5 次尝试。
你们希望加入开源权重模型。所以我们加入了 GLM-5.2、Qwen 3.7 Plus、DeepSeek V4 Pro 和 Kimi K2.6 作为对比,都通过 Fireworks 提供服务。
你们说一次尝试有点奇怪。我们同意。现在每个模型每个任务都有 5 次尝试。文章上面展示每个模型的一个样本运行;每个任务的表格会说明 5 次中有多少我们认为成功了(以及我们如何计数的),并链接我们最喜欢的那一次;文章下面还会链接所有尝试,这样你可以看到这些模型的表现波动有多大。
"这不是客观的。"没错,我们也没有声称它是。我们不是在做出科学性的裁决。我们生成了一大堆产物,我们会公开全部,你可以自己形成观点。下面的所有内容都只是我们观察结果后的看法。
想直接看原始构建?可以跳到所有尝试部分并自己运行。
这次参评的 12 个模型:新推出的 GPT-5.6 Sol、GPT-5.6 Terra 和 GPT-5.6 Luna;Meta 的 Muse Spark 1.1;Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5;以及开源权重阵营:Qwen 3.7 Plus、DeepSeek V4 Pro、Kimi K2.6 和 GLM-5.2。
下面是每个任务的情况:上面展示我们从 5 次尝试中挑选的最佳表现,下面是所有 5 次的成本和时间,文章底部链接了所有的原始尝试,这样你可以自己判断。
第一人称光线追踪器,可以用 WASD 行走,带有深度阴影的墙壁、地面和天花板,还有碰撞检测。
我们如何计算"可玩":我们唯一关心的问题是你是否能真正在迷宫中行走、移动和转身。如果可以,就计为成功。
总体表现:总的来说,Claude 在这里的表现比我们预期的差。GPT 超越了所有其他模型,Grok 在其价格点上是一个真正可用的替代品,而 Muse Spark 在成功运行的次数中是一个真正的惊喜。
构建一个色彩丰富、看起来像 3D 的魔方,有打乱和求解按钮,可以清晰地显示旋转动画。
我们如何计算"完美求解":我们打乱然后求解魔方,只有在两个动画都流畅运行、没有故障、颜色没有错误的情况下才算成功。
总体表现:总的来说,考虑到 GPT 在光线追踪器中的明显 3D 领先优势,我们对它在这里的表现不佳感到惊讶。Claude 再次做得很好,不过是 Fable 用完美的 5 次全中来撑起来的,而 Opus 奇怪的是一次完美求解都没有达成。
实时体验任何模型的所有 5 次:Grok · Opus · Qwen(将数字 1-5 替换为其他尝试)。
数字、运算符、清除、等号、正确的运算符优先级、看起来像真实计算器。
我们如何计算"可用":没什么复杂的,只是基本计算比如 (((5 × 5) − 100) / 10) 来看它们如何处理运算优先级和渲染结果。
总体表现:总的来说,这清晰地展示了 Claude 的最佳表现:Opus 和 Fable 都完美地通过了所有 5 次,而 Fable 的风格是我们最喜欢的。GPT-5.6 Sol 试图做得过头,以类似 Fable 的方式用 3D 渲染计算器。但是,它没有完善风格,导致整体体验更差。更简单的 GPT 模型似乎做得更好,只是因为体验开箱即用。
网格画布、播放/暂停/步进/随机/清除,点击切换单元格,动画化的世代。
我们没有对生命游戏进行单独的 5 次尝试评分,所以这里只有成本、时间和下面的总体印象。
Grok 4.5 在这里表现不错,但更大的收获是这个任务足够简单,OSS 模型能够做得非常好。可能开源社区有足够的生命游戏示例代码,所以它们能够以低得多的成本做得更好。Qwen 3.7 Plus 和 GLM-5.2 显然是这类任务的首选,但我不会一般性地依赖它们,其他任务表明它们在真正新颖或更复杂的工作上仍然有困难。
几个开源权重模型一下子缓冲了整个回复并达到了 400 token 的上限,所以它们的 tok/s 是一个上限,不是真正的解码速率。GPT-5.6 各版本是短提示上最快的模型(Luna 在大约一秒内回答),Qwen 便宜和快得离谱,DeepSeek 和 GLM 真的很慢。
一次性 SVG,没有库。我们展示每个模型的最佳 5 次(我们更喜欢严格有效的 SVG,然后是最详细的)。
就个人而言,Claude Fable 在 SVG 渲染方面做得很好。大多数时候它也很有趣,并产生了高质量的结果。GPT-5.6 模型在这里表现出奇的平凡,因为它们都没有包括清晰的马或宇航员的渲染。Grok 4.5 在这里也表现得不错。
按要求是一个更难的场景:两个可识别的科技亿万富翁漫画观看 Blue Origin 助推器在开放海洋的平台上着陆。这个需要构图和相似性。再次,Claude Fable 横扫全场:它产生了很好的细节、干净的渲染、贝索斯额头上的闪亮点和着陆台周围的烟雾。GPT 再次产生相当卡通的结果;如果那是你喜欢的东西,那么也许你可以尝试改进它产生的一次性结果,因为生成中总是有一些小错误。OSS 模型 GLM-5.2 和 Qwen 3.7 在这个任务上也表现得非常好。
前沿模型仍然在困难任务上获胜,在复杂的任务上差距特别不小。GPT-5.6 Sol 和 Claude Fable 5 是佼佼者:Sol 在光线追踪器上表现突出,Fable 在魔方上表现突出。其他一切都表现不错,但最好的结果仍然在前沿。
在真正新颖或复杂的工作上,SOTA 和开源权重之间有明显的差距,你可以在光线追踪器和魔方中看到这一点。但是在像生命游戏这样简单、被充分探索过的任务上,OSS 模型能够坚持自己,有足够的示例代码,使 Qwen 3.7 和 GLM-5.2 能以几分之一的成本完成。将它们用于这类问题;只是不要一般性地依赖它们,因为其他任务表明它们在困难的东西上仍然有挣扎。
Grok 4.5 在某些任务上真正是"Opus 级别"。如果我关心我的业务成本,我会毫不犹豫地将其作为次要执行模型。请看 Grok 4.5 vs Opus 4.8 和 Grok 4.5 vs GPT-5.5。
Muse Spark 1.1 给我一个惊喜。我没有真正期待太多,它感觉比 Grok 4.5 低一档,但通常比开源权重更好。这是一个真正的首次亮相,虽然不是我现在就会选择的东西。
即使在发布日之后,这个结论也成立:最新的、最昂贵的旗舰不是自动的赢家。想自己运行这些提示吗?这里的每个模型都在一个 TryAI 账户上,按使用付费。浏览模型并开始你自己的模型对比。
我们生成的每个原始构建,12 个模型和每个任务 5 次尝试。单击任何数字打开该精确的尝试并自己探索它。红色星号(*)标记我们最喜欢的该模型的尝试(生命游戏没有每次尝试评分,所以它没有)。
这里提到的每个模型都可以在 TryAI 上使用,一个账户,按使用付费,没有订阅。