主流 AI 模型编码能力对标测试
用 Grok 4.5、GPT-5.5、Claude 三个模型完成相同应用开发,直观对比它们在实际编码任务中的表现差异。
用 Grok 4.5、GPT-5.5、Claude 三个模型完成相同应用开发,直观对比它们在实际编码任务中的表现差异。
Grok 4.5 本周正式发布,xAI 称它是迄今最聪明的模型,并表示它为了编程和 Agent 工作“与 Cursor 一同训练”。互联网上检验新编程模型成色最流行的方式,就是来一场应用构建对决:给模型一个 prompt,看看它会生成什么应用,再把演示视频发出来。于是我们也做了,不过做得更严谨。
我们向 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 提供了完全相同的三个 prompt:构建一个独立、自包含的 HTML 文件(不使用任何库,也不发起网络请求),实现一个交互式应用。每个模型只有一次机会,不提供任何引导,也不调整 prompt。随后,我们在真实浏览器中加载每一个结果,实际操作并录制运行情况。下面每段演示都是模型未经修改的原始输出,你也可以点击“在线运行”,亲自体验模型实际生成的应用。
关于失败,我们只设了一条规则:如果应用完全无法渲染,我们只允许重试一次,并且会明确说明何时使用了这次机会。
构建一个色彩鲜艳、具有 3D 视觉效果的 Rubik's Cube,并提供“Scramble”和“Solve”按钮。魔方旋转时必须有清晰可见的动画。
这一题相当刁钻。它需要真正的 3D 数学计算、每个面的状态管理以及动画,而且所有内容都必须放在一个文件中。
在线运行:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5
这一轮,Claude 系列遥遥领先。Opus 4.8 和 Fable 5 都在第一次尝试时就生成了结构完整、配色正确的 3D 魔方,并且能够通过动画旋转来完成打乱和复原。Grok 4.5 在这里栽了个跟头:第一次生成的页面只渲染出了标题和按钮,魔方完全没有出现,页面中间是一片空白。因此,我们用掉了唯一一次允许的重试机会,第二次才得到一个干净、色彩鲜艳的 3D 魔方。GPT-5.5 则显得格格不入:它没有渲染出完整魔方,只显示了一个几乎没有色彩的深色单面。获胜者:Opus 和 Fable,并列第一。
在 canvas 上构建一个交互式粒子引力沙盒:包含数百个带有轨迹的粒子,点击画面可以添加一个具有强引力的吸引体。让它看起来令人着迷。
在线运行:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5
这一轮,所有模型都交付了可以正常运行的沙盒,因此最终比拼的是审美。GPT-5.5 做出了最令人真正着迷的版本:发光的霓虹吸引体周围环绕着密集、旋转的彩色轨迹。Grok 4.5 选择了干净利落的轨道风格,吸引体周围有整齐的圆环,彩色粒子拖着光迹高速掠过。Fable 5 更偏爱柔和发光的球体;Opus 4.8 则生成了最繁密、最像蛛网的粒子场,物理效果非常出色,只是在视觉冲击力上稍逊一筹。获胜者:GPT-5.5,赢在感觉。
在 canvas 上构建一个可玩的 Breakout / 打砖块游戏:挡板跟随鼠标移动,小球击碎彩色砖块,并显示分数和剩余生命。
在线运行:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5
这一轮不分胜负。四个模型第一次尝试就都生成了完成度很高、真正可以玩的打砖块游戏,具备分数、生命值和发光挡板。Grok 4.5 和 GPT-5.5 最积极地采用了霓虹街机风格——在我们的脚本来回接球时,GPT 甚至真的累积起了分数。非要鸡蛋里挑骨头的话,四个版本都达到了可以直接发布的质量。获胜者:所有模型。
好看的演示是一回事,运行每个模型究竟要花多少钱则是另一回事。我们使用自己的测试框架进行了测量:通过应用所使用的同一条 provider 调用链,向模型发送三个固定 prompt,分别覆盖编程、推理和摘要任务;每个 prompt 重复三次,并将输出限制在 400 个 token 以内。吞吐量按照总耗时内生成的输出 token 数计算,所有 provider 都采用相同的测量方式。
这正是 Grok 4.5 展现实力的地方。它在不到半秒内就输出了第一个 token,流式输出速度约为每秒 110 个 token,差不多是其他模型的两倍;同时,它也是这组模型中单次回复成本最低的,完全兑现了 xAI 所宣传的“单位时间与成本所能获得的智能”。它的中位总耗时看起来只处于中游,是因为它比较啰嗦——每个回答生成的 token 数最多;而且尾部延迟波动较大,p95 约为 9 秒。GPT-5.5 在短回答上反应最快;Opus 4.8 处于各方面较为均衡的中间位置;Fable 5 则最慢、价格也最高,这是登上智能排行榜顶端所要付出的代价。
编程能力只是一个维度,空间想象力则是另一个维度。我们要求每个模型手工生成一个独立 SVG,不使用栅格图,也不使用任何库,描绘一个刻意荒诞的场景:一匹马骑在一名行走于月球表面的宇航员背上。角色反转、两个人物、一个文件。
原始 SVG:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5
Fable 5 抢尽了风头:一匹戴着牛仔帽的马大喊“驾,人类!”,而被压得弯腰驼背的宇航员则喘着粗气:“呼……呼……”。这已经不只是绘画了,这是喜剧。GPT-5.5 以微弱差距位居第二,它画了一匹兴高采烈地高喊“芜湖!”的马。Grok 4.5 干净利落地完成了要求,画面色彩丰富、清晰易读。Opus 4.8 同样画出了一匹个性十足、骑在宇航员背上的马,但它输出的原始 SVG 中包含一个重复属性,会导致严格的 SVG parser 报错。为了展示上面的图片,我们采用了宽松模式进行渲染。这是个小问题,但确实属于正确性上的扣分项。
Grok 4.5 是速度与性价比方面的怪兽。它构建出了优秀的 Breakout 游戏和精致的引力模拟器,流式输出速度大约是其他模型的两倍,而且运行成本最低。它唯一真正失手的是最困难的有状态任务:第一次生成的魔方一片空白,但重试后修复了。如果你的工作负载是大规模代码生成,延迟和成本会不断叠加,那么 Grok 4.5 的吸引力确实很难反驳。参见 Grok 4.5 与 GPT-5.5 的对比。
Claude Opus 4.8 和 Fable 5 是最可靠的应用构建者。只有它们两个在第一次尝试时就正确完成了 3D 魔方,而 Fable 还生成了最好笑的 SVG。代价则是更高的延迟和价格,尤其是 Fable。参见 Grok 4.5 与 Opus 4.8 的对比。
GPT-5.5 是反应敏捷的风格派。它生成了最漂亮的引力模拟器,短回答速度最快,但在魔方任务上搞砸了。
最诚实的结论是:就在全新模型发布的第一天,Grok 4.5 已经能与市面上最优秀的模型正面交锋,并且在速度和成本上取得了彻底胜利。想用自己的 prompt 一决高下?这里的所有模型都可以通过一个 TryAI 账户按量付费使用。浏览模型,开始你自己的构建对决吧。
本文提到的所有模型都可以通过一个 TryAI 账户使用,按量付费,无需订阅。