通过创意测试对比 GPT、Claude、Gemini 等模型的差异。249+ points 高热度,帮助程序员直观认识不同模型的特点和表现。
我们构建了一个绘图竞技场:给模型一张空白的白色画布和一套有色铅笔工具,然后闪开。模型设置颜色、笔尖宽度和压力,铺下一批笔画,进行混合、擦除,并调用 view_canvas 来查看自己的作品并决定需要修复什么。它可以复制目标图像或根据文本提示进行绘制。
我们运行了四个视觉模型,GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash,针对两个目标(蒙娜丽莎和梵高的《星月夜》,两者都进行了客观评分)和五个开放式提示,总共 28 幅绘画。我们将涵盖工具使用、成本、输出,以及模型是否实际改进了它们的工作,最后给出我们的意见。
关于为什么我们要做这件事,有必要作一个简要说明。我们上一次这样的实验(模型制作音乐视频)引发了很好的讨论,有些人将其理解为我们在宣传模型的创意或艺术能力。这些并非对模型能力的客观测试。它们是故意设计的开放式、模糊的任务。以下是我们个人继续运行它们的原因:
它们很有趣,而且真正信息量丰富。 观看模型处理一项宽松、开放式的任务比再看一个基准数字更能有趣地展示能力。
它们暴露了真实的边界与开放权重之间的差距。 更便宜的开放权重模型绝对可以为大量执行工作替代边界,我们将继续报告这一点。但也存在很多基准最大化的情况,像这样的任务可以贯穿其中。它们真正地将边界能力与其余部分分开。Grok 4.5,正如你将看到的,在这项"基本"绘图任务上表现粗糙,我们尝试的开放权重模型甚至无法使用,有些只是返回了一张空白画布。(这可能会随着 Kimi K3 而改变,一旦它完全开源,我们将报告这一点)
它们展示了长期运行任务的真实成本。 Claude Fable 5 几乎总是花费比其他模型更长的时间,花费更多的钱,并且产生了更差的输出。Fable 在许多任务上击败了 GPT-5.6,包括音乐视频挑战,但在这个任务上,它的开销更高,产出更差。根据你的用例,这种权衡很重要。
我们喜欢这些讨论。 讨论确实很有趣,如果你对设置或新任务有建议,我们会将其考虑在内。运行这些一直很有趣,看到输出非常令人兴奋。
每个模型都使用了完全相同的有色铅笔工具集:
plan: 一个无操作的草稿本,用于思考和步骤之间的规划。
view_target: 再次查看目标图像。
view_canvas: 渲染当前页面并查看它。这也是我们对绘画与目标进行评分的时候。
set_color / set_brush / set_pressure: 当前铅笔颜色、笔尖宽度和压力(0 到 1 的不透明度,低压力用于柔和的色调)。
draw: 一次调用中铺下一批标记(笔画、线条、形状轮廓、点)。没有实心填充,色调和颜色通过分层构建,就像真正的铅笔一样。
smudge: 混合/柔化一个矩形区域,就像混合笔。
erase / clear_canvas: 将一个区域抬回白色 / 重置整个页面。
整个工具集是开源的,位于 github.com/hershalb/canvas-arena。将其指向任何目标图像或文本提示并自己运行。
模型可以一直看到目标,并根据与目标的结构相似性 (SSIM) 进行评分。我们在下面显示了 SSIM 分数。
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
没有目标,没有得分,只有文本简介和空白页面。
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
完整记录:GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
每个模型在所有七幅绘画中的平均值和总计。
四个模型以完全不同的方式使用了完全相同的工具集。
GPT-5.6 Sol 从未调用过 set_color、set_brush 或 set_pressure 一次,它改为在每个 draw 调用中内联设置这些,所以它的调用几乎都是 draw、smudge 和 view_canvas。
Grok 4.5 做了相反的事情:其 1,349 个工具调用中有 65% 是 set_color / set_brush / set_pressure,这就是为什么它平均每幅绘画 99 步。
Claude Fable 5 倾向于使用 smudge(123 次调用)并不断审查。
Gemini 3.6 Flash 是所有模型中最执着的审查者,其几乎三分之一的调用是 view_canvas(每幅绘画大约 23 次自我审查),并且像 Sol 一样从未触及 set_* 工具。
Claude Fable 5 的七幅绘画估计成本为 160 美元,大约是 GPT-5.6 Sol ($7.74)、Grok 4.5 ($9.21) 或 Gemini 3.6 Flash ($12.87) 的 20 倍。这现在不应该真的令人惊讶。Grok 使用了迄今为止最多的 token(3,400 万),但由于约 98% 是以输入速率的一小部分进行缓存读取,并且 Grok 的费率是四个中最低的,所以保持便宜。Gemini 也严重依赖缓存读取,所以即使在 2,770 万 token 时,它仍然保持适度成本。
每次 view_canvas 都会重新对画布与目标进行评分,所以我们可以观察运行过程中的进展。两个模式在两个目标中保持一致:
首先,它们很早就达到了平台期。Claude Fable 5 审查了其蒙娜丽莎 27 次,但其相似性在第五次审查后基本持平。
其次,在所有八次目标运行中,最终绘画的得分都低于模型在运行过程中达到的最佳成绩。GPT-5.6 Sol 的蒙娜丽莎在 0.352 SSIM 处达到峰值,以 0.325 结束;其《星月夜》在 0.179 处达到峰值,以 0.130 结束。Gemini 3.6 Flash 审查最多(每幅绘画约 23 次),达到了整个批次中最高的峰值,蒙娜丽莎上的 0.449,然后一路滑回到最后的 0.337。更多审查并没有转化为更好的完成。模型在自己最佳表现之外继续编辑。
SSIM 为 0 到 1,越高越接近目标。RMSE 为 0 到 255,越低越接近目标。
在原始 SSIM 上,Gemini 3.6 Flash 在两个目标上的得分最高,无论是最终得分还是峰值,尽管它在最佳帧和最终帧之间的变化也最大。Gemini 3.6 Flash 看起来不错,但绝对不是看起来最接近目标输出的。很有趣的是原始分数最终证明更高了。如常,SSIM 测量结构接近度,而不是人眼看到的绘画效果如何。
四个模型,两个评分目标加每个五个提示,总共 28 幅绘画。所有运行都使用相同的有色铅笔工具集。每个模型的推理都设为高。
SSIM/RMSE 通过将两个图像调整为 256x256 并进行比较来计算。它们测量结构/像素接近度,而不是艺术质量,仅适用于目标运行(提示没有参考评分)。
挂钟时间包括模型自己的思考和工具往返。
GPT-5.6 Sol 是遥遥领先的领导者。 其《星月夜》和玫瑰是我们整个批次中最喜欢的,考虑到它在空白画布上笔画笔画地绘制它们,这很疯狂。它在几乎每幅绘画的细节上也击败了其他两个,唯一的例外是老渔夫。
Grok 4.5 在这里基本上是垃圾。 它很少产生任何可用的东西,尽管它疯狂地使用工具,我不相信它能可靠地理解或判断视觉输出。
Gemini 3.6 Flash 绝对比 Grok 更好,成本略有增加, 但将 Flash 模型与边界版本进行比较似乎有点不公平。我绝对对看 Gemini 4 的表现感到兴奋。我们也已经知道这一点,但 token 输出速度就是如此令人印象深刻。
Claude Fable 5 在质量上排名第二,但成本和时间方面处于最远端。 对于这项任务,它是三个中最不吸引人的权衡:慢得多,昂贵得多(约其他三个的 20 倍),而输出跟不上 Sol。
这里提到的每个模型都可以在 TryAI 上通过一个账户获得,按使用量付费,无需订阅。