Simon Willison用Fable 5.1生成动画鹈鹕,详细对比五个推理强度档位的代码质量差异,给出实操参考。
今天是 Claude Fable(以及 Mythos)5.1 发布的日子。Anthropic 称 Fable 5.1"为编程、知识工作和长时间任务解决设定了新标准"。他们的公告用了相当大的篇幅介绍科学研究,炫耀在全新的 Terminal-Bench-Science 0.1 基准测试(8 月 27 日首次发布)中取得了 52.6% 的分数,相比之下 Fable 5 是 24.7%、Opus 5 是 29.0%、GPT-5.6 Sol 是 22.4%。其他基准测试的分数略有提升,但没有哪个像这个科学基准这样令人印象深刻。
但它在"鹈鹕"上的表现如何呢?
回到今年七月,我写了一篇关于我如何对这个"鹈鹕"基准测试失去信心的文章——它与模型在其他任务上表现好坏之间的联系,似乎不再像 2025 年那样紧密。现在从中获得的最有趣的洞察是同一模型家族内部的对比,尤其是同一提示在不同推理努力级别下的对比。
Fable 5.1 有五个推理级别:low、medium、high、xhigh、max——而且没有完全关闭推理的选项。
我修复了 llm-anthropic 中的一个问题,该问题导致推理痕迹无法被正确记录,然后运行了一些提示。
以下是所有推理级别的完整鹈鹕图,每张都附有完整推理记录。我在这里复现:
接下来,有点神秘。这是 effort low 得到的结果:

记录中没有显示任何总结的推理 token,输出 token 数为 1,998。对于 Claude 来说,这个输出 token 数包含了推理 token。用时 23.8 秒,费用 10.017 美分。
我调到 medium,得到了这个:

奇怪的是,这张也没有推理文字,使用了 1,977 个输出 token——比 low 少了 21 个。用时 23 秒,费用 9.912 美分。
所以对于这个特定的提示("Generate an SVG of a pelican riding a bicycle"),Fable 5.1 在 low 和 medium 两个设置下似乎都跳过了推理。
这是 high——29.6 秒,2,612 个输出 token,13.087 美分:

这个确实做了一点推理,摘要如下:
我正在规划这只骑着自行车的鹈鹕的 SVG 布局,包括天空和地面背景、一辆有两个辐条轮子的自行车、车架、座椅和车把,以及一只白色身体、长脖子、橙色鸟喙的鹈鹕位于上方。
不过和 low、medium 相比真的没什么区别。
到了 xhigh,情况就截然不同了。36,767 个输出 token,7 分 51 秒,$1.83!

推理记录相当长,包含这样的细节:
添加眼睛、翅膀向下延伸到车把握把、橙色的腿伸向踏板,以及小小的尾羽,同时故意把鹈鹕画得比自行车大以增加喜剧效果。[...]
我接受这轻微的厚度感,认为它很有魅力,而不是过度工程化。
将 effort 设为 max 给了我目前在 Anthropic 所有模型中见过的最好的鹈鹕。65,927 个输出 token,13 分 54 秒,$3.30:

这张图有很多值得喜欢的地方。背景很雅致,腿明显在车架两侧,脚在踏板上,翅膀放在车把上,鹈鹕戴着一顶可爱的蓝色帽子,还有一篮子里装着一条鱼。
它仍然没有显示出接近 Gemini 3.7 Flash 那样的风格,但我没有要求风格——我要求的是 SVG,我得到了 SVG。
以下是那条推理记录的一些亮点:
在两只脚附近添加踏板形状,第二条腿的远端脚在车架后面部分可见。我正在考虑是否添加一条小围巾或帽子来增加特色,但倾向于保持简洁以避免杂乱。
现在我在纠结是给头上加自行车头盔还是保留鹈鹕标志性的羽冠——鸟喙和喉囊已经足够清楚地传达"鹈鹕"的信息,所以头盔可以强化自行车主题而不失去身份认同,尽管它可能会与羽冠在视觉空间上竞争。
我意识到位于 (484,84) 的鸟喙会与圆顶头盔重叠,所以我需要缩小头盔,让它只覆盖头顶,调整其圆弧端点使其更高更窄,这样鸟喙就可以在前面干净利落地连接而不产生碰撞。[...]
我正在添加一个较深的尖端区域来表示初级飞羽,然后重新考虑后缘,考虑用扇形的羽毛曲线代替一条平滑的线条,以获得更自然的外观。[...]
现在我在检查头盔上的通风口线条位置,确保它们考虑到线宽和圆形端盖后位于头盔边缘足够内侧,并确认每个通风口都保持在头盔的圆形边界内。[...]
我决定省略车把铃铛和轮胎高光,因为它们是不必要的附加物。现在我在重新考虑前叉的曲线——当前的控制点将形状向后拉,而它应该向前弯曲以获得正确的倾斜角度,所以我需要将控制点向右移动来修正前叉的倾斜。
在 Hacker News 上,swalsh 对那个 Max 鹈鹕评论道:
既然这已经是一个被攻克的基准测试了,我们能看看动画版吗?
我不想再花 $3,所以我就用 Max 鹈鹕通过默认的 High 思考级别处理:
llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'
6,121 输入,26,201 输出 = $1.37。结果看起来是这样的,由于有些人无法观看动画 SVG,在这里导出为视频:
Your browser does not support HTML5 video.
视频中轮子的旋转方向是错的,但我觉得这是转换为 MP4 时的伪影——在原始 SVG 中它们似乎是朝正确方向转的。
Understanding ChatGPT Work - 2026 年 8 月 30 日
Conceptual integrity and counting lines of code - 2026 年 8 月 19 日
这是 Simon Willison 的《Claude Fable 5.1 made me a really nice animated pelican》,发布于 2026 年 9 月 1 日。
上一篇:Understanding ChatGPT Work
每月只需 $10 赞助我,即可收到当月最重要 LLM 进展的精选邮件摘要。
付费让我给你发得更少!