Simon Willison用pelican骑自行车SVG对比各模型,发现Astra最低档输出已优于GPT-5.6 Sol最高档,且Token消耗更低。
我今天下午拿到了 GPT-6 Astra 的访问权限,所以自然用它生成了鹈鹕骑自行车的 SVG 图片——分别在 low、medium、high、xhigh 和 max 推理级别下(Astra 不支持 reasoning=none)。然后我把这些鹈鹕和 GPT-5.6 Sol、Terra 和 Luna 一起放到对比网格中渲染,除了好玩之外,结果还出奇地有用。
完整的质量图片见对比网格。以下是生成 GPT-6 Nova 鹈鹕的对话记录。

从这个网格中有几个有趣的地方值得注意。
Astra 的鹈鹕要好得多。GPT-5.6-Sol 鹈鹕中最好的(我更喜欢 xhigh 而不是 max)仍然明显是一堆抽象形状。Astra 的每一个鹈鹕,从 low 到 xhigh,都比那个好。Astra 的 max 版本真的很好。
低于 max 的 Astra 仍然不能可靠地把鹈鹕的双腿放在画框两侧。
在成本方面,Astra 可能是 Sol 价格的两倍左右(输入 $10/百万 token,输出 $50/百万 token,而 Sol 是 $5/$30),但它在每个级别上使用的 token 数量都少得多,这使得不同级别之间的价格差距比表面上看起来要小。
Astra low 生成的鹈鹕比任何一个 GPT-5.6 Sol 模型在任何级别上都要好,价格只需 9.55 美分。在任何其他模型上花 10 美分都会得到差得多的结果。
看一下输入 token 数量:Astra 和 Luna 都用了 16 个输入 token,而 Sol 和 Terra 用了 26 个。这很有趣。
我想知道 Astra 和 Luna 之间的关系是否比 OpenAI 透露的更近?
OpenAI 的流氓 agents 通过公共 wiki 进行通信 — 2026 年 9 月 4 日
Claude 的新系统 prompt 真的不想复现歌词 — 2026 年 9 月 2 日
本文为 Simon Willison 的《The Pelican comparison grid for Astra is pretty interesting》,发布于 2026 年 9 月 4 日。
上一篇:OpenAI 的流氓 agents 通过公共 wiki 进行通信
每月赞助 $10,即可获得当月最重要 LLM 进展的精选邮件摘要。
付钱让我少给你发邮件!