第三方开发者展示GPT-6 Astra模型驱动机械臂完成精细操作,多模态推理能力从纯文本扩展到物理世界控制。
这是我们之前对 Claude Fable 5 和 Fable 5.1 对比的延续。我们在相同的 Inspect Robots agent 策略下,让 OpenAI 的 GPT‑6 Astra 控制同样的 YAM 机械臂,执行同样的两个任务:
"把桌上的红色方块拿起来,放进碗里。"
"拿起圆形蓝色拼图块(抓住其中心的把手),把它放进板子上对应的圆形凹槽里。"
在碗任务中,Astra 在 20 次试验中成功了 19 次,Fable 5.1 是 8 次,Fable 5 只有 1 次;每次试验耗时 2.5 分钟,而 Fable 5.1 需要 6.8 分钟;每次运行成本约 0.94 美元,而 Fable 5.1 是 2.12 美元。
拼图任务则是另一番景象:Astra 在 20 次试验中完成了 2 次插入,与 Fable 5.1 的 2 次持平。它能到达凹槽,但在最后一步卡住,和 Fable 一样;每次运行成本 1.36 美元对比 2.18 美元。
碗中放方块:每个模型的最佳完成运行(最高阶段,其次最短耗时),各按相同倍速播放。计时器显示的是去掉思考暂停后的实际 elapsed 时间。
Astra 完成碗任务的频率要高得多,每次运行成本约为一半
大圆点是条件均值;小圆点是各次独立试验(完成则 100,否则 0),标注在各自成本位置。
每项试验都由人工评分员评定其达到的最高阶段,因此即使失败的运行也会记录它走到了哪一步。评分规则与 Fable 报告中的保持一致。
Astra 几乎每次都能放入方块;在拼图任务上它在 Fable 卡住的同一步停滞
各模型到达各阶段的试验占比;每行的 n 是该单元格中的试验数量。
全部纳入计数的试验共 120 次。
Astra 的试验在 Fable 试验两天后进行,两者并未交叉进行。拼图对比在相同设备上;碗对比不在:Astra 碗试验运行在 rig-3 上,但该设备不可用。
评分由操作员人工判定,且已知模型身份,因此分数存在无意识偏差的风险。
成本均为标价。Anthropic 的请求未使用 prompt 缓存;OpenAI 自动为 Astra 约五分之一的输入做了缓存,此处未计入折扣,因此 Astra 的成本实际是有高无低。
物体在试验之间手工复位,所有模型均仅以中等推理力度运行。