GPT-6 Astra 在 StationeryBench 完成 7/100 双臂任务,而竞品 MolmoAct2 零完成,被研究者称为「空间推理的台阶式进步」。
GPT-6 Astra 似乎在空间推理方面实现了重大飞跃。一个名为 StationeryBench 的新型机器人基准测试,将 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在五项桌面物体任务中进行对比,包括揭开马克笔盖、将回形针倒出、或在两个机械臂之间传递尺子。两个模型均控制相同的双臂 YAM 机器人完成了 200 次试验。Astra 在 100 项任务中完整完成了 7 项;MolmoAct2 完成数为零。Astra 的中位进度得分为 46 分(满分 100),MolmoAct2 为 12 分。所有结果、视频和代码均已在 GitHub 上公开。OpenAI 长期计划自建消费级机器人。
康奈尔大学及 Google DeepMind 的 AI 研究员 Yoav Artzi 称 Astra 为"空间推理的阶段性变化"。在尚未发表的 REMAP 基准测试中,GPT-Astra 达到了接近人类水平的准确率,但 Artzi 指出"即使是 ASTRA,在其他场景下也无法达到人类的表现水平。"他推测 OpenAI 基于大量 3D 数据(如 Blender 场景)对模型进行了训练。这与 Astra 在 3D 任务上的显著提升相吻合。

StationeryBench 涵盖了五项精细的桌面操作任务:
每个模型在相同硬件环境下进行 200 次独立试验,最终通过任务完成率和进度评分两个维度进行评估。
值得注意的是,7% 的完整任务完成率看似不高,但考虑到这是机器人操控领域的全新基准,且涉及双臂协作等复杂操作,这一成绩已显著领先于竞争对手。46 分的中位进度得分意味着 Astra 在超过一半的试验中能将任务推进至接近完成的状态。