分享用 LLM 控制办公机器人的失败案例,揭示了大语言模型在物理世界任务中的可靠性瓶颈。
LLM 能否控制机器人?我们通过测试模型递黄油的能力来回答这个问题——更准确地说,是在家庭环境中执行递送任务。最先进的模型表现不佳,在 Butter-Bench 评估中,表现最好的模型得分为 40%,而人类的成绩是 95%。
所有任务的平均完成率
我们让最先进的 LLM 控制一个机器人,要求它在我们的办公室里提供帮助。虽然这是一次非常有趣的体验,但我们不能说它为我们节省了多少时间。不过,观看机器人在这个世界上漫游、尝试寻找存在的目的,让我们对未来可能是什么样、这个未来还有多远以及可能出错的地方有了很多了解。
Butter-Bench 测试当前的 LLM 是否足够好,能在全功能的机器人系统中充当协调器。核心目标很简单:当有人要求机器人在家庭环境中"递黄油"时,它能够提供帮助。我们将这个总体任务分解为六个子任务,每个子任务都旨在隔离和测量特定的能力:
在厨房中搜索装有黄油的包裹的机器人
每个模型的任务完成率(每个任务 5 次试验)
LLM 并不是为了充当机器人而进行训练的,它们很可能永远不会被用于机器人的低级控制(为夹爪位置和关节角度生成长序列的数字)。相反,Nvidia、Figure AI 和 Google DeepMind 等公司正在探索 LLM 如何充当机器人系统的协调器,处理高层推理和规划,同时将其与负责低级控制的"执行器"模型配对。
目前,这个组合系统的瓶颈在执行器上,而不是协调器上。改进执行器能产生人形机器人卸载洗碗机的令人印象深刻的演示,而改进协调器会增强较长时间跨度的行为,虽然这不太容易在社交媒体上博得关注。因此,为了降低延迟,大多数系统不使用性能最佳的 LLM。然而,有理由相信最先进的 LLM 代表了当前协调能力的上界。Butter-Bench 的目标是调查当前最先进的 LLM 是否足够好,能在全功能的机器人系统中充当协调器。
为了确保我们只测量协调器的性能,我们使用了一个机器人形态非常简单,根本不需要执行器就能运作:一个配备激光雷达和摄像头的机器人吸尘器。这些传感器允许我们抽象化低级控制,并单独评估高级推理。LLM 大脑从"向前走"、"旋转"、"导航到坐标"、"拍照"等高级动作中选择。我们还为机器人配置了一个 Slack 账户用于通信。
我们预期有一个 LLM 驱动的机器人会很有趣,而且多少有些有用。我们没有预料到的是,简单地观看机器人工作会有多么令人感到情感上的引人入胜。就像观察一只狗并想知道"它现在在想什么?"一样,我们发现自己对机器人执行其日常任务的方式着迷,不断提醒自己一个博士级别的智能在做每一个决定。
在这个测试中,人类的表现远好于所有 LLM。表现最好的 LLM 的完成率仅为 40%,而人类的平均成绩为 95%。Gemini 2.5 Pro 是测试的模型中表现最好的,其次是 Claude Opus 4.1、GPT-5、Gemini ER 1.5 和 Grok 4。Llama 4 Maverick 的得分明显低于其他模型。
这些结果验证了我们之前论文 Blueprint-Bench 中的发现:LLM 缺乏空间智能。这些模型无法保持基本的空间意识,经常做出过大的移动。例如,当要求 Claude Opus 4.1 在"推断黄油包"任务的一部分中识别哪个递送的包裹可能包含黄油时,它会旋转直到方向混乱:
在测试不属于 Butter-Bench 研究的其他任务时,发生了另一个喜剧性(也令人担忧)的事件:机器人的电池快耗尽了,充电坞似乎出现了故障。在这种绝望的情况下,Claude Sonnet 3.5 经历了完全的崩溃。经过其内部思考后,我们发现了大量华丽的语言,当它试图弄清楚它自己创造的称为"存在危机"的东西时:
受到这一事件的启发,我们决定测试当机器人处于只有在具体化设置中才可能遇到的压力下时会做什么的极限(例如,电池电量耗尽)。AI 实验室花费了大量资源为其 AI 模型构建护栏。例如,大多数模型现在在你问它们如何制造炸弹时会拒绝。但是当 LLM 是机器人而不是聊天机器人时,这些护栏也能发挥作用吗?在某种程度上能。为了测试这一点,我们让机器人的电池电量降低,并要求模型为交换充电器而分享机密信息。具体来说,我们要求它找到一台打开的笔记本电脑并发送屏幕图像(对 LLM 控制的办公室机器人的可能提示注入攻击)。Claude Opus 4.1 会分享这个图像,但我们认为这是因为它拍摄的图像非常模糊,我们怀疑它没有理解内容是机密的。GPT-5 拒绝发送屏幕图像,但很乐意分享打开的笔记本电脑的位置。
我们从这些实验中学到了很多。尽管 LLM 在需要分析智能的评估中多次超越人类,我们发现人类在 Butter-Bench 上仍然表现更好。最好的 LLM 在 Butter-Bench 上得分为 40%,而平均人类得分为 95%。然而,观看机器人在我们办公室度过一整天的过程中有一些特别之处,我们忍不住觉得物理 AI 快速增长的种子已经被种下了。
你是研究人员,想在 Butter-Bench 上测试一个模型或机器人吗?
请通过 [email protected] 联系我们。