谷歌推出融合视觉的大规模具身语言模型。高质量研究工作,对AI研究者有参考价值,但实践应用相对专业。
大型语言模型已经展现出执行复杂任务的能力。然而,要让它在现实世界中具备通用推理能力——例如解决机器人问题——就必须应对语义落地(grounding)的挑战。我们提出了具身语言模型(embodied language models),将现实世界中连续的传感器模态直接整合进语言模型,从而建立词语与感知之间的联系。具身语言模型的输入是多模态句子,其中交错包含视觉编码、连续状态估计编码和文本输入编码。我们将这些编码与预训练的大型语言模型结合起来,针对多种具身任务进行端到端训练,包括机器人连续操作规划、视觉问答和图像描述。评估结果表明,PaLM-E 作为一个统一的大型具身多模态模型,能够基于多种观测模态、在多种具身载体上处理不同类型的具身推理任务。此外,它还表现出了正向迁移能力:在互联网规模的语言、视觉和视觉语言领域进行多样化的联合训练,可以让模型从中受益。我们最大的模型 PaLM-E-562B 拥有 562B 参数。除了接受机器人任务训练之外,它还是一个通用的视觉语言模型,在 OK-VQA 上取得了最先进的性能,并且随着模型规模的扩大,依然保留了通用语言能力。
PaLM-E 的核心架构思想,是将图像、状态估计或其他传感器模态等连续的具身观测注入预训练语言模型的语言 embedding 空间。具体做法是把连续观测编码成一个向量序列,其中每个向量的维度都与语言 token 的 embedding 空间相同。这样一来,连续信息就能以类似语言 token 的方式注入语言模型。PaLM-E 是一个仅包含 decoder 的 LLM,它会根据给定的前缀或 prompt,以自回归方式生成文本补全。我们将模型命名为 PaLM-E,是因为它以 PaLM(Chowdhery 等,2022)作为预训练语言模型,并在此基础上赋予其具身能力(Embodied)。
我们展示了几个示例视频,说明 PaLM-E 如何在两种不同的真实具身载体上规划并执行长时程任务。请注意,所有这些结果都来自同一个使用全部数据训练的模型。在第一个视频中,我们执行了一条长时程指令 "bring me the rice chips from the drawer"(把抽屉里的米制薯片拿给我)。这项任务包含多个规划步骤,同时还需要结合机器人摄像头提供的视觉反馈。最后,我们还展示了同一个机器人上的另一个示例,其指令为 "bring me a green star"(给我拿一颗绿色星星)。这台机器人此前并未直接接触过绿色星星这种物体。
接下来,我们展示 PaLM-E 控制一个桌面机器人整理积木。结果表明,PaLM-E 能够根据视觉和语言输入,成功完成多阶段规划。模型可以成功规划一项长时程任务:"sort blocks by colors into different corners"(按照颜色把积木分类放到不同角落)。另一个示例同样展示了模型如何跨越多个阶段进行规划,并在较长的时间跨度内持续结合视觉反馈。最后,我们还演示了这台机器人执行另一项长时程推动任务。第一条指令是 "move remaining blocks to the group"(把剩余的积木移到那一组)。PaLM-E 会按顺序向底层策略发送逐步指令,例如 "move the yellow hexagon to the green star"(把黄色六边形移到绿色星星处),以及 "move the blue triangle to the group"(把蓝色三角形移到那一组)。
接下来,我们展示两个泛化能力示例。在下面这个案例中,指令是 "push red blocks to the coffee cup"(把红色积木推到咖啡杯旁)。数据集中只有三个包含咖啡杯的演示,而且这些演示都没有出现红色积木。我们还展示了另一个泛化示例,指令为 "push green blocks to the turtle"(把绿色积木推到乌龟旁)。尽管机器人以前从未见过这只乌龟,它仍然能够成功执行这项任务。
除了为机器人规划解锁新的能力之外,PaLM-E 还是一个能力出色的 Vision-Language Model。更多细节请参阅我们的论文,并查看下面的演示。
下面展示的内容全部是 PaLM-E 生成的补全示例,以橙色显示。prompt 由一张或多张图片以及灰色文本组成。
PaLM-E 的响应以橙色阴影显示。
作者谨向以下人员致谢,感谢他们提供的建议、帮助与支持:Xi Chen、Etienne Pot、Sebastian Goodman、Ted Xiao、Keerthana Gopalakrishnan、Kehang Han、Henryk Michalewski、Neil Houlsby、Basil Mustafa、Justin Gilmer、Yonghui Wu、Erica Moreira、Victor Gomes、Tom Duerig 和 Kendra Byrne。