Gemini Robotics ER 1.6:具身推理能力升级
Google DeepMind 发布机器人专用模型,增强空间推理和多视图理解。主要面向机器人和自动化领域,大多数程序员应用场景有限。
Google DeepMind 发布机器人专用模型,增强空间推理和多视图理解。主要面向机器人和自动化领域,大多数程序员应用场景有限。
Laura Graesser、Peng Xu
要让机器人真正为我们的日常生活和各行各业提供帮助,它们不能只是遵循指令,还必须能够对物理世界进行推理。从在复杂设施中导航,到读取压力表的指针,机器人的“具身推理”(embodied reasoning)能力让它能够弥合数字智能与物理行动之间的鸿沟。
今天,我们正式推出 Gemini Robotics-ER 1.6。这是我们以推理为先的模型的一次重大升级,让机器人能够以前所未有的精度理解周围环境。通过增强空间推理和多视角理解能力,我们正在为下一代物理 Agent 带来更高水平的自主性。
该模型专门强化了机器人领域的关键推理能力,包括视觉与空间理解、任务规划和成功检测。它可以充当机器人的高层推理模型,通过原生调用 Google Search 等工具来查找信息,调用视觉-语言-动作模型(VLA),或调用用户定义的任何其他第三方函数,从而执行任务。
与 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 相比,Gemini Robotics-ER 1.6 均有显著提升,尤其增强了指点、计数和成功检测等空间与物理推理能力。我们还解锁了一项新能力:仪表读数。现在,机器人可以读取复杂的仪表和视镜——这是我们与合作伙伴 Boston Dynamics 密切协作时发现的一个使用场景。
从今天起,开发者可以通过 Gemini API 和 Google AI Studio 使用 Gemini Robotics-ER 1.6。为了帮助你快速上手,我们还提供了一个面向开发者的 Colab,其中包含如何配置模型,以及如何通过 prompt 让它执行具身推理任务的示例。
指点是具身推理模型的一项基础能力,并且随着每一代模型不断演进。点可以用于表达许多概念,包括:
Gemini Robotics-ER 1.6 可以将点作为中间步骤,用于推理更加复杂的任务。例如,它可以通过指点来统计图像中的物品数量,也可以标记图像中的显著点,帮助模型执行数学运算,从而提高度量估算的准确性。
下面的示例展示了 Gemini Robotics-ER 1.6 在指向多个元素方面的优势,以及它判断何时应该指点、何时不应指点的能力。
在机器人领域,知道任务何时完成,与知道如何开始任务同样重要。成功检测是自主性的基石,也是一套关键的决策引擎,让 Agent 能够明智地判断:究竟应该重试失败的操作,还是进入计划的下一阶段。
要让机器人实现视觉理解并不容易。系统需要结合复杂的感知与推理能力,以及广泛的世界知识,才能应对遮挡、光照不足和指令含糊等复杂因素。此外,大多数现代机器人系统都包含多个摄像头视角,例如俯视摄像头和腕部摄像头画面。这意味着系统需要理解不同视角如何在每个时刻以及整个时间维度上相互结合,从而形成连贯一致的整体图景。
Gemini Robotics-ER 1.6 推进了多视角推理能力,让系统能够更好地理解多个摄像头视频流及其相互关系,即使是在动态或存在遮挡的环境中也能做到这一点。下面这个典型的多视角场景展示了这种能力。
要理解 Gemini Robotics-ER 1.6 的一项关键优势,就必须看看它如何将空间推理和世界知识等能力结合起来,解决复杂的真实世界问题。仪表读数就是一个绝佳示例。
这项任务源自设施巡检需求,而设施巡检正是我们的合作伙伴 Boston Dynamics 重点关注的领域。工业设施中包含许多需要持续监测的仪表,例如温度计、压力表、化学品视镜等。Boston Dynamics 的机器人产品 Spot 可以巡视设施内的各个仪表,并拍摄它们的图像。
读取仪表需要复杂的视觉推理。系统必须精准感知各种输入,包括指针、液位、容器边界和刻度线等,并理解这些元素之间的关系。对于视镜而言,系统需要考虑摄像头视角造成的畸变,估算液体在视镜中所占的比例。仪表通常还会显示描述计量单位的文字,这些文字必须被读取和解释;有些仪表还包含多个分别代表不同小数位的指针,系统需要将它们组合起来才能得到最终读数。
Gemini Robotics-ER 1.6 通过 Agentic Vision 实现了高度准确的仪表读数。这种技术将视觉推理与代码执行结合在一起。模型会采取一系列中间步骤:首先放大图像,以便更清楚地读取仪表上的细小细节;随后通过指点和代码执行来估算比例与间隔,获得准确读数;最后运用自身的世界知识解释读数的含义。
准确读取模拟仪表
安全性被整合进我们具身推理模型的每一个层面。Gemini Robotics-ER 1.6 是我们迄今最安全的机器人模型。与此前所有代际的模型相比,它在对抗性空间推理任务中表现出更强的 Gemini 安全政策遵循能力。
该模型遵守物理安全约束的能力也得到了大幅提升。例如,在夹爪或材料约束条件下,它可以通过指点等空间输出来判断哪些物体能够被安全操作,从而做出更安全的决策(例如,“不要处理液体”“不要拿起重量超过 20kg 的物体”)。
我们还根据真实伤害报告设计了文本和视频场景,用于测试模型识别安全隐患的能力。在这些任务中,我们的 Gemini Robotics-ER 模型在准确感知受伤风险方面优于 Gemini 3.0 Flash 基线:文本场景提升 6%,视频场景提升 10%。
我们致力于确保 Gemini Robotics-ER 能够为机器人社区创造最大价值。如果当前能力还无法满足你的专业应用需求,欢迎提交表单,并附上 10~50 张带标注的图像,用于说明具体的失败模式,帮助我们构建更加稳健的推理功能。我们期待与你合作,在后续版本中进一步增强这些能力。
立即前往 Google AI Studio 体验 Gemini Robotics-ER 1.6
以负责任的方式推动 AI 与机器人技术发展