Gemini Robotics ER 2 增强了视频理解、任务编排和多机器人协作能力,为机器人开发者提供更强的推理和协作工具。对机器人和自动化领域的工程师有直接应用价值。
Gemini Robotics ER 2 代表了机器人领域的一个飞跃,通过视频理解、任务编排和多机器人协作来赋能机器人——使机器人能够在物理世界中提供更多帮助。
高级员工工程师
员工工程师
我们正式推出 Gemini Robotics ER 2,这是一个新模型,旨在充当机器人的高级大脑。它能够实现实时空间推理、多步骤任务规划,以及不同机器人之间的协作。你现在可以通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型,开始构建你自己的物理 AI 智能体。
Google 刚刚推出了 Gemini Robotics ER 2,它就像机器人的聪慧大脑。它帮助机器人快速思考、规划多步骤任务,甚至与其他机器人协作。该模型让机器人能够观看视频源来追踪自己的进度,并实时修正错误。它的设计目标是让机器人在现实世界中更安全、更有帮助。
要让机器人在日常环境中协助人类,仅有准确的空间推理是不够的。机器人还必须能够快速思考,使其决策和推理的时序与物理世界的实时速度相匹配。
这正是我们今天推出 Gemini Robotics ER 2 的原因——我们在机器人学中功能最强大的"具身推理"(embodied reasoning)模型。可以把 Gemini Robotics ER 2 看作机器人的高级大脑。它允许机器人与人类对话、理解物理世界,并规划多步骤任务。然后,它会把运动执行权交给任何给定的低级视觉-语言-动作(Vision-Language-Action, VLA)模型。Gemini Robotics ER 2 还可以原生调用工具,如 Google Search 来获取信息,或任何其他用户定义的函数。Gemini Robotics ER 2 的设计使得机器人可以在执行动作的同时"思考"接下来的步骤。
Gemini Robotics ER 2 相比 Gemini Robotics ER 1.6 是一次重大升级。通过观看持续的视频源,机器人现在可以追踪自己的进度、在出现问题时自适应调整,以及精确判断何时转向下一步。我们还引入了多机器人协作功能,使机器人能够在共享空间中协同工作,完成单个机器人无法独自完成的复杂工作流。
Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 向开发者公开发布,并在 Gemini Enterprise Agent Platform 上处于私有预览阶段。为了帮助你快速上手,我们分享了一些关于如何配置该模型以及如何用它驱动更实用的物理 AI 任务的示例。
现实世界中的大多数任务都很复杂,需要多个步骤才能完成。Gemini Robotics ER 2 是一个物理智能体,它编排机器人的步骤,使其能够自我纠正并推广到更新颖的情况。为了构建智能体设置,开发者可以声明低级控制接口——如视觉-语言-动作(VLA)模型或导航 API——作为工具,并将多模态视频、音频或文本直接流传输到模型中。
Gemini Robotics ER 2 改进了这个工具编排工作流程。我们可以在模拟中使用真实的机器人控制,甚至与远程控制机器人的人类配对,来评估其性能。
Gemini Robotics ER 2 在工具编排上相比 ER 1.6 有一致的性能提升,涵盖三种控制模式:真实 VLA、模拟 VLA 和人类远操。
在机器人学中,高级推理取决于执行速度。Gemini Robotics ER 2 集成到 Gemini Live API 中,使用双向流式端点,针对延迟敏感的任务进行了优化。结果是流畅的编排:Gemini Robotics ER 2 命令动作模型和机器人 API 完成多步骤任务,不会有令人不适的"停下来思考"的停顿。为了说明这一点,我们与来自合作伙伴 Boston Dynamics 的 Spot 构建了一个演示。我们使用 Gemini Robotics ER 2 来编排 Spot API,如导航和操纵器移动,创建了一个可以为你取物的交互式机器人。
Gemini Robotics ER 2 驱动的 Boston Dynamics Spot 机器人在自然语言命令下取回爆米花零食。
代码可在 Github 上获得,还有其他示例。
机器人学面临的最大难题之一是知道何时任务已完成。Gemini Robotics ER 2 在视频理解和进度跟踪上带来了飞跃式的改进,它能够验证复杂任务——如拧紧灯泡或绑紧垃圾袋——是否完成到规范,然后再切换到下一个任务。
在这次更新中,我们在任务进度理解的两个基础能力上取得了进展:进度分类和时刻发现。
进度分类是指机器人追踪任务完成进度的能力。在我们的评估中,我们将视频源中的每一帧分配到五个进度级别(0-20%、20-40%、40-60%、60-80%、80-100%)。通过量化任务进度,Gemini Robotics ER 2 为机器人提供了实时态势感知,使其能够动态调整动作或重试失败的步骤,而无需重新启动整个工作流。
Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的精度,超过了前代模型和竞争性的前沿模型。
时刻发现衡量的是模型识别关键事件发生的确切视频帧的能力(即何时停止向杯子倒咖啡)。Gemini Robotics ER 2 在时刻发现上实现了显著的性能提升,使机器人能够精确地在任务之间切换、验证成功并建议纠正。
在时刻发现任务上,Gemini Robotics ER 2 达到了 91.3% 的精度和 0.96 秒的平均绝对距离。它与更大规模的模型种类竞争力相当,但以计算成本的一小部分和 4 倍的执行速度提供了这种精度——这种亚秒级延迟正是在现实世界中安全运行物理机器人所实际需要的。
没有单一的机器人适合所有任务——轮式探测器在室内表现出色,而人形机器人可能在不平坦的地形上表现更好。Gemini Robotics ER 2 实现了多机器人协作,允许不同的机器通过共享语义理解进行通信,以进行任务交接并完成复杂的工作流。看看 Gemini Robotics ER 2 如何使 Apptronik 的 Apollo 2 和 Franka F3 Duo 协作。
Gemini Robotics ER 2 推进了我们的核心空间推理能力,通过三个基准来衡量:
成功/失败检测:现在在原始视频源上运行,而非静态快照,以捕捉执行中的失败,如溅洒、滑动或错位。
通用仪表读取:扩展范围超越圆形刻度盘和观察窗,包括数字显示、线性刻度、尺子和液体温度计。我们在 10 种不同类型的仪表上测试了它。
增强的空间 VQA:通过 Gemini 在多模态理解中的进步改进视觉问答。
Gemini Robotics ER 2 在所有核心能力上始终实现最高精度,亮点包括成功检测(图像/视频)、问答(ERQA)和通用仪表读取。
Gemini Robotics ER 2 是我们最安全的模型,在安全指令遵循和人类邻近度基准上取得了显著进展,这些基准评估模型在推理任务中如何遵守物理约束以及用于检测人类的空间感知。我们发现 Gemini Robotics ER 2 在人员靠近时成功让人形机器人停止,并在区域被清空后自动恢复工作。为了推进物理智能体的安全,我们引入了一个基准,通过测试基础模型充当安全 VLA 编排器的能力,即其强制执行安全约束、监控环境、评估物理可行性以及寻求人类澄清的能力,来评估基础模型的这一能力。详情请见我们的安全技术报告。
Gemini Robotics ER 2 在安全指令遵循和人类邻近度基准上优于 ER 1.6 和其他前沿模型。
展望未来,我们的计划是推动这些模型处理更加复杂的任务,以加速有帮助的机器人的开发,并支持机器人学社区。