Google DeepMind 推出 Gemini Robotics 2 系列模型,包括视觉-语言-动作模型和具身推理框架。虽然技术先进,但针对的是机器人硬件领域,与大多数应用程序员距离较远。
Google DeepMind 发布了 Gemini Robotics 2,这是其新一代机器人的智能层。此次发布将该技术栈从桌面操作扩展到全身控制、五指灵巧性和多机器人团队协作。它以三个不同的模型发布,配有三个不同的访问层级。
当今大多数机器人都是预编程的或遥操作的,只能执行狭窄、重复的任务序列。它们无法适应不可预测的环境,技能也很少能在不同机器人体型间迁移。Gemini Robotics 2 同时针对所有三个限制。
三个模型一起发布:一个 VLA、一个具身推理 VLM 和一个设备上 VLA。
一个检查点可驱动 Apollo 2 配备两种不同的手以及一个 Franka Duo 夹爪。
Gemini Robotics ER 2 处于公开预览阶段;VLA 和设备上模型保持门禁状态。
多手指灵巧性仍然是薄弱环节,成功率从 32% 到 92% 不等。
ASIMOV-Agentic 是一个新的安全基准,发布在 Hugging Face 上,采用 CC-BY-4.0 许可证。
Gemini Robotics 2 是视觉-语言-动作(VLA)模型。它将视觉和语言输入转换为电机控制。它可以驱动从脚到指尖的完整人形机器人,以及其他双臂机器人。它还处理灵巧操纵,包括多手指手和平行夹爪。
Gemini Robotics ER 2 是具身推理(ER)模型。它是一个充当高级大脑的视觉语言模型。它与人类交流,理解物理世界,并规划持续几分钟的多步骤任务。根据其模型卡,ER 2 基于 Gemini 3.5 Flash。它接受交错的文本、图像、视频和音频,上下文窗口高达 128k,输出文本可达 64K 令牌。
Gemini Robotics On-Device 2 是优化为在机器人本地运行的高效 VLA。其模型卡说明它基于 Gemini Robotics 1.5 技术和 Google 的设备上 Gemma 模型构建。输入是文本、图像和机器人本体感觉(数值)。输出是机器人动作(数值)。
分工对系统设计很重要。ER 2 规划和跟踪任务,然后将电机执行交给声明为工具的 VLA。开发者注册低级控制接口,如 VLA 模型或导航 API,作为可调用的工具。然后他们直接将多模态视频、音频或文本流式输入到模型中。
之前的 Gemini Robotics 模型只控制人形机器人的上身用于桌面任务。Gemini Robotics 2 首次将控制扩展到全身运动。
工作示例使用了 Apptronik 的 Apollo 2。给定指令"把浇水罐放进底层的绿色垃圾桶",Apollo 走到桌子前拿起浇水罐。然后它走几步到书架前,将物体放在目的地。
Google DeepMind 对剩余差距的态度很直白。它声称其机器人在运动速度方面仍需进步。
Gemini Robotics 2 可以控制 Apollo 2 上的五指、22 自由度 SharpaWave 手。报告的动作包括打结和密封拉链袋。同一个模型也在 Franka Duo 平台上操作标准的两指平行夹爪,用于紧凑堆放等任务。
报告的成功率来自一个模型检查点控制三个具体化身:配备 SharpaWave 手的 Apollo 2、配备 Inspire 手的 Apollo 2 和配备 Robotiq 夹爪的 Franka Duo。
| 类别 | 具体化身 | 任务 | 成功率 |
|---|---|---|---|
| 通用全身操纵 | Apollo 2 + Inspire 手 | 从架子上拿起 | 76.3% |
| 通用全身操纵 | Apollo 2 + Inspire 手 | 从桌子上拿起 | 68.4% |
| 通用全身操纵 | Apollo 2 + Inspire 手 | 从地板上拿起 | 45.7% |
| 多手指灵巧性 | Apollo 2 + Sharpa 手 | 拧灯泡 | 92% |
| 多手指灵巧性 | Apollo 2 + Sharpa 手 | 系垃圾袋 | 44% |
| 多手指灵巧性 | Apollo 2 + Sharpa 手 | 拉链袋 | 40% |
| 多手指灵巧性 | Apollo 2 + Sharpa 手 | 螺纹灯泡 | 36% |
| 多手指灵巧性 | Apollo 2 + Sharpa 手 | 簸箕 | 32% |
| 夹爪灵巧性 | Franka Duo | 精确插入任务 | 89.6% |
| 夹爪灵巧性 | Franka Duo | 多样工具套装 | 78.9% |
| 夹爪灵巧性 | Franka Duo | 通用拿起和放置 | 74.2% |
开发者 X 帖子关注了一个很少被基准测试的问题:知道任务何时真正完成。
进度分类:
视频流中的每一帧都被分配到五个进度级别之一,从 0-20% 到 80-100%。Gemini Robotics ER 2 在此任务上达到 57.4% 的准确率。Google DeepMind 报告这超过了前一代模型和竞争对手的前沿模型。
这衡量的是模型是否能识别关键事件发生的精确帧。一个例子是停止向杯子中倒咖啡的时刻。ER 2 达到 91.3% 的准确率,平均绝对距离 0.96 秒。Google DeepMind 报告它与大得多的模型类别竞争接近,但执行速度快 4 倍。
ER 2 跨三种控制模式进行评估:真实 VLA、仿真 VLA 和人工遥操作。它在所有三种模式上都超过了 Gemini Robotics ER 1.6。
ER 2 通过双向流式端点与 Gemini Live API 集成。其目的是消除破坏多步骤执行的停顿-思考暂停。它还可以本地调用工具,如 Google Search 或任何用户定义的函数。
升级了三个空间能力。成功和失败检测现在在原始视频流上运行,而不是静态快照,能够捕捉执行中的溅洒和滑动。通用仪器读取从圆形刻度扩展到数字显示、线性刻度、尺子和液体温度计,在 10 种仪器类型上测试。空间视觉问答通过 Gemini 的多模态进步而改进。
Google DeepMind 使用 ER 2 构建了一个与 Boston Dynamics 的 Spot 的演示,以编排 Spot 导航和操纵器 API。示例代码可在 robotics-samples 存储库中获得。
Gemini Robotics 2 引入了不同机器人类型之间的协作。理由是没有单一机器人适合每项任务。轮式探测车适合室内工作,而人形机器人更好地处理不平地形。
机器人通过共享的语义理解来沟通,以移交子任务。演示的配对是 Apptronik 的 Apollo 2 和 Franka F3 Duo。
Gemini Robotics On-Device 2 面向无法依赖网络延迟或连接的应用。它原生支持多具体化身,继承了 Gemini Robotics 1.5 的运动迁移技术。
Google DeepMind 报告只需几小时就能适应新的双臂具体化身,通常需要少于 200 个示例。这对于形状、传感器和自由度差异很大的具体化身也适用。演示的平台包括 Dexmate、SO101 和 Trossen。
模型卡发布了针对仅在后训练期间引入的平台的 On-Device 1 的数据缩放比较:
| 平台 | 模型 | 开始 | 结束 |
|---|---|---|---|
| SO101 | On-Device 2 | 6.7% | 53.3% |
| SO101 | On-Device 1 | 0.0% | 6.7% |
| Dexmate | On-Device 2 | 24.4% | 75.6% |
| Dexmate | On-Device 1 | 13.3% | 33.3% |
SO101 的结果更明显。On-Device 1 几乎无法离开地面,而 On-Device 2 超过了 50%。
模型卡还列出了限制。On-Device 2 在泛化到分布外任务和控制高自由度机器人方面存在局限。
| 模型 | 访问权限 |
|---|---|
| Gemini Robotics ER 2 | 通过 Gemini API 和 Google AI Studio 的公开预览;Gemini Enterprise Agent Platform 上的私有预览 |
| Gemini Robotics 2 (VLA) | 早期访问合作伙伴 |
| Gemini Robotics On-Device 2 | 受信任的测试者 |
AI Studio 启动链接使用模型字符串 gemini-robotics-er-2-preview。快速入门笔记本在 robotics-samples 存储库中。
来源:Gemini Robotics 2 公告、Gemini Robotics ER 2 开发者帖子、ER 2 模型卡、On-Device 2 模型卡、ASIMOV-Agentic 数据集和安全技术报告。
Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位富有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台因其对机器学习和深度学习新闻的深入报道而脱颖而出,既在技术上严谨,又易于广泛受众理解。该平台拥有超过 200 万月度浏览量,充分说明了其在受众中的受欢迎程度。