Google DeepMind 升级 Gemini 机器人模型,从仅控制上半身扩展到整个人形机器人的端到端控制。
Google DeepMind 表示,最新版 Gemini Robotics AI 模型可以“控制整个人形机器人”。此前的模型主要控制人形机器人的上半身,而据周四发布的公告称,Gemini Robotics 2 现已支持从双脚到指尖的“全身运动”。
新模型能够让人形机器人执行更广泛的动作,包括行走、下蹲、伸展和操控物体。Google 分享的视频展示了 Apptronik 的 Apollo 2 机器人如何弯腰拿起洒水壶,以及如何从货架上找到并取下指定物品。
尽管 Google DeepMind 指出,其机器人“在移动速度方面仍有很大的提升空间”,但也表示,此次更新“是迈向掌握更复杂现实世界任务所需技能的重要一步,这些任务需要全身协调配合”。
此外,Gemini Robotics 2 的灵巧性也有所提升,现在可以控制结构更加复杂的五指手。这让机器人能够执行封好 Ziploc 密封袋、扎紧垃圾袋或拧下灯泡等任务。
Google DeepMind 还更新了 Gemini Robotics ER(embodied reasoning,具身推理)。这是一种 vision-language model,可帮助机器人分析周围环境、处理指令并执行多步骤任务。Gemini Robotics ER 2 更擅长完成持续时间较长的任务,并且“现在能够理解任务何时开始、何时结束”。
Google DeepMind 表示,此次更新还支持多个不同类型的机器人协同工作并完成任务。其中一段视频展示了在清理车库时,Apollo 2 如何指示 Google 的双臂机器人将工具放进收纳箱。
该公司指出,Gemini Robotics ER 2 是其“迄今最安全的机器人模型”,因为它能够“更好地检测附近是否有人、触发安全工具调用,并在有人靠得过近时让机器人安全停止”。
与此同时,Google DeepMind 还改进了 Gemini Robotics On-Device Model。该模型无需互联网连接,即可在机器人本地运行。如今,它能够更快适配新的机器人形态,包括那些拥有“截然不同的外形、传感器和自由度”的机器人。