Google DeepMind 发布 Gemini Robotics 2,支持机器人全身协调控制,推进端到端机器人学习。
从脚到指尖——我们正在教会机器人实现智能全身控制、精细操作和团队协作,从而完成各种复杂任务。
几十年来,我们一直梦想着机器人能够无缝融入我们的世界,助人一臂之力。如今,这一愿景向前迈出了重要一步。
大多数机器人只能按照预先编写的程序运行,或通过远程操控完成范围有限、不断重复的任务序列。它们既无法真正自主学习,也不能适应不可预测的环境。此外,将一种机器人学会的技能迁移到另一种机器人本体上,依然极其困难。要大规模解决最棘手的问题,各种形态和尺寸的机器人都需要 AI 模型赋予它们思考、行动和智能交互的能力,从而安全地完成任务。
我们此前通过 Gemini Robotics 展示了 Gemini 的多模态理解能力如何驱动现实世界中的行动。今天,我们正式推出 Gemini Robotics 2——驱动下一代真正具备适应能力的机器人的智能层。随着它迈出字面意义上的第一步,这项重大进展解锁了智能全身控制、高级灵巧操作以及多机器人协作能力。
Gemini Robotics 2 让机器人能够对每一个动作进行推理,从而解锁广泛的任务能力。例如,它可以让人形机器人通过行走、蹲下、伸展身体和操作物体,清理杂乱的房间。它甚至还能与其他机器人组队,更快地完成工作。更重要的是,这种强大的智能还可以直接在设备本地运行,并且只需几小时便能无缝适配全新的机器人本体。
我们通过三个能力强大的模型实现了这一点:
Gemini Robotics 2: 我们目前最先进的视觉-语言-动作模型(VLA),可以将视觉和语言输入转化为运动控制,让机器人采取行动。该模型能够控制完整的人形机器人——从脚到指尖——以及其他双臂机器人。它还显著提升了双手和夹爪的灵巧操作水平。
Gemini Robotics ER 2: 我们目前能力最强的具身推理(ER)模型。这是一个充当 Agent 的视觉语言模型(VLM),使机器人能够与人类沟通、理解物理世界,并规划持续数分钟的多步骤任务。我们还首次引入了让机器人以团队形式协同工作的能力。
Gemini Robotics On-Device 2: 我们最高效的视觉-语言-动作模型(VLA),经过专门优化,可直接在机器人设备本地运行。现在,只需使用几小时的数据,该模型便能快速适配完全不同的机器人本体。
我们的推理模型 Gemini Robotics ER 2 现已在 Google AI Studio 上开放,并在 Gemini Enterprise Agent Platform 中提供私有预览。VLA 和 On-Device 模型则面向早期体验合作伙伴开放。关于如何将这些模型引入你的硬件,请参阅我们的 Developer 博客。
现实世界是围绕人类的运动方式构建的;我们需要在狭窄、杂乱的空间里伸手、弯腰并保持平衡。此前,我们的模型只能控制人形机器人的上半身来完成桌面任务,而 Gemini Robotics 2 将物理 AI 扩展到了全身运动。
我们的模型现在首次能够控制完整的人形机器人,将意图转化为智能全身控制。例如,在控制 Apptronik 的 Apollo 2 人形机器人时,我们可以要求它“把洒水壶放进最底层搁板上的绿色箱子里”。Apollo 会处理这条指令,走到桌子旁拿起洒水壶,再走几步来到搁板前,将它准确地放进目标位置。尽管我们的机器人在运动速度方面仍有提升空间,但这是迈向更复杂现实任务所需技能的重要一步,因为这类任务要求机器人具备全身协调能力。
要想在家庭和工作场所中真正发挥作用,机器人必须具备精细操作能力。无论机器人使用的是手还是夹爪,Gemini Robotics 2 都能在不同的末端执行器上解锁更高水平的物理灵巧性,让机器人比以往任何时候都更加实用。
现在,该模型可以控制 Apollo 2 机器人所搭载的 SharpaWave 五指手。这只机械手拥有 22 个自由度,能够完成打结、密封自封袋等精细动作。它还可以控制 Franka Duo 平台上的标准双指平行夹爪,执行复杂的灵巧操作任务,例如紧密装箱。我们正在继续提升其精度和速度,以实现人类水平的灵巧操作能力。
现实世界中的大多数任务都需要在较长时间内完成多个步骤。为了应对这种复杂性,我们的具身推理(ER)模型 Gemini Robotics ER 2 会充当机器人的高层大脑,处理用户指令并与人类沟通。它会观察房间、推理完成任务所需的步骤、与 VLA 协调以执行动作,并持续跟踪进度,直至任务完成。这套架构让机器人能够执行复杂的多步骤任务,在某一步失败时自行纠正,并将能力泛化到新的情境和目标中。
在这次更新中,我们让机器人能够更可靠地执行持续数分钟、涉及数百次决策的长任务序列。Gemini Robotics ER 2 现在能够理解任务何时开始、何时结束,还可以准确定位关键事件发生的时刻,使其对任务进度的理解实现了跨越式提升。
此外,我们还引入了多机器人协作能力。不同类型的机器人现在可以相互沟通、协同工作,完成单个机器人无法独立处理的复杂工作流。
许多机器人应用需要在没有网络延迟或互联网连接的情况下运行。Gemini Robotics On-Device 2 正是为应对这些限制而构建的——它是我们最高效的视觉-语言-动作模型(VLA),经过专门优化,可以直接在机器人设备本地运行。
该模型原生支持多种机器人本体,并继承了 Gemini Robotics 1.5 中先进的“动作迁移”技术。现在,我们只需几小时的适配时间,通常使用不到 200 个样本,就能适配新的双臂机器人本体。即使新本体在外形、传感器和自由度方面存在巨大差异,这项能力依然有效。如下方所示,Dexmate、SO101 和 Trossen 等平台都可以完成各种不同的任务。
安全是我们机器人研究的根基。随着机器人获得越来越强的物理能力,我们致力于确保端到端的安全性和对齐。每次发布新版本时,我们都会采用多层次方案,将传统的物理安全措施与稳健的 AI 安全框架结合起来。
Gemini Robotics 2 尤其强化了机器人在应对现实世界不确定性以及与人类协同工作时的安全能力。
我们推出了 ASIMOV-Agentic,这是一项用于评估 Agent 式安全编排和不确定性消解能力的新基准。例如,它会衡量具身推理 Agent 拒绝 VLA 不安全工具调用的能力,还会评估 Agent 能否预测一项任务是否可行,以及能否在存在不确定性时主动请求人类介入。
此外,得益于增强的具身推理能力,Gemini Robotics ER 2 在安全约束遵循和人类近距离交互基准中,成为我们迄今最安全的机器人模型。它可以更准确地检测附近是否有人,在必要时触发安全工具调用;如果有人靠得太近,还能让机器人安全停止。这是协作安全标准中的一项关键要求。更多详情请参阅《Gemini Robotics 2:安全技术报告》。
Gemini Robotics 2 是我们在解决物理世界 AGI 的道路上取得的一项重要里程碑。要释放机器人技术的真正潜力,就必须跨越单任务自动化,迈向通用智能。通过构建这种核心智能,我们的目标是让物理世界中的 AI 能够与人类并肩协作,共同解决复杂挑战。
这项工作由 Gemini Robotics 团队完成:Abhijit Ogale、Abhishek Jindal、Adil Dostmohamed、Adrian Collister、Alan Thompson、Alessio Quaglino、Alex Bewley、Alex Hofer、Alex Taeho Kim、Alex X. Lee、Alex Zihao Zhu、Allen Chai、Amaris Paryag、Amit Hampaul、Amy Nommeots-Nomm、Amy Shen、Andre Araujo、Anirudha Majumdar、Anna Volosina、Annie S. Chen、Annie Xie、Anthony Brohan、Antoine Laurens、Arunkumar Byravan、Asaf Revach、Assaf Hurwitz Michaely、Baruch Tabanpour、Ben Moran、Benoit Landry、Bingyi Cao、Bogdan Mazoure、Brandon Hernaez、Brijen Thananjeyan、Bryan Anenberg、Caden Lu、Carl Doersch、Carolina Parada、Charles Shu、Chengda Wu、Christine Chan、Christy Koh、Chuyuan Fu、Claire Cui、Clare Lee、Claudio Fantacci、Connor Schenck、David Rendleman、Deepali Jain、Demetra Brady、Dennis Li、Dhruv Shah、Dimple Vijaykumar、Dirk Ehrlich、Divya Garikapati、Dmitry Kalashnikov、Dre Mahaarachchi、Dushyant Rao、Erik Frey、Fangchen Liu、Francesco Romano、Frankie Garcia、Gabor Simko、Gautam Salhotra、Giulia Vezzani、Grace Popple、Grace Vesom、Graziano Misuraca、Guangyao Zhou、Hagen Soltau、Hanzi Mao、Hao-Tien Lewis Chiang、Harris Chan、Hila Noga、Howard Zhou、Ian Storz、Idan Lev-Yehudi、Ignacio Rocco、Inessa Konstanz、Isaac Reid、Ishita Prasad、Ivan Kapelyukh、J. Chase Kew、Jacky Liang、Jake Varley、James Susilo、Jasmine Hsu、Jerad Kirkland、Jeremy Plassmann、Jessica Lo、Jie Tan、Jimmy Yan、Jingwei Zhang、Jinyu Xie、Jose Enrique Chen、Joshua Ainslie、Joss Moore、Juanita Bawagan、Junkyung Kim、Justin Lidard、Kanishka Rao、Kathryn Quinn Shea、Kaustubh Sridhar、Keerthana Gopalakrishnan、Ken Caluwaerts、Kenneth Oslund、Khimya Khetarpal、Konstantinos Bousmalis、Krista Reymann、Krzysztof Choromanski、Ksenia Konyushkova、Kun Zhang、Kunal Aneja、Laura Graesser、Leen Verburgh、Leonard Hasenclever、Li-Heng Lin、London Chappellet-Volpini、Lucie Kerley、Maria Attarian、Maria Bauza Villalonga、Marissa Giustina、Max McCabe、Meet Kirankumar Dave、Mehdi S. M. Sajjadi、Metin Tokosz-Exley、Michael Neunert、Michael Noseworthy、Michiel Blokzijl、Miguel Rivas、Mithun George Jacob、Mitsuhiko Nakamoto、Mo Dawoud、Mohan Kumar Srirama、Mohit Sharma、Mohit Shridhar、Muinat Abdul、Murilo F. Martins、Nathan Batchelor、Nicolas Heess、Niko Milonopoulos、Norman Di Palo、Oliver Groth、Ouais Alsharif、Padmini Copparapu、Parth Parekh、Paul Ruiz、Paul Wohlhart、Peide Huang、Peng Xu、Peter Pastor、Petko Yotov、Phil Duffy、Philemon Brakel、Rachel Sterneck、Rajkumar Vasudeva Raju、Ravin Kumar、Razvan Surdulescu、René Wagner、Reza Sanatinia、Robert Baruch、Robert Moreno、Rohan Thakker、Roland Hafner、Sajjad Zafar、Sally Jesmonth、Sam Haves、Saminda Abeyruwan、Sandy Han Huang、Scott Crowell、Seliem El-Sayed、Sergey Yaroshenko、Sergio Martinez Abad、Serkan Cabi、Sharath Maddineni、Shuang Li、Sichun Xu、Silvia Cruciani、Skanda Koppula、Skye Yang、Soo Sung、Stefan Welker、Stefani Karp、Stefano Saliceti、Steven Hansen、Stuart Bowers、Sumeet Singh、Svetlana Grant、Takahiro Miki、Takuma Yoneda、Thomas Buschmann、Thomas Lampe、Thomas Power、Thor Schaeff、Tim Hertweck、Tingnan Zhang、Todd McInally、Todor Davchev、Tong Zhao、Travers Rhodes、Tsang-Wei Edward Lee、Vika Koriakin、Vikas Sindhwani、Wenhao Yu、Wentao Yuan、Xiaolin Fang、Yahav Nussbaum、Ying Sheng、Ying Xu、Yuheng Kuang、Yuxiang Yang、Yuxiang Zhou。
感谢 Jean-Baptiste Alayrac、Zoubin Ghahramani、Koray Kavukcuoglu 和 Demis Hassabis 对这项工作的领导与支持。我们还要感谢 Google 和 Google DeepMind 内部为这项工作做出贡献的众多团队,包括法务、市场营销、传播、责任与安全委员会、负责任开发与创新、公共政策、战略与运营,以及业务和企业发展团队。我们也要感谢 Robotics 团队中所有未在上文明确列出的成员,感谢他们持续提供支持与指导。最后,感谢我们的合作伙伴:Apptronik、Boston Dynamics 和 Agile Robots 团队,感谢他们给予的支持。