新版本赋予机器人感知、规划、决策、工具操作能力,推进物理 Agent 的自主执行复杂多步任务。
我们正在推动物理Agent时代的到来——让机器人能够感知、规划、思考、使用工具并付诸行动,从而更好地解决复杂的多步骤任务。
今年早些时候,我们在将Gemini的多模态理解能力引入物理世界方面取得了巨大进展,首先推出了Gemini Robotics系列模型。
今天,我们在推动智能、真正通用目的机器人方面迈出了又一步。我们推出两个模型,通过先进思维能力解锁Agent体验:
Gemini Robotics 1.5 – 我们最强大的视觉-语言-动作(VLA)模型,将视觉信息和指令转化为机器人的电机命令来执行任务。该模型在采取行动前会思考并展示其过程,帮助机器人更透明地评估和完成复杂任务。它还能跨具身学习,加速技能获得。
Gemini Robotics-ER 1.5 – 我们最强大的视觉-语言模型(VLM),能推理物理世界、原生调用数字工具,并创建详细的多步骤计划来完成任务。该模型现在在空间理解基准上实现了最先进的性能。
这些进展将帮助开发者构建更强大、多功能的机器人,能够主动理解环境,以通用方式完成复杂的多步骤任务。
从今天开始,我们通过Google AI Studio中的Gemini API向开发者提供Gemini Robotics-ER 1.5。Gemini Robotics 1.5目前向精选合作伙伴提供。可在开发者博客上详细了解如何使用下一代物理Agent进行开发。
大多数日常任务需要上下文信息和多个步骤才能完成,这使得它们对当今机器人来说极具挑战性。
例如,如果要求机器人"根据我的位置,你能否将这些物品分别放入正确的堆肥、回收和垃圾箱?",它需要在网络上搜索相关的本地回收指南,观察面前的物品,根据这些规则弄清楚如何分类——然后执行完全整理这些物品所需的所有步骤。因此,为了帮助机器人完成这些复杂的多步骤任务,我们设计了两个在Agent框架中协作的模型。
我们的具身推理模型Gemini Robotics-ER 1.5就像一个高层大脑,编排机器人的活动。该模型擅长在物理环境中进行规划和逻辑决策。它具有最先进的空间理解能力,能够使用自然语言交互,估计成功和进度,并能原生调用Google搜索等工具查找信息或使用任何第三方用户定义函数。
Gemini Robotics-ER 1.5随后为Gemini Robotics 1.5提供自然语言指令以执行每一步,后者利用其视觉和语言理解能力直接执行特定操作。Gemini Robotics 1.5还帮助机器人思考其行动,以更好地解决语义复杂的任务,甚至可以用自然语言解释其思维过程——使其决策更加透明。
这两个模型都建立在核心Gemini系列模型的基础上,并使用不同的数据集进行了微调,以专门化各自的角色。结合使用时,它们增强了机器人泛化到更长任务和更多样化环境的能力。
Gemini Robotics-ER 1.5是首个为具身推理优化的思维模型。它在学术和内部基准上都实现了最先进的性能,灵感来自我们信任的测试者计划中的真实应用案例。
我们在包括具身推理问答(ERQA)和Point-Bench在内的15个学术基准上评估了Gemini Robotics-ER 1.5,衡量该模型在指向、图像问答和视频问答方面的性能。
查看我们技术报告中的详细信息。
传统的视觉-语言-动作模型直接将指令或语言计划转化为机器人的运动。Gemini Robotics 1.5不仅仅是简单地转化指令或计划,现在还能在采取行动前进行思考。这意味着它能生成自然语言的内部推理和分析序列,来执行需要多个步骤或需要更深层语义理解的任务。
例如,当完成"按颜色分类我的衣物"这样的任务时,下面视频中的机器人在不同层面进行思考。首先,它理解按颜色分类意味着把白色衣物放入白色箱子,其他颜色的衣物放入黑色箱子。然后它思考要采取的步骤,比如拿起红色毛衣放入黑色箱子,以及涉及的详细运动,比如移动毛衣以便更容易地拿起它。
在这个多层级思维过程中,视觉-语言-动作模型可以决定将更长的任务分解成更短的简单任务段,供机器人成功执行。这也帮助该模型泛化到解决新任务,并对环境变化更加鲁棒。
机器人有各种形状和大小,具有不同的感知能力和不同的自由度,这使得难以将一个机器人学到的运动转移到另一个机器人。
Gemini Robotics 1.5展现了跨不同具身学习的非凡能力。它能将从一个机器人学到的运动转移到另一个机器人,而无需为每个新具身专门定制模型。这个突破加速了新行为的学习,帮助机器人变得更聪明、更有用。
例如,我们观察到仅在训练期间呈现给ALOHA 2机器人的任务,也可以在Apptronik的人形机器人Apollo和双臂Franka机器人上运行,反之亦然。
当我们释放具身AI的全部潜力时,我们正在主动开发新颖的安全和对齐方法,以便能够在以人为中心的环境中负责任地部署Agent AI机器人。
我们的责任与安全委员会(RSC)和负责任开发与创新(ReDI)团队与机器人团队合作,确保这些模型的开发符合我们的AI原则。
Gemini Robotics 1.5通过高层语义推理实施整体安全方法,包括在采取行动前思考安全问题、确保与人类的尊重对话(符合现有的Gemini安全政策对齐),以及在需要时触发机器人上的低层安全子系统(例如避碰)。
为了指导Gemini Robotics模型的安全开发,我们还发布了ASIMOV基准的升级版本,这是一个用于评估和改进语义安全的全面数据集集合,具有更好的尾部覆盖、改进的注释、新的安全问题类型和新的视频模态。
在ASIMOV基准的安全评估中,Gemini Robotics-ER 1.5表现最先进,其思维能力显著促进了对语义安全的理解和对物理安全约束的更好遵守。
在我们的技术报告或访问我们的安全网站上详细了解我们的安全研究。
Gemini Robotics 1.5标志着朝着解决物理世界中的AGI迈进的重要里程碑。通过引入Agent能力,我们正在超越对命令做出反应的模型,创建能够真正推理、规划、主动使用工具和泛化的系统。
这是朝着构建能够以智能和灵巧方式应对物理世界复杂性的机器人迈进的基础性一步,最终成为更有帮助且融入我们生活的存在。
我们期待与更广泛的研究社区继续这项工作,迫不及待地想看看机器人社区将使用我们最新的Gemini Robotics-ER模型构建什么。
致谢
这项工作由Gemini Robotics团队开发:Abbas Abdolmaleki、Saminda Abeyruwan、Joshua Ainslie、Jean-Baptiste Alayrac、Montserrat Gonzalez Arenas、Ashwin Balakrishna、Nathan Batchelor、Alex Bewley、Jeff Bingham、Michael Bloesch、Konstantinos Bousmalis、Philemon Brakel、Anthony Brohan、Thomas Buschmann、Arunkumar Byravan、Serkan Cabi、Ken Caluwaerts、Federico Casarini、Christine Chan、Oscar Chang、London Chappellet-Volpini、Jose Enrique Chen、Xi Chen、Hao-Tien Lewis Chiang、Krzysztof Choromanski、Adrian Collister、David B. D'Ambrosio、Sudeep Dasari、Todor Davchev、Meet Kirankumar Dave、Coline Devin、Norman Di Palo、Tianli Ding、Carl Doersch、Adil Dostmohamed、Yilun Du、Debidatta Dwibedi、Sathish Thoppay Egambaram、Michael Elabd、Tom Erez、Xiaolin Fang、Claudio Fantacci、Cody Fong、Erik Frey、Chuyuan Fu、Ruiqi Gao、Marissa Giustina、Keerthana Gopalakrishnan、Laura Graesser、Oliver Groth、Agrim Gupta、Roland Hafner、Steven Hansen、Leonard Hasenclever、Sam Haves、Nicolas Heess、Brandon Hernaez、Alex Hofer、Jasmine Hsu、Lu Huang、Sandy H. Huang、Atil Iscen、Mithun George Jacob、Deepali Jain、Sally Jesmonth、Abhishek Jindal、Ryan Julian、Dmitry Kalashnikov、Stefani Karp、Matija Kecman、J. Chase Kew、Donnie Kim、Frank Kim、Junkyung Kim、Thomas Kipf、Sean Kirmani、Ksenia Konyushkova、Yuheng Kuang、Thomas Lampe、Antoine Laurens、Tuan Anh Le、Isabel Leal、Alex X. Lee、Tsang-Wei Edward Lee、Guy Lever、Jacky Liang、Li-Heng Lin、Fangchen Liu、Shangbang Long、Caden Lu、Sharath Maddineni、Anirudha Majumdar、Kevis-Kokitsi Maninis、Andrew Marmon、Sergio Martinez、Assaf Hurwitz Michaely、Niko Milonopoulos、Joss Moore、Robert Moreno、Michael Neunert、Francesco Nori、Joy Ortiz、Kenneth Oslund、Carolina Parada、Emilio Parisotto、Peter Pastor Sampedro、Acorn Pooley、Thomas Power、Alessio Quaglino、Haroon Qureshi、Rajkumar Vasudeva Raju、Helen Ran、Dushyant Rao、Kanishka Rao、Isaac Reid、David Rendleman、Krista Reymann、Miguel Rivas、Francesco Romano、Yulia Rubanova、Pannag R Sanketi、Dhruv Shah、Mohit Sharma、Kathryn Shea、Mohit Shridhar、Charles Shu、Vikas Sindhwani、Sumeet Singh、Radu Soricut、Rachel Sterneck、Ian Storz、Razvan Surdulescu、Jie Tan、Jonathan Tompson、Saran Tunyasuvunakool、Jake Varley、Grace Vesom、Giulia Vezzani、Maria Bauza Villalonga、Oriol Vinyals、René Wagner、Ayzaan Wahid、Stefan Welker、Paul Wohlhart、Chengda Wu、Markus Wulfmeier、Fei Xia、Ted Xiao、Annie Xie、Jinyu Xie、Peng Xu、Sichun Xu、Ying Xu、Zhuo Xu、Jimmy Yan、Sherry Yang、Skye Yang、Yuxiang Yang、Hiu Hong Yu、Wenhao Yu、Li Yang Ku、Wentao Yuan、Yuan Yuan、Jingwei Zhang、Tingnan Zhang、Zhiyuan Zhang、Allan Zhou、Guangyao Zhou和Yuxiang Zhou。
我们还想感谢:Amy Nommeots-Nomm、Ashley Gibb、Bhavya Sukhija、Bryan Gale、Catarina Barros、Christy Koh、Clara Barbu、Demetra Brady、Hiroki Furuta、Jennie Lees、Kendra Byrne、Keran Rong、Kevin Murphy、Kieran Connell、Kuang-Huei Lee、M. Emre Karagozler、Martina Zambelli、Matthew Jackson、Michael Noseworthy、Miguel Lázaro-Gredilla、Mili Sanwalka、Mimi Jasarevic、Nimrod Gileadi、Rebeca Santamaria-Fernandez、Rui Yao、Siobhan Mcloughlin、Sophie Bridgers、Stefano Saliceti、Steven Bohez、Svetlana Grant、Tim Hertweck、Verena Rieser和Yandong Ji。
对于这项工作的领导和支持,我们要感谢:Jean-Baptiste Alayrac、Zoubin Ghahramani、Koray Kavukcuoglu和Demis Hassabis。我们要表彰Google和Google DeepMind的众多团队为这项工作做出的贡献,包括法律、市场营销、通信、责任与安全委员会、负责任开发与创新、政策、战略与运营,以及我们的业务和企业开发团队。我们要感谢上面没有明确提及的机器人团队的每一位成员的持续支持和指导。最后,我们要感谢Apptronik团队的支持。
Gemini Robotics将AI引入物理世界
Gemini Robotics On-Device将AI带入本地机器人设备