Google DeepMind 发布 Gemini Robotics 2 套件,包含 VLA 视觉-语言-动作模型、具身推理模型和本地部署 VLA;核心突破是模型可在数小时内适配全新机器人形态,而传统方式需数月。
Gemini Robotics 2 是 Google DeepMind 于 2026 年 7 月 30 日发布的机器人基础模型套件,将 AI 控制从机器人的桌面夹持器扩展到全身——从脚到指尖。它以三个模型的形式发布:一个将相机画面和语音指令转化为电机指令的视觉-语言-动作(VLA)模型;一个在多分钟任务中进行规划和监督的具身推理模型(ER 2);以及一个在机器人本地运行的设备端 VLA。核心宣称是:人形机器人现在可以自主行走、蹲下、弯腰、操作物体并与第二台机器人协作,而且整个技术栈在几小时内就能适配全新的机器人躯体,而不是几个月。
最后这个数字才是值得深思的。机器人领域的瓶颈从来不是"模型能不能拿起一个杯子"。真正的瓶颈在于:每一个新底盘、每一个新夹持器、每一个新摄像头位置,都意味着要从近乎零开始重新训练。如果一个基础模型能在几小时内迁移到新的具身形态,整个人形机器人行业的经济逻辑就会改变——这比又一段机器人叠衣服的实验室演示要大得多。
本文将拆解实际发布的内容、三个模型如何分工、演示证明了什么又没证明什么,以及 Gemini Robotics 2 在 2026 年物理 AI 领域的站位。
Google DeepMind 于 2026 年 7 月 30 日宣布 Gemini Robotics 2,为其机器人基础模型产品线增加了全身控制、先进灵巧性和多机器人协作能力。
三个模型一同发布:Gemini Robotics 2 (VLA)、Gemini Robotics ER 2(具身推理)和 Gemini Robotics On-Device 2(本地 VLA)。
该系统在 Apptronik 的 Apollo 2 人形机器人上进行了演示,实现全身自主运动,而非仅仅局限于坐姿机械臂操作。
ER 2 充当规划者的角色:它观察场景、将任务分解为步骤,并在持续数分钟的任务中做出数百个决策。
DeepMind 表示,该技术栈能在几小时内适配新的机器人躯体——这是本次发布中最具商业意义的宣称。

Gemini Robotics 2 是 Google DeepMind 的三个机器人基础模型家族,将视觉和自然语言指令转化为机器人全身的物理电机控制。上一代产品主要聚焦于固定基座的上半身操作。版本 2 增加了运动、平衡和协调能力,因此人形机器人可以在单一连续策略下穿越环境并对其施加动作,而不需要在行走控制器和抓取控制器之间来回切换。
根据 Google DeepMind 的公告,该模型可以驱动完整的人形机器人以及传统双臂机器人,支持多指手和简单的平行夹持器。这种硬件无关性比听起来重要得多。大多数机器人学习研究都悄悄绑定在某一特定机械臂、某一只手、某一个实验室。能跨夹持器迁移的策略,才是制造商真正愿意付费购买的策略。
与发布同步公布的演示视频刻意选择了平淡无奇的任务:拧上灯泡、系垃圾袋、整理凌乱的房间。选择这些任务是因为它们需要持续的多步推理加上精细的力控制——这两件事机器人历来无法同时做到。
架构上深思熟虑地将"思考"和"执行"分开,理解这种分工能解释演示中的大部分内容。
ER 2 是被低估的那个部分。正如 Google 在 ER 2 论文中所描述的,它观察环境、制定工作流程、跟踪进度并指导动作模型——在持续数分钟的任务中做出数百个决策。这就是"能执行一个动作的机器人"与"能完成一项家务的机器人"之间的区别。
设备端变体是实用的那个。延迟和连接性是工厂车间的现实约束,一个能优雅降级到本地推理的策略,比每一步控制都需要往返数据中心的策略更容易部署。这与在本地运行 LLM 的架构直觉相同——云端模型设定了上限,本地模型设定了在网络不通时仍然能工作的下限。
在演示中是的,但有一个重要的附带条件:灵巧性的提升是展示出来的,而不是与公开标准对比测量的。DeepMind 报告了跨多指手和平行夹持器的先进灵巧性,Bloomberg 的报道明确将本次发布定位在机器人"灵巧性困难"这一语境上——诚实的解读是:这是对一个尚未解决问题取得的进展,而非已解决的问题。
机器人领域至今没有 Terminal-Bench 或 MMLU。没有任何共享的、对抗性的第三方评估体系,能让你说出"模型 A 在操控上比模型 B 高 N 分"这样的话。这种缺失意味着 2026 年的每一次机器人发布都是基于视频来评判的,而视频是世界上最容易挑选的媒介。当我们实际评估这类宣称时,真正重要的问题是:拍了几条、成功率的试测是多少、机器人是从失败中恢复的还是直接切断了画面?
DeepMind 值得肯定的是,多机器人协作演示比单臂视频更难造假,因为两个机器人共享一个任务时必须实时处理彼此的时序误差。
展示用的机器人是 Apptronik 的 Apollo 2。根据 Robotics & Automation News 的报道,Apollo 2 运行 Gemini Robotics 2 时能够执行全身自主运动——行走、蹲下、弯腰、操作——同时实时推理复杂任务。
这是一个战略性选择,而不只是营销。Google DeepMind 将自己定位为大脑层,让合作伙伴拥有躯体层。这是 Android 策略在机器人领域的应用:不做硬件制造,但确保每个重要的制造商都跑你的技术栈。如果"几小时内适配新躯体"的宣称经得起第三方测试,那这个策略会快速变得极具说服力,因为机器人 OEM 的切换成本将趋于零。
对应的立场是特斯拉——它正在自研大脑和躯体,以及中国的人形机器人制造商——他们主要在单元成本上竞争。这是三种真正不同的赌注,赌的是物理 AI 的价值最终积累在何处。

机器人基础模型在计算上的需求饥渴,将其直接连接到我们一直在追踪的基础设施故事。训练一个全身 VLA 意味着视频规模的多模态数据和大量的加速器时间,而云端 ER 2 模型的推理是按每机器人、每秒计费的成本,而非按每次查询计费。
这使得机器人领域完全置身于驱动定制 AI 芯片革命和韩国 880 亿美元 AI 芯片投资计划的同一困境中。1000 台持续运行多模态推理的人形机器人车队,是一个带着腿的数据中心工作负载。设备端模型不仅仅是一个延迟优化——它是一个成本策略,那些本地推理做得好的实验室将能够部署云端竞争对手无法负担运行的车队。
还有一个安全性维度,公告处理得很低调。一个 LLM 误读指令会产生一段糟糕的文字。一个全身策略误读指令会产生 60 公斤移动的金属。该行业的评估实践还没有追上这种不对称性,而这正是我们在 AI 浏览器代理及其安全漏洞上标记过的同样结构性差距:能力释放的速度超过了验证它的 harness。
这是大多数报道缺失的角度。"几小时内适配新躯体"正在被当作一个研究结果来解读。它实际上是一个商业模式的结果。
如果适配是廉价的,那么每一个部署的机器人都成为改进共享策略的数据来源,而且每一次额外部署的边际价值不是下降而是上升。这是一个复合循环,与让云端 LLM 可防御的循环相同。无论谁先部署了一个大型、多样化、持续运行的车队,他拥有的不仅仅更多机器人——他拥有的是没有匹配的车队就无法复制的策略。
这意味着在未来 12 个月要关注的数字不是基准分数,而是部署在非结构化环境中运行 Gemini Robotics 2 的已部署机器人小时数。DeepMind 尚未公布这个数字。在它公布之前,把能力宣称当作强烈信号而非已定论的结果来对待。
Gemini Robotics 2 是什么? Gemini Robotics 2 是 Google DeepMind 于 2026 年 7 月 30 日宣布的机器人基础模型套件,赋予人形机器人和双臂机器人全身控制、先进灵巧性和多机器人协调能力。它包含一个视觉-语言-动作模型、一个名为 ER 2 的具身推理模型,以及一个高效的设备端变体。
Gemini Robotics 2 与第一版有何不同? 第一代聚焦于固定基座的上半身操控。Gemini Robotics 2 增加了全身控制,因此人形机器人可以在单一策略下行走、蹲下、弯腰的同时操控物体。它还增加了多机器人协作和一个本地设备端模型。
哪些机器人运行 Gemini Robotics 2? 旗舰演示平台是 Apptronik 的 Apollo 2 人形机器人。DeepMind 表示该模型也可以驱动传统双臂机器人,可使用多指手或标准平行夹持器,并能在几小时内适配新的机器人躯体。
Gemini Robotics 2 可以在没有互联网的情况下运行吗? 部分可以。Gemini Robotics On-Device 2 是一个高效 VLA,经过优化可在机器人硬件上本地运行,因此基本的动作执行可以离线继续。负责长时程规划的 ER 2 推理模型则是云端组件。
Gemini Robotics 2 对开发者开放吗? 目前只能通过 Google DeepMind 的机器人合作伙伴计划访问,而非通用公共 API。对比一下开放权重发布如 Thinking Machines 的 Inkling——任何人都可以下载权重——2026 年机器人模型比语言模型的门控程度仍然高得多。
这意味着人形机器人已经准备好进工厂了吗? 还没有大规模就绪。2026 年经验证的商用人形机器人部署在全球仍以数百到低数千台计,大多数需要现场供应商工程支持。Gemini Robotics 2 提高了软件上限;硬件供应链和集成成本仍然是刚性约束。
Gemini Robotics 2 是 2026 年以来最重要的机器人发布,而原因在于架构而非杂技。将具身推理与动作执行分离,并在云端模型旁边发布本地模型,这是使车队部署在财务上可行的设计。全身演示令人印象深刻;但"数小时而非数月"的躯体迁移才是真正可能重组一个行业的部分。
诚实的附带说明:机器人领域没有共享基准,因此这里的每一项宣称都基于 DeepMind 自己的视频和 DeepMind 自己的数字。把它当作强烈信号而非定论来对待,并关注未来两个季度在非 Apptronik 硬件上的第三方复现。
如果你在追踪这一切的计算资源来自哪里,请阅读我们对定制 AI 芯片革命的深度解析——这些机器人中的大脑是那场芯片之争的下游。
机器人终于学会了同时行走和思考。现在这个行业必须证明它们能在八小时轮班中、在别人的工厂车间里、在没有 Google 工程师站在旁边的情况下做到这些。