Google 发布视觉-语言-动作(VLA)通用机器人模型,整合多模态感知和控制,为机器人开发者提供新的能力基础。
2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2——它可能是迄今最接近“通用机器人智能大脑”的技术。
多年来,RT-2、Octo 和 π0 等视觉-语言-动作(Vision-Language-Action,VLA)模型始终专注于一件事:桌面操作。一条机械臂、一个夹爪,以及在固定台面上执行取放任务。它们固然实用,但距离真正能够在人类活动空间中自由移动的机器人还很遥远。
Gemini Robotics 2 改变了这一局面。它是首个能够在单次会话中控制完整人形机器人身体的 VLA 模型家族——从脚、腿、躯干、手臂、手掌到手指。
下面是对它的客观拆解:哪些是真正的创新,哪些仍受限于合作伙伴计划,以及谁应该关注它。
Gemini Robotics 2 并不是单一模型,而是由三个模型组成,分别面向机器人技术栈的不同部分。
这是一个视觉-语言-动作模型,可以将摄像头输入和文本指令直接转换为电机控制命令,不需要中间的运动规划层。它支持:
这是一个视觉-语言模型,充当机器人的高层智能大脑。它可以规划持续数分钟的多步骤任务、与人类沟通、监控任务进度,并在某个步骤失败时重新规划。它还能协调多个机器人共同完成同一项任务。
关键在于,ER 2 目前已经可以在 Google AI Studio 中使用——即使没有机器人,你也可以测试这个推理模型。
这是一个可以直接在机器人硬件上本地运行的高效 VLA,无须依赖云端。它最突出的特点是:只需数小时即可完成机器人本体迁移。DeepMind 表示,仅需几个小时的数据和不到 200 个样本,就能让模型适配新的机器人身体。
这是最值得关注的部分。以往的 VLA 模型只能控制桌面上的机械臂,而 Gemini Robotics 2 可以控制完整的人形机器人——演示中的差异非常直观:
全身控制要求模型同时对平衡、触达范围、运动轨迹、作用力和物体交互进行推理。这是一个神经网络多年来始终难以解决的协调问题——也是只能待在工厂围栏里的机器人与能够在你家中工作的机器人之间的关键区别。
另一个首次实现的能力是:在同一个推理层的控制下,不同类型的机器人可以协同工作。DeepMind 的演示展示了一个轮式机器人负责取物,同时由一个人形机器人完成高处货架上的精细摆放,二者通过 ER 2 统一协调。
这项能力非常重要,因为真实环境本就是异构的。一座仓库中可能同时存在地面机器人、机械臂和移动操作机器人。用一个统一的推理层为它们分配任务并协调合作,才是实现实际部署的路径——而不是部署一支彼此割裂、各自只能完成单一任务的机器人队伍。
它的局限也确实存在:
Gemini Robotics 2 在一个统一的模型家族中实现了机器人领域最困难的三项能力——跨不同机器人本体的泛化、精细运动控制和长周期任务规划。对于研究实验室和企业机器人团队而言,这将带来颠覆性的改变。
对于其他人来说,AI Studio 中的 ER 2 推理模型让我们得以真正提前体验即将到来的未来。随着硬件成本下降以及模型逐步开放,Gemini Robotics 2 可能会被视为一个历史性时刻:“通用机器人”从科幻概念真正走向可交付的现实产品。
这篇评测是 AIPlaybook 持续推出的 AI 开发者工具实测报道之一。我们会亲自测试自己撰写的产品——没有联盟营销偏见,也没有付费赞助的结论。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。