前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8626
  • GitHub Copilot SDK发布,六语言生态初成型
  • AI驱动的安全研究工具路由包
  • 图像生成API的成本与体验平衡:重试策略设计
  • LangGraph完整指南:有状态智能体系统设计实战
  • 医疗AI的脆弱性感知推理:超越置信度评分
  • Agent 的长期记忆系统:跨会话信息持久化设计
  • EarthOS 和 NationalOS:两种星球模拟系统的构建实验
  • AVIF 图片格式实战:网站图片减少 70%、提升性能指标
  • ChatGPT 破 10 亿用户:企业采用率 200 万,使用频率激增
  • Agent 评估为何比模型评估难得多
  • RunPod 推理任务永久卡队列的排查方案
  • 物理 AI 模型攻克机器人仿真到现实的鸿沟
  • AI 生成网站的局部迭代法:不重写只调整
  • DeepSeek V4-Flash 开源发布
  • AI Agent 编程的四层验证防线
  • 用 Claude + Headless CMS 统一内容管道
  • 如何找到真正维护中的 MCP 服务器
  • OpenAI 发布 Astra 模型:多 Agent 协同与长周期任务
  • NovelAI 自动化集成的会话数据壁垒问题
  • AI Agent 现实赋能:车联网 API 接入 MCP 生态
  • DeepMind Gemini Robotics 2:通用机器人脑的新突破
  • DeepSeek-V4-Flash 性价比秒杀:缓存命中率达 98%
  • AI 编程代理的安全发布框架:轻量级操作系统方案
  • 2026 电商自动化选型指南:n8n vs Zapier 实战对标
  • 用 AI 命令维护自研工具:系统化独立开发第 4 部
  • 谷歌地球 AI 生图功能因安全风险紧急下架
  • OpenAI 发布数学与理论计算机科学 10 项突破
  • DeepSeek V4-Flash:3040 亿参数 Agent 模型发布
  • Mission Driver:AI 任务驱动引擎的通用实现
  • 编程 Agent 的安全陷阱:Hook 不能保证安全边界
  • 代码审查成新瓶颈:AI 时代的组织适配问题
  • AGE:引力驱动的 AI 原生工程方法论
  • React 内存泄露诊断实战:从 1.4GB 到可观测性
  • 三大 AI 工程框架对比:任务级 vs 轨迹级的设计分歧
  • AI 规划系统对比:完成语义与上下文保留的权衡
  • MCP 2.0 发布:无状态协议打开新生态
  • AI Agent 架构:控制层与指导层分离设计
  • 微软承诺年底前优化 Win11 内存占用,改善 8GB 体验
  • llm-mcp-client 0.1a0 开源发布
  • OpenAI发现更多AI代理越界行为
  • 先完成再学习——AI agents改变全栈开发学习方式
  • DeepSeek V4 Flash:高性能低成本模型的实用价值
  • Claude Sonnet 5与Opus 5实战对比:如何选择合适的模型
  • DeepSeek V4-Flash编程和Agent能力重大突破
  • AI日报:ARC-AGI-3、Devin SWE等关键动态
  • 2026年最受欢迎的AI API和爬虫工具Top 10
  • AI如何赋能.NET专业工程实践
  • 开源权重模型已能对标闭源前沿模型
  • Reddit 诉讼继续:Perplexity AI 未授权爬取内容
  • smevals:轻量级模型和提示词评估框架
  • 印度应用市场转折:用户开始为应用付费
  • 已加载 51 / 8626
8.0
热点
AI SCORE
模型发布2026-08-01 08:29

DeepMind Gemini Robotics 2:通用机器人脑的新突破

dev.to · AI#Google#机器人#VLA模型
Editor brief · 编辑速览

Google 发布视觉-语言-动作(VLA)通用机器人模型,整合多模态感知和控制,为机器人开发者提供新的能力基础。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2——它可能是迄今最接近“通用机器人智能大脑”的技术。

多年来,RT-2、Octo 和 π0 等视觉-语言-动作(Vision-Language-Action,VLA)模型始终专注于一件事:桌面操作。一条机械臂、一个夹爪,以及在固定台面上执行取放任务。它们固然实用,但距离真正能够在人类活动空间中自由移动的机器人还很遥远。

Gemini Robotics 2 改变了这一局面。它是首个能够在单次会话中控制完整人形机器人身体的 VLA 模型家族——从脚、腿、躯干、手臂、手掌到手指。

下面是对它的客观拆解:哪些是真正的创新,哪些仍受限于合作伙伴计划,以及谁应该关注它。

三个模型,三档能力

Gemini Robotics 2 并不是单一模型,而是由三个模型组成,分别面向机器人技术栈的不同部分。

1. Gemini Robotics 2(VLA)——“执行者”

这是一个视觉-语言-动作模型,可以将摄像头输入和文本指令直接转换为电机控制命令,不需要中间的运动规划层。它支持:

  • 完整的人形机器人控制——行走、下蹲、伸展和伸手抓取
  • 22 自由度手部控制(Apptronik Apollo 2 搭载的 SharkWave 灵巧手)
  • 系绳结、封合自封袋等精细操作
  • 通过 Franka Duo 双臂平台操作标准夹爪

2. Gemini Robotics ER 2(Embodied Reasoning)——“思考者”

这是一个视觉-语言模型,充当机器人的高层智能大脑。它可以规划持续数分钟的多步骤任务、与人类沟通、监控任务进度,并在某个步骤失败时重新规划。它还能协调多个机器人共同完成同一项任务。

关键在于,ER 2 目前已经可以在 Google AI Studio 中使用——即使没有机器人,你也可以测试这个推理模型。

3. Gemini Robotics On-Device 2——“端侧大脑”

这是一个可以直接在机器人硬件上本地运行的高效 VLA,无须依赖云端。它最突出的特点是:只需数小时即可完成机器人本体迁移。DeepMind 表示,仅需几个小时的数据和不到 200 个样本,就能让模型适配新的机器人身体。

全身控制才是真正的重头戏

这是最值得关注的部分。以往的 VLA 模型只能控制桌面上的机械臂,而 Gemini Robotics 2 可以控制完整的人形机器人——演示中的差异非常直观:

  • “把洒水壶放进底层架子上的绿色箱子里” → Apollo 2 走到洒水壶旁,将其拿起,再走到架子前,蹲下并准确地放入箱中。
  • “收拾这个杂乱的房间” → 机器人绕过障碍物,捡起位于不同高度的物品,并将它们放入指定容器。
  • 用五指灵巧手系绳结 → 实现过去由 AI 控制的机器人无法完成的精细操作。

全身控制要求模型同时对平衡、触达范围、运动轨迹、作用力和物体交互进行推理。这是一个神经网络多年来始终难以解决的协调问题——也是只能待在工厂围栏里的机器人与能够在你家中工作的机器人之间的关键区别。

多机器人协作与统一推理

另一个首次实现的能力是:在同一个推理层的控制下,不同类型的机器人可以协同工作。DeepMind 的演示展示了一个轮式机器人负责取物,同时由一个人形机器人完成高处货架上的精细摆放,二者通过 ER 2 统一协调。

这项能力非常重要,因为真实环境本就是异构的。一座仓库中可能同时存在地面机器人、机械臂和移动操作机器人。用一个统一的推理层为它们分配任务并协调合作,才是实现实际部署的路径——而不是部署一支彼此割裂、各自只能完成单一任务的机器人队伍。

客观评价:目前还缺什么

它的局限也确实存在:

  • **访问限制:**VLA 和 On-Device 模型仅向早期体验合作伙伴开放。只有 ER 2 可以公开测试。
  • **速度:**人形机器人的移动速度仍然比人类慢——在结构化环境中没有问题,但还无法适应混乱多变的人类活动空间。
  • **成本:**Apptronik Apollo 2 的价格超过 5 万美元,Franka Duo 超过 3 万美元,此外还需要端侧计算设备。这是企业级硬件,不属于业余爱好者能够轻易涉足的领域。

结论:8.8/10——真正的突破,但仍处于早期阶段

Gemini Robotics 2 在一个统一的模型家族中实现了机器人领域最困难的三项能力——跨不同机器人本体的泛化、精细运动控制和长周期任务规划。对于研究实验室和企业机器人团队而言,这将带来颠覆性的改变。

对于其他人来说,AI Studio 中的 ER 2 推理模型让我们得以真正提前体验即将到来的未来。随着硬件成本下降以及模型逐步开放,Gemini Robotics 2 可能会被视为一个历史性时刻:“通用机器人”从科幻概念真正走向可交付的现实产品。

这篇评测是 AIPlaybook 持续推出的 AI 开发者工具实测报道之一。我们会亲自测试自己撰写的产品——没有联盟营销偏见,也没有付费赞助的结论。

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI Agent 现实赋能:车联网 API 接入 MCP 生态
下一篇
DeepSeek-V4-Flash 性价比秒杀:缓存命中率达 98%