AREX Feed Article
Google DeepMind 发布 Gemini Robotics 2:首个实现全身控制的 VLA 模型,要做"具身 AI 的 Android"
7 月 30 日,Google DeepMind 正式发布 Gemini Robotics 2 模型系列,首次将视觉-语言-动作(VLA)模型的控制范围从上半身扩展至整个人形机器人的全身——涵盖腿部行走、躯干协调、双臂操作与五指灵巧手。官方以 Apptronik 的 Apollo 2 人形机器人作为演示平台,展示了行走取物、弯腰拾取、拧灯泡、扎垃圾袋等连续动作,并同步推出云端推理、机载端侧推理及多机器人协作能力。行业评论将其策略概括为"具身 AI 的 Android":Google 不参与昂贵的硬件竞争,而是让 Gemini 成为第三方机器人(Apollo 2、MOTOMAN NEXT、Franka Duo 等)的通用智能层。
三款模型,三种定位
此次发布包含三个模型,覆盖从高级推理到本地执行的完整链路:
- Gemini Robotics 2(VLA):核心视觉-语言-动作模型,将视觉与语言输入转化为全身电机控制指令,可控制从五指灵巧手到双腿行走的完整人形机器人,也支持双臂平台(如 Franka Duo)。同一模型检查点可在不同硬件形态间通用。
- Gemini Robotics ER 2(VLM):具身推理模型,充当机器人的"高级大脑",负责理解环境、规划多步任务、跟踪进度、自我纠错,并与 VLA 模型协同执行。此次新增多机器人协作能力:不同类型的机器人可在共享空间内通信并分工完成单个机器人无法独立处理的复杂工作流。该模型已通过 Google AI Studio 免费开放,并在 Gemini Enterprise Agent Platform 提供私有预览。
- Gemini Robotics On-Device 2(VLA):专为无网络连接或低延迟场景优化的端侧模型,支持快速适配全新机器人形态——通常在数小时内、不到 200 个示例即可完成对新双臂机器人的适配,包括形状、传感器和自由度差异显著的平台(如 Dexmate、SO101、Trossen)。
关键能力突破
从上半身到全身控制
前代 Gemini Robotics 模型仅能控制人形机器人上半身完成桌面级任务。Gemini Robotics 2 首次实现"从脚到指尖"的统一全身控制。在一项演示中,Apollo 2 接收到指令"把浇水壶放到下层绿色箱子里"后,自主步行至桌边拾取水壶,再走到置物架前精确放入目标位置。Google DeepMind 坦承机器人的移动速度"仍有提升空间",但将此次升级定位为通向复杂真实世界任务的关键一步。
灵巧操作:五指手与夹爪
模型可控制 Apollo 2 搭载的 22 自由度 SharpaWave 五指灵巧手完成打结、密封密封袋等精细动作,也可操控标准两指平行夹爪执行精密插入等任务。不过官方数据显示,五指灵巧操作仍是显著瓶颈。
具身推理与进度感知
Gemini Robotics ER 2 在连续视频流上实现了两项关键能力:进度分类(将任务完成进度实时划分为五个阶段,准确率 57.4%)和关键时刻定位(在视频流中精确识别关键事件发生的帧,准确率 91.3%,平均绝对误差 0.96 秒)。这使得机器人能够在执行中自我监控、识别失败并在不重启整个流程的情况下重试。
官方公布的性能数据
Google DeepMind 在博客中公开了分任务、分硬件平台的测试成功率。以下为 Apollo 2 人形机器人的核心数据(均为公司自报,未经独立验证):
全身操作(Apollo 2 + Inspire 手):
- 从桌面拾取:68.4%
- 从地面拾取:45.7%
- 从货架拾取:76.3%
五指灵巧操作(Apollo 2 + SharpaWave 手):
- 拧下灯泡:92%
- 拧上灯泡:36%
- 扎垃圾袋:44%
- 密封袋任务:40%
- 簸箕任务:32%
双臂夹爪操作(Franka Duo + Robotiq 夹爪):
- 通用抓放:74.2%
- 工具套件组装:78.9%
- 精密插入:89.6%
从数据来看,夹爪操作的可靠性明显高于五指灵巧手,后者多项任务成功率不足 50%。Google DeepMind 也明确指出"多指灵巧操作仍然具有挑战性"。
安全框架
Google DeepMind 同步发布了 ASIMOV-Agentic 安全基准,用于评估具身推理模型在安全编排和不确定性消解方面的能力——包括拒绝不安全的 VLA 工具调用、预测任务可行性以及在不确定时主动请求人类干预。Gemini Robotics ER 2 据称是该公司"迄今为止最安全的机器人模型",在人类接近检测方面表现出色,可在有人靠近时触发安全停止,在人员离开后自主恢复工作。
策略含义:"具身 AI 的 Android"
Google 的路径与 Tesla Optimus、Figure AI 等垂直整合玩家形成鲜明对比。DeepMind 不制造自己的机器人硬件,而是通过与 Apptronik、Boston Dynamics、Agile Robots 等合作伙伴联手,将 Gemini 定位为跨硬件平台的通用智能操作系统。这一策略的核心逻辑与 Android 在智能手机时代的路径类似:通过提供一个可在多种硬件上运行的统一软件层,大幅降低机器人研发门槛,同时让 Google 掌握生态的智能中枢。
待验证的问题
- 所有成功率数据均来自 Google DeepMind 官方,尚未经过独立第三方测试。
- 演示场景为受控环境;在非结构化真实场景中的泛化能力仍有待观察。
- 机载端侧版本(On-Device 2)的性能边界与云端版本之间的差距未充分披露。
- 移动速度被官方明确标注为需要改进的方向,意味着全身控制的实际部署节奏仍需观望。