AREX Feed Article
Google DeepMind 发布 Gemini Robotics 2:VLA 模型实现人形机器人"从脚趾到指尖"全身控制
2026 年 7 月 30 日,Google DeepMind 正式发布新一代视觉-语言-动作(VLA)模型 Gemini Robotics 2,将物理 AI 的控制范围从上肢桌面操作扩展至人形机器人的全身运动。与此同步推出的还有具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,三者共同构成机器人"思考—行动—协作"的智能层。
从上半身到全身:人形机器人学会走路、下蹲与伸展
此前 Gemini Robotics 仅能控制人形机器人的上半身完成桌面级任务。Gemini Robotics 2 首次实现了对完整人形机器人——从脚趾到指尖——的运动控制。在演示中,搭载该模型的 Apptronik Apollo 2 机器人能够根据自然语言指令"把浇水壶放进底层架子的绿色收纳箱",自主步行至桌边、拾起浇水壶、再走几步将其精准放入目标位置。Google DeepMind 坦言机器人在移动速度上仍有提升空间,但称此次更新是"迈向需要全身协调的复杂现实任务的重要一步"。
同一模型检查点可同时控制三种不同硬件形态——Apptronik Apollo 2(搭配 SharpaWave 五指灵巧手或 Inspire 手)以及 Franka Duo 双臂平台,在全身份与灵巧操作任务中取得中等至高等成功率。
手指级的精细操作
灵巧性方面,Gemini Robotics 2 可控制拥有 22 自由度的 SharpaWave 五指手,完成打结、密封自封袋、拧灯泡等精细动作;同时也能驱动 Franka Duo 平台的标准二指平行夹爪,执行紧密装箱等复杂操作。Google DeepMind 表示,多指精细操作目前仍是难题,团队正继续提升精度与速度以逼近人类水平。
具身推理升级:理解任务进度、多机器人协作
Gemini Robotics ER 2 作为机器人的"高层大脑",能够持续观看视频流,推理任务步骤、调用底层 VLA 模型执行动作,并跟踪任务完成进度。新版本实现了两项关键能力:
- 进度分类:将任务进度按 0–20%、20–40% 等五个层级量化,准确率达到 57.4%,使机器人具备实时情境感知,可在步骤失败时自行重试而非重启整个流程。
- 时刻定位:精确定位关键事件发生的确切视频帧(例如何时停止倒咖啡),准确率 91.3%,平均绝对误差仅 0.96 秒,且推理速度为同类大模型的 4 倍。
更具突破性的是,Gemini Robotics ER 2 首次支持多机器人语义协作:不同类型的机器人可通过共享语义理解进行沟通与分工。演示中,Apptronik Apollo 2 人形机器人与 Franka F3 Duo 双臂机器人协同完成车库清理——Apollo 2 负责指挥,Franka 负责将工具放入收纳箱。
端侧模型:数小时适配全新硬件形态
Gemini Robotics On-Device 2 专为离线、低延迟场景优化,继承自 Gemini Robotics 1.5 的"运动迁移"技术,可在数小时内(通常少于 200 个示例)适配形状、传感器和自由度差异极大的全新双臂机器人形态,包括 Dexmate、SO101 和 Trossen 等平台。
安全框架:ASIMOV-Agentic 基准与人员接近检测
安全层面,Google DeepMind 引入 ASIMOV-Agentic 基准,评估具身推理模型在拒绝不安全 VLA 工具调用、预测任务可行性以及主动请求人类干预等方面的能力。Gemini Robotics ER 2 在安全指令遵循和人员接近检测两项基准上均超越前代及其他前沿模型——当检测到人员靠近时,可自动触发安全停机,待区域清空后自主恢复作业。
当前状态与行业定位
Gemini Robotics ER 2 已通过 Google AI Studio 和 Gemini API 向开发者开放,并在 Gemini Enterprise Agent Platform 提供私有预览。VLA 模型与端侧模型目前仅面向早期合作伙伴提供。
此次发布是人形机器人基础模型竞赛中的重要进展。与 Figure、Tesla Optimus、1X 等同类方案相比,Gemini Robotics 2 的核心差异在于"全身智能"——从腿部行走到指尖操作的一体化控制,以及跨机器人形态的语义协作能力。但目前该发布仍属研究阶段,尚无第三方独立实测数据与商业化时间表。