AREX Feed Article
社区在等 3.5 Pro,Google 先给机器人装了一个能追踪进度的大脑
7 月 30 日,Google DeepMind 发布了 Gemini Robotics ER 2,一个专门给机器人用的"具身推理"模型。社区苦等了大半年的 Gemini 3.5 Pro 再次缺席。Logan Kilpatrick(Google DeepMind 技术团队成员,负责 Gemini API 和 Google AI Studio)在 X 上宣布这一消息后,@Google 官方账号(3190 万关注者)随即转发,将这条推文推到了超过 3 万次浏览和 660 次点赞。
但点开评论区,画风是这样的:
"can we just get 3.5 pro please"(我们能先拿到 3.5 Pro 吗?)——@Ananth7e,自称 OpenAI voices 部门负责人,获 10 赞
"Introducing everything except Gemini 3.5 Pro."(什么都发了,除了 3.5 Pro)——@ggg78g89,AI 领域博主,获 18 赞
"你们什么都发,就是不发布新 Gemini 版本 🙃"——@brunocordista
社区的情绪很直白:等 3.5 Pro 已经等得太久了。但 Google DeepMind 有自己的节奏。同一天,他们不仅发布了 ER 2,还发布了 Gemini Robotics 2(视觉-语言-动作模型)和 Gemini Robotics On-Device 2(端侧 VLA 模型),三箭齐发,全部指向物理世界。
Paige Bailey(Google DeepMind 开发者关系工程主管,7.5 万关注者)在引用转发中写道:"前沿级的机器人任务性能,但更快、成本只有几分之一。"机器人社区的反应总体积极——@BuildSignals(14 万关注者)评论:"很高兴看到机器人技术站到舞台中央,是时候让 AI 的用途走出软件了。"
ER 2 解决的核心问题:机器人终于知道"任务什么时候算做完"
ER 2 的升级可以用一句话概括:它让机器人获得了"时间感"。
上一代 ER 1.6 已经能理解空间、规划步骤,但它缺乏对任务进度的持续追踪能力。ER 2 通过连续视频流理解,让机器人能实时判断自己做到哪一步了、有没有出错、什么时候该切换到下一个动作。
具体来说,ER 2 引入了两项核心新能力,加上首次落地的多机器人协作。
连续进度分类:将任务完成度分成五个等级(0-20%、20-40%、40-60%、60-80%、80-100%),机器人能实时判断当前处于哪个区间。如果某一步失败,它可以就地重试,而不是从头开始整个流程。ER 2 在这项任务上达到 57.4% 的准确率,相比 ER 1.6 和其他前沿模型有明显优势。
精确时刻定位:模型需要从视频流中准确定位关键事件发生的那个瞬间,比如什么时候该停止往杯子里倒咖啡。ER 2 在此任务上的准确率达到 91.3%,平均绝对误差仅 0.96 秒。在达到这个精度的同时,它的推理速度是同类大模型的 4 倍——低于 1 秒的延迟,是物理世界安全操作的最低门槛。
多机器人协作是这次更新的另一大亮点。ER 2 首次让不同类型的机器人能够通过共享语义理解协同工作。官方演示中,Apptronik 的 Apollo 2 人形机器人与 Franka F3 Duo 机械臂配合完成了一项复杂任务。Logan Kilpatrick 在自己的跟进推文中特别提到:"多机器人协作是我感到真正震撼的时刻。"
在工具编排层面,ER 2 接入了 Gemini Live API 的双向流式端点,让机器人能够以低延迟调用底层控制接口,无论是真实的 VLA 模型、仿真环境中的 VLA,还是人类远程操控,ER 2 都展现出相比 ER 1.6 的一致性提升。一个直观的演示是:Boston Dynamics 的 Spot 机器狗使用 ER 2 编排自己的导航和机械臂 API,在听到自然语言指令后,走到厨房取回了一袋爆米花。
安全方面同样有实质进展。ER 2 在安全指令遵循和人体接近检测两项基准上全面超越 ER 1.6。当有人靠近工作中的机器人时,ER 2 能可靠触发安全工具调用,让机器人暂停操作,直到人离开危险区域后再自动恢复。
三模型齐发:Google 同时在推三条机器人产品线
ER 2 的发布不是孤立的。同一天,Google DeepMind 还发布了 Gemini Robotics 2(控制全身动作的 VLA 模型)和 Gemini Robotics On-Device 2(可在本地运行的端侧 VLA)。三者构成了一个清晰的分层架构:
- ER 2 是"大脑"——负责理解、对话、规划、追踪进度;
- Gemini Robotics 2 是"小脑和身体"——将规划转化为全身运动控制,从手指到脚趾;
- On-Device 2 是"嵌入式大脑"——在本地运行,且能在几小时内用不到 200 个样本适配全新的机器人形态。
这套架构的核心思路是分工。ER 2 不直接控制电机,它调用底层的 VLA 模型或机器人 API——就像在软件世界里,一个语言模型调用工具一样。这种设计让 ER 2 可以适配任何机器人形态,无论是人形机器人、四足机器人还是机械臂。
Gemini Robotics 2 本身也不容忽视。它首次实现了对人形机器人的全身控制,从走路、下蹲到伸手取物。在 Apptronik Apollo 2 上的演示中,机器人可以"走到桌子前,拿起浇水壶,走几步到架子前,把它精准放进绿色收纳箱"。虽然移动速度还有提升空间,但这已经是让机器人完成"从 A 走到 B 然后操作 C"闭环的重要一步。
ER 2 的博客文章由 Steven Hansen(高级主任软件工程师)和 Peng Xu(主任软件工程师)署名,但致谢名单长达数百人,涵盖了 Google DeepMind 的 Gemini Robotics 团队。这一系列模型从 2025 年 3 月的 Gemini Robotics 初代起步,到 9 月的 ER 1.5,再到今年 4 月的 ER 1.6,演进速度非常快。
Figure 和特斯拉在卷硬件,Google 在卷推理层
当前机器人 AI 赛道大致分成两条路线。
一条是以 Figure AI 和特斯拉 Optimus 为代表的"端到端人形机器人"路线——核心是把硬件和 AI 做深度绑定,从机械结构到运动控制全栈自研。Figure 在 2025 年宣布与 OpenAI 的合作终止后,转向自研模型;特斯拉则把 Optimus 作为自动驾驶技术向人形机器人迁移的试验场。
另一条是 Google DeepMind 选择的"推理层平台化"路线——把最高阶的认知和规划能力抽象为独立模型(ER 系列),与硬件解耦,通过 API 接入各种机器人。这条路线的好处是覆盖面广:从 Boston Dynamics 的 Spot 到 Apptronik 的 Apollo 2,从 Franka 机械臂到 Dexmate 平台,同一个 ER 2 模型可以驱动完全不同的形态。
两种路线各有逻辑。端到端路线追求极致优化,理论上能让硬件和 AI 的配合达到最高效率。但 Google 的平台化路线解决了另一个问题:机器人硬件厂商不需要自己训练一个顶级推理模型,他们只需要接入 ER 2,然后专注于做好自己的 VLA 控制和硬件设计。
目前 ER 2 已在 Gemini API 和 Google AI Studio 上公开可用,Gemini Enterprise Agent Platform 上也提供私有预览。
物理世界是 Google 的下一个战略性赌注
回到开头那个问题:为什么 Google 不先发 3.5 Pro,而是把资源投给了机器人?
答案可能就藏在时间线里。从 3 月的初代 Gemini Robotics 到今天的 ER 2,Google DeepMind 在 16 个月里迭代了四代机器人推理模型。这个节奏不像"顺便做做"的实验项目,更像是按路线图全力推进的核心产品线。
在 3.6 Flash 和 3.5 Flash-Lite 发布的博客中,Google 曾透露 3.5 Pro 正在与合作伙伴测试中,同时也提到"团队已经在为 Gemini 4 做我们最雄心勃勃的预训练"。结合今天的机器人三连发,一个清晰的图景浮现出来:Google 不认为 AI 的未来只存在于聊天窗口里。物理世界——从工厂到家庭、从仓库到医院——是下一块必须拿下的版图。
至于 3.5 Pro 什么时候来?@runnerjose93 在评论区写道:"have the decency to let us know if we should stop waiting for 3.5 pro, to leave us in limbo is impolite."(好歹告诉我们还要不要等了,让人悬着心不礼貌。)
Google 暂时没回答这个问题。但他们给机器人装的那个新脑子,已经开始干活了。
来源: