AREX Feed Article
三强跑分打平后,Google 的杀招是把电脑操控做成最便宜的标配
6 月 24 日,Google DeepMind 通过官方博客宣布:Gemini 3.5 Flash 已原生支持 Computer Use。推文在 24 小时内获得 810 个赞、93 次转发和 314 个书签,成为当周 AI 社区关注度最高的产品更新之一。
Computer Use 让 Gemini 3.5 Flash 可以像人一样"看屏幕"——截取画面、识别按钮和输入框、执行点击、输入、滚动和标签切换——覆盖浏览器、移动端和桌面三大环境。它在 OSWorld-Verified 基准上得分 78.4%,与 GPT-5.5(78.7%)和 Claude Opus 4.7(78.0%)实质打平。而这一切跑在定价 $1.50/$9 每百万 token 的 Flash 模型上——Google 声称不到竞品一半。
更关键的变化藏在架构层面:Computer Use 不再是一个需要单独调用的专用模型,而是 Flash 的一个内置工具。
五个结论看懂这次更新为什么重要
第一,Computer Use 不再是独立模型,而是 Flash 的内置工具。Google 在 2025 年 10 月发布的 Gemini 2.5 Computer Use 是一个基于 2.5 Pro 的专用模型,需要与主推理模型分开调用。此次更新将电脑操控能力直接嵌入 Gemini 3.5 Flash,使同一个模型可以同时推理、搜索、调用 API 和操控界面,消除了多模型编排带来的延迟和成本。
第二,OSWorld-Verified 跑分实质三强打平。Gemini 3.5 Flash 得分 78.4%,比 GPT-5.5(78.7%)低 0.3 个百分点,比 Claude Opus 4.7(78.0%)高 0.4 个百分点。在测量误差范围内,三家的 Computer Use 基础能力已难分高下。竞争焦点正在从"能不能做"转向"多快、多便宜、多可靠"。
第三,定价策略指向"普及"而非"溢价"。$1.50/M 输入、$9/M 输出的定价约为竞品的一半。在 289 token/s 的输出速度加持下,长链条 agent 任务的总成本优势会被进一步放大。这是 Google 选择的差异化路径:不比最强,比最便宜。
第四,安全方案从外挂走向原生。针对性对抗训练被写入模型训练流程,两道企业级安全护栏(敏感操作确认 + prompt injection 自动终止)作为可选功能上线。Google 强调"纵深防御"——不靠单一机制保证安全。
第五,企业落地速度超过预期。Salesforce、Xero、Shopify、Ramp 四家公司已在集成 Computer Use,覆盖 Agentforce 平台、税务自动化、电商数据分析和 OCR 四个场景。Google 选择从企业端切入,而不是消费端。
从独立模型到内置工具,Google 的两次转身
Gemini 3.5 Flash 的 Computer Use 不是从零开始的。2025 年 10 月,Google DeepMind 发布了 Gemini 2.5 Computer Use 模型——一个基于 2.5 Pro 构建的专用模型,专注于浏览器和移动端 UI 操控。当时它在 Browserbase 的 Online-Mind2Web 基准上以最低延迟领先竞品,但有一个关键局限:它是一个独立模型,与 Gemini 主力系列割裂。开发者如果想用 Computer Use,必须在工作流里维护两套模型调用——一套做推理和对话,一套专门操控界面。
八个月后,Google 的选择是把这个能力"塞"进 Flash。
离开独立模型,八个月后 Google 选择了另一种路
这不是简单的功能迁移。Google DeepMind 产品经理 Mateo Quiros 在博客里写得很清楚:Computer Use 现在是一个"内置工具"(built-in tool),而不是一个独立模型。这意味着 Gemini 3.5 Flash 在处理一个任务时,可以同时调用搜索、地图定位、函数调用和电脑操控——所有工具跑在同一个推理引擎上。
这一变化的工程含义不容小觑。独立模型架构下,agent 需要在两个模型之间传递上下文——截图从前端传到 Computer Use 模型,动作结果再传回推理模型——这中间的每一次上下文切换都是错误和延迟的来源。内置到 Flash 之后,这些切换被压缩进同一个推理过程,模型的"思维链"可以从"我需要搜索这个信息"无缝衔接到"我需要点击这个按钮来验证搜索结果"。
从开发者体验的角度看,这个改动解决了一个更朴素的问题:费用。此前用 Gemini 做 agent,如果要加 Computer Use,相当于同时为两个模型付费。现在一个 API 调用解决问题,而 Flash 的定价是 $1.50/M 输入 token、$9/M 输出 token。如果将 Gemini 3.5 Flash 与 Claude Opus 4.7 的典型企业定价做对比,长周期 agent 任务的成本差异会迅速放大。
OSWorld 78.4%:三个数字的差距比你以为的小
OSWorld-Verified 基准上的数字支持了内置工具架构的效率,但也暴露了一个微妙的真相。Gemini 3.5 Flash 得分 78.4%,GPT-5.5 是 78.7%,Claude Opus 4.7 是 78.0%。最大差距仅 0.7 个百分点。用 MLQ.ai 的话说,这是"实质上的三强打平"(effectively a three-way tie)。
但当跑分打平,其他维度就开始放大。Gemini 3.5 Flash 的输出速度为 289 token/s,大约是竞品的 4 倍。对于需要连续执行数十步操作的 agent 任务——比如遍历一个电商后台批量更新商品信息——每一步的延迟累积直接影响用户体验和经济可行性。
但速度同时也是双刃剑。开发者 Daksh Trehan 在原推下提出了一个尖锐的问题——"95% 的单步成功率,经过 20 步之后,端到端成功率只剩约 36%。Flash 是每一步重新定位,还是在上一次截图上滑行?"Google 尚未公开回答 Flash 在长链条任务中的状态管理机制。
另一个值得关注的数字来自模型卡中的 MCP Atlas 基准——衡量模型在多步骤工具调用中的表现。Gemini 3.5 Flash 得分 83.6%,远超 GPT-5.5 的 75.3% 和 Claude Opus 4.7 的 79.1%。这似乎验证了 Google 的核心叙事:内置工具协同比拼接多个专用模型更高效。
两道安全锁,一次针对性对抗训练
把 Computer Use 交给一个可以操控浏览器、手机和桌面的模型,安全问题不再是锦上添花,而是生死线。Google 这次推出了两道企业级安全护栏。
第一道是"需要用户显式确认方可执行敏感或不可逆操作"——类似于银行转账前的二次验证,但应用范围更广,开发者可以自定义哪些操作属于敏感范畴。第二道是自动终止——如果检测到间接 prompt injection,任务会被立即停止。
更具工程学意味的是,Google 没有把安全完全交给外挂系统。博客明确提到,团队对 Gemini 3.5 Flash 中的 Computer Use 进行了"针对性对抗训练"(targeted adversarial training)。这意味着模型在训练阶段就已经见过注入攻击的模式,而不是等到推理时才靠策略过滤。Google 建议开发者将此与安全沙箱(sandboxing)、人在环中验证(human-in-the-loop)和严格的访问控制组合使用——一个"纵深防御"(defense-in-depth)的完整方案。
四个企业客户已经上了桌
企业客户没有等 GA。Salesforce 正在通过其 Agentforce 平台将 Computer Use 集成到多 agent 企业工作流中;Xero 用它构建供应商识别和税务文件自动化流程;Shopify 和 Ramp 则将其用于数据分析和 OCR。四家公司的用例覆盖了财务、电商和 SaaS 三个垂直领域,Google 显然在押注"企业自动化"而不是"消费级酷炫 demo"。
价格是这个棋局的关键一子。$1.50/$9 的定价不仅低于 Claude Opus 4.7 和 GPT-5.5,甚至低于许多开发者此前用"推理模型 + 独立 Computer Use 模型"拼接方案的总成本。当 Computer Use 从高配模型的专属功能变成 Flash 的内置工具,一个之前被成本挡在门外的群体——独立开发者和小团队——突然有了入场券。
Anthropic 开了枪,Google 补了刀
Anthropic 是这条赛道的先行者。2024 年 10 月,Claude 3.5 Sonnet 率先上线 Computer Use 功能,彼时这还是一个贴着"实验性"标签的能力,Anthropic 在博客中特意强调它"可能笨拙且容易出错"。一年半后,Computer Use 已成为三个前沿模型家族的标配。
OpenAI 紧随其后推出 Operator,GPT-5.5 在 OSWorld 上以 78.7% 略占上风。但三家模型的跑分差距在统计意义上可以忽略。社区反应开始分化——用户 @frvdu74785379 在原推下评论道:"Anthropic 先发了 Computer Use,Google 把它原生塞进 Flash 意味着它即将变成一个打勾功能,而不是差异化优势。"这条评论折射出科技社区对"Computer Use 快速商品化"的预判。
但更微妙的博弈在定价侧。一位开发者 @BertrandDiouly 评论道:"我的 browser-use 账单要爆炸了,或许 Flash 能救我。"这句话指向一个更深层的市场动态:当 Computer Use 能力从"高配模型的奢侈品"下放到"Flash 级别的日用品",受到冲击的不仅仅是 Anthropic 和 OpenAI,还有整个围绕 Computer Use 构建的第三方工具生态——Browserbase 等中间件服务的价值主张需要重新定义。
Hacker News 上的讨论则更尖锐。有人指出 Gemini 3.5 Flash 在自家图表中被 Opus 4.8 和 GPT-5.5 的数据压过,而图表着色暗示 Gemini 胜出——这是科技巨头 blog 的老毛病。也有人聚焦更实际的问题:社区对 Gemini 的 MCP 支持缺失表达了持续不满——如果 agent 不能接入 Slack、Notion、GitHub 等外部工具,Computer Use 的能力就会被局限在"点击网页"这个单一场景里,而无法融入日常工作流。
Agent 正在变成 API 调用的标准件
走向一:Computer Use 加速商品化。当三个前沿模型在 OSWorld 上实质打平,当最便宜的那个把能力做成了内置工具,Computer Use 将从一个差异化功能变成 API 的基础选配。这类似于 2024 年的 function calling——最初是亮点,后来是标配。对开发者而言,这意味着选模型的标准将从"谁能操控屏幕"变成"谁操控屏幕的成本最低"。
走向二:Gemini 3.5 Pro 的上线将成为下一个关键变量。社区对 3.5 Pro 的期待已在评论区溢出。如果 3.5 Pro 也内置 Computer Use 并以更高推理能力执行复杂操控任务,Google 将拥有从 Flash(便宜快打)到 Pro(高精度长链条)的完整 Computer Use 产品线。但 3.5 Pro 迄今没有明确的发布时间表。
走向三:agent 开发的范式正在从"拼模型"变成"调 API"。中文 AI 社区观察者 @sujingshen 在引用推文中总结道:"以后开发 Agent 不再需要拼模型了:一个 Gemini 3.5 Flash 同时看屏幕 + 搜网页 + 调 API,成本只有竞品的 1/3。Agent 正在变成 API 调用的标准件,而不是实验室玩具。"这个判断如果成立,意味着 agent 创业公司的技术壁垒将从"我们能做出 Computer Use"转移到"我们能把 Computer Use 用在什么垂直场景里"——技术门槛下沉,行业 know-how 上升。
Google 的这次更新,本质上是在回答一个问题:当所有人都能做 Computer Use 时,胜负手是什么?它的答案是速度、成本和集成度。这是一个务实的答案,也是一个缺乏浪漫的答案。但在 agent 从 demo 走向生产的 2026 年,务实可能是最稀缺的品质。
参考链接:
本文由机器之心基于公开信息独立撰写,不代表任何当事方立场。转载请联系机器之心。