AREX Feed Article
Google 把 Computer Use 塞进最便宜的 Flash,Anthropic 的高端叙事还站得住吗?
Computer Use 曾经是奢侈品
2024 年 10 月,Anthropic 率先发布了 Claude Computer Use,向世界展示了"AI 直接操作电脑"的可能性。那一刻的叙事很清楚:这是最前沿的能力,需要最贵的模型。在此后近两年里,Computer Use 一直与"旗舰""高端""企业专属"这些标签绑定。Anthropic 的 Opus 系列、OpenAI 的 Operator 和 GPT-5 系列,都在强化同一个暗示:想让 AI 替你操作屏幕?先准备好预算。
2026 年 6 月 25 日,Google 在 X 上发了一条不足 50 词的推文,附了一段 Demo 视频,把这条叙事撕了一道口子。"Computer Use is now a built-in tool supported in Gemini 3.5 Flash." 没有"Pro",没有"Ultra"——是 Flash。那个以"快"和"便宜"定位的基础款。
推文在 24 小时内获得超过 20 万次查看、1299 次点赞和 410 次书签。在随后发布的安全说明线程中,Google 补了一句:"Computer Use in Gemini 3.5 Flash is built with safety in mind." 两段文字、一个 Demo 视频、两个安全开关——Google 用极简的信息密度,完成了一次可能改变 Agent 赛道格局的发布。
Flash 跑出了旗舰分数
一句话总结这次发布的核心:Google 把 Computer Use 从一个需要单独调用的专用模型,变成了 Gemini 3.5 Flash 的内置工具。这意味着开发者不再需要维护两条模型管线——一条模型、一次调用,Agent 就能看屏幕、做推理、执行操作。
三个关键数字定义了这次升级的分量。OSWorld-Verified 得分 78.4%,逼近 GPT-5.5 的 78.7% 和 Claude Opus 4.8 的 83.4%,较前代 Gemini 3 Flash 的 65.1% 提升了 13.3 个百分点。输出定价 $9/百万 token——约为 Claude Opus 的三分之一。支持三端——浏览器、移动端、桌面端。再加上 Chrome 149 同步推出的"Select from screen"功能——用户在浏览器中框选任意区域即可直接送入 Gemini 提示词——Google 的 Agent 产品矩阵正在从开发者 API 向消费者触点全面延伸。
从独立模型到内置工具,Google 在安全上做了两件事
2025 年 10 月,Google 首次发布 Computer Use 能力时,它是一个独立的 Gemini 2.5 模型,与主模型分开调用。开发者需要维护两条模型管线:一条处理对话和推理,另一条专门接收屏幕截图、输出操作指令。这种"双模型"架构意味着额外延迟、更高成本和更复杂的工程。
现在,Computer Use 被原生整合进了 Gemini 3.5 Flash。Google DeepMind 产品经理 Mateo Quiros 在官方博客中写道:"Computer use is now a built-in tool supported in Gemini 3.5 Flash, delivering our best performance yet for agentic computer use tasks." Computer Use 变成了和代码执行、搜索 grounding、函数调用并列的一个内置工具——开发者只用一个模型、一次调用,就能让 Agent 看屏幕、推理、点击、输入、滚动。
在官方 Demo 中,Gemini 3.5 Flash 为分析自家 Gemini App 的功能列表,在 73 个交互回合中自主完成了从打开应用、浏览界面、归类特征到输出结构化报告的全流程。另一个 Demo 展示了 Flash 审计自身技术文档的 accessibility 合规性——Agent 逐页检查、标记问题项、生成整改建议。
更关键的变化在安全层。Google 没有把 Computer Use 当成一个"能点按钮的 API"就撒手不管。团队为这个工具做了针对性对抗训练,专门防御间接提示注入——即恶意指令藏在网页文本或文档中,诱导 Agent 执行非预期操作。这并非理论威胁:研究人员已多次证明 AI Agent 在浏览网页时会被页面内容操控。
在此之上,Google 发布了两套可选的企业安全保障系统。第一套叫 Explicit User Confirmation:Agent 在执行敏感或不可逆操作之前,必须获得人类明确批准。第二套叫 Automated Task Stopping:系统一旦检测到间接提示注入攻击,自动冻结当前任务。两套系统都是可选而非默认开启——Google 推荐的策略是"纵深防御",即同时叠加沙箱隔离、人类在环验证和严格访问控制。官方文档坦率承认,单一安全机制不足以应对所有风险。Browserbase 已提供在线演示环境,GitHub 上发布了参考实现,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 直接调用。
为什么是 Flash 而不是 Pro?
Gemini 3.5 Flash 的定位本身就值得拆解。在 2026 年 5 月的 Google I/O 上,这个模型被定位为"最快的 agentic AI 模型"——它并非 Google 最强的模型,但在速度/成本比上做到了极致:输入 $1.50/百万 token,输出 $9.00/百万 token,上下文窗口 100 万 token。
把 Computer Use 放进 Flash 而非 Pro,是一个战略性选择。Computer Use 是已知 token 消耗最密集的 AI 工作负载——每看一眼屏幕、每做一次点击都需要一次完整的视觉推理循环。在 73 个回合的 Demo 中,token 账单可以轻易膨胀。如果把这个能力放在昂贵的旗舰模型上,企业级部署的经济账根本算不过来。
这也是为什么 X 用户 Null Hype(@nullhypeai,AI 商业分析博主,专注于挖掘每次 AI 发布背后的行业信号)在回复中一针见血地指出:Flash 的 OSWorld 得分 78.4%,追平了 Claude Opus 4.7(78.0%)和 GPT-5.5(78.7%)。这三个是各自阵营的旗舰。但 Flash 的输出定价是 $9/百万 token,Opus 约 $25。他的结论是:"Google just put flagship accuracy on its cheapest model. The real moat is that it owns Chrome, Android and ChromeOS, the exact surfaces these agents run on."
Anthropic 靠精度,OpenAI 靠生态,Google 靠"我全都要"
把 Computer Use 放进市场坐标系里看,竞争格局正在分化为三条路径。
Anthropic 走的是精度路线。Claude Opus 4.8 在 OSWorld 上以 83.4% 领先全行业,且 Claude Computer Use 可以跨操作系统操作文件系统,不仅限于浏览器。但代价是贵——Opus 的输出定价约为 Flash 的 2.8 倍。在 Computer Use 这种 token 密集型场景下,成本差异会被急剧放大。
OpenAI 的路径是生态整合。Operator 深度嵌入 ChatGPT 和 API,借助 GPT-5.5(OSWorld 78.7%)的能力覆盖浏览器自动化场景。但 Operator 目前仍以浏览器为主,尚未像 Google 一样明确承诺跨桌面和移动端的统一 Agent 体验。
Google 的路径是"平台 × 价格"。Flash 的 OSWorld 得分(78.4%)与 GPT-5.5(78.7%)几乎持平,定价却只有同级模型的几分之一。更重要的是,Google 拥有 Chrome(全球市场份额约 65%)、Android(全球约 70% 移动操作系统份额)和 ChromeOS——Agent 要操作的屏幕,大多数跑在 Google 的平台上。
在社区反应中,开发者 Bojan(@bojan_ai,驻迪拜的交易与 AI 系统构建者)抓住了成本逻辑:"computer use in a fast cheap model is the quiet unlock. the bottleneck was never can the agent click the button, it's can it do it fast enough and cheap enough to actually run all day." ML 工程师 Sebastian Buzdugan(@sebuzdugan,博士研究生,getfrai 联合创始人)则指出了工程现实:"computer use gets demo wins but recovery after a failed click is still the blocker." Filecoin 官方账号从审计角度切入:"A record of what they actually did, independent of the platform running them, is what makes that trustworthy at scale."
Kanika(@KanikaBK,3.4 万粉丝的 AI 趋势博主)在引用推文中写道:"Google just gave Gemini 3.5 Flash the ability to use your computer. I am talking about real things. Click buttons. Browse. Fill forms. The AI agent market hits $47 billion by 2030. Google played extremely smart." 这条引用推文获得了 29 次点赞和 10 次转发。
Agent 大战的下一章不在模型里,在操作系统里
把 Computer Use 塞进 Flash,Google 做的不只是一次功能升级。它的真正意图是在 Agent 赛道上换一套游戏规则:当"看屏幕、点按钮"的能力从奢侈品变成日用品,胜负手就不再是哪个模型的 OSWorld 分数高三个百分点,而是谁拥有 Agent 要操作的那些屏幕本身。
Anthropic 仍然拥有最好的 Computer Use 精度,OpenAI 仍然拥有最广的开发者生态。但 Google 的选择——把能力下沉到最便宜的模型、把安全做成可选的企业配置、把 Chrome/Android/ChromeOS 变成 Agent 的原生运行环境——指向的是一条更接近"基础设施"的路径。如果这条路走通,Computer Use 将不再是一个"你用哪个模型"的问题,而是一个"你的 Agent 跑在谁的操作系统上"的问题。
参考链接:
本文由机器之心基于一手推文、官方博客及媒体公开报道独立撰写,转载需注明出处。