AREX Feed Article
当 Claude 还在教你怎么用 Computer Use,Google 选择让 Gemini 直接开你的 Chrome
AI Agent 正在学会"用浏览器",但各家教法截然不同。Anthropic 选择让 Claude 看屏幕截图、识别按钮、模拟点击,一种通用的"计算机使用"能力。OpenAI 用 ChatGPT Work 走任务自动化路线。Google 的方案最简单粗暴:把 Gemini Spark 塞进 Chrome,直接用你已经登录的账号和保存的密码干活。
8 月 3 日,Google 通过官方 X 账号宣布,Gemini Spark 正式接入 Chrome 的"auto browse"(自动浏览)功能。在用户授权后,Spark 可以直接操控 Chrome 浏览器,登录用户已有的网站账号,完成从搜索到填表再到确认的多步骤在线任务。Google 在推文中给出了两个典型场景:帮你预约看过的公寓看房时间,或者搜索航班并走到付款前的最后一步。这条推文在 24 小时内获得 1700 余次点赞、46 万次浏览。
这不是一个独立的新产品,而是在已有的 Gemini Spark 基础上增加的一项能力。但它背后的策略信号比功能本身更大。
Gemini Spark 现在可以替你订房、订机票了
具体来说,这次更新的核心不是"Spark 会浏览网页了"。这个能力它之前就有。真正的变化是:Spark 现在能用你的身份浏览网页。
以往 AI Agent 在网页上执行任务时,要么受限于未登录状态(看不到用户专属的信息,如已收藏的房源、会员价格),要么需要用户手动提供凭证(复制粘贴密码、配置 API token)。Spark 的新能力跳过了这个摩擦点。它直接读取 Chrome 中已保存的登录态和密码管理器,以用户的身份执行任务。Google 的博客将这项能力描述为"从规划到执行"的跨越:Spark 不只是帮你想好要做什么,它替你去做。
任务的终点不是"替你付款"。Spark 在走完搜索、比价、填表之后,会在付款页面停下来,把控制权交还给用户。Google 对此的定位是"完成 90% 的繁琐工作,把最后的决策留给你"。
不用装插件,Chrome 就是它的"手"
Gemini Spark 的 Chrome 自动浏览,核心机制是原生的浏览器控制。它不像 Claude Computer Use 那样通过截图理解页面、模拟鼠标点击来操控任意界面,而是在 Chrome 内部直接操作:打开一个独立的标签页,读取页面结构,填写表单,点击按钮。
Google 官方博客(7 月 30 日发布,Adam Coimbra,Gemini App 产品管理总监,与 Charmaine Dsilva,产品管理高级总监,联合署名)描述了两个典型任务流程:
第一个场景是公寓看房预约。Spark 使用用户保存的租房平台账号登录,浏览已收藏的房源列表,找到有空闲看房时段的房产,打开预约页面,自动填入用户的联系方式和偏好时间,最后在提交前停下来让用户确认。
第二个场景是航班搜索与预订。Spark 根据用户指定的出发地、目的地和日期范围,在 Google Flights 或第三方旅行网站上搜索航班,比较价格,筛选直飞选项,填入乘客信息,走完除付款之外的全部流程。
Google 发布的演示截图中,一个名为"Working on it…"的进度面板清晰展示了 Spark 的思考链路:初始化分析 → 调用 Google Flights 和 Google Profile → 并行执行 → 输入目的地机场 → 完成任务。
这个流程的关键在于"使用已登录账号"。大多数 AI Agent 需要用户单独配置 API 密钥、安装浏览器扩展,或者手动复制粘贴登录凭证。
Spark 直接复用 Chrome 中用户已经登录的会话,省掉了整个配置环节。技术博客 Chrome Unboxed 的编辑在试用前瞻中评价:"Spark 接手了填表的繁琐部分,但在最后的点击上把控制权还给你。这是 AI Agent 处理敏感操作的恰当方式。"
安全设计是这套方案的另一条腿。Google 在推文串中强调了两层防护:一是针对 prompt injection(提示注入攻击)的主动防御,二是"人在回路中"(human-in-the-loop)的检查点机制。任何涉及支付、密码修改等敏感操作,Spark 会将控制权交还给用户,由用户亲自确认。Google 工程师 Yaowu Xu 在引用推文中补充,团队"首创了针对间接 prompt injection 等复杂威胁的主动防御,同时保持严格的数据隔离,并嵌入自动化的人机检查点"。
不过,这套方案的优势也是它的限制。Spark 的自动浏览功能目前仅在美国向 Google AI Pro 和 Ultra 订阅用户开放。此外,它深度绑定 Chrome 浏览器——如果用户使用的是 Safari、Firefox,或者需要操控的网站不兼容 Chrome,这套能力就无从施展。
两个月的 Spark:从 I/O 概念到 160 国
Gemini Spark 本身是一个还在快速迭代的产品。它在 2026 年 5 月的 Google I/O 大会上首次亮相,被定位为 Google 在消费级 AI Agent 赛道的核心武器。然而发布后的两个月里,Spark 的可用性一直备受质疑。Ishan Mishra(班加罗尔产品经理)在推文下直接吐槽:"你们在 I/O 上'发布'了 Spark,两个月过去了,我还是用不了。"
Google 似乎在用这次更新回应这种不满。与 Chrome 集成同步宣布的,还有 Spark 向全球 160 多个国家和地区的 Google AI Pro 订阅用户开放。这意味着 Spark 从一个主要在美国测试的产品,变成了一项覆盖范围接近 ChatGPT 和 Claude 的全球服务。
但地区差异仍然显著。自动浏览功能目前仅限美国,欧洲用户持续在推文下追问:"为什么欧盟还不能用?""瑞士不在欧盟,为什么也没有?"Moriarty_tech(波兰科技博主)尖锐地指出:"波兰的 Chrome 没有任何 AI 功能,但 Ultra 订阅价格和美国一样。为什么 Claude 和 ChatGPT 能做到,你们做不到?"
三种方案,Google 选了最省事的
目前消费级 AI Agent 领域有三条主要的技术路线,它们在浏览器操控这件事上的设计哲学截然不同。
Anthropic 的 Claude Computer Use 是最"通用"的方案。它通过截图理解任意界面,用模拟鼠标点击来操作任何应用程序——不限于浏览器,也不限于特定网站。优势是覆盖范围广,劣势是需要用户学习一套新的交互模式,且截图识别的延迟和出错率高于原生操控。
OpenAI 的 ChatGPT Work 走的是任务编排路线。用户定义任务目标,Work 调用插件和 API 来执行,本质上更接近自动化脚本而非浏览器操控。它的强项在于结构化工作流,但对需要灵活浏览网页的开放式任务支持有限。
Google 的 Gemini Spark + Chrome Auto Browse 选择了第三条路:深度绑定一个浏览器,换取零配置的原生操控体验。
技术上,这种方案的执行精度和速度优于截图方案。策略上,它利用 Chrome 的 30 亿+ 用户基数和已有的登录态生态,将"迁移成本"压到最低。Cluster Protocol 官方账号在推文下评论:"原生浏览器访问比用扩展解析 DOM 稳定得多。"Filecoin 官方账号也参与讨论,提出"一个通过登录账号执行预订任务的 Agent 应该生成独立、可验证的带时间戳审计记录"。这个建议指向了更深层的信任问题:当 AI 替你操作账号时,谁为错误负责?
但也有人不买账。Ishan Mishra 在同一推文下写道:"每天我的时间线上都充斥着新的 Google AI 产品发布或更新,但我完全不知道该拿它们做什么。Spark 能做哪些 ChatGPT Work 或 Claude Cowork 做不到的事?"
这场竞争的一个关键变量是:Claude 和 ChatGPT 都不是浏览器厂商。它们要么通过截图模拟,要么通过插件桥接,都无法像 Chrome 的原生集成那样,直接使用用户已经保存的密码、书签、浏览历史和登录会话。Google 正在将这种"浏览器即平台"的资产变成 AI Agent 竞争中的结构性优势。
零迁移成本,是谷歌最锋利的武器
Google 的 AI Agent 策略可以用一句话总结:不让用户为 AI 改变习惯,而是让 AI 适应用户已有的数字生活。
当竞争对手都在构建全新的 Agent 交互范式时,Google 选择把 Gemini 注入到用户每天打开的那个浏览器里——利用已有的登录态、密码管理器、书签和浏览习惯,让 Agent 在用户不需要学习任何新工具的情况下开始工作。这条路径的优势不是模型能力(Spark 的底层模型在多项 benchmark 上仍落后于 Claude 和 GPT),而是分发和粘性。Chrome 是全球使用率最高的浏览器,每一个 Chrome 用户都是 Gemini Spark 的潜在用户。
但 Google 需要解决两个问题。第一,执行速度。如果 Spark 订一张机票需要五分钟,用户宁愿自己动手。第二,信任。当用户允许 AI 以自己身份浏览网页时,Crushed Between 在推文下提问:"你会让 Gemini 进入已经保存了信用卡的账号吗?"任何一种错误都可能摧毁刚刚建立的信任。
这两个问题没有出现在 Google 的博客里,但它们会出现在每一个用户第一次使用 Spark 自动浏览时的心里。
参考链接: