AREX Feed Article
腾讯 AI 开源 BrowserSkill:智能体借用你已登录的标签页,验证码交还给人
北京时间 2026 年 9 月 16 日 16 时 41 分, 发帖宣布开源 BrowserSkill,代码放在 ,MIT 许可。该 简介自述为 @Tencentglobal 的官方 AI 资讯与开发者资源渠道,2025 年 12 月创建,目前有 22,718 名关注者。
按推文的介绍,BrowserSkill 不给智能体另开一个浏览器,而是让它从用户正在使用的真实浏览器里「借」一个标签页:登录态现成可用,撞上验证码或确认弹窗就交还给人,处理完再继续。发帖当天仓库即可访问,README 与推文口径一致:项目由 bsk 命令行工具(CLI)、本地守护进程(daemon)和浏览器扩展三部分组成;推文强调它是 CLI 而非 MCP 服务器(Model Context Protocol,模型上下文协议),Cursor、Claude Code、Codex 等编码智能体在支持之列。
不开新浏览器,从「借一个标签页」开始
「大多数工具给智能体一个空白浏览器。我们让它从你的浏览器借走一个标签页,用完再还回来。」推文把这句定位写得直白。README 把「借」写成了硬性动作:智能体想碰你已经打开的标签页,必须显式借用,任务完成后归还,浏览器其余部分则不许动。
浏览器任务跑在一个单独、可见的 Agent Window 里,用户可以继续用自己的浏览器。复用真实登录态被列为第一条特性:智能体直接工作在你已登录的网站上,不需要为此另建测试账号。当任务走到验证码、登录、确认对话框这类只有人能处理的步骤时,智能体会请求用户接管,用户处理完毕后它接着执行——README 将其称为内置的人在回路(human-in-loop)。
CLI 而非 MCP:一条全部在本地的调用链
「它是一个 CLI,不是 MCP 服务器——任何能执行 shell 的智能体都能用它,而且你能看到它发出的每一次调用。」腾讯 AI 在推文中这样解释接口选型。「能执行 shell」指的是能在命令行环境运行指令的智能体;README 同时写明,bsk 不锁定特定模型、Agent 框架或运行框架(harness)。
README 的架构图把链路拆开:智能体从不直接连浏览器。它以 shell 调用 bsk CLI,CLI 经本地进程间通信(IPC)把请求交给 bsk daemon,daemon 通过 127.0.0.1 上的 WebSocket 与浏览器扩展通信,实际操作由扩展在 Agent Window 里执行;只有被明确要求时,扩展才会借用用户的标签页。推文所称的「一切本地运行」,对应的正是这条不出本机的链路。
工程形态上,仓库是 Cargo + pnpm workspace:Rust 编写的 bsk CLI 与 daemon 位于 crates/bsk-cli,共享协议类型与 JSON Schema 位于 crates/bsk-protocol,浏览器扩展位于 apps/extension,扩展界面带英语、简体中文和韩语本地化。适配面由一条 bsk install-skill 命令覆盖:它把教会智能体使用 bsk 的技能文件装进检测到的 harness,README 列出 Cursor、Claude Code、Codex、OpenClaw、CodeBuddy、WorkBuddy、Pi、Hermes Agent;DeepSeek Harness 走 npm 上的专用插件 @wxg-prc-cpg/browser-skill-dsh-plugin,为智能体注入原生的 browser_* 工具。智能体跑在远端服务器时,README 也说明了如何通过内置认证服务把它配对到用户本地浏览器。
开关存在浏览器设置里,命令行参数压不过它
推文专门提醒了一个容易漏掉的点:「智能体借用标签页前会先请求许可,而这个开关存在你的浏览器设置里,不在某个标志位上,所以它无法被说服绕过。」
具体形态写在 README 里:扩展弹窗有两个相互独立、默认都开启的 Automation 设置——「Confirm before borrowing tabs」(借用标签页前确认)和「Allow requests for human help」(允许请求人工帮助)。设置随浏览器配置文件保存,对已有和新建会话一律生效;浏览器断连时返回错误,而不是依据命令行标志或环境变量在本地判定为已禁用。
0.3.0 的升级说明把这个设计往前推了一步:--unattended、tab borrow --no-confirm、BSK_REQUEST_HELP=off 三个旧入口「不再能绕过确认或关闭帮助」,为兼容起见仍被接受但已弃用,无法覆盖浏览器设置,CLI 与 daemon 会在日志里记录提示。tab borrow --timeout 60s 这类参数只控制等待确认的时长,不改变「是否需要确认」本身。
帮助被关闭后的边界同样写明:request-help 返回 disabled,技能指引智能体重新观察现场,在既有登录态、已授权输入和可用工具范围内设法完成步骤;在任务授权与主机规则允许的前提下,具备图像理解能力的模型可以尝试图形验证,而手机扫码、人脸验证、无法获取的短信验证码,以及纯文本模型面对的图像验证码这几类步骤可能仍被挡下。一次 disabled 结果既不构成任务完成,也不带来额外权限。
安装也交给智能体:一行指令加两家商店
README 推荐的安装方式,是把安装直接交给手头的智能体:用户把一句固定指令发给 Cursor、Claude Code 或 Codex,智能体按仓库内的 AGENT_INSTALL.md 文档自行装好 CLI 与技能文件,再引导用户加载浏览器扩展。习惯手动的用户,可以在 macOS 与 Linux 上用一行 curl … | sh 脚本把 CLI 装进 ~/.local/bin(Windows 走 PowerShell 脚本),扩展从 或 安装;README 称其他基于 Chromium 的浏览器「预计可用」,Firefox 在计划中。
系统支持面为 macOS(Apple Silicon 与 Intel)、Linux(x64 与 ARM64)和 Windows x64。装完后用 bsk --version 确认版本、bsk doctor 做健康检查,再让智能体打开 example.com 并总结页面作为首次使用检查;后续更新用 bsk update --yes,需在活动任务结束后执行。具体能力各有命令入口,比如整页截图可由智能体执行 bsk screenshot --session <id> --full-page --out page.png 完成。
当天能核验什么,什么还只是发布方口径
本文能独立核对的部分:推文与仓库真实存在且互相印证,MIT 许可写在 README 末尾,两个商店的上架链接由 README 给出,仓库页面显示 2k stars、160 个 fork、20 位贡献者。经 API 核实该帖时,它发布不到一天,已积累 1,197 次点赞、1,528 次收藏和 86,263 次浏览。
仍属发布方口径的部分:从「登录态直接可用」到「无法被说服绕过」,能力与安全表述均来自腾讯 AI 的帖文和项目自身的 README。仓库自带的 evals/browser 是一套跑在本地确定性页面上的浏览器能力评测,属于项目方自己的测试设施,不是第三方验证;实际采用情况与安全性,在发布当天的公开信息里仍是待独立评估的部分。
README 同时写明了不可逆的边界:关闭确认开关会释放尚待确认的借用请求,已经完成的借用不会被撤销,已结束的求助也不会被重新打开;把开关重新打开,只对之后的操作生效。至于「无法被说服绕过」这句判断,0.3.0 移除命令行旁路是写进文档的改动,它在真实智能体与真实网页环境中的成色,要等仓库之外的独立评估来回答。