AREX Feed Article
GPT-6 发布约六个半小时后,browser_use 创始人实测:Luna 以约 1/22 价格接近 Opus 5.5 的浏览器 Agent 成绩
北京时间 9 月 23 日 8 时 44 分(UTC 00:44),browser_use 创始人 Gregor Zunic(@gregpr07)了对 GPT-6 Sol 与 Luna 的最早一批独立实测之一:在他随帖附上的 Browser Use Benchmark v2 成本-成绩散点图中,GPT-6 Luna xhigh 每任务花费 0.190 美元、得分 57.6,对比模型 Claude Opus 5.5 花费 4.21 美元、得分 59.4。他在帖文里写道,Luna「比 Opus 5.5 便宜 22 倍,表现相近」,这些是「极长且非常困难的浏览器 Agent 任务,即使对人类也如此」,并称「GPT-6 模型自成一档」。
OpenAI 于 9 月 22 日 18 时 12 分(UTC)这两款模型,Zunic 的帖子在约六个半小时后上线。测试由其在公司自建基准上完成,任务集自选,成绩目前只有发布方自己的数据支撑、未经第三方复核;但由于它不带厂商立场,又给出了每任务成本这类可直接比价的数字,是发布后最早可操作的独立性价比读数之一。
散点图补上的细节:Luna 低价档与图上最高点
图上横轴是每任务记录成本(Recorded agent cost per task,美元),纵轴为百分制评分,数十个模型按成绩与价格落点排开,每个点标注各自花费,加圈的是当前 GPT-6 各档与 Opus 5.5。比 Zunic 早五分钟(UTC 00:39),browser_use 公司账号,原话是「帕累托前沿今天被完全重画」,并把最关键的三行抄在帖文里:Claude Opus 5.5 得 59.4 分;GPT-6 Sol medium 得 66.9 分、比 Opus 5.5 便宜 3.5 倍;GPT-6 Luna xhigh 得 57.6 分、比 Opus 便宜 22 倍。公司账号的结尾同样是「OpenAI 自成一档」,并附一句「所有模型都可以在我们的云上试用」。
Zunic 的截图补上了帖文没写的部分:Luna 系列在图上铺出一条完整的低价档——xhigh 0.190 美元、high 0.155 美元、medium 0.126 美元、low 0.018 美元,得分随花费递减;图上最高点是 GPT-6 Astra medium,标价 8.87 美元、约 81 分。就分数而言,Luna 的 57.6 略低于 Opus 5.5 的 59.4——「相近」是测试者对这组数字的概括,不是两个分数相等;分数高于 Opus 5.5 的还有 Sol medium(66.9 分)。
Bench v2 是什么:60 个任务,按每任务记录成本计价
Browser Use Benchmark v2 不是为这次发布新搭的测试。公司账号 9 月 21 日就在用「Long Horizon Browser Use Benchmark v2」这个名字,当时给出的成绩是 GPT-6 Astra 80.6 分居首,DeepSeek V4.1 Flash 47.9 分,Grok 4.7 39.9 分。9 月 22 日的一条帖子:60 个任务、逐个记录每任务花费——那次对比 MiMo v2.6 Flash 与 Grok 4.7,写的是「每任务 0.10 美元对 5.72 美元」。
本身是一家浏览器 Agent 云服务商,X 简介自署「Agents that use the Browser」。用「性能接近旗舰、价格便宜数十倍」的句式推模型是这家公司的惯常表述:9 月 11 日,帖子的写法是「GPT 5.6 Sol xhigh 97% 的性能、便宜 30 倍」,并附上 15 美元免费额度邀请试用。
OpenAI 前一日的官方口径:降价 50%,对比对象是 Opus 5
Zunic 测的两款模型是 OpenAI 9 月 22 日官宣的 GPT-6 家族新成员:称二者沿用本月早些时候发布的旗舰 GPT-6 Astra 的训练方法,把专业工作、事实性、编码、计算机使用与对齐方面的进展带进「更快、更便宜」的档位。API 定价为 Sol 每百万 token(模型处理文本的计费单位)输入 2 美元、输出 10 美元,Luna 输入 0.10 美元、输出 0.50 美元,均比 GPT-5.6 的促销定价便宜 50%;模型当日登陆 ChatGPT Work 与 Codex(面向 Plus 及以上档位),API 名称分别为 gpt-6-sol 与 gpt-6-luna。与降价同步,OpenAI 还改进了 GPT-6 的提示缓存,缓存输入读取按一折计费。
官方博客自己也给了计算机使用方面的对比:在 OSWorld 2.0 offline 上,GPT-6 Sol xhigh 得 60.5%,略高于 Claude Opus 5(medium 档)的 60.3%,每任务成本约低 80%。两份对比的对象并不相同:OpenAI 用自家评测对比的是 Opus 5,而 Zunic 的图上已经是更新的 Opus 5.5;两份数据基准不同、口径不同,不能用其中一份去印证另一份。
回复区的分歧:「相近」,还是「便宜的另一档」
截至发稿(UTC 约 13 时),Zunic 的帖子获得 531 个赞、47,465 次浏览,回复里很快出现两类声音。一类顺着数字往下追问:用户 读出「每任务 0.19 美元对 4.21 美元」,但问「真实耗时那一列在哪」——长浏览器任务里,会话和购物车可能在模型思考时过期,这种失败「不管 token 多便宜都照价收费」。另一类质疑「相近」二字: 认为「真正的头条是 Sol medium——66.9 对 Opus 的 59.4,还便宜 3.5 倍,严格更好」,Luna 的 57.6 则是「便宜的另一档,谈不上相近」;他还追问横轴是实测花费还是标价,「每任务成本的大头是重试,一次验证失败就按全价重来」。也有人给出相反的体感: 写道,「这与我今天用 Luna 和 Sol 跑浏览器任务的个人体验完全不符」。
未经复跑的 22 倍
目前可以核实的:帖子存在、时间明确、图表与帖文数字互相咬合,发布者是 browser_use 创始人本人与公司官方账号,两条帖子前后相隔五分钟。不能核实的更多:任务清单、判定标准、复现脚本都没有随帖公开,运行环境是 browser_use 自家的 harness(评测运行框架)与云,图注写明成本是「记录值」,但没有说明是否包含重试。22 倍本身只是两个数字相除的直接结果(4.21 ÷ 0.190 ≈ 22),有争议的是这两个「每任务成本」是怎么算出来的。
同一张图上对 Opus 5.5 双向占优的是 Sol medium:66.9 分、1.20 美元,分数更高,价格不到其三成。至于 Luna 的 22 倍价差能否在别人的任务集上站住,要等 browser_use 公开这 60 个任务的清单与判定标准,或出现第一份独立复跑——在那之前,它只是单一从业者自建基准上的一张截图。