AREX Feed Article
Browser Use 创始人发布自测结果:DeepSeek V4.1-Flash max 档得分约为 GPT-5.6 Sol xhigh 的 97%,agent 成本约低 30 倍
9 月 11 日,Browser Use 创始人 Gregor Zunic(@gregpr07)在 X 上公布了一组:DeepSeek 前一天发布的 V4.1-Flash 在 max 档上的得分约为 GPT-5.6 Sol xhigh 的 97%、Claude Opus 5 的 95%,而「记录到的 agent 成本」约低 30 倍。
这是 V4.1-Flash 发布后较早出现的第三方测试之一,也是把它与 GPT-5.6 Sol、Claude Opus 5 直接对表的一条。它来自 Zunic 单人发布的基准测试,正文里只有结论和数字,没有实验方法说明;回复区里,关于成本口径的追问和能力层级的质疑先后出现。
从「60 个残酷的浏览器任务」到一条简短帖子
Zunic 的帖子只有几句话,另附一张图:「max 档上的 DeepSeek V4.1 Flash 简直疯狂」「GPT-5.6 Sol xhigh 分数的 97%」「Claude Opus 5 分数的 95%」「记录到的 agent 成本低 30 倍」。
11 个多小时前,他发过:V4.1-Flash「在 60 个残酷的浏览器任务上位于帕累托前沿」,性能相近时,「记录到的 agent 成本比 Sol 和 Opus 低 50 倍以上」,「整个数据集跑下来的成本比 Sol 的单个任务还低」。两版结果都用「记录到的 agent 成本」这个说法,但成本倍数一个写 50 倍、一个写 30 倍,两条帖子的正文都没有解释口径的差别。
几分钟后,Browser Use 的官方账号,并把开发者引向自家云端的 V4.1-Flash:「GPT 5.6 Sol xhigh 97% 的性能、便宜 30 倍」;用 15 美元的免费额度,可以跑 100 个复杂的网页 agent 任务。
成本为什么可能低:每百万 token 0.003 美元,和 890 字节的 KV 缓存
省钱的机制写在 DeepSeek 9 月 10 日的里。官方称 V4.1-Flash 是新架构家族里最小的一款,带原生视觉理解;骨干是 552B 参数的 MoE(混合专家)模型,采用新的因果编码器-解码器(Causal Encoder-Decoder)结构,读入时激活 8B 参数、生成时激活 16B 参数。
补上了其余规格:模型共 40 层,20 层做编码、20 层做解码;上下文窗口 100 万 token;全局 KV 缓存(键值缓存)降到每个 token 890 字节。官方公告给出的比例是:KV 缓存对 HBM(高带宽内存)的需求为上一代的四分之一,对 SSD 存储的需求为八分之一。官方还说,缓存命中费用在 agent 成本里通常占大头,把缓存压小,成本就跟着掉。
价格表是这套机制在 API 上的体现:非高峰时段,缓存命中的输入每百万 token 0.003 美元、缓存未命中 0.15 美元、输出 0.60 美元;高峰时段全部翻倍;高峰时段是工作日 UTC 01:00~04:00 与 06:00~10:00,其余时间(含周末和节假日)都算非高峰。作为对照,VentureBeat 列出的 GPT-5.6 Sol 缓存命中输入价为每百万 0.40 美元,Claude Opus 5 为 0.50 美元,和 0.003 美元隔着两个数量级。
但挂牌价和「记录到的 agent 成本」是两个口径。据 VentureBeat 的解释,agent 的实际总成本还取决于输出长度、推理 token、重试、工具调用乃至任务成功率,缓存命中比例是关键变量之一;同样的单价差,落在不同负载上会得出不同的倍数。
同样的两个对手,官方表格给出的领先面是混合的
官方发布页的对比图(本文题图)里,GPT-5.6 Sol 和 Claude Opus 5 也在列:DeepSWE v1.1 上,V4.1-Flash 得 74.2,Opus 5 得 74.0,Sol 得 73.0;CyberGym 得 88.1,Automation-Bench 得 54.8。但 Terminal-Bench 3.0 上,Opus 5 以 43.3 对 30.0 领先;Terminal-Bench 4.0 的差距更大,51.8 对 31.2;GPQA Diamond 和 SEC-Bench Pro 的领先者是 Sol。这些都是 DeepSeek 自己跑的分。
官方对比表跑在最高强度上:据 VentureBeat 引述的技术报告,推理强度从 25 提到 100,DeepSWE v1.1 从 66.0% 升到 74.2%、Terminal-Bench 2.1 从 82.4% 升到 90.6%,代价是约 2.5 倍的输出 token 消耗;60~80 档能用不到一半的预算拿到大部分提升。DeepSeek 的 API 把推理强度分为 low、high、max 三档,对应 50、75、100;Zunic 帖子里写的「max」,与这套预设里的最高档同名。
其他早期第三方测试的结果也不一致。设计工具项目 OpenDesign 在 9 月 9 日,V4.1-Flash 在日常设计任务上达到 GPT-6 Astra 分数的 98%,成本是后者的 1.4%。同一天,vibe coding 社区 BridgeMind 的给出了另一个方向:在熔岩灯任务上,V4.1-Flash 的完成时间比 Fable 5.1 和 GPT-6 Astra 更长,尽管它跑到每秒 344 token、消耗 2,350 万 token、缓存命中率 99.7%、花掉 0.33 美元;产出的熔岩灯则好于 Muse Spark 1.3 和 Gemini 3.8 Flash。
回复区:口径追问、层级质疑与「钱包要哭了」
成本的统计口径被直接追问。Greg Glazewski :「这个『记录到的成本』是按单个任务算,还是按完整 agent 运行算?便宜模型的重试一旦堆积,优势通常就没了。」
层级之争也很直接。Chris Hayes 的是:「它甚至不如 Sol……是个好模型,但毕竟是个 flash 模型。你真觉得它到了 Astra 的水平?去看看它做出来的东西。」中文 AI 博主「范凯说 AI」在里写道,这个评测「和我的体感一样」,并认为 DeepSeek 的实际能力「在 Astra 和 Claude 之下」。
支持的一方同样直接。EDDY VU 称,这样的性价比「完全改变了自主 agent 运行的单位经济」。
在回复里,Zunic 也答应了补跑:Alexander Yue 把「Astra 的各档强度」也补上,理由是「我听说 medium 比 xhigh 还贵」;Zunic :「钱包要哭了,行吧,让我来,哈哈哈。」
旧标识迁移:退役、质疑与 9 月 14 日的路由切换
DeepSeek 已经开始替换旧模型。官网写明:V4-Flash 和 V4-Flash-Vision-Exp 已退役,它们的标识被暂时路由到 V4.1-Flash。
这种「换底层模型、不换标识」的做法已经引来反对声音。据 VentureBeat 报道,Hacker News 上的开发者认为,在生产标识背后更换底层模型,可能让回归测试失效,即便替代品名义上更好、更便宜。
DeepSeek 已公布 V4-Pro 的切换时间:9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求都会按 V4.1-Flash 的费率处理,直到 V4.1-Pro 推出。