AREX Feed Article
Token 翻三倍,用户超后两名之和:DeepSeek V4 Flash 免费一周登顶 Cline
8 月 7 日,开源编程 Agent 平台 宣布:DeepSeek V4 Flash 已成为其平台上使用量第一的模型。自 7 月 31 日模型更新以来,用量增长 40%,token 消耗量翻了 3 倍,用户数超过排名第二和第三的模型之和,并连续四天创下平台历史新高。
从免费开放到登顶,只用了七天。
用户不是在换模型,而是在让模型跑更久
Cline 的公告帖下,一位用户 点出了一个关键数据:token 翻了 3 倍而用量只涨了 40%,意味着人均 token 消耗大约翻了一番。"人们不只是切换到它,而是让它跑更久,因为成本不再是一个停下来的理由。"
另一位用户 写得更具体:他用 DeepSeek V4 Flash 在 Cline 上跑了一个三小时的 session,花费不到一美元。
同一天,开源编程 Agent 也宣布将 DeepSeek Flash 的免费配额翻倍。OpenCode 的构建者 (@thdxr)透露,过去 48 小时内他们看到的 DeepSeek 流量超过了其他任何模型,且流量来源不仅限于 OpenCode 自身客户端。
两个开源编程 Agent 平台在 8 月 7 日同一天用行动确认了同一个信号:开发者在用 session 投票,而不是等评测报告。
7 月 31 日,三件事同时发生
这一周的速度建立在 7 月 31 日的三重动作之上。
当天,,代号 0731。模型架构没变,仍是 284B 参数的 MoE,每次前向 13B 参数激活。变的是后训练:一轮针对指令遵循、工具调用和多步推理的强化学习,让它在 9 项 agent 和编程 benchmark 上超越了 DeepSeek 自家的旗舰 V4-Pro-Preview。同时,模型以 MIT 许可证在 Hugging Face 上开放权重,API 定价为输入每百万 token 0.14 美元、输出 0.28 美元,并首次原生支持 OpenAI Responses API 格式。
同一天,,称它是"我们找到的第一个达到 SOTA 级别的 flash 模型"。
三天后的 8 月 3 日,,并表示"我们发现这件事可以很可持续地做下去"。
从第一天就有的免费接入,加上三天后的配额翻三倍,为后续的使用量爆发提供了基础设施。
13B 激活参数,在 agent 任务上干翻了自家旗舰
DeepSeek 公布的 benchmark 数据显示,V4 Flash 0731 在 Terminal-Bench 2.1 上拿到 82.7 分,比自家旗舰 V4-Pro-Preview 的 72.1 分高出 10 分以上。在 DeepSWE 上更是从预览版的 7.3 分暴增至 54.4 分,提升了 645%。独立评测平台 Artificial Analysis 也确认,V4 Flash 0731 在其 Intelligence Index 上比预览版提升了约 10 分。
这些数字有一个重要注脚:DeepSeek 承认 Terminal-Bench 2.1 的 82.7 分是用自研的、未公开发布的 "DeepSeek Harness" 跑出来的。第三方用标准工具链复现的结果可能不同。不过,Artificial Analysis 的独立验证至少确认了性能提升的方向是真实的。
对开发者来说,benchmark 之外还有两个更直接的变化。
一是价格。输入每百万 token 0.14 美元,缓存命中仅 0.0028 美元。按 3:1 的输入输出比和 30% 缓存命中率,一个 2000 万 token 的 agent session 总成本约 2.88 美元。同等规模的任务在 Claude Opus 4 上可能跑到 150 美元以上。
二是原生 Responses API 支持。此前用 DeepSeek 接 Codex CLI 需要中转层,工具调用和多轮对话的格式兼容一直是摩擦点。0731 版本直接打通了这条链路,开箱即用。
Flash 模型,第一次被当成了主力
过去,flash 类模型在开发者工具中的角色是"便宜备胎":主模型配额用完了临时顶上,或者做一些不重要的批量任务。没人把 flash 设成默认。
Cline 的数据打破了这一定位。V4 Flash 的用户量超过了平台上排名第二和第三的模型之和。这意味着大量开发者直接把它设成了主力。人均 token 消耗翻倍进一步说明,开发者不只是"试试",而是把它用于真实的长程任务。
OpenCode 的 dax 评论称,过去 48 小时的 DeepSeek 流量数据来自"各种客户端,不仅仅是 OpenCode"。这与 Cline 的数据形成了一个更大的画面:DeepSeek V4 Flash 的采用不是某一个平台的孤例,而是跨工具的现象。
定价、许可证和性能的同时到位,正在把开发者的默认选择从"哪个模型最强"推向"哪个模型在成本和能力之间最优"。
速度本身就是信号
七天。从免费开放到平台使用量第一,DeepSeek V4 Flash 0731 在 Cline 上的爬升速度本身就是一个信号。它没有靠发布会、没有靠评测榜单造势、没有靠封闭的内测排队制造稀缺。它靠的是 MIT 开源权重、一个足够低的 API 价格,以及一个愿意冒着成本风险让用户免费试的平台。
当开发者可以在自己的编辑器里直接验证一个模型好不好用、贵不贵、跑不跑得动,品牌溢价和 benchmark 排名的权重就会下降。Cline 的这份数据,是这个趋势的第一份量化证据。