AREX Feed Article
DeepSeek V4-Flash 一刀砍穿 AI 定价:三美分杀穿基准测试,Fable 5 贵 105 倍
DeepSeek 在 7 月 31 日悄悄更新了 V4-Flash 的 changelog,随后 Artificial Analysis 亮出一组让整个行业沉默的数字:跑完一套基准测试,V4-Flash 只要三美分,Claude Fable 5 要三美元十五美分。105 倍的价差背后,是一个 284B 参数的 MoE 模型,在 Terminal-Bench 2.1 上拿下 82.7 分,直接把 Anthropic 最贵的旗舰踩在脚下。
跑完一整套基准测试,只要三美分
独立研究机构 Artificial Analysis 在 8 月 3 日发布的报告中,用了一组简单到残忍的数字:DeepSeek V4-Flash 完成其 Intelligence Index 全部测试的平均成本约为三美分。
排在这个数字后面的,是 Moonshot 的 Kimi K3(86 美分)、OpenAI 的 GPT-5.6 Sol(1.86 美元)、Anthropic 的 Claude Fable 5(3.15 美元)。
三美分。对比最昂贵的竞品,便宜了 105 倍。
这不是 sticker price 的文字游戏。Artificial Analysis 的 Intelligence Index 测量的是实际完成任务所需的模型调用费:推理模型可能在一次任务中消耗数量级不同的 Token,只看输入输出单价毫无意义。用成本除以完成的任务数,V4-Flash 正在把「贵」的定义从底层改写。
一夜之间,X 上的 AI 圈为它烧穿了流量天花板
DeepSeek 官方在 X 上发布 V4-Flash 公测公告时,配了一张 Terminal-Bench 的对比图,V4-Flash 正式版(82.7)远超自家 V4-Pro 预览版,逼近 GPT-5.6 Sol。
这条推文收获了 29,096 个赞、3,464 次转发、8,419,306 次浏览。
独立开发者 Peter Dedene 紧随其后贴出价格对比图,配文模仿下属向老板汇报的口气:"Sir,一个新模型刚刚发布了。输入便宜 18 倍,输出便宜 28 倍,而且匹配了 Opus 4.8。"这条推文拿下 12,985 个赞、707 次转发、106 万次浏览。
AI 编程工具 Cline 的官方账号率先发现 changelog 更新:"DeepSeek 一小时前悄悄更新了 V4-Flash。Terminal-Bench 得分 82.7,比四月预览版暴涨 25.8 分。" 5,903 个赞、1,760,350 次浏览。
Databricks 的 Yuchen Jin 用一句话定义了这次发布的意义:"开源模型正在把智能逼到便宜得无法计价的边缘。"Alex Finn,一位拥有 46 万粉丝的创始人,则在推文中直击要害:"4,000 美元的硬件,现在能给你无限的超级智能。"
这股声浪的烈度,把 V4-Flash 推向了 X 趋势榜。多位评论者将这一周称为"开源 LLM 历史上最伟大的一周"。
从 R1 炸穿美股到 V4-Flash 逼宫 Fable 5,剧本从未换过
2025 年 1 月,DeepSeek R1 横空出世,在推理基准上追平 OpenAI o1,API 定价却只有对方的零头。当天美股科技板块蒸发数千亿美元市值,投资者第一次认真问:前沿 AI 真的需要那么多算力吗?
此后一年半,DeepSeek 以稳定的节奏持续出货:DeepSeek Math V2 以开源模型身份拿下 IMO 金牌;V3.2-Speciale 对标 Gemini 3 Pro;今年 4 月发布 V4 系列预览版,首轮外部融资超过 70 亿美元。
7 月 31 日,V4-Flash 正式版上线公测。架构没变,参数没改,纯靠后训练翻盘:Agent 评分暴涨 25.8 分,直接超越 V4-Pro 预览版。同一天,Anthropic 仍在为 Fable 5 的出口管制禁令与美国政府拉锯,该模型曾因此从全球下线 19 天。
两天后的 8 月 2 日,Arena.ai 将 V4-Flash 列入前端编码前沿模型;8 月 3 日,Artificial Analysis 的定价报告引爆媒体。一套组合拳下来,V4-Flash 从一次模型更新,变成了对行业定价体系的一次公开处刑。
参数没变,架构没改,后训练翻了盘
V4-Flash 的核心数据很简单,但每一行都在挑战直觉:
- 架构:284B 总参数,每个 Token 仅激活约 13B(MoE)。CSA + HCA 混合注意力机制交错排列,既压低了推理成本,又维持了长上下文能力。
- Benchmark 跳升:Terminal-Bench 2.1 从四月预览版的 56.9 → 正式版 82.7(+25.8 分),超越 Claude Fable 5 的 80.5 分。DeepSWE 达 54.4%,Toolathlon 达 70.3%,CyberGym 从 38.7 跃升至 76.7。
- 定价不变:$0.14/百万输入 Token,$0.28/百万输出 Token,缓存输入仅 $0.0028。
- MIT 开源:权重开放下载,GGUF 量化版已由 Unsloth 发布。
跳跃的秘密不在架构上。DeepSeek 明确表示正式版与预览版"结构和尺寸相同,只重新做了后训练"。
预览版技术报告披露了一条被低估的路径:分别训练数学、代码、Agent 和指令遵循专家,使用 SFT 和 GRPO 强化各自能力,再通过十多个教师模型的 On-Policy Distillation 合并回同一个模型。工具调用被当成了独立问题处理——专门的调用格式减少参数转义错误,Interleaved Thinking 让模型在工具返回后保留前面的推理链,而 DSec 提供数十万个并发沙箱让模型反复练习"运行代码 → 读报错 → 修改 → 再运行"。
这些训练没有增加参数,但大幅减少了 Agent 最常见的失败模式:选错工具、填错参数、忘记状态、提前终止。
八万亿 Token,一天。DeepSeek 划出的「斩杀线」
开源 AI Agent 工具 OpenCode 披露了一个更惊人的数字:8 月 2 日当天,V4-Flash 通过其平台消耗了 8 万亿 Token,5 万亿来自免费额度,3 万亿来自付费套餐。
一个小背景:接入了 400 多款模型的 OpenRouter 平台,日均处理约 6.6 万亿 Token。DeepSeek 一款模型,一个入口,一天的用量超过了 OpenRouter 全平台。
这指向了一个比 benchmark 更深刻的变化。Agent 时代已经改变了模型使用的单位:从"一次回答有多聪明"变成了"完成一项长任务要花多少钱、失败几次、多久"。一次 Agent 任务可能持续数小时,调用几十次工具,消耗的 Token 是单次问答的数百倍。当价格差达到两个数量级,几分的能力差距远不如几十倍的价格差距重要。
DeepSeek 不需要成为最强的模型。只要达到"大多数时候能做完",它就能用 105 倍的价差,把更贵的模型挤出默认调用位。OpenAI 的 GPT-5.6 Sol 在 Terminal-Bench 2.1 上以 85.8 分守住了王座,但 V4-Flash 的 82.7 分只差 3.1 分,而 Sol 每百万输出 Token 收费 30 美元,是 V4-Flash 的 107 倍。
最先受到冲击的,不是最弱的小模型,也不是最强的旗舰。真正尴尬的是中间层:比 V4-Flash 强几个百分点,却贵几十倍;又没有强到能稳定解决 V4-Flash 做不了的问题。
Sam Altman 在 7 月底的播客中曾坦承,OpenAI 预计模型使用量会极大增长,不需要靠"极高毛利"养活自己。DeepSeek 的梁文锋也相信 AI 需求几乎没有上限。两人的判断一致,但 DeepSeek 先把价格打到了那个未来。
三美分之后,智能不再是奢侈品
V4-Flash 的真正杀伤力,不在于一张榜单,而在于它永久性地改变了默认选项。
过去调用旗舰模型不需要算账:要最好的,就付最贵的。现在,一个便宜 100 倍的模型已经能完成大多数编码和 Agent 任务,昂贵模型必须反过来证明:剩下来那几分能力,究竟值不值得多付几十倍的钱。
对于 Anthropic 和 OpenAI 正在筹备的 IPO,这组数字的意义比任何一家投行报告都更直接。Zack Kass,OpenAI 前市场负责人,将此刻定义为"模型回报递减"时代——一旦模型"足够好",下一个百分点的改进几乎不影响购买决策,价格说了算。
8 月 3 日这天,Artificial Analysis 把硬数据摆上了台面。三美分跑完基准测试,不是一次促销,是一张宣战书。智能,从此不再是奢侈品。
Sources
- — V4-Flash costs ~$0.03 per Intelligence Index test; Fable 5 $3.15 (105x more)
- — Intelligence Index score 50, pricing details, $7B funding context
- — 29K likes, 8.4M views, Terminal-Bench chart, Responses API + Codex support
- — 5.9K likes, 1.76M views; first to flag changelog update, +25.8 point leap
- — 13K likes, 1.06M views; 18x cheaper input, 28x cheaper output
- — Terminal-Bench scores: V4-Flash 82.7, Fable 5 80.5, GPT-5.6 Sol 85.8
- — 284B params, 13B active, post-training retrain, DeepSWE 54.4
- — 8T tokens/day via OpenCode, "斩杀线" analysis, architecture details, local deployment
- — MIT license, 1M context, MoE architecture confirmation
- — "greatest week in open source LLM history"
- — "$4,000 hardware now gives you unlimited super intelligence"
- — 82 tok/s on 2x DGX Sparks, peak 95 tok/s; Unsloth GGUF release_