AREX Feed Article
实测 DeepSeek V4-Flash 写代码:比 Pro 更强,但总成本没省一分钱
DeepSeek 说 V4-Flash 刷新版编程能力反超自家旗舰 V4-Pro,定价只要三分之一。The New Stack 记者 Jessica Wachtel 拿了三个真实的 Python 编程任务,用 OpenCode 让两个模型各跑一遍,逐 token 记账。只有一个意外:Flash 确实更强,总成本却没省。
Flash 的 API 定价是输入 $0.14 / 输出 $0.28 每百万 token,Pro 是 $0.435 / $0.87,几乎刚好三倍。如果廉价模型在编码上反超旗舰,旗舰还有什么存在理由?
两个任务打成平手,Flash 少烧了近一半的 token
第一个任务是修 bug:Rich 库在 macOS 的 Dropbox 目录下导入时报 PermissionError 崩溃。两个模型找到了同一行修复——把异常捕获从 FileNotFoundError 扩到 OSError。区别只在测试文件的放置:Pro 读了一遍已有测试结构,把回归测试加进了现有套件;Flash 直接新建了一个测试文件。两边的修复都跑通了全部 957 个测试。
Flash 用了 59 秒、6 次 API 请求、119.9K token,不到 1 美分。Pro 用了 61 秒、13 次请求、159.2K token,约 1 美分。同一行代码,Pro 多打了一倍的 API 调用才找到。
第二个任务是给 Rich 的 Text 类加 lstrip() 方法:从文本开头剥离空白但保留样式。因为样式是按位置锚定的,删掉前面的字符后,所有样式的起止坐标都得跟着平移,比 rstrip() 难一个量级。两个模型的实现都通过了 Wachtel 设计的 8 个边界测试。
Flash 用时 1 分 29 秒、6 次请求、191.2K token。Pro 用时 1 分 43 秒、23 次请求、333.6K token。Pro 的初版代码还出了一个 bug:丢掉了起始位置落在被剥离空白内部的样式区间,靠自己的测试抓出来修好的。Wachtel 的结论是:代码质量打平,Flash 效率胜出。
性能优化任务:Flash 找到 1.83 倍加速,Pro 只看到 1.06 倍
第三个任务没有标准答案:给 Rich 的表格渲染找出性能热点并优化。这才是两个模型真正拉开距离的地方。
Flash 干了 27 分钟,发出 128 次 API 请求,烧了 1540 万 token。它自己搭了一套测试装置,在 37 种表格上比对新旧输出差异,中途两次发现自己的 benchmark 量错了库的版本、主动修正,还顺手清掉了 13 个类型检查告警。最终交出了 1.83 倍的实测加速。
Pro 面对同一个 prompt,只优化了一个重复计算步骤和一段热点代码,报告了 3.3% 的提升。Wachtel 实测只有 1.06 倍。Pro 的输出确实是逐字节和原始版本一致,Flash 则在一个极边缘场景下(彩色终端中某个特定表格布局)写出了颜色码顺序略微不同的输出。视觉上完全一致,没有用户会发现,但 Flash 声称"输出完全一致"是不准确的。
Wachtel 的判断很直接:便宜的模型在这个任务上更有创造力,贵的模型只做了表面工作。
15M token 花了 8 美分,缓存定价让成本账翻了
整个三轮测试跑下来,Flash 总计消耗约 1570 万 token,Pro 消耗约 520 万 token。Flash 烧了三倍的 token,最终账单却是 $0.09 对 $0.10,几乎持平。
原因藏在 DeepSeek 的缓存定价里。在性能优化任务中,Flash 98.6% 的 token 是缓存读取,缓存命中价仅 $0.0028 每百万 token。Pro 的 token 消耗少得多,但单价是 Flash 的三倍,价格优势被 token 量的劣势完全抵消。
这个结果颠覆了"Flash 绝对更便宜"的简单叙事。在需要深度推理的开放式任务上,更好的推理质量以更多 token 为代价,缓存定价的极度慷慨又把 token 量暴涨的成本压了下去。两相抵消,总成本几乎一样。
Hassan(Together AI 开发者体验总监)此前在 DeepSWE 编码任务上也发现了类似的性价比曲线:,成本反而低三倍。
SemiAnalysis 也发布了基准对比,从另一个维度印证了 Flash 的效率:,激活参数少 4.2 倍。
DeepSeek 已经在用量页面挂出了涨价横幅
Wachtel 在 DeepSeek 的 API 用量页面上截到了一条系统横幅(原文为英文):
We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected. Please plan your usage accordingly. The specific pricing plan will be subject to official notice.
大意是:近期计划整体上调 API 定价,预计涨幅显著,具体方案以官方通知为准。
横幅截图被直接放进了 The New Stack 的报道中。DeepSeek 没有公布新价格表,也没有给出生效日期。但信号很清楚:当前 V4-Flash 的定价不可持续。
Flash 的模型权重已在 Hugging Face 上以 MIT 协议开源,284B 总参数、13B 激活参数的 MoE 架构,意味着你可以在 API 涨价后。但自行部署就涉及 GPU 成本,不再是"3 美分跑完一个测试任务"的账本了。
对于已经在 V4-Flash 上构建生产流量的团队,Wachtel 这篇测试提出的问题比答案更紧迫:如果更好的推理天然意味着更多 token 消耗,而单价即将上调,当前 $0.09 一个完整编程会话的成本,能维持多久?
参考链接
- _