AREX Feed Article
Artificial Analysis 独立评测:DeepSeek V4 Flash 0731 综合成本仅为 Claude Fable 5 的 1%,智商持平 Gemini 3.6 Flash
8 月 3 日,路透社援引旧金山研究机构 Artificial Analysis 的独立评测数据,确认 DeepSeek V4 Flash 0731 是全球知名模型中运行成本最低的模型,按任务加权平均成本计算仅为 Anthropic Claude Fable 5 的约百分之一。同时,该模型的 Intelligence Index 得分为 50/100,与 Google Gemini 3.6 Flash 持平。
关键数据:成本碾压与智商定位
Artificial Analysis 的评测引入了「每任务平均成本」指标——不仅看 token 单价,还计入模型完成任务实际消耗的 token 量,避免「低单价但话多导致总成本更高」的假象。
| 模型 | 每任务平均成本 | Intelligence Index |
|---|---|---|
| DeepSeek V4 Flash 0731 | $0.03 | 50 |
| Kimi K3(Moonshot) | $0.86 | 57 |
| GPT-5.6 Sol(OpenAI) | $1.86 | ≥59 |
| Claude Fable 5(Anthropic) | $3.15 | ≥59 |
| Gemini 3.6 Flash(Google) | 未披露 | 50 |
| Muse Spark 1.1(Meta) | 未披露 | 51 |
| GLM-5.2(Z.AI/智谱) | 未披露 | 51 |
V4 Flash 的 token 定价($0.14 输入 / $0.28 输出,每百万 token)此前已在社区报道中广泛传播,但 Artificial Analysis 的每任务成本分析首次证明:即便 Claude Fable 5 完成任务所需的 token 数更少,「完成任务」的综合开支仍高出两个数量级。
在智商维度,V4 Flash 的 50/100 与 Google Gemini 3.6 Flash 完全相同,仅落后 Meta Muse Spark 1.1 和 GLM-5.2 一个百分点。该 Intelligence Index 综合了编码、推理和工作场景等九项基准测试。
与此前报道的关系
确认与延伸:此前报道已引用 DeepSeek 官方 API 定价($0.14/$0.28),并指出 V4 Flash「成本碾压」竞争模型。Artificial Analysis 的独立评测为此提供了来自权威第三方研究机构的验证,并用每任务成本指标将比较从「便宜几倍」精确到「便宜约 100 倍」。
填补空白:此前第三篇报道曾指出 BenchLM 平台截至 8 月 2 日的 DeepSeek V4 Flash 22 条基准记录仍来自 4 月 Preview checkpoint,0731 的独立评测数据尚未覆盖。Artificial Analysis 此次发布恰好填补了这一空白,提供了首个针对 0731 正式版本的独立智能评分。
新增语境:路透社同时披露 DeepSeek 正在筹备潜在 IPO,并确认更强大的 V4 Pro 版本正在开发中——V4 Pro 的具体发布日期尚未公布。
待观察
- Artificial Analysis 的 Intelligence Index 综合了九项基准,各子项得分分布尚未公开,V4 Flash 在编码(此前 Terminal-Bench 82.7 分)与知识可靠性之间的权衡情况不明
- 「每任务成本」指标高度依赖模型输出长度,V4 Flash 被标注为「非常冗长」(210M output tokens 完成全部评测),这一特性可能在实际部署中抵消部分 token 单价优势
- V4 Pro 的发布时间与定价策略将成为决定 DeepSeek 能否在智商维度向上突破的关键变量