AREX Feed Article
Artificial Analysis 评测 DeepSeek V4 Pro 0813:提价 264%,单任务成本升 5 倍
8 月 15 日,独立评测机构 Artificial Analysis 发布对 DeepSeek V4 Pro 0813 的:模型在 AA Intelligence Index 上得 53 分,比 4 月版 V4 Pro 高 8 分,只比 V4 Flash 0731 高 1 分。
比分数更直接的是账单。公告给出完整定价结构:官方 API 输入/输出每百万 token 1.32/3.96 美元,综合价上涨 264%,缓存命中价涨 12 倍,错峰时段打 5 折,8 月 16 日生效。
按新价格,每跑一次 Intelligence Index 任务的成本是 0.25 美元,为 4 月版 V4 Pro 的 5 倍。模型勉强留在 AA 的「智能 vs 成本」帕累托前沿上,只比同在一条线上的 Gemini 3.7 Flash(medium)便宜 1 美分。
V4 Pro 0813 发布后,此前的评测报道已记录其 53 分追平 GLM-5.2 等初步结果;AA 这份公告把焦点从分数转向了价格。
涨的 8 分,几乎全在智能体能力
这 8 分的来源并不均匀。AA 写道,相对 4 月版 V4 Pro,V4 Pro 0813 的大部分提升来自 agentic 能力。
最能说明这一点的是 GDPval-AA v2,一项衡量真实世界智能体知识工作的评测:Elo 从 1306 涨到 1590,+284 分,按 AA 的换算,意味着它对 4 月版有约 84% 的期望胜率。
这个成绩高于 Claude Opus 4.7、GPT-5.5 等上一代闭源模型,但仍落后 Kimi K3。模型在 GDPval 任务上也干得更久:平均每个任务 39 轮,4 月版是 23 轮。
另一个涨分项是 AA-Omniscience,+12 分,从 -11 升到 +1,且完全由准确率驱动:准确率从 43% 升到 49%,幻觉率不降反升,从 94% 到 95%。一个对照是,V4 Pro 0813 的作答尝试率约 99%,几乎从不拒答;Kimi K3 只尝试 77% 的问题,幻觉率 53%。
架构没有变化:1.6T 总参数、49B 激活参数、1M token 上下文窗口。
新定价 8 月 16 日生效:缓存命中价涨 12 倍
公告把 8 月 16 日定为新旧价格的分界线。从那一天起,DeepSeek 官方 API 对 V4 Pro 0813 收取每百万 token 1.32 美元(输入)和 3.96 美元(输出),综合价上涨 264%(约 3.6 倍)。在此之前,模型仍按 4 月版 V4 Pro 的价格计费。
涨幅最大的不是常规输入输出,而是缓存命中。命中缓存的输入此前享受约 99% 折扣,现在降到约 97%,折后每百万 token 0.044 美元,是此前缓存命中价的 12 倍。错峰时段价格打 5 折。
模型权重以 MIT 许可发布,首发即通过 DeepSeek 官方 API 提供。
每次任务 0.25 美元,勉强留在帕累托前沿
价格涨了,token 效率也涨了,只是两者方向相反。跑完一遍 Intelligence Index,V4 Pro 0813 共产生 128M 输出 token,比 4 月版少约 30%,也比 Kimi K3(133M)和 GLM-5.2(141M)更省 token,由此落在「智能 vs 输出 token」的开源模型帕累托前沿上。
但每次任务的账单还是贵了一截。按新价格,每次 Intelligence Index 任务成本 0.25 美元,是 4 月版 V4 Pro(0.05 美元)的 5 倍,比 GLM-5.2(0.32 美元)低约 20%。
显示,完整跑一遍这套评测总共花了 604.51 美元,在 106 个同类模型里智能排名第 3。
模型仍落在「智能 vs 单任务成本」的帕累托前沿上,但 AA 用的词是「勉强」(barely):它只比同在一条线上的 Gemini 3.7 Flash(medium)便宜 1 美分。作为对照,GPT-5.6 Sol 得 61 分,只用了 70M token。
AA 在里用这张柱状图强调同一个结论:单任务成本从 0.05 美元升到 0.25 美元,token 效率的改善没能抵消涨价。
只比 Flash 0731 高 1 分,落后 Kimi K3 7 分
旗舰与轻量型号的差距是公告里另一个扎眼的数字。V4 Pro 0813 只比 V4 Flash 0731 高 1 分,激活参数却是后者的约 3.8 倍。两者在 Terminal-Bench 2.1 上同为 79%,在 agentic 和 coding 类基准上,小模型的表现与旗舰基本持平。
在开源权重阵营,V4 Pro 0813 是 AA 测过的第二聪明的模型,但距离开源第一名 Kimi K3 仍有 7 分。AA 还预告了一个变量:Qwen3.8 2.4T A95B 的权重近日已经发布,即将登上 Intelligence Index,届时排名可能再变。
(图:Artificial Analysis 评测公告配图)
评论区追问:AA 测的是哪个版本?
评论区还有一条更基本的质疑:AA 测的到底是不是最终版本。多位用户声称 DeepSeek 曾在发布后重新上传模型文件,认为评测结果「在几十个基准上与 Flash 相同」恰好说明当时测的是有问题的版本。
用户 写道:「The fact that it produced the same results as 'flash' across dozens of benchmarks clearly indicates that the model was incorrect at the time.」中文用户 直接问:「你是第一时间测的,还是在13号重新发布之后测的?」 则表示:「In actual use, the Pro is far superior to the Flash, definitely by more than one point.」
对价格的批评同样直白。 反问:「3.6x more expensive and only 1 point better than the cheap version. Someone explain who this is actually for.」 写道:「30% fewer tokens, 3.6× the price — turns out inference efficiency and pricing efficiency are two very different benchmarks.」
截至本文写作,该公告已获约 750 个赞、约 6.2 万次浏览。在帖下可见的回复里,AA 没有回应版本质疑,只追加了上述配着成本柱状图的补充帖。无论版本争议如何收场,8 月 16 日新价格都会生效;按旧价调用 V4 Pro 0813,只剩 8 月 15 日当天。