AREX Feed Article
DeepSeek V4 Pro 跑出 80.6%,MIT 开源、输入价仅为 Fable 5 的 1/23
8 月 9 日,AI 数据账号 贴出一组数字:DeepSeek V4 Pro 在 SWE-bench Verified 上拿到 80.6%,输入定价每百万 token $0.435;Anthropic 的 Claude Fable 5 在 SWE-bench Pro 上拿到 80.3%( 榜单确认),输入定价每百万 token $10。
同一个质量区间,价格相差 23 倍。V4 Pro 的模型权重以 MIT 协议开源,任何组织都可以自行部署,无需向 DeepSeek 付 API 费用。
8 月 7 日更新的 SWE-bench Verified 榜单提供了更完整的参照:Fable 5 在同一套 Verified 测试中实际跑到 95%,但不同测试脚手架和推理设置会带来显著的分数差异;V4 Pro 的 80.6% 来自 DeepSeek 今年 4 月技术报告的自报分数,与同期 Claude Opus 4.6 的 80.8% 仅差 0.2 个百分点。
严格来说,StatsWire 把两个不同测试集的分数放在一起比较并不严谨。SWE-bench Verified 的题库在 2024 年已经公开,OpenAI 于 2026 年 2 月以"题目污染"为由撤回了 Verified 分数;SWE-bench Pro 使用持续更新的仓库,不存在公开答案泄露。
但定价层面的算术没有争议:Fable 5 的 API 输入价 $10/M,V4 Pro 的 $0.435/M,23 倍建立在各自官网公开的价目表上。
「不能说是完全编的吧」
DeepSeek Harness 团队负责人崔天一在社交平台对一份流传的投资文件给出了耐人寻味的回应。据 8 月 7 日报道,这份 8 月初泄露的融资材料声称 V4 Pro 的编程能力"仅比 Claude 旗舰模型低 0.3%",并附带了 Terminal-Bench 2.1、DeepSWE 和 SWE-bench Pro 的预测分数。
崔天一调侃道:"不能说是完全编的吧?"暗示材料中的技术数据并非凭空捏造,但营销口径经过了明显包装。所谓"0.3%"很可能是将 V4 Preview 在单一 benchmark 上与 Claude Opus 4.6 的 0.25% 差距四舍五入后,包装成了"整体编程能力仅差 0.3%"。
独立开发者的真实账单比投资文件更有说服力。AI 创业者 在 7 月 31 日公开了当月 API 用量审计:9.28 亿 token,97.5% 为缓存命中。"在 Claude Opus 上这笔账单是 $6,200,在 V4 Flash 上只要 $64。"
另一位开发者 在 7 月 26 日的长帖中写得更为直接:"开源不是在赢因为它道德上更好,它在赢因为真正出货的开发者付不起被锁在闭源 API 里的代价。"
四个月,从 Preview 到搅动定价的变量
4 月 23 日,DeepSeek 以 Preview 名义同时放出 V4-Pro(1.6 万亿参数、490 亿活跃)和 V4-Flash(2840 亿参数、130 亿活跃),均以 MIT 协议开源,默认支持 100 万 token 上下文窗口。 在发布当天指出,V4-Pro 由此成为"有史以来最大的开源权重语言模型"。独立评测机构 Artificial Analysis 将 V4-Pro 列为所有开源模型中经济价值工作能力的第一名。
6 月,Anthropic 发布 Claude Fable 5,被 评为综合质量指数 100/100,在 SWE-bench Verified 和 Pro 两个榜单上均位列前三。同月,DeepSeek 完成了首轮约 5000 亿元人民币的外部融资,估值超 3.5 万亿元。
7 月 31 日,DeepSeek 更新了 V4 Flash 的后训练版本。据 报道,Terminal-Bench 2.1 从 61.8 跳升到 82.7,DeepSWE 从 7.3 跃至 54.4,价格不变。
紧接着,涉及 DeepSeek 第二轮融资的投资文件泄露( 整理了其中的 benchmark 对比表),将 V4 Pro 包装为"编程能力仅比 Claude 旗舰低 0.3%",成为 StatsWire 定价对比的直接引爆点。
稀疏注意力与混合精度:降价不是烧钱
V4 Pro 的低价有其工程基础。在 DeepSeek 公布的技术数据中,100 万 token 上下文下,V4 Pro 的单 token 推理 FLOPs 仅为前代 V3.2 的 27%,KV 缓存内存仅为 10%。四组架构选择支撑了这些效率增益。
混合稀疏注意力(CSA + HCA)替代了标准全注意力机制,长上下文不再对每对 token 做全精度比对,DeepSeek 将其命名为"DeepSeek Sparse Attention"。流形约束超连接(mHC)修改了 Transformer 残差连接,在万亿参数规模上保持信号传播稳定。
训练端采用了 Moonshot AI Kimi 系列率先推广的 Muon 优化器,加速收敛。推理端将 MoE 专家参数存为 FP4 精度、其余存为 FP8,把 V4 Pro 的磁盘占用控制在约 865 GB。不做混合精度,同等参数量的模型轻松突破 TB 级。
benchmark 数据反映了这组架构的擅长领域与盲区。V4-Pro-Max 在 LiveCodeBench 上拿到 93.5,Codeforces 评分 3206,均领先于 GPT-5.4 和 Claude Opus 4.6。SWE-bench Verified 80.6% 与同期 Opus 4.6 的 80.8% 打平。
短板在知识检索和跨领域推理:GPQA Diamond 90.1 低于 Gemini 3.1 Pro 的 94.3,SimpleQA-Verified 57.9 落后于 Gemini 的 75.6。DeepSeek 自己在技术报告中坦承,V4"较 GPT-5.4 和 Gemini 3.1-Pro 略有不及,发展轨迹落后前沿模型约 3 到 6 个月"。
$10/M 的定价逻辑,撞上了 MIT 协议
在 V4 Pro 之前,前沿编程模型维持着分层定价:Fable 5 输入 $10/M、输出 $50/M;Claude Opus 5 输入 $5/M、输出 $25/M;GPT-5.5 输入 $5/M、输出 $30/M。编程能力越强,token 单价越高。
V4 Pro 的 $0.435 输入 / $0.87 输出打破了这个等式。它不是靠牺牲编程质量来换低价——SWE-bench Verified 80.6%、LiveCodeBench 93.5、Codeforces 3206,全部处于或超过 Claude Opus 4.6 的水平线。
ModemGuides 在 4 月发布当天的定价分析中算出,V4 Pro 输出 token 价约为 Claude Opus 4.7 的七分之一、GPT-5.5 的九分之一。8 月,StatsWire 的对比聚焦输入价:V4 Pro 的 $0.435 对 Fable 5 的 $10,差距 23 倍。
比价格更让闭源厂商难受的是 MIT 协议。V4 Pro 的权重可以下载、修改、商用、在自有 GPU 集群上跑。对于有数据合规要求的金融和医疗客户,自部署意味着代码和 prompt 不必出境。对于高吞吐量的 SaaS 公司,自建推理让 API 账单直接消失,只剩硬件折旧和电费。
过去六周内,三款前沿级开源模型密集发布:Z.ai 的 、Moonshot AI 的 Kimi K3、以及 DeepSeek V4 系列。全部在编程和智能体 benchmark 上逼近闭源旗舰,全部 MIT 或近似 MIT 协议,全部比闭源竞品便宜一个数量级以上。
独立研究者 Simon Willison 在 V4 发布当天评价:"几乎就是前沿水准,价格只是一个零头。"Swfte 8 月榜单上的价值指数更为直观:Fable 5 的综合价值评分 3.3,V4 Pro 是 137.9,差距 41 倍。这不是一次促销,是架构效率和开源协议共同制造的定价压力。
「贵即好」的推销术,还能撑多久
StatsWire 在原帖结尾写道:"编程模型的'溢价即品质'推销术,这个月死了。"这句话或许高估了叙事终结的速度——Fable 5 在 SWE-bench Verified 上的 95% 仍然领先 V4 Pro 近 15 个百分点。但 23 倍的价差和 MIT 协议的同时出现,把闭源编程模型的定价逻辑逼到了一个需要重新自证的位置。当开源模型在同一套 benchmark 上只差 0.2 个百分点、价格却只有你的 1/23 时,"品质溢价"就不再是一句营销术语——它是一个需要逐条举证的成本项。