AREX Feed Article
DeepSeek-V4-Pro-0813 静默发布:总榜 53 分追平 GLM-5.2,网络安全突出、终端任务偏弱
中国 AI 初创公司 DeepSeek 静默更新了它的旗舰模型。8 月 12 日(周三),公司官网贴出一份简短公告,称新版模型具备 "significantly enhanced agent capabilities"(显著增强的 agent 能力);到周四下午,这则公告已被撤下。 8 月 13 日报道,这款对 4 月预览版的静默更新(stealth update)就是 DeepSeek-V4-Pro-0813。
第一批第三方评测随即公布。Artificial Analysis 的 Intelligence Index 给 0813 版打 53 分:与智谱 AI 6 月发布的 GLM-5.2 持平,落后 OpenAI GPT-5.6 系列中端型号 Terra 4 分,落后 Moonshot AI 的 Kimi K3 7 分。 的 Vals Index 上它得 66.25%,排第 12。细分项两头极端:Aikido Security 的网络安全基准上它找漏洞数量第一,沙箱终端与 Excel 金融建模则掉到榜单下半区。
53 分:追平 GLM-5.2,只比自家 Flash 高 1 分
记录:DeepSeek V4 Pro 0813(Reasoning, Max Effort)8 月发布,开源权重,总参数 1.6 万亿、每 token 活跃参数 490 亿,上下文窗口 100 万 token,MIT 协议。Intelligence Index v4.1.1 汇总 9 项评测(GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR), 是 Claude Opus 5 的 63 分。
53 分的参照系:智谱 GLM-5.2(max)同为 53,GPT-5.6 Terra(max)为 57。AA 官方账号 8 月 13 日的给出同一口径,写明 Gemini 3.7 Flash 中档推理得 53,"与 DeepSeek V4 Pro 0813(max)和 GLM-5.2(max)持平"。
同一条推文还标出 DeepSeek V4 Flash 0731(max)为 52 分。旗舰只比 7 月底发布的小模型 Flash 高 1 分。价格差却很大:AA 页面记录 0813 版 API 定价为输入每百万 token 1.32 美元、输出 3.96 美元,并标注在该站同类开源模型里偏贵;4 月预览版上线时 是 0.43 和 0.87 美元,新价格约为预览期的 3 倍以上。AA 同时测到 83.2 token/s 的输出速度(中位数 66),每次 Intelligence Index 任务成本 0.25 美元;评测期间它产出 1.3 亿个输出 token,AA 评语是 "somewhat verbose"。
总榜第 12 名,SWE-bench 却排到第 2
Vals AI 在首页公布完整结果:Vals Index 66.25%、第 12 名,比 4 月预览版 V4 的 55.62% 高出 10.63 分;仍落后上一代 GPT-5.5 的 67.95%,也大幅落后 Kimi K3 的 74.70% 和 Claude Opus 5 的 74.82%。
Vals AI 列出的强项很具体。SWE-bench Verified 得 96.40%,82 个模型里第 2,是榜上最高的开源权重模型,超过 Kimi K3 的 93.40%;比 Claude Opus 5 的 97.00% 低 0.6 个百分点,每次测试成本却只有 0.02 美元,对 Opus 5 的 1.29 美元。推理与法律评测同样跳升:ProofBench 从 10.00% 到 49.00%(第 45 升至第 15),Legal Research Bench 从 23.08% 到 40.87%(第 27 升至第 11),Harvey's Legal Agent Benchmark 得 7.50%、criteria pass rate 88.06%,43 个模型里排第 10。Vals AI 说明评测在 max 推理强度下进行,模型不接受 temperature 参数,支持最多 384k 输出 token 与工具调用。
两个垫底项:沙箱终端和 Excel 金融建模
Vals AI 的原文是 "It struggles on terminal-driven coding and Excel tasks"。Terminal-Bench 2.1 三轮完整评测平均 54.68%,52 个模型里排第 33,其中 hard 任务只有 28.89%;Excel Modeling Benchmark(EMB)得 52.80%,37 个模型里排第 24。
EMB 测的不是普通表格。按 Vals AI 的说明,它考察 agent 能否搭出投行与私募实际使用的复杂 Excel 金融模型(LBO、DCF、M&A 等),再用专家撰写的标准模型逐项对照打分。在沙箱终端里做多步运维式编码、在电子表格里搭财务模型,恰好是官方公告宣称"显著增强"的 agent 能力最直接的两种测试场景。
唯一亮眼的是网络安全
Aikido Security 的 AI Pentest Lead Philippe Dourassov 8 月 13 日在 公布自家基准结果:DeepSeek V4 Pro 0813 "outperformed EVERY (!) other model at finding vulnerabilities",pass@3 设置下重新发现了基准中 87.5% 的 CVE,明显高于 Claude Opus 5 和 Qwen 3.8 的 81.3%。
代价写在同一条推文里:模型报告的漏洞只有 65.6% 有效,远低于 GPT-5.6-Sol 的 86.4%;单次运行平均找出 58.3%,合并多次运行结果后才最强。安全研究者 Joshua Saxe(Abundant Security 联合创始人,前 Meta AI 与网络安全方向):这只是单个评测,结果 "a bit noisy",但它说明开源与闭源前沿模型在攻击性网络能力上已经处于同一量级。
开发者不满的,除了分数还有价格
SCMP 概括的首轮反馈是:一些开发者对整体能力感到不满足,对定价失望。HN 题为 "DeepSeek V4 Pro 0813" 的 一天内积了 1000 多分、440 条评论,其中一条回复来自 simjnd:V4 Flash 0731 以小模型和低价格带来巨大能力跃升,这版 Pro 相比之下令人失望,他短期内不打算从 Flash 升级到 Pro。
这条回复落在一个具体数字上:AA 的榜单里,新旗舰只比 Flash 高 1 分。SCMP 给出的背景是,V4 Flash 上月刚以极致成本效率震动硅谷。对 0813 版来说,最难赢下的对手可能不是 Kimi K3,而是自己那个便宜得多的小模型。