AREX Feed Article
DeepSeek V4 Flash 两天两验:ARC 超 Kimi K3,Terminal-Bench 压 Grok 4.5
8 月 7 日,ARC Prize 官方验证了 DeepSeek V4 Flash 0731 在 ARC-AGI-2 半私有集上的成绩:61.4%,每题 $0.04。两天后,8 月 9 日,Antigma Labs 用开源 Ante harness 独立复现了 DeepSeek 自报的 Terminal-Bench 2.1 得分——82.7%,与 DeepSeek 自己的数字完全一致。
两项独立验证在 48 小时内先后落地,指向同一个结论:这个 2840 亿总参数、仅 130 亿激活参数的 MoE 效率模型,在专门设计来抵抗训练的推理基准上以约 1/40 的成本略胜 Kimi K3 的 60.4%,在 agentic coding 基准上则以 82.7% 压过 Grok 4.5 的 80.9%。一个模型的自报分数和第三方验证之间的信任缺口,本周被合上了。
ARC Prize 下场:61.4%,$0.04,Kimi K3 被一寸一寸追上
8 月 7 日,ARC Prize 在官方 X 账号公布了 DeepSeek V4 Flash 0731 的验证结果:。ARC Prize 称该模型"在成本-性能帕累托前沿设立了新标准"。
显示了三个推理强度的完整数据:Max 档 89.0%(ARC-AGI-1)/ 61.4%(ARC-AGI-2),High 档 87.0% / 56.0%,Low 档 84.0% / 46.0%。从 Low 到 Max,ARC-AGI-1 只涨了 5 个百分点,ARC-AGI-2 却涨了约 15 个百分点。ARC-AGI-2 是专门为抵抗训练设计的更难题库,题目更难、采用对抗性设计和私有划分,推理计算投入带来的大幅提升恰恰是这套基准希望看到的行为。
放在 上看:Kimi K3(7 月 16 日验证)在 ARC-AGI-1 上仍以 94.5% 领先,但 ARC-AGI-2 上 DeepSeek V4 Flash 0731 的 61.4% 已经略高于 Kimi K3 的 60.4%。指出,Kimi K3 的每题成本约为 $1.59,DeepSeek V4 Flash 0731 则是 $0.04——约为前者的 1/40。GPT-5.6 Luna 同期在 ARC-AGI-2 上拿到 59.6%,成本为 $0.67/题。
两天后 Antigma 复现了 82.7 分,DeepSeek 的自报不再是一家之言
DeepSeek 在 7 月 31 日发布 V4 Flash 0731 时,上列出的 Terminal-Bench 2.1 得分是 82.7——但该数字仅来自 DeepSeek Harness,即 DeepSeek 自有的、未开源的评测框架,任何第三方都无法重跑。这个缺口直到 8 月 9 日才被补上。
显示,在相同的 89 题、每题 5 次试验、严格超时限制的参数下,DeepSeek V4 Flash 0731(max 推理强度)跑出了 82.7% ±1.79 SE,445 次试验中通过 368 次,总成本 $68.41。这恰好是 DeepSeek 自报的数字。Ante 是一个开源终端 agent harness,每次运行的原始 Harbor 链接对外公开、可被审计。
同一 harness 下,Grok 4.5 得分为 80.9% ±1.27 SE,总成本 $242.57。两者均插入官方 Terminal-Bench 2.1 已验证榜的第二名(Codex + GPT-5.5,83.2%)和第三名(Terminus 2 + Fable 5,80.5%)之间。需要注意两点限制:Grok 4.5 有 20 条轨迹因 reward hacking 被排除(Ante PR #129),Grok 侧的对比已经过过滤;Ante 是独立 harness 供应商而非学术实验室。
0731 这个 build 本身也很关键。Ante 此前对 7 月 5 日的 pre-0731 checkpoint 跑出的是 66.4%,Artificial Analysis 在 7 月末的快照测得 61.8%。跳到 82.7% 是 7 月 31 日 post-training 版本独有的提升——这与 DeepSeek 自己把 agentic coding 标为本次升级重点的说法一致。
284B 参数、13B 激活:这两个数字才是整件事的题眼
整理了 DeepSeek V4 Flash 0731 的架构参数:2840 亿总参数、130 亿激活参数的 MoE 架构,使用 Muon 优化器和 V4 系列的 CSA/HCA 混合注意力机制,训练数据超过 32 万亿 token。作为对比,Kimi K3 是一个 2.8 万亿参数、1040 亿激活的 MoE——DeepSeek V4 Flash 的总参数约为其 1/10,激活参数约为其 1/8。
DeepSeek 官方的 API 定价为输入 $0.14/百万 token、输出 $0.28/百万 token。即便 DeepSeek 在 8 月 6 日预告了整体涨价,当前 $0.02–$0.04 的每题成本仍然成立。相比之下,Grok 4.5 的 API 定价约为 $2/$6 每百万 token——Ante 跑完全部 445 次 V4 Flash 试验花了 $68.41,而 Grok 4.5 的同类测试花了 $242.57。
OrcaRouter 引述了一个参照点:2025 年 ARC Prize 竞赛冠军在 ARC-AGI-2 私有评估上只拿到 15.42%,每题 $0.20。从 15% 到 61%,从 $0.20 到 $0.04——两年间效率模型在同一个抗训练基准上的推进幅度,用这两个数字就能说清。
"等于 Kimi K3"的范围只到 ARC-AGI-2 为止
""是计算与算力分析师 teortaxesTex 在 ARC Prize 推文下的评论。他写道:"这是第一次见到一个确认了规模与预训练成本的模型跑到这个水平。它等于 Kimi K3。Whale(指 DeepSeek)的 research program 是中国第一。他们也有 ARC-shaped 环境。"
但这个等号不能划到 ARC-AGI-2 之外。Kimi K3 是原生多模态通用旗舰模型,在长程软件工程和开放式推理上更强,API 定价为 $3/$15 每百万 token。DeepSeek V4 Flash 0731 是纯文本模型,专为吞吐量设计。在大多数非 ARC 基准上,K3 仍然领先。更诚实的表述是:在专门设计来抵抗训练的测试上,便宜的效率模型现在和旗舰模型每分必争,而在成本上彻底碾压。
至于 teortaxesTex 提到的"ARC-shaped 环境"——即 DeepSeek 可能在训练中大规模生成网格谜题并做强化学习,让模型事先见过任务族——这是一种分析师推测,不是 DeepSeek 的公开声明,也未被本次验证证实或证伪。ARC Prize 页面确认的是半私有评估集上的分数是真实的;这些分数反映的是泛化能力还是任务族熟悉度,正是 benchmark 社区当前争论的焦点。
分析师连追两天推文,社区开始用性价比重新标定效率模型
teortaxesTex 在 8 月 7 日发出第一条评论后,:"Ante harness 把 V4-Flash 放到了 Grok-4.5 之上。0731 在 TerminalBench 2.1 上拿到 82.7,恰好是 DeepSeek 为 DeepSeek Harness 引用的数字。"他同时指出不同评测方给出的分数差异——Artificial Analysis 测出 79%,Vals 测出 67%——但强调 Vals 的测试中 V4 Flash 成本仅为同分段 Grok 的约 1/28。
ARC Prize 的验证推文获得超过 50 万次查看、1800 余次喜欢和 147 次转发。OrcaRouter 在分析中提醒,社区反馈显示该模型在实际部署中仍存在 tool-loop 和长上下文卡顿——ARC-AGI 衡量的是对新异视觉推理谜题的适应能力,不能直接等同于生产环境中的 agent 可靠性。
中已经用同一 DeepSeek V4 Flash 模型 slug 测试了五种 agent harness,结论是:固定模型不变,仅换 harness 就能改变通过率、成本、速度和内存占用。这一发现让 8 月 9 日的 Terminal-Bench 复现更有分量——它不是"换个架子分数就变了",而是在公开、一致、可审计的 harness 上跑出了与厂商自报一致的分数。
验证关过了,但"怎么做到的"可能才是更难的问题
两项独立验证填补了信任缺口,却没有回答一个更深的问题:一个 284B 总参数、13B 激活的模型,如何在训练数据以外拿到这个分数?DeepSeek 至今未公开其 ARC 训练管线,用于 ARC 评测的 harness 也未开源——OrcaRouter 在文中特意指出,ic.work 的分析仍然成立:DeepSeek 7 月 31 日的发布说明从未提及 ARC-AGI,arXiv 技术报告(2606.19348)也未被独立确认为这些分数的来源。ARC Prize 的验证证明分数是真的,但 harness 不透明是一个独立的、尚未解决的限制。
相比之下,Terminal-Bench 一侧已无此顾虑:Ante 的开源 harness、公开 Harbor 链接和完整的试验记录,让 82.7% 这个数字具备了第三方可复现性。ARC-AGI 的验证来自最权威的独立来源,但复现链条仍然不完整——这是两个基准之间此刻最关键的差异。