AREX Feed Article
ARC Prize 独立验证 DeepSeek V4 Pro:ARC-AGI-1 最高 90.5%、ARC-AGI-2 61.3%
ARC Prize 于 UTC 2026 年 8 月 21 日 20:41(北京时间 8 月 22 日凌晨 4:41)通过官方 X 账号公布了对 DeepSeek V4 Pro 0813 的 ARC-AGI 独立验证结果。
ARC-AGI-1 最高 90.5%(每任务 $0.18),ARC-AGI-2 为 61.3%(每任务 $0.60)。称各推理档分数相近,最高分与 DeepSeek V4 Flash 相当,并附上链接。
被测模型 DeepSeek V4 Pro 0813 于 2026 年 8 月 13 日发布,提供 Max、High、Low、None 四档推理设置。ARC-AGI-3 的成绩尚未公布,官方称将在未来数周内滚动发布。
最高分出自 Low 档,None 档只剩 13.0%
结果页的验证分数表按四个推理档分别列出,题集标注为 Semi-Private(半私有)。ARC-AGI-1:Max 档 90.0%($0.30/任务)、High 档 87.2%、Low 档 90.5%、None 档 13.0%。
ARC-AGI-2:Max 档 61.3%($0.60/任务)、High 档 59.7%、Low 档 56.3%、None 档 0.8%。
两个基准的最高分来自不同档位:ARC-AGI-1 是 Low 档的 90.5%,ARC-AGI-2 是 Max 档的 61.3%,推文引用的正是这两组数字。
ARC-AGI-1 上 Low/High/Max 三档的差距只有 3.3 个百分点,ARC-AGI-2 上为 5 个百分点。关掉推理的 None 档则直接掉到 13.0% 和 0.8%。
官方解释:High 档比 Max 多用了推理 token
分数不随档位单调上升,成本曲线同样参差。ARC-AGI-1 上 High 档的记录成本约 $0.31/任务,高于 Max 档的约 $0.30,而 Low 档只要 $0.18。
ARC-AGI-2 上 High 与 Max 的记录成本几乎相同(均约 $0.60)。
ARC Prize 在中给出两个原因:和 V4 Flash 一样,V4 Pro 在 High 档比 Max 档使用了更多推理 token,ARC-AGI-1 上多 1%、ARC-AGI-2 上多 4%。
另外,重复超时(timeout)把各档的记录成本不均匀地拉低,造成了锯齿状的成本趋势。
按官方口径,High 档更高的 token 消耗解释了它拿到接近 Max 档的分数;成本数字的锯齿则被归因于超时造成的记录不均。
120 道 ARC-AGI-2 公开题里,只有 1 道四档全过
结果页还逐题列出通过/失败明细,这些题属于公开题集(Public Eval)。
ARC-AGI-2 的 120 道公开题中,Max 档通过 64 道、High 档 71 道、Low 档 65 道,None 档只有 1 道(任务 981571dc)。它也是唯一一道四个档全部通过的题;37 道题四个档全部失败。
ARC-AGI-1 的 400 道公开题中,83 道四档全过、7 道四档全败,None 档通过 84 道。
页面单独挑出两道代表题:ARC-AGI-1 的 16b78196 与 ARC-AGI-2 的 13e47133,标注均为“没有任何推理档解出这道题”。
公开题的通过率与正文的 Semi-Private 分数是两套数据,例如 ARC-AGI-2 公开题 Max 档通过率 53.3%,而 Semi-Private 分数是 61.3%。
官方在里给出了与测试政策页链接。
榜单第 45 名,与 V4 Flash 相当
按结果页内嵌的榜单数据,V4 Pro 0813 的 ARC-AGI-2 Max 档(61.3%)在已收录的 221 个系统中排第 45,ARC-AGI-1 Low 档(90.5%)在 219 个系统中排第 43。
两个 None 档中,ARC-AGI-1 的排第 195,ARC-AGI-2 的排第 191。注明,榜单只显示运行成本低于 $10,000 的系统。
官方称最高分与 DeepSeek V4 Flash 相当,后者以 DeepSeek V4 Flash 0731 的名义列在同一结果页的 ARC-AGI-2 排行榜上。
同页还有 Claude Opus 5、GPT-5.6 Luna/Sol/Terra、Gemini 3.6/3.7 Flash、Grok 4.5/4.6、Kimi K3 等模型。
结果页把 arXiv 上的 列为论文链接;该报告以预览版形式介绍 V4 系列,称 V4 Pro 是 1.6T 总参数(激活 49B)的 MoE 模型。
V4 Flash 为 284B 参数(激活 13B),两者都支持百万 token 上下文。
榜单之外,推文回复最先追问的是成本。用户 Vlady 问单任务成本是否公布,称“那个数字通常比原始分数更让我在意”(that number usually matters more to me than the raw score)。
自称前一天用自家基准套件测过 V4 Pro 的 BullBear.News 认为 $0.18/任务“够便宜”(cheap enough)。
但模型仍在第 42 个测试用例上“幻觉”出一个 fixture 路径(hallucinated a fixture path on test case 42)。
ARC-AGI-3 悬置:官方预告未来数周滚动发布
ARC-AGI-3 在结果页表格中仍是“—”,配图标注 Not evaluated。
ARC Prize 在中解释,ARC-AGI-3 的评测“操作上更耗时”(more operationally intensive),结果将在未来数周内滚动发布。
排行榜页面说明,ARC-AGI-3 与前两代不同,要求智能体在陌生的交互环境中即时适应(adapt on the fly)。
对 V4 Pro 0813 来说,这是验证成绩单上唯一悬而未决的一栏;官方给出的时间窗口是“未来数周”,具体日期未定。