AREX Feed Article
ARC Prize 公布 Gemini 3.7 Flash 验证成绩:ARC-AGI-1 95.5%、ARC-AGI-2 84.6%
8 月 20 日,ARC Prize 官方账号了 Google Gemini 3.7 Flash 的 ARC-AGI 验证成绩:ARC-AGI-2 得分 84.6%、每任务成本 0.25 美元;ARC-AGI-1 得分 95.5%、每任务成本 0.12 美元。官方称,Gemini 3.7 Flash 的亮点是"在 ARC-AGI-1 和 ARC-AGI-2 上以低成本、相对其他前沿模型取得高分"。
同一条消息流里,ARC Prize 还宣布了两件事:结果页上线了模型直接对比功能,官方给出的示例就是 Gemini 3.7 Flash 对比 Gemini 3.6 Flash;ARC-AGI-3 评测正在运行、完成后会公布结果,这一说明连同排行榜、测试政策链接发在同一条里。成绩明细与对比入口都已同步到 。
只有三家模型在 ARC-AGI-2 上超过它
按结果页的说明,这两个分数来自高推理强度(high effort)配置下的 Semi-Private 题集。同一模型还有两档更低的推理强度:在 ARC-AGI-1 上,Medium 为 91.2%、Low 为 85.2%;在 ARC-AGI-2 上,Medium 为 63.7%、Low 为 52.9%。评测涉及的公开题集规模是 ARC-AGI-1 400 题、ARC-AGI-2 120 题。
把 84.6% 放进 ARC Prize 的看,ARC-AGI-2 得分更高的只剩三家:Claude Opus 5(90.4%)、GPT-5.6(92.5%)、Claude Fable 5(89.2%)。其余在榜模型被甩开一截:xAI Grok 4.6 为 67.1%,DeepSeek V4 Pro 0813 为 61.3%,Gemini 3.6 Flash 与 Kimi K3 均为 60.4%。ARC-AGI-1 一侧,95.5% 高于自家前代 3.6 Flash(91.2%)和 Kimi K3(94.5%),低于 Claude Fable 5(98.5%)、Claude Opus 5 与 GPT-5.6(97.5%)。
ARC Prize 的本身就把成本当作坐标系的一轴:横轴是每任务成本,纵轴是分数。榜单页的解释是,"真正的智能不只是解决问题,还要用最少资源高效解决"。
"Verified" 是怎么测出来的
"Verified" 不是厂商自报分数,而是 ARC Prize 基金会的评测流程。据其公开的,该基金会是 2024 年 4 月由 François Chollet 与 Mike Knoop 联合创办、由 Greg Kamradt 任主席的非营利组织。评测用开源的 ARC-AGI Benchmarking 仓库运行,ARC Prize 为每个新模型建立配置(模型名、推理强度、token 上限),测试结果——模型输出、评测耗时、成本、逐题得分——全部发布到 HuggingFace。
保密题集是这套流程的核心:政策文件写明,"ARC-AGI 的核心设计原则是考生不能提前知道考题",数据集分为公开与私有两档。测试方法论由一个独立学术小组审查,成员包括 NYU 心理学与数据科学教授 Todd Gureckis、Santa Fe Institute 教授 Melanie Mitchell、Columbia 计算与 AI 副院长 Vishal Misra。
发布一周,验证成绩就贴了出来
Gemini 3.7 Flash 于 8 月 13 日发布。Google 称它是"迄今最智能的 workhorse 模型",面向编码与 agent 工作流,距离 Gemini 3.6 Flash 发布只有三周。ARC Prize 在其后一周给出了验证成绩。该模型的介绍价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,Google 明确写的是 3.6 Flash 首发价的一半;这一价格 2026 年 12 月 31 日到期,2027 年 1 月 1 日起涨到每百万 1.50 美元 / 7.50 美元。
ARC Prize 强调的"低成本",对应的就是结果页上每任务 0.12 美元与 0.25 美元的数字。评论区随即有人追问口径:用户 d(@dx0oz)在推文下,0.25 美元/任务用的是不是明年生效前的折扣价——临时折扣会激励"花钱买位置","先把价格降到十分之一挤进前沿,两个月后再涨十倍"。
结果页能直接对比模型了,ARC-AGI-3 还在跑
新上线的对比功能让两个模型在结果页直接并排比较,官方示例是 Gemini 3.7 Flash 对 Gemini 3.6 Flash,后者 7 月 21 日录入的验证成绩为 ARC-AGI-1 91.2%、ARC-AGI-2 60.4%。ARC Prize 在里配了一段操作演示视频。
ARC-AGI-3 是新一代基准:按榜单页的说法,前两代测的是"被动流体智能",第三代要求 AI agent 在全新交互环境中即时适应。现有 ARC-AGI-3 最高分是 Claude Opus 5 的 30.16%,GPT-5.6 为 7.78%,Grok 4.6 为 2.11%。ARC Prize 8 月 20 日表示,ARC-AGI-3 评测正在运行、完成后公布结果;8 月 21 日又在另一条里补充说,ARC-AGI-3 评测"操作量更大,结果将在接下来几周内陆续放出"。
评论区的头条是 0.25 美元,不是 84.6%
围绕这条消息的讨论,火力集中在成本上。账号资料自称 founder、CTO 且为前微软员工的 Bally_AgenticAI(@bally_kehal):"84.6% on ARC-AGI-2 at $0.25/task 才是真正的头条:前沿推理从旗舰采购变成了预算条目。"自称在 Google 做 Gemini 与 TPU、此前在 Meta MTIA 和 AWS Trainium 工作过的 Patrick C Toulme(@PatrickToulme)称"TPU 又快又便宜",并"我们还有世界上最好的编译器 XLA,才能做出这种 serving"。
质疑同样不少。自称用 coding agent 开发的 cmore(@ccccccmore):"Flash 模型登顶 AGI 基准,恰恰说明这个基准已经变成价格表,而不是智力测试。"自称独立 IT 咨询专家的用户 @luyun0120 用中文说,这是"用低价换市场占有率的阳谋,靠 Flash 系列走量,把开发者圈进自家生态",并提醒"这测的是模式识别,离真正的通用智能还差着十万八千里"。
两个数字都还没落地:ARC Prize 承诺几周内陆续放出的 ARC-AGI-3 结果,和 12 月 31 日到期的 Google 介绍价。0.25 美元/任务这个成本口径会不会随新价格表重算,现有公开信息无法判断。