AREX Feed Article
OpenAI 总裁称 ARC-AGI-3 已饱和,另一评测口径仅 62.7%
美东时间 9 月 3 日 17 时 46 分(北京时间 9 月 4 日 5 时 46 分),OpenAI 总裁兼联合创始人 Greg Brockman 在 X 账号 @gdb 上发出一条只有四个单词的推文:「arc-agi-3 is now saturated」(ARC-AGI-3 现在已经饱和)。他的账号简介为「OpenAI 总裁兼联合创始人」,带蓝标认证。这条推文没有附上任何分数、榜单截图或评测说明,没有点名是哪个模型、哪次结果触到了上限,也没有解释「饱和」的确切口径。
这句断言出自同一场发布:约两小时前,OpenAI 官宣新一代模型 GPT-6 Astra,公告称「Astra 同样以 99.9% 的分数使 ARC-AGI-3 饱和(saturates)」。
「saturates」原本是 OpenAI 公告的措辞
美东时间 9 月 3 日 15 时 32 分,OpenAI 官方账号宣布 GPT-6 Astra 当天开始向有限数量的组织推送,未来数日将开放给全部 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 API 和 AWS。12 分钟后,Brockman 转发公告博客并写道「Introducing GPT-6 Astra」;17 时 46 分,他发出了那句「饱和」结论。这是 Brockman 当天围绕 Astra 发布的第三条推文。
OpenAI 公告把 saturate 一词用在了不止一个基准上:除 ARC-AGI-3 外,FrontierMath Tier 4 拿到 98%,ExploitBench 拿到 100%,公告称三者均「饱和」。截至本文写作时,Brockman 那条推文已被浏览约 8 万次、获 1,259 个赞、66 次转发。
「饱和」之争的伏笔埋在更早。7 月 29 日,OpenAI 发表分析称,ARC 官方评测框架会丢弃模型的私有推理、并用滚动截断丢掉较早的上下文,导致 GPT-5.6 Sol 在 ARC-AGI-3 公开集上只拿到 13.3%;改用自家保留推理并启用压缩的 Responses API 设置后,同一模型得分 38.3%,输出词元降到原来的六分之一。OpenAI 当时建议:比较模型应采用保留推理并压缩的评测设置,因为那最贴近 ChatGPT 和 Codex 中的实际用法。
哪种 harness 的分数才算「饱和」?
在 Brockman 发推前约两小时(美东 15 时 39 分),ARC-AGI-3 的发布方、非营利组织 ARC Prize 已发布了对 Astra 的独立验证与分析,并给出两套分数:
- Standard harness(标准评测脚手架):模型只能携带自己选择保留的可见笔记,所有厂商共用同一套最小化接口。Astra(max 推理档)在 ARC-AGI-3 半私有集(Semi-Private)上得分 62.7%,总成本约 2.6 万美元。
- Provider Adapter harness(厂商适配器脚手架):在请求之间保留模型不透明的推理状态,并用压缩管理长对话,相当于让 Astra 用上 OpenAI 自家的上下文管理机制。Astra(high 档)在同一半私有集上得分 99.9%,成本约 1.9 万美元。
ARC Prize 的结论是:两套口径下 Astra 都是 ARC-AGI-3 的新 SOTA(最优成绩)。但选哪一套数字,直接决定「饱和」是否成立:两个分数相差 37.2 个百分点,99.9% 意味着基准几乎没有剩余空间,62.7% 则说明还远未触顶。
ARC Prize 的分析还提供了第三个维度——动作效率。该基准的设定是「100% 分数意味着 AI 能以和人类一样高的效率通关每个游戏」,为此发布前测试了约 500 名普通公众建立人类基线。在厂商适配器口径下,Astra(max)在 96.0% 的关卡上所用动作少于人类中位基线,平均每关少用 51.7% 的动作;分析称这是「一个有分量的里程碑」。ARC Prize 还观察到 Astra 会在游戏中途自创一套紧凑的代数式简写来建模规则与状态。
口径之争在 Brockman 推文的回复区立刻出现。用户 saietta(@vsaietta)回复道:「63% 标准 vs 99% 适配器,仅工具层就有 36 个百分点的摆动。『饱和』描述的是 harness 加模型的组合,不是 Astra 自身的能力」。
ARC Prize:承认 SOTA,不称 AGI
基准创办方对 Astra 的定性相当高,但边界画得很清楚。ARC Prize 官方推文称 Astra 在 ARC-AGI-3 上取得 SOTA,并「构建了我们见过的对陌生环境最精确的符号模型」。分析文章(作者为 ARC Prize 总裁 Greg Kamradt,发布于 9 月 3 日)写道:「我们在发布 ARC-AGI-3 时就说清楚过:饱和这个基准不构成『实现 AGI』的证据。因此,尽管我们认为 Astra 代表了通向通用化的有意义进展,我们不会声称它是 AGI。」文章同时宣布,今后 ARC-AGI-3 排行榜将同时标注两套 harness 的结果。
ARC-AGI 的创造者、ARC Prize 联合创始人 François Chollet 把话说得更直接。他当天写道,Astra 的表现说明「harness 的能力正在越来越多地转移到模型本身」,并将其称为「模型智能的一次重大突破」。在另一条推文中他回顾:3 月 ARC-AGI-3 发布时前沿模型得分不足 1%,当时有人指责「基准坏了,最大可达分数其实只有 40%」;如今他认为「从 <1% 到 100% 的 6 个月轨迹说明,这个基准捕捉到了 agentic 能力近期的跃升,而这次跃升比大多数人、包括我们预期的都要快」。
另一位联合创始人 Mike Knoop 在长推中给出了他的判断:Astra 是「迈向 AGI 的一次质的飞跃」,但「我们缺少证据把它称为 AGI」;他认为,迄今还没有任何模型展示出「开放式发明(open-ended invention)」能力,而「这将构成 ARC-AGI-4 的新基础」。
五个多月被宣告触顶,社区追问「接下来测什么」
ARC-AGI-3 于今年 3 月 25 日随 ARC Prize 2026 竞赛一同启动,从发布到被 OpenAI 总裁宣告饱和,只隔了五个多月。
Theo(t3.gg 公司 CEO)在 OpenAI 官宣后约一小时写道:「ARC-AGI 3 是个残酷到让我想称之为恶意的基准,我从没想过我们能突破 30%。GPT-6 Astra 把它饱和了。什么鬼」。「saturated」的说法在 Brockman 发推之前已经在传播。Byrne Hobart 比他早 34 分钟发文调侃「既然 ARC-AGI-3 饱和了,我们需要一套新基准」,还要求前沿模型测准「单掌拍手之声」。
Brockman 发推之后,FirstMark Capital 投资人 Matt Turck 感叹道:「ARC-AGI 当初就是为对抗 LLM scaling 范式而造的……Astra 刚刚把它彻底饱和了(用的是它自己的原生 harness)」。科技内容创作者 Chubby(getsuperintel 主编)则写道:「今天这一课的教训是:我们需要尽快搞出新基准」,这条推文获得 300 余赞。
「饱和」以哪一套口径为准,仍是这场争论的未决问题:Brockman 的断言没有给出任何数据,ARC Prize 的两套验证之间隔着 37.2 个百分点,一个接近满分,一个仍有明显距离。这个基准是否真正触顶,取决于后续公开评测采用哪种口径。