AREX Feed Article
Astra 低推理档每动作输出 0 个推理 token、准确率两倍于 Sol max,Knoop 推测存在“第二条扩展轴”
ARC Prize 联合创始人 Mike Knoop 于北京时间 9 月 5 日凌晨发布了一张 GPT-6 Astra 在 ARC v3(ARC-AGI-3)上的新图表:在低推理档(low)下,Astra 每个动作常常输出 0 个推理 token(reasoning token),Knoop 称这是 ARC 测试中此前从未见过的现象;同一档位的准确率约为 GPT-5.6 Sol 最高推理档(Sol max)的两倍。他据此推测,Astra 在可见的推理预算之外利用了第二条测试时适应(test-time adaptation)扩展轴,可能与潜在空间推理(latent-space reasoning)有关。
围绕 OpenAI 所称的饱和,ARC Prize 一方给出了自己的数据。OpenAI 发布 GPT-6 Astra 时称其以 99.9% 的得分饱和(saturate)了 ARC-AGI-3,。ARC 团队在给出另一组口径:在 Semi-Private 测试集上,只允许模型携带可见笔记的标准 harness(ARC 团队对包裹模型、管理记忆与交互的评测流程的称呼)最好成绩 62.7%(max 档),保留不透明推理状态、用压缩(compaction)延续长对话的 Provider Adapter harness 最好成绩 99.9%(high 档)。ARC-AGI 创造者、ARC Prize 联合创始人 François Chollet 随后连发数条解读,强调解出 ARC-AGI-3 不是 AGI 的证明。总裁 Greg Brockman 随后发推称“arc-agi-3 is now saturated”(UTC 时间 9 月 3 日晚,北京时间 9 月 4 日清晨)。
low 档在六档表格里垫底
ARC 团队此前公布的标准 harness 成绩表里,low 档只有 17.5%,比标注为 none 的档位(35.2%)还低,是六个档位中的最低分;接入 Provider Adapter harness 后,六个档位的成绩全部落在 96.7%~99.9% 之间。
Knoop 的图给 low 档补上了此前没有的观测角度,即每个动作输出多少推理 token。配文很短:较低推理档下 Astra 每个动作常常输出 0 个推理 token,“我们从未见过这种情况”;low 档的准确率约为 Sol max 的两倍,他说这也“出人意料”。这些数字与 ARC 团队博客里的成绩一样,都是 ARC Prize 自己的测试口径,和 OpenAI 官方公告的成绩属于两套不同的测试。
Knoop 的猜测,Chollet 的观察
Knoop 对这两个数字的解释止于推测。他在帖子里写道,这暗示 Astra 正在利用第二条测试时适应扩展轴,“大概(presumably)是潜在空间推理”。按字面理解,潜在空间推理指不把思考写进可见文本、而在模型内部表示中完成的推理;Knoop 没有在这条帖子里展开这条轴如何运作。
Chollet 前一天的评测解读提供了另一头的观察。他说检查推理链时看到 Astra 为每局游戏现场建立符号化世界模型,甚至自创一种近似代数记法的局面简写 DSL(domain-specific language,领域专用语言)来记录状态;这类符号建模此前只出现在复杂的 harness 上,说明 harness 的能力正越来越多地转移进模型本身。他把 Astra 称为交互式推理问题上“模型能力的阶跃式进步”(step-function change)和“模型智能的重大突破”,同时拒绝据此主张 AGI:“我们不做这个主张。对这个系统,我们目前知道的只有它的基准分数。”
antirez:更难的是设计下一版基准
公开讨论中,(UTC 时间 9 月 4 日上午发帖)把重点从 Astra 的分数上移开:“这里说的话非常坦诚,非常感谢。这条帖子更重要的不是 Astra 本身在 ARC-AGI-3 上的表现。要设计一版初始通过率很低、人类又能拿到体面分数的新基准,恐怕会非常复杂。”
Chollet 在旁注里回应过围绕基准本身的质疑:ARC-AGI-3 今年 3 月发布时前沿模型得分不足 1%,有人说基准从根本上就是坏的、最聪明的人类也解不出来、理论上限只有 40%,团队此后一直承受攻击。他说 AI 用 6 个月从不足 1% 走到接近 100%,恰好说明基准校准正确,也说明 agentic 能力的上升快于多数人、包括他们自己的预期。他同时提醒,人类要拿 100% 并不难,只要动作数少于基线即可,而基线本身并不强,因为测试者没有筛选。
ARC 团队自己也公布过“人类能拿高分”的参照:基线由约 500 名未按解谜能力筛选的公众测试者构成;接入 Provider Adapter harness 的 Astra(max)在 96.0% 的关卡上动作数少于人类基线中位数,平均每关少用 51.7% 的动作。
ARC-AGI-4 预计 2027 年 Q1 推出
Chollet 已经公布了下一版基准的时间表:ARC-AGI-4 在 ARC-AGI-3 发布后即启动开发,预计 2027 年第一季度推出,“我们认为它会非常特别”。他把基准设计描述为与模型共同演化的持续过程:新基准用新问题塑造研究方向、提供反馈信号,再随模型进步瞄准 AI 与人类智能之间的残差。
他在同一线程里回顾了此前的预测:ARC-AGI-3 发布时被问到“前沿模型何时会饱和它”,他回答“大约一年,取决于它被明确针对的程度”。那是 6 个月前,Astra 代表的进度大约比他预期快一倍,他预计新模型的速度会挑战许多人基于旧模型形成的对 AI 的看法。
这轮讨论留下两个没有答案的问题:新版基准要同时满足“初始通过率低”和“人类能拿体面分数”,antirez 说这很难;Astra 如何做到低推理档下“不输出推理却更准”,Knoop 的潜在空间推理猜测也只说到“presumably”为止。