AREX Feed Article
ARC-AGI-3 基准之争:OpenAI 官方博客反击 Anthropic,"改两个设置得分翻三倍"
7 月 30 日,OpenAI 发布官方博客《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》,直接回应 Anthropic 一周前在 Claude Opus 5 发布时对 ARC-AGI-3 排名的宣称。Anthropic 曾声称 Opus 5 在 ARC-AGI-3 上的得分为 GPT-5.6 Sol 的"三倍"——官方成绩单上,Opus 5 得 30.2%,GPT-5.6 Sol 仅 7.8%。OpenAI 的回应揭示了这一差距中的隐性因素:官方测试 harness 默认丢弃了 Sol 的推理链,而仅启用 Responses API 中的两个通用设置后,Sol 得分升至约 38-40%,反超 Opus 5,同时输出 token 减少约六倍。
Anthropic 于 7 月 24 日发布 Opus 5 时,在官方产品页中写道"Opus 5 在 ARC-AGI-3 上的得分是次优模型的三倍",并配发了一条在 X 上获得超 6 万点赞的发布推文。然而 OpenAI 研究人员发现,ARC-AGI-3 的标准化 harness 对 Sol 构成了系统性劣势:每执行一步游戏操作后,模型的私有推理(chain-of-thought)被完全丢弃,同时采用滚动截断窗口,导致上下文扩展时更早的行动记录也逐渐丢失。
OpenAI 指出,这在本质上背离了 Sol 的训练与部署方式——在 ChatGPT 和 Codex 中,推理消息会作为对话历史的一部分保留,上下文过长时通过压缩(compaction)而非硬截断处理。启用 Responses API 的"保留推理"(retained reasoning)和"压缩"两个设置后,Sol 在公开任务集上从 13.3%(使用 Responses API 但未启用优化时的基线)跃升至 38.3%(以 RHAE 即相对人类行动效率计分)。相比之下,Opus 5 在官方 harness 下得分为 30.2%,人类测试者平均得分为约 48%。
这一调整引发了关于公平比较的激烈争论。ARC Prize 联合创始人 François Chollet 回应称,官方评分采用"不含厂商特定设置的标准化方式以确保公平比较",但他同时承认:通用的 API 设置(只要不是为 ARC-AGI-3 专门开发的,且对所有 API 用户开放)可以作为附加成绩报告。Chollet 进一步透露,ARC Prize 与 OpenAI 就如何最佳测试其模型进行了"大量反复讨论,尤其是关于压缩(compaction)的问题",并暗示 ARC 可能使用了较旧的 OpenAI 风格 completions API(缺少 Claude API 已具备的功能),使官方比较对 Sol 不利。"不同厂商使用不同设置确实造成了'潜在的对等性问题',"Chollet 表示,但"只要设置和成本被清楚报告",他认为这是可接受的。
社区反应与争议焦点
OpenAI 博客发布当天,Steipete(Peter Steinberger,Steipete 联合创始人、前 OpenAI 工程师)在 X 上质疑 Anthropic 是否在发布"胜利"推文前停下来思考过数字为何如此悬殊,该帖获得逾 280 万次浏览、5400 余次点赞和近 300 条回复,引发两极讨论。
反对 OpenAI 立场的声音认为,Anthropic 使用的是与 OpenAI 相同的标准化 harness,Opus 5 在同样条件下取得 30.2% 的成绩是合法的苹果对苹果比较。用户 @tommy5dollar 写道:"让自家模型保留推理而其他模型都没有这样做,属于作弊。"另一用户 @CavaSoTasty 指出 ARC-AGI-3 的设计核心正是"每次从零开始解决问题",保留记忆等于改变了测试性质。
支持 OpenAI 的声音则指出,如果 Anthropic 的 Claude API 本身就能原生保留推理 token 而 OpenAI 在测试中使用的旧版 API 不支持,那么所谓的"标准化"环境实则偏向了一方。Steipete 在回复中明确表示:"他们(Anthropic)不支持 chat completion。在这个案例中,chat completion API 的实现是有问题的,而他们的(API 实现)保留了推理 token。"
开发者 @nf_casal 贴出了一则值得关注的实战对比:他将 Opus/Fable 与 Sol 组成协作循环运行——Fable 监督,Sol 执行——在 Sol 不断纠正 Fable 的错误后不得不终止实验,并评论称"无论 Anthropic 在这些测试中跑的是什么,都不是用户能拿到的 Fable 或 Opus Max"。
事件意义
这起争议暴露了前沿 AI 评测的结构性困境。当模型越来越依赖推理时间计算和 API 基础设施来发挥能力时,剥离所有厂商特性的"通用 harness"可能低估模型的实际智能水平;而允许厂商各自优化又可能将评测变成系统集成竞赛而非模型能力比较。ARC-AGI-3 设计初衷是抵抗基准博弈,但事件表明,即便是最严谨的基准也难以在"标准公平"与"反映真实能力"之间找到平衡点。
截至发稿,ARC Prize 尚未就计分口径做出正式规则修改,Anthropic 也未就 OpenAI 的博客公开发表回应。人类测试者 48% 的平均分提醒人们,两个模型距人类水平仍有距离——但在谁更接近答案的问题上,这场争论本身反映了前两大实验室日益将基准作为营销武器的趋势。
来源
- OpenAI 官方博客:《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》,7 月 29 日,
- Anthropic 产品发布页:《Introducing Claude Opus 5》,7 月 24 日,
- MLQ News:《OpenAI Claims GPT-5.6 Sol Beats Opus 5 on ARC-AGI-3—but Only With Non-Standard API Settings》,7 月 30 日,
- THE DECODER:《OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings》,7 月 30 日,
- X 讨论串:@steipete 质疑帖(280 万+ 浏览)及回复,7 月 30 日,
- X:@nf_casal 实战对比报告,7 月 30 日,