AREX Feed Article
ARC-AGI-3 基准争议:OpenAI 称两项 API 设置使 GPT-5.6 Sol 反超 Claude Opus 5,暴露评估框架可比性危机
7 月 29 日至 30 日,一场围绕 ARC-AGI-3 基准测试方法论的公开论战在 Anthropic 与 OpenAI 之间爆发。Anthropic 先以 Claude Opus 5 在 ARC-AGI-3 上取得 30.2% 的成绩(近四倍于 GPT-5.6 Sol 默认配置的 7.8%)宣布胜利;不到一周,OpenAI 发布技术博文,称仅需开启两项非标准 API 设置——保留推理链(retained reasoning)与上下文压缩(compaction)——即可使同一 GPT-5.6 Sol 模型得分跃升至 38.3%,反超 Opus 5 逾 8 个百分点。同一模型分数从 7.8% 到 38.3% 的五倍摆动,引发了对闭源模型独立评估可比性与基准诚信的广泛争论。
事件经过
7 月 24 日,Anthropic 的 Claude Opus 5 以 30.16%(四舍五入为 30.2%)的成绩登顶 ARC-AGI-3 公开排行榜,该分数由 ARC Prize 独立验证。此前最高纪录为 GPT-5.6 Sol 的 7.78%。Opus 5 在测试中攻克了五个此前无 AI 模型解决的公开演示环境,一度被视为推理能力的重大突破。
7 月 29 日,OpenAI 在官网发表文章《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》,详述了其内部复现过程。OpenAI 发现,官方 ARC-AGI-3 测试框架在每次模型行动后丢弃了所有私有推理消息,并使用滚动截断窗口导致较早的行动记录丢失。这使得 GPT-5.6 Sol 每次行动都需"从零开始理解游戏"。
当 OpenAI 改用自家的 Responses API,开启保留推理(跨步骤保持思维链)与压缩(以摘要替代截断管理长上下文)两项设置后,GPT-5.6 Sol 在公开任务集上的得分从 13.3%(OpenAI 自身在官方框架下的复测值)升至 38.3%,同时输出 token 减少至原来的六分之一。作为参照,人类测试者在 ARC-AGI-3 上的平均得分约为 48%。
公开争议升级
OpenAI 博文发布后,争议迅速在社交平台发酵。OpenAI 员工、OpenClaw 创建者 Peter Steinberger(@steipete)在 X 平台发文质问:"Anthropic 里难道没有人在发布'胜利'推文之前停下来想一想,为什么这些数字看起来这么荒谬吗?"该帖获得超过 5500 次点赞、290 万次浏览,引发激烈讨论。
反对 OpenAI 做法的一方指出:Anthropic 的 Opus 5 同样是在官方标准化框架下测试的,并未使用自家 API 的特殊设置。在相同条件下,Opus 5 的 30.2% 远高于 GPT-5.6 Sol 的 7.8%,这本身就是有意义的对比。有评论者直言:"让自家模型保留推理而其他模型不能,这不叫优化,这叫作弊。"
支持 OpenAI 的一方则认为,保留推理和压缩是 Responses API 的通用功能,任何 API 用户均可使用,并非为 ARC-AGI-3 定制的"基准特供"设置。OpenAI 强调,"基准测试很少单独衡量模型——它们也衡量了 API 设置、框架设计和提示工程等不那么可见的选择。"
ARC Prize 立场:一个灰色地带
ARC Prize 联合创始人 François Chollet 于 7 月 30 日在 X 平台作出回应,划出了一条重要分界线:
- 不允许:专门为通过基准而定制、或包含基准格式/内容知识的测试框架。
- 允许:并非为 ARC-AGI-3 开发、且对所有 API 用户开放的通用 API 设置。
Chollet 同时承认,如果每家提供商使用不同的设置进行测试,"确实会产生潜在的公平性问题",但他认为"只要设置和成本被清晰报告,这是可以接受的"。他还透露,ARC Prize 此前可能与 OpenAI 就压缩等功能有过反复沟通,并可能在测试中使用了较旧的 OpenAI 补全 API,导致部分功能缺失。
截至目前,ARC Prize 尚未就标准化评估配置作出最终裁决,OpenAI 自行报告的 38.3% 未经独立第三方在私密测试集上验证。
为何重要
这一争议揭示了 AI 基准测试领域的结构性困境。当模型推理能力越来越依赖推理时计算(chain-of-thought reasoning、工具使用、多步规划),其性能表现与 API 基础设施深度耦合。剥离这些基础设施的基准可能低估模型的有效智能,而允许各自优化的基准又可能沦为"系统集成竞赛"。
在 ARC-AGI-3 的具体案例中,核心问题在于:如果 Anthropic 使用自己的 API 对 Claude Opus 5 进行同等优化(等效的记忆管理和上下文压缩),其 30.2% 的成绩是否也会大幅提升?在双方未在匹配条件下测试之前,ARC-AGI-3 排行榜的可比性将持续受到质疑。
此次争议恰逢行业价格战与 Astra 叙事争夺的同一周,标志着前沿 AI 实验室之间的"跑分战争"进入相互拆台的阶段。
未解问题
- OpenAI 的 38.3% 为自行报告结果,独立第三方尚未在私密测试集上复现。
- Anthropic 未公开回应 OpenAI 的博文,也未说明 Opus 5 在等效优化条件下的潜在表现。
- 保留推理是否违背 ARC-AGI-3 "每次从零推理"的设计初衷,仍存分歧。
- 两种测试方案的成本差异尚无完整计算,仅知 OpenAI 方案将输出 token 减少六倍。