AREXOpen in interactive Feed

AREX Feed Article

两个设置翻三倍:GPT-5.6 的 ARC-AGI-3 翻盘,击穿了"跑分"这件事

July 30, 2026View primary source

13.3% → 38.3%,一篇博客引爆 29 万阅读

7 月 29 日下午,OpenAI 在官方博客和 X 账号同时发布了一篇题为《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》的文章。核心数据只有一行:GPT-5.6 Sol 在 ARC-AGI-3 公开测试集上原本得分 13.3%,开启 retained reasoning 和 compaction 两个 API 设置后,得分跳到了 38.3%。涨幅 188%,同时输出 token 减少到原来的六分之一。

推文 24 小时内阅读量突破 29 万,4044 次点赞,被 Ethan Mollick(沃顿商学院教授)等头部 KOL 转发评论。这不是一条普通的 benchmark 更新——它在 OpenAI 和 Anthropic 围绕 ARC-AGI-3 的竞赛叙事里,扔了一颗炸弹。

一个公式足以概括:得分 = 模型 × 缰绳

OpenAI 这篇博客报告提炼出了五个关键结论,每个都在动摇当前的 benchmark 游戏规则。

第一,标准评测 harness 在每一步执行后丢弃了 GPT-5.6 Sol 的推理日志。ARC-AGI-3 是一个交互式 benchmark——模型需要对不熟悉的 2D 游戏环境进行探索、试错、学习。但标准 harness 把每一步当作独立调用,不保留上一步学到的东西。更糟的是,当上下文窗口被填满,早期的行动记录会被滚动截断,模型被迫反复从零开始。

第二,启用 retained reasoning 和 compaction 后,得分从 13.3% 暴涨至 38.3%。retained reasoning 让模型在跨轮对话中保持推理连贯性;compaction 则用智能压缩替代粗暴截断,在上下文窗口接近上限时保留关键信息而非直接丢弃。

第三,38.3% 超越了 Anthropic Claude Opus 5 此前创下的 30.2%,让 GPT-5.6 Sol 成为 ARC-AGI-3 公开测试集的新 SoTA。而就在一周前,Opus 5 的 30.2% 还被广泛报道为"GPT-5.6 Sol 7.8% 的近四倍"。

第四,38.3% 距离 OpenAI 估算的人类测试者平均水平 48% 不到 10 个百分点。

第五,也是最重要的一条:benchmark 分数测的是"模型 + 产品 harness",不是纯粹的模型能力。 OpenAI 在博客中明确指出,如果你是一个 API 开发者,想榨出模型的最大性能,应该使用他们在自家产品(ChatGPT、Codex)中部署的相同设置。

"模型每走一步,harness 就清空它的记忆"

OpenAI 在博客中用了一段动画演示来直观解释问题所在。ARC-AGI-3 设计的本意是测试 AI 在陌生环境中"边玩边学"的能力——没有说明书,没有规则提示,只能通过不断尝试来摸索怎么玩。

但在标准 harness 下,GPT-5.6 Sol 每走一步,前一步的推理过程就被丢弃。模型确实在"学"——它每轮都在分析当前局面,推演可能的规则,尝试不同策略——但这些学到的东西没有传递到下一轮。上下文窗口一满,更早期的动作记录也被裁掉。

Ted Sanders(OpenAI 研究员,本次博客的合著者之一)在 X 上说得更直白:"在 ARC-AGI-3 上,GPT-5.6 蠢得像块土。但如果你打开我们在 ChatGPT 和 Codex 里用的那两个 API 设置,它的公开测试集得分涨了约三倍,token 效率涨了约六倍。性能 = 模型 + 产品,不单是模型。"

Ilan Bigio(OpenAI 工程师,本次调查的主导者)制作了那些展示"有记忆"和"无记忆"状态下模型行为差异的动画。OpenAI 内部显然不是今天才发现这个问题——博客提到,retained reasoning 和 compaction 在 ChatGPT 和 Codex 产品中已经默认开启,但此前没有人想过要去检查标准 benchmark harness 是否也启用了这些设置。

两个设置分别做了什么

retained reasoning(推理保持)是 OpenAI Responses API 的一个功能。它在服务端维护跨轮次的推理状态,每一步的思考结果不会因为 API 调用结束而消失。标准 Chat Completions API 做不到这一点——每次调用都是无状态的。

compaction(上下文压缩)则是 Response API 处理长对话的策略。当上下文长度逼近模型的上限时,compaction 会对历史信息做智能摘要,保留关键推理线索,而不是简单地从最早的消息开始一刀切。

两个设置单独开启都有提升,但叠加效果最强。OpenAI 没有公布单独开启每个设置的详细数据,只给出了最终叠加结果:188% 得分提升,6 倍 token 节省。

一个有趣的细节:compaction 自 GPT-5.1-codex-max 起就已经是 OpenAI 内部 RL 训练策略的一部分。N8 Programs(Johns Hopkins 应用数学与统计专业学生,关注 in-context learning)在引用推文中指出:"compaction 自 5.1 以来就是 'on policy' 的——模型在训练时就已经学会了在存在 compaction 的环境下工作。ARC Prize 的评测 harness 让模型在一个它从未被训练适应的环境里裸奔。"

38.3% vs 30.2%:翻盘的数据

这场翻盘的核心数字是这样的:

场景ARC-AGI-3 公开测试集得分
GPT-5.6 Sol(标准 harness)13.3%
GPT-5.6 Sol Max(标准 harness)7.8%
Claude Opus 5(Anthropic 自报)30.2%
GPT-5.6 Sol(retained reasoning + compaction)38.3%
人类测试者(OpenAI 估算)~48%

从 7.8%/13.3% 到 38.3%,GPT-5.6 Sol 在同一个公开测试集上,同一个模型权重,只是改变了 harness 的行为——就完成了对 Opus 5 的反超。

这组数字的冲击力在于:Opus 5 发布时,30.2% 是 ARC-AGI-3 的历史最高分。TechTimes 的标题是《Claude Opus 5 Took ARC-AGI-3 Record With an Equation No AI Had Written Before》。The Decoder 的标题是《Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence》。如今 OpenAI 用一篇博客就把这个叙事翻了过来。

OpenAI 给开发者的四句话

博客结尾,OpenAI 给 API 开发者列了四条建议:

  1. 使用 Responses API,不要用老旧的 Chat Completions API
  2. 开启 retained reasoning
  3. 开启 compaction
  4. 如果想亲自体验 ARC-AGI-3 的难度,去 arcprize.org/tasks 试试公开游戏

最后一条带着明显的挑衅意味——"你觉得模型不行?你先试试看。"

随后 OpenAI 官号在跟推中补充:"我们希望这些实验提醒大家,评测很少在孤立中测量模型——它们还测量了一堆不那么显而易见的选择:API 设置、harness 设计、prompt 策略。"

ARC Prize:"发现很有价值,但我们不改"

社区最期待的回应来自 ARC Prize 官方。

在 OpenAI 博客发布约三个半小时后,ARC Prize 在 X 上发了一篇长推文。措辞谨慎但立场清晰:

"OpenAI 的内部测试表明,提供商管理的对话状态在跨轮次推理中保持了更好的连续性,并提升了在 ARC-AGI-3 这类长周期任务上的表现。这是一个真实而有价值的发现。我们很受鼓舞地看到 ARC 被用来识别有用的 harness 设计。"

然后画了红线:"ARC 的官方验证分数使用的是'无 harness'方法——以避免开发者有意或无意地针对评测做定向优化,并公平比较所有提供商。所有系统接收相同的观测、相同的系统 prompt,在相同的动作限制下运行。对话状态由客户端使用业界标准的 LLM 接口(OpenAI 风格 completions API)管理。"

最后留了门缝:"我们正在与包括 OpenAI 在内的多家行业实验室积极合作,想办法在保持公平性和跨提供商一致性的前提下,将这些服务端状态管理的发现纳入我们的验证评测体系。"

ARC Prize 的立场并非不可理解。如果允许每个提供商在评测中使用自己定制的 harness 设置,benchmark 分数将完全失去跨模型比较的意义。但问题在于——当"业界标准接口"(Chat Completions API)本身就是 OpenAI 已经不再推荐的旧产品,而被评测的模型在训练和部署中已经深度依赖 Responses API 的 compaction 等特性时,"无 harness"是否反而制造了一种系统性的偏差?

N8 Programs 在他的引用推文中直接建议 ARC Prize 更新评测 harness:"retaining reasoning 和 compaction 是通用工具,大多数 agent 默认就带着它们。模型已经在有这些工具的环境中被 RL 训练过。如果 compaction 被认为太像'harness',那至少 retained reasoning 应该被允许。"

跑分游戏还有多少可信度?

这次事件打开了三个可能的方向。

第一种可能:benchmark 组织被迫改革。ARC Prize 已经在和 OpenAI 等实验室协商如何纳入 harness 设置的考量,但如果无法达成跨提供商的公平方案,ARC-AGI-3 的"官方分数"将越来越像一场双方都默认不真实的表演——OpenAI 的模型戴着镣铐跑,Anthropic 的模型也戴着镣铐跑,但两副镣铐不一样重。

第二种可能:harness engineering 成为一个显学。Ethan Mollick(沃顿商学院教授,AI 领域最具影响力的学术评论者之一)在转发 OpenAI 博客时写道:"模型 + harness。我们才刚刚开始理解 harness engineering 的最佳做法。即使模型不再进步,也有大量的 untapped potential——何况模型还在进步。"当同一个模型可以因为 harness 设计不同而得分差三倍,开发者将不再只问"哪个模型最强",而是问"怎么用这个模型最强"。

第三种可能:行业加速从"比模型"转向"比产品"。如果 benchmark 分数连模型真实能力的排名都无法可靠反映,那么评价 AI 系统的最终标准将回归到产品体验——ChatGPT vs Claude 的实际表现,Codex vs Cursor 的编码效率。这对 OpenAI 和 Anthropic 都是利好——它们恰好是两家同时拥有前沿模型和终端产品的公司。

OpenAI 的这篇博客本质上是一封给行业的公开信。正文里写的是"两个设置翻三倍",字缝里写的是另一句话:别再用 benchmark 裸分来排名了,那玩意测不准。 对于还在用 Chat Completions API 接上 benchmark 脚本就跑分的开发者来说,这个提醒来得正是时候。


参考链接: