AREX Feed Article
"测的是 harness 而非模型"成共识:Chollet 称测试时计算仅为"补丁一",离散程序搜索才是终局
8 月 2 日,ARC-AGI-3 争议进一步深化。在 Anthropic 与 OpenAI 的评分争端持续发酵之际,两条独立分析线索汇聚为同一判断:ARC-AGI-3 排行榜分数反映的首先是测试框架(harness)的内存管理策略,其次才是模型本身的推理能力。而基准设计者 François Chollet 本人同日发出的信号,更将当前依赖测试时计算的范式定性为"补丁"——而非终极方案。
Chollet:测试时计算是"补丁一",离散程序搜索才是"补丁二"
在引发广泛讨论的系列帖文中,Chollet 将 AI 演进路径描述为两个"补丁"的叠加。他在主帖中写道:"为解决深度学习的局限并避免停滞,AI 领域首先应用了补丁(一),该方案于 2024 年 12 月开始演示,九个月后的今天已完全普及。然而从长远看,AI 不可避免地要转向补丁(二)。"
结合后续回复可知,"补丁一"即测试时计算(test-time compute)——包括思维链推理、推理链保留(retained reasoning)等范式,正是当前 ARC-AGI-3 争议的核心技术;"补丁二"则指向离散程序搜索(discrete program search),即通过搜索而非统计预测来合成可解释程序。
这一表述与此前报告中所引 Chollet"测试时计算是必要范式转变"的立场一脉相承,但语气明显不同。"补丁"一词暗示测试时计算是临时性修复,而非架构上的根本突破。Chollet 仍在同一线程中重申:基础大模型(无测试时计算)至今无法在 2019 年的 ARC-1 上取得好成绩——尽管算力自 2019 年以来增长了约 10 万倍。对 Chollet 而言,测试时计算打开了能力天花板,但离散程序搜索才是真正的出口。
值得注意的是,该帖文下的讨论反映出社区分歧。有评论者质疑测试时计算是否真的"完全普及"(Marvin Baumann),也有人认为整体方向正确但担心"补丁叠补丁"终将导致调试噩梦(Maximus)。更有反对者直接称 Chollet 等人的观点为"动机性推理——除非包含我偏好的研究方向,否则就到不了 AGI"(Hartmut Straub)。
Context Studios:标杆比较根本无效
第三方机构 Context Studios 创始人 Michael Kerkhoff 于 7 月 31 日发表长篇技术分析《ARC-AGI-3 Measured the Harness, Not Just the Model》,为这场争议提供了迄今最系统的工程视角解读。
分析的核心论断是:媒体广泛引用的"38.3% 击败 30.2%"比较在方法论上不成立。38.3% 是 OpenAI 在公开任务集上以自有框架测得的结果;30.2% 则是 ARC Prize 在标准化协议下独立验证的成绩。两者使用不同任务集、不同测试框架,"不构成排名关系"。在 ARC Prize 官方排行榜上——这是唯一受框架控制的排名——Claude Opus 5 仍以约 30.2% 领先于 GPT-5.6 Sol 的约 7.8%,OpenAI 7 月 29 日的博文并未改变排行榜上的任何一行。
Context Studios 还指出,OpenAI 研究博文本身从未提及 Opus 5。"正面对决"的叙事来自 OpenAI 员工在 X 平台上的帖文和后续媒体标题,而非原始技术文档。
技术共识:内存策略 = 框架 = 分数
Context Studios 的分析将争议凝练为一个可操作的工程诊断:大多数开发者从未主动选择过其 agent 循环中的内存策略——它只是框架默认值。关键问题有三:(1)agent 循环是否跨工具调用携带推理链,还是每步从零重新推导计划?(2)上下文窗口填满时,是截断还是压缩(compaction)?(3)是否仍在使用旧版 Completions 端点而非厂商当前部署的 API 接口?
这与 AI Founders 同日发表的评论《GPT-5.6 Sol Didn't Get Smarter. Its Memory Did.》形成互文——尽管该站因反爬限制无法全文获取,但其标题即总结了已形成的技术共识:同一模型分数五倍摆动,变的是记忆而非模型。
本次更新延伸了哪些判断
本轮信息确认并深化了此前报道的多条线索:
- 确认:官方测试框架的 API 适配器存在不对等问题——Context Studios 的分析与 Scott Sun 的 LinkedIn 帖文(前次报道已引)相互印证。
- 深化:Chollet 从"测试时计算是必要范式转变"的辩护性表述,转向了"这是补丁一,补丁二才是终局"的阶段性定位。这暗示 ARC Prize 基准的设计哲学可能已内在地预期了当前范式的过渡性。
- 扩展:"测的是 harness 而非模型"从零散批评升级为正式分析框架,被第三方机构以可复现的工程诊断形式系统表述。
截至发稿时,ARC Prize 尚未就标准化评估配置作出最终裁决;Anthropic 仍未公开回应 OpenAI 的博文或第三方分析。