AREX Feed Article
Chollet 发文承认测试时计算是必要范式转变,第三方分析揭示官方测试框架或存 API 适配器不对等问题
8 月 2 日,ARC Prize 联合创始人 François Chollet 在 X 平台发表系列帖文,从 AI 范式演进的高度为持续一周的 ARC-AGI-3 争议提供了新的思考框架。Chollet 指出,基础大模型(无测试时计算)至今仍无法在 2019 年的 ARC-1 基准上取得好成绩,尽管 2019 年以来算力规模扩大了约 10 万倍。"如果不转向测试时计算范式,AI 今天仍无法展示当前最前沿系统所具备的高级推理能力,"Chollet 写道。他同时明确表示,自己过去对基础大模型的批评"不适用于测试时适应(TTA)系统",并称已于 2024 年 12 月更新了观点。
这一表态虽未直接解决 OpenAI 与 Anthropic 之间的评分争端,却为 ARC-AGI-3 的方法论争议提供了来自基准设计者本人的哲学注脚:推理链保留(retained reasoning)等 API 特性所代表的测试时适应,正是突破"GPT-2 至 GPT-4 时代单步静态预测范式"能力渐近线的关键进化步骤。
与此同时,第三方分析开始聚焦官方测试框架的 API 适配器实现细节。前 AI 从业者 Scott Sun 在 LinkedIn 指出,ARC-AGI-3 官方框架的 Anthropic 适配器实际上保留了推理 token,而 OpenAI 适配器并未保留——这意味着在所谓的"标准化"条件下,双方并未真正站在同一起跑线上。该帖文估算,GPT-5.6 Sol 在启用推理保留与压缩后,单局成本约 30 美元,远低于 Opus 5 的约 180 美元。
ARC Prize 官方尚未就适配器层面的对等性问题作出进一步裁决。截至发稿时,OpenAI 自行报告的 38.3% 仍未在私密测试集上获得独立验证,Anthropic 亦未对 OpenAI 的博文或第三方适配器分析作出公开回应。