AREX Feed Article
GPT-6 Sol 发布次日实测遇冷:105 个预埋 bug 仅修 29.3 个,DHH 同日称 Opus 5.5 进步明显
GPT-6 Sol 在 9 月 22 日与 GPT-6 Luna 一同发布,「把 Astra 背后的进展带进更快、更便宜的模型」,API 价格砍半。发布次日,两份第三方独立实测给它打出了与这套口径不同方向的分数。9 月 23 日 16:11(北京时间),独立评测者 公布他对 GPT-6 Sol 的首次真实工作测试:在 2 个真实代码仓库、105 个预埋 bug 的「找出并修复」任务里,GPT-6 Sol 的 max 推理档修复了 29.3 个,低于同帖列出的四个对照模型——GPT-6 Astra 45 个、上一代 GPT-5.6 Sol 43.5 个、Anthropic 的 Opus 5.5 41.7 个、Meta 的 Muse Spark 1.3 32.2 个。他的原话是:「看起来是一次巨大的退化。」
成本一栏是另一幅图景:按 API 等价价格折算,GPT-6 Sol 完成全部任务只要 $9.93,是五个模型中最低——GPT-6 Astra $33.04,Opus 5.5 $58.53,GPT-5.6 Sol 高达 $95.25,Muse Spark 1.3 为 $18.11。同日 19:40,Ruby on Rails 创造者、37signals CTO 公布他的 @rails agent evals 榜单最新结果:OpenAI 模型「仍保持明显领先」,Opus 5.5「进步明显」,而性价比黑马是 GPT-6 Luna Max——18% 完成率、约 $11 成本,离 GPT-6 Sol 已经不远。两份结果方向一致:GPT-6 Sol 相对偏弱,Opus 5.5 有实质提升。它们都是第三方自报结果——Huryn 是单人评测,DHH 的帖文未附完整方法细节,数字均未经独立复现。
Huryn 的测法:bug 不是随机埋的,裁判是模型
在 Huryn 的原帖线程里有交代。任务不是抽象的编程题,而是「找出并修掉你能找到的 bug」;105 个 bug 并非随机埋设,而是 2026 年初前沿模型没能发现的高难度问题。他前一天刚用同一套基准测过,当时的结论是「Anthropic 回到牌桌上了」。
计分规则有三条容易误读。其一,模型顺手发现并报告的「计划外 bug」一律不计分——Huryn 解释说,OpenAI 模型会「bugmax」,报告大量真实、理论性或不相干的问题,而修掉它们只会把方案复杂化;他的顶部也写明「只统计预埋 bug,计划外修复永不计入得分」。其二,识别出来但没修好、或交出不完整方案,记 0 分。其三,分数由来自不同模型家族的裁判模型对照秘密答案键给出。榜单截图还显示,多数新模型的成绩是多次运行的平均:GPT-6 Astra、Opus 5.5 与 GPT-6 Sol 均标注 n=3,GPT-5.6 Sol 为 n=2,Muse Spark 1.3 为 n=5;OpenAI 系模型跑在 Codex CLI 上,Anthropic 系跑在 Claude Code 上,Meta 的 Muse Spark 走 Muse Code 加 Meta API。
同一组数字的两种读法
把 放在一起看,结论会朝两个方向走。按修复数,GPT-6 Sol(29.3/105)比同门旗舰 GPT-6 Astra(45)少了约三分之一,比上一代 GPT-5.6 Sol(43.5)也少了约三分之一。按每个修好的预埋 bug 折算 API 等价花费,排序反转:GPT-6 Sol 约 $0.34,Muse Spark 1.3 约 $0.56,Astra 约 $0.73,Opus 5.5 约 $1.40,GPT-5.6 Sol 约 $2.19——分数垫底的那一档,单个修复的成本反而最低,不到 Astra 的一半。
榜单截图里还有两个细节:GPT-6 Sol 跑完全部任务用时 63.4 分钟,Astra 为 89.8 分钟;GPT-6 Sol 在 105 个计分 bug 之外还发现了 41.3 个不在预埋清单上的真实问题,Astra 有 55 个——这些发现既证明模型在干活,也换不来分数。
官方公告称「大幅提升」,第三方仓库测出反向差距
矛盾的另一头在 里。公告称 GPT-6 Sol 与 Luna 用了与 Astra 相似的训练方法,为的是「把 Astra 在专业工作、事实性、编码、计算机操作与对齐上的一流表现所依托的进展,带进更快、更便宜的模型」;Sol 的 API 价格从 GPT-5.6 Sol 的每百万 token 输入 $4、输出 $20 降到 $2、$10,降幅 50%。公告引用 OpenAI 自家基准称:在评估编码代理能否产出可合并变更的 FrontierCode 上,「GPT-6 Sol 较 GPT-5.6 Sol 有大幅提升」;在真实代码库软件工程任务 DeepSWE v1.1 上,Sol 的 max 档拿到 68.8%,距 Claude Fable 5 的最高分只差 1.1 个百分点,每任务成本低约 80%。
Huryn 的实测给出了另一组答案:同一对模型,在他的真实仓库任务里是 29.3 对 43.5。两组数字测的不是同一件事——官方基准考察可合并的代码变更与长周期工程任务,Huryn 考察预埋 bug 的查找与修复——但至少在这份第三方实测的场景里,「大幅提升」没有出现,出现的是反方向的差距。Huryn 已在帖子里预告,xhigh、high、medium、low 各推理档的数据会在原线程陆续放出,实时榜单也在同步更新。
DHH 的 @rails agent evals:GPT-6 Sol 只跑了 medium 档
DHH 的榜单测的是另一件事。他的 按 feature 考察模型:每个模型配置要做 20 个 feature,完成率按 60 次运行统计,卡片上还标注每次运行时长、步数和成本。最新卡片显示:GPT-6 Astra(max 档)以 53% 完成率居首,60 次运行完成 32 次,成本 $397.62;Claude Opus 5.5 以 33% 排第二,完成 20 次;Claude Fable 5.1 与 Grok 4.7 均为 32%;Gemini 3.8 Flash 23%;GPT-6 Sol 22%,完成 13 次,成本 $27.17;GPT-6 Luna Max 18%,完成 11 次,成本 $11.47。
DHH 在帖文中写道:「看到 @rails agent evals 的最新结果,可以清楚地看到 @openai 仍保持明显领先,尽管 Opus 5.5 进步明显。黑马依然是 Luna Max——18% 完成率,只花了 $11!离 GPT-6 Sol 已经不远了!」他的榜单上,GPT-6 Sol 跑的是默认 medium 档,标注「尚无 max 档成绩」,与 Huryn 测的 max 档数字不可直接对比;Sol 每次运行约 5 分钟——Astra 要 24 分钟,Opus 5.5 要 11 分钟。即便如此,两份榜单有两点重合:OpenAI 的领先来自 Astra 而非 Sol;Opus 5.5 的跳升两边都有数据支撑——在 Huryn 里,上代 Opus 5.0 的 max 档只有 27 分,Opus 5.5 发布当日的初步成绩是 43 分(9 月 23 日榜单上三次运行平均为 41.7)。
单评测者、模型裁判、未复现:数字之外的待解问题
两份成绩单的成色需要放在同一杆秤上看。 是 Huryn 个人运营的榜单,他写作面向产品经理的 AI 通讯 The Product Compass,网站自述的原则是「亲手实测、不炒作、没跑过的不收」(hands-on, no hype, nothing that was not run first);但裁判是模型而非人,答案键保密,预埋 bug 的挑选、「计划外发现」不计分这些流程选择都会影响排名。他的 GPT-6 Sol 结果发布半天内获得超过 20 万浏览、1,500 余赞,评论区里出现另一种算法:一位指出,「修复数除以成本,最划算的反而是被说『大幅退化』的那一档」。DHH 那边,帖文只附了一张榜单卡片图,没有方法说明,各模型配置的档位与细节都以图为准。
目前,两份评测都还没有第三方复现,与 OpenAI 官方基准的分歧也没有仲裁。接下来可以直接核对的数字有两处:Huryn 预告的其余推理档数据,以及 DHH 榜单上 GPT-6 Sol 与 Opus 5.5 仍空着的 max 档成绩——任何一处更新,都可能改写 9 月 23 日这两份初步结论的排位。