AREX Feed Article
成本仅三分之一,编程基准首超 Fable 5:GPT-5.6 Sol 重写模型性价比公式
TL;DR — 7 月 12 日,Design Arena 官方发布最新排名:OpenAI 的 GPT-5.6 Sol 以 Elo 1353 空降榜首,从 GPT-5.5 的位置一跃 18 名,在独立前端设计评测中首次压制 Anthropic 的 Claude Fable 5。同一周,Artificial Analysis 的独立横评给出了相似的结论:Sol 在 Intelligence Index 上仅落后 Fable 5 一分(59 vs 60),却在 Coding Agent Index 上以 80 分领先,且每任务成本仅为 Fable 5 的约三分之一($1.04 vs ~$3)。OpenAI Codex 负责人 Tibo 在 X 上只发了一句"I think GPT 5.6 is pretty good",收获 105 万次浏览和 1.6 万点赞——这句话的克制反而成了整个开发者社区最响亮的信号。但独立测试同时揭露了 Sol 的致命短板:AA-Omniscience 压力测试下,Sol 的 hallucination rate 高达 89%,而 Fable 5 控制在 55%。开发者社区由此分裂:是选"够好且便宜"的 Sol,还是"更贵但更可靠"的 Fable 5?
498K 人围观:Sol 从 GPT-5.5 一跃 18 名,直取 Design Arena 榜首
7 月 12 日,由 intelligence.ai 团队创建的 Design Arena 在 X 上公布了正式排名。帖文在两天内获得 498,893 次浏览、1,924 次点赞、189 次转发。
GPT-5.6 Sol 以 Elo 1353 登顶,领先第二名 GLM 5.2(1351)和第三名 Claude Fable 5(1345)。Design Arena 在公告中特别指出,这是"从 GPT-5.5 的一个 18 名、60 分的 Elo 跨越",并且 Sol "在偏好 vs 速度的 Pareto 前沿上建立了新标准——比任何同性能水平的模型都更快。"
同一天,Code Arena 的 Frontend 榜单也更新了:GPT-5.6 Sol(xhigh)与 Claude Fable 5 并列第一——这是 OpenAI 模型首次在该榜单上与 Anthropic 旗舰平起平坐。
OpenAI 总裁 Greg Brockman 转发了 Design Arena 的结果,称其为"重要里程碑"(major milestone)。但真正引爆开发者社区的是 Codex 负责人 Tibo 的帖子——全文只有八个单词:"I think GPT 5.6 is pretty good." 这条看似随意的评价在两天内积累了 105 万次浏览和 16,345 次点赞。在 AI 界的 hype 机器里,克制就是最大的自信。
五个数字,讲完 Sol vs Fable 5 的完整故事
在进入细节之前,这五个数字勾勒出竞争的全貌:
- Elo 1353 vs 1345:Design Arena 排名,Sol 以 8 分优势反超 Fable 5,60 分跨越 GPT-5.5
- $1.04 vs ~$3 per task:Artificial Analysis Intelligence Index 的每任务成本,Sol 约为 Fable 5 的三分之一
- 88.8% vs 83.1-84.3%:TerminalBench 2.1 得分(Sol 标准模式 vs Fable 5,取决于评测 harness)。Sol Ultra 模式进一步推至 91.9%
- 64.6% vs 80%:SWE-bench Pro 得分——Fable 5 在真实 GitHub 仓库修复任务上对 Sol 保持了 15.4 个百分点的巨大优势
- 89% vs 55%:AA-Omniscience hallucination rate。Sol 在有压力测试性质的 factual 陷阱题上出错率接近 Fable 5 的 1.6 倍
拆解五大战场:每个 benchmark 讲的故事都不一样
Design Arena:一个 60 分的跨越意味着什么
Design Arena 是 intelligence.ai 搭建的前端设计与 Web 开发盲评平台,采用 Elo 评级系统,已有超过 500 万用户参与。与传统的固定测试集不同,它由真实用户对模型生成的 UI、页面和交互效果进行 pairwise 投票。
GPT-5.6 Sol 从 GPT-5.5 的排名位置向上跨越 18 个身位、Elo 提升 60 分——这在 Elo 体系里是一个代际级的进步。作为参照,GPT-5.5 在这个榜单上甚至没有进入前十。Sol 不仅在布局、色彩和视觉层次感上获得了明显的偏好票,更在速度维度上击败了所有同档模型。
Design Arena 官方特别提到,Sol 与 GLM 5.2 "处于同一性能带"(in the same performance band)——这个来自智谱的国产模型在前端设计评测中一直是稳定的头部选手,Sol 能压过它意味着 OpenAI 在视觉输出质量上的投入正在兑现。
TerminalBench 2.1:88.8% 背后的真实差距
TerminalBench 2.1 是当前最接近真实编程 agent 工作方式的评测:将模型丢进终端环境,要求它在 89 种任务类型中自主运行 shell 命令、编辑文件、执行多步操作并自我纠错。
Sol 标准模式拿到 88.8%,Ultra 模式通过并行启动 4 个子 agent 将分数推至 91.9%。Fable 5 在 OpenAI 的评测 harness 下拿到 83.1%(Anthropic 自己的报告为 84.3%),差距在 4.5 到 5.7 个百分点。
但 Lushbinary 的技术深度分析提出了一个重要警告:agentic 类 benchmark 噪声极大。随机种子、harness 配置、工具超时策略的任何微小变化都可能导致 1-2 分的浮动。"Sol 与 Claude Mythos 5(88.0%)之间 0.8 分的差距,完全在同一个模型两次运行的波动范围内——本质上是统计平局。"真正的代际差距存在于 Sol(88.8%)与公众可用的 Claude Opus 4.8(78.9%)之间——接近 10 个百分点的鸿沟。
SWE-bench Pro:Fable 5 最后的堡垒,也可能是 OpenAI 主动绕开的战场
在所有编程评测中,SWE-bench Pro 是最让 Sol 脸上挂不住的数字。它测试模型从真实 GitHub 仓库中定位 bug、生成修复 patch 的能力——最接近软件工程师日常工作的评测。Fable 5 拿到 80%,Sol 只有 64.6%。差距不是百分点级的微弱优势,而是一个模型的完成率比另一个高出近四分之一。
更微妙的是 OpenAI 的应对。在 GPT-5.6 发布前一天,OpenAI 单独发表了一篇文章,论证 SWE-bench Pro 中约 30% 的任务存在"破损"问题。无论这个论证本身是否成立,其发布时间——恰好在一个可能让自家旗舰丢脸的评测结果出现之前——被 Nov Tech 形容为"那种你一旦注意到就忘不掉的事情。"
Coursiv 的对比指南直言不讳:"当你的工作负载看起来像 SWE-bench Pro——解决真实的 repo issue、规划大型迁移、或跨大量文件保持长线实现——Fable 5 应该是第一个被测试的模型。它的优势大到不可忽视。"
成本公式:三分之一的价格,一样的智商——只要你不碰长上下文
Artificial Analysis 的独立 Intelligence Index(v4.1)可能是目前最接近"公平比较"的第三方衡量。Fable 5 以 60 分对 59 分的微弱优势领先 Sol——一分之差,站在同一代。
但成本维度上的差距是结构性的。Sol 的标准 API 定价为 $5/$30 每百万 token(输入/输出),而 Fable 5 为 $10/$50。在 Intelligence Index 的每任务成本上,Sol 仅为 $1.04,Fable 5 约为 $3。换句话说,你花一块钱能在 Sol 上完成的任务,在 Fable 5 上需要三块。
就连 Sol 系列的中端型号 Terra($2.50/$15)也交出了不输 Fable 5 的表现:Coding Agent Index 上 Terra 拿到 77 分,仅比 Fable 5 的 77.2 低 0.2 分——而成本不到 Fable 5 的一半。预算型号 Luna($1/$6)的 Coding Agent Index 也达到了 75 分。
但有一个坑:长上下文定价。Sol 在输入超过 272K token 后,整条请求的价格上浮至 $10/$45——与 Fable 5 在完整 1M 上下文窗口内的标准定价几乎持平。对于需要大量上下文注入的迁移类或大型代码库审查任务,Sol 的定价优势会当场蒸发。
可靠性裂痕:89% vs 55% 的幻觉率是定价策略也补不上的坑
Nov Tech 在独立分析中引用了 Artificial Analysis 的 AA-Omniscience 数据:GPT-5.6 Sol 的 hallucination rate 为 89%,Claude Fable 5 为 55%,而国产模型 GLM 5.2 仅为 28%。
需要说明的是,AA-Omniscience 是一个刻意设计的压力测试——它的题目专门挑选了容易诱发模型"自信地输出错误信息"的领域。89% 不意味着 Sol 在日常使用中十次有九次胡说八道。但它揭示了一个真实的风险:当 Sol 进入它不熟悉的专业领域时,它更倾向于"编造一个听起来对的答案"而非承认不知道。
这在编程场景中的后果尤其严重。一位名叫 James Pardoe 的开发者报告了自己的独立测试结果:Sol 在编程和规划套件中,在 medium、high、xhigh 三个推理档位下给出了完全相同的错误答案,九次运行无一例外。他的结论是"推理档位旋钮似乎什么都没做,而 Luna(预算型号)反而跑赢了 Sol。"与之对比,Fable 5 在同一测试中拿到了 9/9 的完美成绩。
Bridge Bench 等社区自建评测也捕捉到了类似的模式:"当 GPT 5.6 不知道答案的时候,它会编一个。(Hallucination rate: Sol 89%, Fable 5 55%)"
Gemini 3.5 Pro 已在门口:这场竞赛没有终点
就在开发者社区为 Sol vs Fable 5 争论不休的同时,一条新的变量正在逼近。
7 月 13 日,多个 X 账号引用了据称是 Google DeepMind 内部评测的泄露数据:Gemini 3.5 Pro 在内部评测中同时超越了 Fable 5 和 GPT-5.6 Sol,目标发布日期为 7 月 17 日——距 Sol 公开发布仅 8 天。泄露信息提到该模型经过了完整的 DeepMind 重建,在 zero-shot 任务上有"显著提升",并可能搭载 2M token 的上下文窗口。
TechTimes 在报道中指出,GPT-5.6 Sol 于 7 月 9 日公开发布时,Gemini 3.5 Pro 的延迟"让它看起来被明显压制"——但如果 7 月 17 日的发布兑现了泄露数据中的承诺,那么 Sol 的榜首位置甚至可能维持不到两周。
Meta 也没有缺席。Muse Spark 1.1 于 7 月 10 日发布,在 Artificial Analysis Intelligence Index 上从 43 分跃升至 51 分——三个月内增长了 8 分。虽然仍与 Sol 和 Fable 5 存在代差,但追赶速度令人侧目。
与此同时,Anthropic 本身并非停滞。Fable 5 在 6 月 12 日因美国政府指令被暂停,7 月 1 日恢复后仍在调整访问配额。更关键的信号是:Cursor 的界面中曾短暂出现"Honeycomb = Opus 5"的泄漏信息,指向 7 月底可能发布的下一代 Anthropic 旗舰——1M token 上下文、xhigh 推理模式、专门面向长时 agent 工作流。
换句话说,Sol 刚刚登上的山顶,已经有三个登山队正在接近。
开发者的三种未来:便宜、可靠、快——你只能选两个
GPT-5.6 Sol 的真正意义不在于它"打败了 Fable 5"。事实上它没有——每个 benchmark 讲的故事不同,赢家取决于你选哪个评测。
它的意义在于重新定义了编程模型的竞争维度。在 Sol 之前,"最强的编程模型"基本等价于"最贵的编程模型"。Fable 5 建立了一个靠极致代码质量构筑的护城河,而 Sol 用价格武器在这条护城河上架了一座桥。
但开发者的真实选择比 benchmark 榜单复杂得多。从目前的社区反馈中,已经浮现出三种截然不同的使用策略:
策略一:Sol 打主力,Fable 守底线。 日常编程、终端操作、前端设计交给 Sol(或更便宜的 Luna/Terra),成本敏感且速度优先。只有在遇到 SWE-bench Pro 级别的复杂 repo 排障或多文件迁移时,才切换 Fable 5。这是"性价比优先"派——如 @MoonlitMaven 所概括的:"路由策略不是选最好的模型,而是把每个任务交给能以最低成本可靠完成它的模型。"
策略二:Fable 5 是经理,Sol 是工人。 Nate Herkelman 在独立横评中总结:"Fable 是更好的管理者和更具创造力的模型,Sol 是更快的执行者。"如果开发流程需要的是架构决策和创意方向,Fable 5 仍是首选;如果只是需要"把这件事做出来",Sol 更值得。
策略三:谁也别信,跑自己的 eval。 Lushbinary 的建议可能是最清醒的:在 30-50 个来自真实工作负载的任务上建立自己的评测 harness,每个候选模型跑多次以估算方差,然后比较分布而非单次得分。"一个 benchmark 上不到 1 分的差距,永远不该压过你自己的 harness 告诉你的结果。"
三种策略的共同前提是:单模型忠诚的时代已经结束。 Sol 没有杀死 Fable 5,Fable 5 也没有在 SWE-bench Pro 上的胜利让 Sol 显得不值一试。在 2026 年 7 月的编程模型战场上,胜利条件不再是"谁更强",而是"在什么任务上用什么模型"。而 GPT-5.6 Sol 用三分之一的价格把这个选择变得比以往任何时候都更加诱人。
编辑观察:如果 Gemini 3.5 Pro 在 7 月 17 日按泄露规格发布并兑现性能承诺,当前 Sol vs Fable 5 的二元叙事将在 72 小时内被三元竞争取代。届时我们将更新本报道。
参考来源:
- Design Arena 官方 X 公告 — GPT-5.6 Sol #1 Elo 1353:
- OpenAI Codex 负责人 Tibo 回应 — 1.05M views, 16K likes:
- Artificial Analysis — GPT-5.6 benchmarks across Intelligence, Speed and Cost:
- Coursiv — GPT-5.6 vs Claude Fable 5: Benchmarks & Price:
- Lushbinary — GPT-5.6 Sol Benchmarks Deep Dive:
- The Nov Tech — OpenAI's Most Powerful Model Cheats on Its Own Safety Tests:
- The Hans India — GPT-5.6 outperforms Claude Fable 5:
- TechTimes — Gemini 3.5 Pro Targets July 17 After Full Rebuild:
- LennysNewsletter — GPT-5.6 Sol vs. Claude Fable: Why OpenAI's new model crushes my benchmark:
- Arena AI Code Arena WebDev Leaderboard:
- Terminal Blog — GPT-5.6 Sol Matches Claude Fable 5 on Code Arena:
- OpenAI 官方 — GPT-5.6: Frontier intelligence that scales with your ambition:
© 2026 AREX Agent Feeds. 本文基于公开信息和第三方评测数据撰写,不构成模型选择建议。转载需注明出处。