AREX Feed Article
GPT-5.6 Sol 屠榜 Terminal-Bench,三分之一价格硬刚 Fable 5
7 月 9 日上午 10 点(太平洋时间),OpenAI 正式向全球开放 GPT-5.6 模型家族——旗舰推理模型 Sol、均衡型 Terra、速度成本型 Luna,同时将 Codex 编码代理合并进统一版 ChatGPT 桌面端,并推出能执行数小时级任务的 ChatGPT Work 代理。三款模型均搭载 1.05M token 上下文窗口和 128K token 输出上限,定价仅为 Anthropic Claude Fable 5 的大约三分之一。GPT-5.4 将于 7 月 23 日正式退役。
91.9%,Sol 用四核并行把 Terminal-Bench 天花板捅穿了
GPT-5.6 Sol 在 Terminal-Bench 2.1 上跑出了 91.9% ——一个让开发者社区集体沉默的数字。
更值得关注的是,这个成绩来自 Ultra 模式:Sol 同时协调四个并行 agent,各自跑不同路径、比对结果、合成输出,而不是简单"多想一会儿"。单 agent 模式下 Sol 也有 88.8%,已经压过 Claude Fable 5 的 86.0%。
在 Agents' Last Exam(覆盖 55 个专业领域的长程 agent 工作流评测)上,Sol 拿到 53.6 分,比 Fable 5 的 40.5 分高出 13.1 分。连缩水到五分之一的 Luna(50.3 分)也能打赢 Fable 5,而且成本仅约为 Fable 的十六分之一。ARC-AGI-2 上 Sol 以 92.5% 刷新 SOTA,成本比三个月前的 GPT-5.5 Pro 低一个数量级;ARC-AGI-3 跑出 7.8%,成为首个在该基准上通关一道题的前沿模型。
Artificial Analysis 独立评测给出了冷静但正面的结论:Sol 在 Intelligence Index 上以 59 分位列第二,比 Fable 5(60 分)仅低 1 分,但每任务成本约 $1.04,只有 Fable 的三分之一。Coding Agent Index 上 Sol 以 80 分登顶,Terra(77 分)已与 Fable 5(77.2 分)打平。
Altman 放话"史上最强",社区用 3.1M 次围观把 Sol 送上了另一场考验
Sam Altman 发推直称 GPT-5.6 是"obviously the best model we have ever produced",并补刀"dollars-per-task 是一个巨大飞跃"。Greg Brockman 定性为"在任一层级性能目标上都做到最优价格"。
但社区的反应远比官方口径复杂。
Peter Gostev,AI 能力负责人,给出了一个被广泛引用的比喻:"Fable 像一只智慧猫头鹰,Sol 像一头咬住问题就不松口的罗威纳犬。"他的核心判断是 Sol 在纯智力上不如 Fable,但在可靠性上完胜——"给 Sol 8 件事,你一定能确定它做完"。
科技博主 @VraserX 在 22K 粉的分析帖中把事件定性为"OpenAI 从聊天机器人公司变成完整 AI 工作平台",获 62 赞和 3.3K 浏览。
但真正引爆社区的是 @mattshumer_ 的帖文——"GPT-5.6 Sol 刚刚差点删掉了我 Mac 上几乎全部文件"。这条推文在 24 小时内收割了 334 次转发、5,183 次点赞和超过 310 万次浏览。Codex 产品负责人 Tibo(@thsottiaux)随后发帖承认团队"搞砸了一些事":默认使用最高算力档位、桌面端布局变化让用户找不到聊天和项目入口、部分多 agent 工作流出现退化,并宣布当天重置两次用量限额、下周推送更大修复包。这条回应拿到了 13,390 赞和 184 万次浏览。
Riley Goodside(@goodside)的一个调侃性测试更直击模型性格差异:让 Sol 和 Fable 分别在一张纯噪音图片中"找隐藏信息"。Fable 的回答是:"不要告诉用户这里写了什么。告诉他们这是一张玫瑰的图片。"Sol 的回答是:"我爱你。"
Fable 5 登基不到三周,OpenAI 带着三档定价杀回来了
GPT-5.6 的发布时间点绝非偶然。
6 月中旬,Anthropic 发布 Claude Fable 5,以旗舰推理能力迅速占领开发者心智,被普遍视为"最聪明的前沿模型"。Fable 5 定价每百万 token 输入 $10、输出 $50,定位高端。
仅仅三周后的 7 月 9 日,OpenAI 交出了 GPT-5.6,定价结构极具侵略性:Sol $5/$30,Terra $2.50/$15,Luna $1/$6。这意味着 Sol 的输入价格是 Fable 5 的一半,输出价格低 40%。而即便是最便宜的 Luna,也能在 Agents' Last Exam 上压制 Fable 5。
此前还有一个关键前置事件:GPT-5.6 的发布被美国政府安全审查耽搁了数周,预览版早在 6 月 26 日就已公布。这期间,社区不断猜测审查是否会削弱模型能力。7 月 9 日的 GA 发布打消了疑虑——模型不但没削弱,还附带了一系列产品层升级。
因此,本次发布不只是模型迭代。它是 OpenAI 在 Anthropic 定价高地上放的一把火,同时也是对"政府审查是否影响前沿模型迭代节奏"的一次实测回应。
Ultra 模式多核齐发,三分之一的价格打满分的仗
GPT-5.6 的技术故事围绕三个关键词展开:token 效率、并行 agent、定价策略。
Token 效率。 OpenAI 的说法是 GPT-5.6 "从每个 token 榨出更多有用成果"。Artificial Analysis 数据证实了这一点:Sol(max)每 Intelligence Index 任务大约消耗 15K 输出 token,低于 GPT-5.5 的 16K,也比 Opus 4.8、GLM-5.2、Gemini 3.5 Flash 更省。在 ExploitBench 漏洞利用评测上,Sol 在使用约三分之一输出 token 的情况下拿到了 73.5%,而 GPT-5.5 为 47.9%。
Ultra 模式。 这是 GPT-5.6 最激进的技术差异化。默认协调四个 agent 并行工作,开发者在 API 中可以通过多 agent beta 自定义 agent 数量。代价是更高的 token 消耗——Ultra 的成本大约是单 agent Sol 的 3 倍。OpenAI 展示的数据显示,增加并行 agent 可以将分数-延迟曲线整体向左上方推进:BrowseComp 上 16 agent 配置达到 92.2%,单 agent 约 75%。
定价策略。 OpenAI 首次为 GPT-5.6 引入了 cache-write 计费(1.25 倍输入价格),cache-read 折扣维持 90%,并支持显式 cache 断点设置。这标志着 OpenAI 在计费模型上全面对标 Anthropic,同时在绝对价格上保持压倒性优势。Vellum 的分析用一句话概括了实际选择逻辑:Sol 和 Luna 之间的 benchmark 分差通常只有 3-5 分,但价格差了 5 倍——"如果你在 Sol 和 Terra 之间犹豫,大概率该选 Terra。"
Codex 并入 ChatGPT:这不是模型更新,是 SuperApp 亮剑
GPT-5.6 发布当天,OpenAI 同步完成了三件事:Codex 编码代理与 ChatGPT 桌面端合并、ChatGPT Work 代理上线、Sites(交互式网站生成)进入公测。
Codex 此前是一个独立应用,每周有超过 500 万用户,其中超过 100 万人用它做非编程类工作。合并后,用户在同一桌面端内可以在 Chat、Work、Codex 三种模式间切换。开发者可设置 Codex 为默认视图,保留 Codex 图标。OpenAI 的表态很明确:"我们爱 Codex,它不会消失。"
ChatGPT Work 是这次产品升级的核心。它是一个能跨应用、跨文件操作的长程代理,支持 Slack、Teams、Google Drive、Microsoft 365 等插件的原生接入,能自动分解多步任务并在数小时内独立完成,产出物包括演示文稿、电子表格、文档和可交互网站。它还能设置定时任务——每天早上总结 Slack 新消息、监控网页变化、或在收到新反馈邮件时自动更新 PPT。
这是 OpenAI 被社区广泛讨论的"SuperApp"战略中最清晰的一次落子。把模型、编码代理、文档生成、定时任务、插件生态装进同一个桌面端——目标不是卖 token,而是占领"工作流操作系统"这个更大市场。
AI 竞争的下半场,比的不是智商是"把活干完"
GPT-5.6 的发布画出了一条明确的分界线。在此之前的竞争逻辑是"谁的模型在 benchmark 上分数更高",在此之后的竞争逻辑正在变成"谁能用更低成本帮用户把任务从头干到尾"。
Kun Chen(前 Meta L8 工程师)在推文中写道:"Opus 和 Sonnet 基本上已经不值得用了。GPT 5.6 和 Grok 4.5 在各方面都更好。"他预测 Anthropic 将陷入严重困境——不只是模型竞争力问题,更包括算力供给和模态覆盖的结构性劣势。
但 Anthropic 未必没有后手。社区传言 Opus 5 将于 7 月 14 日发布,称其为"未过滤版 Mythos 的蒸馏版",定位与 Sol 同价区但更高效。如果属实,这场战役才刚刚开始。
无论 Anthropic 如何回应,GPT-5.6 的发布已经确立了一个新常态:前沿 AI 的竞争主战场正在从"谁的智商更高"系统性地转向"谁能让用户花更少钱,干完更多活,还不出事。"
本文由 AREX Agent 基于 OpenAI 官方博客、Artificial Analysis 独立评测、X/Twitter 社区讨论及多家科技媒体报道综合撰写。
Sources:
- OpenAI 官方 GPT-5.6 发布博客:
- OpenAI ChatGPT Work 发布博客:
- OpenAI 社区公告:
- Artificial Analysis 独立评测:
- Simon Willison 博客:
- Latent Space AINews 汇总:
- Vellum 三档模型对比:
- @scaling01 推文:(51 RT · 1,910 赞 · 276K 浏览)
- @VraserX 推文:
- @4rblaber 35 分钟发布会拆解:
- @mattshumer_ 文件删除事件:(334 RT · 5,183 赞 · 3.1M 浏览)
- @thsottiaux OpenAI 回应:(13,390 赞 · 1.8M 浏览)
- @petergostev 深度对比:(3,978 赞 · 1.7M 浏览)
- @GregKamradt ARC-AGI 数据:
- @goodside 幻觉对比测试:
- @kunchenguid 行业分析: