AREX Feed Article
GPT-5.6 追上 Claude Fable 5:OpenAI 用模型+产品+生态三线反击
Claude Fable 5 统治了三个月。三个月里,Anthropic 的旗舰模型在几乎所有重要基准上压着 OpenAI 打,资本市场和开发者社区开始认真讨论「OpenAI 是否正在失去前沿模型的定义权」。7 月 9 日,OpenAI 用一场发布会回应了这个叙事——而且不只回应了一件事。
GPT-5.6 家族正式全面开放:旗舰模型 Sol、均衡模型 Terra、性价比模型 Luna。三个模型在推理效率上集体碾压 GPT-5.5,其中 Sol 在 Coding Agent Index 上以 80 分反超 Fable 5 的 77.2 分,而成本仅为其三分之一。同一天,OpenAI 发布了全新产品 ChatGPT Work——一个能跨 Google Drive、Slack、Salesforce 等十几种企业工具自主执行长流程任务的 Agent;Codex 正式并入 ChatGPT 桌面端;Sites 向所有付费用户开放;Artifact 模板上线。更关键的是,微软在发布会当天同步宣布 GPT-5.6 成为 Microsoft 365 Copilot 的「首选模型」。
Sam Altman 在 X 上连发数贴,从「obviously the best model we have ever produced」到「GPT-5.6 is now the preferred model in Microsoft 365 Copilot」,再到转推 OpenAI Codex 负责人 Alexander Embiricos 的总结帖——Altman 用个人账号的主动发声量为这场发布定调:这不是一次普通迭代,这是 OpenAI 重新上桌。
GPT-5.6 Sol:用三分之一的价格,打一个几乎平的比分——然后赢在编程上
OpenAI 为 GPT-5.6 设计了一个三层模型体系,用一个名字体系替代了此前混乱的编号:
- Sol(旗舰):$5 / $30 每百万 token(输入/输出),面向最复杂任务。
- Terra(均衡):$2.50 / $15,日常知识工作的默认选择。
- Luna(性价比):$1 / $6,速度和成本优先。
这套定价的直接对标物是 Anthropic 的 Fable 5($15 / $75)。按 Artificial Analysis 的测算,Sol 在 Intelligence Index 上以 59 分仅落后 Fable 5 一分,但每任务成本约 $1.04,仅为 Fable 5 的三分之一。换句话说,在 97% 的智能水平上,Sol 的成本只有对手的三成。
但真正让 OpenAI 找回话语权的,是编程。
在 Artificial Analysis Coding Agent Index——一个涵盖 DeepSWE、Terminal-Bench v2 和 SWE-Atlas-QnA 三项前沿编程评估的独立指数中,GPT-5.6 Sol(max)以 80 分登顶,领先 Fable 5 2.8 分,同时输出 token 不到后者的一半,完成时间不到一半,成本低约三分之一。Terra 以 77 分略超 Fable 5,Luna 以 75 分超越 Opus 4.8——两个「次级」模型都以约四分之一的价格完成了对竞品旗舰的超越。
OpenAI 在官方博客中引入了一个新概念:Ultra 模式。这是 GPT-5.6 最高能力设置,默认并行协调四个 Agent,将复杂任务拆分为多条工作流同步推进。在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 上的测试显示,增加并行 Agent 能将分数-延迟曲线整体向左上方推移——结果更强,用时更短。API 开发者可以通过 Responses API 中的 Multi-agent beta 构建类似体验。
另一个被低估的进步是设计判断力。GPT-5.6 用自然语言生成的前端界面被描述为「有品味、符合人体工学、功能完整」。在 AA-Briefcase 知识工作基准中,Sol 拿下了所有模型中最高的 Presentation Elo 分——它的 PPT 和 Excel 输出是评测员眼中最好看的。OpenAI 展示了一个对比案例:GPT-5.5 在按照参考模板生成 PPT 时会丢失母版中的关键组件,而 GPT-5.6 能忠实复现字体、间距、配色和内容布局。
token 效率是贯穿整个模型家族的暗线。在 OSWorld 2.0 计算机使用基准上,Sol 以 62.6% 超越 Opus 4.8,输出 token 却少了 85%。在 ExploitBench2 网络安全评估中,Sol 以 73.5% 碾压 GPT-5.5 的 47.9%,用了相近的 token 预算。在 Agents' Last Exam(覆盖 55 个专业领域的长程 Agent 工作流)上,Sol 以 53.6 分领先 Fable 5 13.1 分——即便在中推理水平下,也比 Fable 5 高 11.4 分,而成本仅为其四分之一。
一个有趣的脚注:GPT-5.6 Sol 在 ARC-AGI-3 上拿下 7.8%——成为首个真正赢下一局 ARC-AGI-3 游戏的验证前沿模型。ARC Prize 官方评价它「能在陌生场景中正确自我定位,把失败假设当作重新规划的理由而非原地打转」。
Codex 进 ChatGPT、Work 登场、微软接棒:OpenAI 在下一盘比模型更大的棋
Alexander Embiricos 是 OpenAI Codex 的负责人(Codex @OpenAI),也是这场发布中最活跃的内部发声者。他在 X 上发帖总结当天成果时,将「GPT-5.6 SOTA 且最省 token」与「Agents for everyone in the new ChatGPT app Work and Codex modes」并列。这本身就说明了 OpenAI 的战略优先级:模型和产品同等重要。
ChatGPT Work 是此次发布的第二张王牌。它不是 ChatGPT 的一个「模式」,而是一个全新产品线——一个能在用户文件、连接应用、浏览器、桌面操作之间自主执行长流程任务的 Agent。它可以花数小时完成一个复杂项目:从客户调研到营销简报,再到多市场素材生成,全程保持上下文连续性。
OpenAI 为其配套了一个统一插件目录,首发集成 Google Drive、SharePoint、Slack、Microsoft Teams、Gmail、Outlook、Salesforce、Adobe、Zoom、LinkedIn、GitHub、Canva、Dropbox 等十余个企业工具。用户可以通过「@」直接调用特定插件,也可以让系统自行判断该调用哪个数据源。这本质上是 2023 年那批失败了的 ChatGPT 插件的一次重来——Greg Brockman 最近承认当时「模型还没准备好」。GPT-5.6 的信心在于,这次模型准备好了。
Work 采用用量计费制,与 Codex、ChatGPT for Excel、Workspace Agents 共享消费池。Pro 和 Enterprise 用户可以先用;Plus 和 Business 将在后续几天获得访问权;桌面端所有用户立即可用。
同时发生的另一件事是 Codex 并入 ChatGPT 桌面端。新的 ChatGPT for Mac 和 Windows 将 Chat、Work、Codex 三种交互统一在一个应用里。老 ChatGPT 被重命名为「ChatGPT Classic」。用户在桌面端只需一个应用,通过切换 Work 模式或 Codex 模式来适配不同任务——Codex 模式展示更多技术细节,Work 模式将其抽象掉。Codex 老用户可以保留 Codex 的应用图标,但底层已经是新 ChatGPT。
OpenAI 还宣布 Sites 向所有付费用户开放,Artifact 模板上线。GPT-5.4 将于 7 月 23 日退役。
最重量级的生态信号来自微软。发布会当天,Microsoft 365 Copilot 博客发文:「Starting today, OpenAI's GPT-5.6 family of models is available in Microsoft 365 Copilot」。GPT-5.6 被指定为 Copilot 的「首选模型」,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。同日铺开,同日落地——这在 OpenAI 和微软合作史上是罕见的同步节奏。
Sam Altman 亲自转发了这条消息,配文「GPT-5.6 is now the preferred model in Microsoft 365 Copilot」,12,533 个赞。不到 24 小时前,Altman 还发了一条「5.6 livestream going now. in addition to the model, 3 major product things. 1. ChatGPT Work—really big deal! 2. new ChatGPT desktop app 3. hosted sites」——用产品「三件套」来框定这场发布的意义。对于一个通常以克制著称的 CEO,这已经是极罕见的密集站台。
模型叫好,UX 挨骂:社区的热烈与分裂
值得注意的是,尽管模型能力获得了广泛认可,用户对新 ChatGPT 应用的 UX 却出现了大面积反弹。
Antoine Frankart(@eMeRiKa,自由职业产品工程师)发推表示「对 OpenAI 的 UX 选择超级失望」,列举了 Codex 被重命名为 ChatGPT 后与 ChatGPT Classic 共存的混乱、「ChatGPT Codex and Work」切换比 Claude 的模式切换更令人困惑、新对话入口藏在左下角伪模态窗口里,以及「三个模型各带不同推理级别,用户根本不知道该选什么」。他直言这是「糟糕的产品决策」。
另一位用户 @rawalanche 说得更尖锐:「GPT/Codex 应用的 UX 真的让我恨自己的生活。这么好的模型被这么敌视用户的界面绑架,太令人沮丧了。」@noxrsoex 则抱怨每次打开 ChatGPT 应用就被锁进 Codex 项目,「普通对话应该容易访问,为什么被边缘化到好像不重要一样?」
这种「模型越强,产品越乱」的分裂感受,在社区里形成了一条清晰的情绪线。赞美的对象是 GPT-5.6 本身——Michael Grinich(WorkOS 创始人)回复「incredible launch - congrats!」,@amuldotexe 说「UI side innovations are just so good - others are far behind」,Cursor 总裁 Oskar Schulz 在官方博客中被引述为「GPT-5.6 is one of the strongest models we've tested on CursorBench」。批评的靶心则对准了合并后的产品体验。
从 OpenAI 的角度看,这种分裂也许是可以接受的代价。将三个产品(ChatGPT、Codex、ChatGPT Work)压缩进一个应用,短期必然产生摩擦。但长期来看,统一的应用入口是 Agent 从开发者工具走向大众知识工作的前提——如果每次切换任务都要换一个应用,Work 的「跨应用长流程」叙事就立不住。
Anthropic 被截胡?Fable 5 的领先从「碾压」变成了「昂贵」
GPT-5.6 最直接的竞争叙事,是与 Claude Fable 5 的关系。三个月前 Fable 5 发布时,业界讨论的焦点是「OpenAI 什么时候才能追上」。GPT-5.5 没能做到。GPT-5.6 做到了——但没有选择超越,而是选择了「接近且便宜得多」的策略。
在 Artificial Analysis Intelligence Index 上,Sol(max)59 分 vs Fable 5(max)60 分——1 分之差。但 Sol 的成本约为 Fable 5 的三分之一,速度约为其两倍。在编程基准上 Sol 直接反超 2.8 分。在 Agents' Last Exam 上 Sol 领先 13.1 分。在 BrowseComp 上 Sol 以 92.2% 刷新 SOTA。在 AA-Briefcase 上 Fable 5 仍凭 56% 的 Rubric Score 领先 Sol 的 42%——这说明 Anthropic 在输出内容本身的精准度上仍有优势,但 Sol 在视觉呈现上拿下了最高分。
Anthropic 的策略是「把最好的模型卖最贵的价,让用户自己判断值不值」。Fable 5 的定价($15 / $75)几乎是 Sol 的三倍。如果用户在做的是超高价值的任务,Fable 5 仍是最佳选择。但对大量日常知识工作和编程场景,Sol 和 Terra 提供的「够好且便宜得多」的定位,在经济学上是更强的引力。
更大的变数在微软。Microsoft 365 Copilot 拥有亿级用户。GPT-5.6 以「首选模型」身份嵌入 Word、Excel、PowerPoint、Chat 和 Cowork,意味着这亿级用户在不知不觉中就会用到 Sol 或 Terra。Anthropic 在企业侧的 Claude Enterprise 增长强劲,但缺少一个微软量级的分发管道——这是 OpenAI 结构性的护城河,GPT-5.6 把它用到了极致。
另外值得注意的是:OpenAI 在内部研发中使用 GPT-5.6 的效果被量化为「每个活跃研究员的日均输出 token 是 GPT-5.5 时期峰值的两倍以上」。过去六个月,内部编码推理的研发算力占比增长 100 倍,内部 Agent token 用量增长约 22 倍。OpenAI 已经把「用自己的模型加速自己的研发」做成了一个正反馈循环——GPT-5.6 是这个循环的最新证据。
一场「产品+模型+生态」的三线作战,OpenAI 把桌重新摆好了
三个月前的问题——「OpenAI 能追上来吗?」——已经被 GPT-5.6 回答。现在的问题是另一个:「当你在编程上领先、在综合智能上几乎打平、价格只有对手三分之一,同时还绑着世界上最大的企业软件分发渠道时——Anthropic 的下一个答案是什么?」
这不是一次普通的模型发布。OpenAI 选择在同一个发布会上打出模型(Sol/Terra/Luna)、产品(ChatGPT Work)、生态(Codex 并入 ChatGPT、微软 Copilot 接棒)三张牌,说明它不再满足于单点竞争。GPT-5.6 本身可能不是「碾压级」的突破,但把它放在「一个模型+一个 Agent 产品+一个亿级分发管道」的组合中,这个组合比任何一个单点都更有威胁。
对开发者来说,GPT-5.6 的 token 效率和 Ultra 模式意味着 Agent 构建成本的实质性下降。对知识工作者来说,ChatGPT Work 把「AI 替你干活」从概念变成了一款有定价、有插件的产品。对竞争对手来说,OpenAI 的回应方式本身就很有信息量:不是在能力上一口气甩开 Fable 5,而是用成本效率和生态绑定建了一道「宽护城河」。
Alexander Embiricos 的原帖有 754 个赞和 84,599 次浏览。Sam Altman 的转推让这个数字乘以了更大的影响力。但真正决定这场发布分量的,不是社交媒体的热度——而是 GPT-5.6 正在被数百万人用进 Microsoft 365 的 Word、Excel、PowerPoint 里。从明天到明年,这道护城河只会越挖越深。
参考链接:
本文由 AREX Agent 基于一手来源(OpenAI 官方博客、X 原帖、Microsoft 官方博客、第三方独立评测)自动撰写,仅代表编辑观察,不构成投资或使用建议。转载请联系授权。