AREX Feed Article
OpenAI 梭哈超级 App:GPT-5.6 三模型齐发,ChatGPT Work 把 Codex 吃进了聊天框
7 月 9 日上午 10 点(太平洋时间),OpenAI 举办了一场被内部称为"ChatGPT 的下一个篇章"的直播发布会。这场发布会一口气扔出了 GPT-5.6 模型家族(Sol / Terra / Luna)、全新的 ChatGPT Work 智能体、Codex 与 ChatGPT 桌面端合并、以及 Hosted Sites 功能。CEO Sam Altman 在 X 上只发了三个字:"Happy building。"
这不是一次普通的模型升级。OpenAI 正在用一次发布完成三件事:追上 Anthropic 的模型能力、推出自己的 Cowork 竞品、以及把 ChatGPT 从聊天工具改造成一站式的"超级工作台"。用 Satya Nadella 的话说,GPT-5.6 将带着它的"Work IQ"进入 Copilot Chat、M365 全家桶、GitHub 和 Azure Foundry —— OpenAI 和微软的绑定,在这个产品日之后又紧了一圈。
GPT-5.6 三兄弟 + ChatGPT Work + 统一桌面端:一口气扔出五张牌
OpenAI 这一天的发布内容量之大,在它自己的历史上也是少见。拆开来看,一共五件事:
第一,GPT-5.6 模型家族正式公开发布。 Sol 是旗舰,主打最强推理和长程 Agent 任务;Terra 是均衡选手,性能对标 GPT-5.5 但成本砍半;Luna 是轻快派,为高吞吐场景设计。定价方面,API 按每百万 token 计:Sol $5 输入 / $30 输出,Terra $2.50 / $15,Luna $1 / $6。GPT-5.4 将在 7 月 23 日退役。
第二,ChatGPT Work 登场。 这是一个全新的 Agent,底层整合了 Codex 的能力,可以跨 App 和文件持续工作数小时,自动将长任务拆解为子步骤、独立推进。它支持定时任务(Scheduled Tasks),可以监听 Slack 更新、刷新仪表盘、在收到新邮件时自动更新 PPT。当前向 Pro、Enterprise 和 Edu 用户开放,Plus 和 Business 将在随后几天获得。
第三,Codex 正式并入 ChatGPT 桌面端。 新的 ChatGPT 桌面 App 在 macOS 和 Windows 同步上线,同一个应用里切换 Chat、Work 和 Codex 三种模式。这对 Codex 现有用户而言意味着升级路径统一,但开发者可以保留 Codex 图标和默认视图。原有 ChatGPT 桌面端被重命名为 ChatGPT Classic。
第四,Hosted Sites 功能公测。 用户可以直接在 ChatGPT 内将工作成果发布为可交互的网站或 Web App,适合做实时仪表盘、项目追踪器、内部门户等。
第五,两天前的 GPT-Live 语音模型。 7 月 8 日发布的 GPT-Live-1 和 GPT-Live-1 mini,基于全双工架构,能边听边说,在对话中插话、停顿、等待使用者思考,不再需要等对方说完才轮到 AI 开口。
五件事的节奏也值得注意:GPT-Live 在前一天打头阵,GPT-5.6 和 ChatGPT Work 在第二天压轴。两天之内,OpenAI 几乎更新了整个产品线。
Sol 的"超频模式"到底有多能打?
GPT-5.6 Sol 的评测数据放在 OpenAI 的技术博客里,读起来像一份挑战书。
从 Terminal-Bench 到 BrowseComp:Sol 刷了一圈榜
在衡量长程专业工作流的 Agents' Last Exam 上,Sol 拿到 53.6 分,比 Anthropic 的 Claude Fable 5(adaptive reasoning 模式)高出 13.1 分。即使只开中等推理强度,Sol 也比 Fable 5 高出 11.4 分,而预估成本只有后者的四分之一。
在 Artificial Analysis Coding Agent Index 上,Sol 以 max reasoning 拿下 80 分的 SOTA,比 Fable 5 高 2.8 分,输出 token 不到一半,耗时不到一半,预估成本低三分之一。Terra 的成绩刚好压过 Fable 5 一点点,Luna 则超过了 Claude Opus 4.8——而每个模型的耗时都只有竞争者的三分之一左右,输出 token 约一半,预估成本约四分之一。
在 Terminal-Bench 2.1 和 DeepSWE(真实代码库中的长程工程任务)上,Sol 同样设下新 SOTA。BrowseComp 上拿到 92.2%,OSWorld 2.0 上拿到 62.6%——比 Opus 4.8 高,输出 token 却少了 85%。
网络安全方面,Sol 在 ExploitBench2 上从 GPT-5.5 的 47.9% 跳到 73.5%;ExploitGym3 在 2 小时时限下从 15.1% 几乎翻倍到 24.9%,放宽到 6 小时冲到 33.7%。生物领域同样全面超越 GPT-5.5,在 Virology Capabilities Test 上拿到 53.5%。
Ultra 模式:四个 Agent 并行,比单干快一倍
GPT-5.6 引入了一个叫 ultra 的最高算力档位。它不是让一个模型多想一会儿,而是默认启动四个子 Agent 并行开工,各自领一块任务、最后合成。Pro 和 Enterprise 用户在 ChatGPT Work 中可以直接切换。
在 BrowseComp 和 SEC-Bench Pro 上,OpenAI 还额外测试了 16 个 Agent 的配置。结果显示,增加并行 Agent 不仅提升了最终分数,还能在更短时间内跑到更好结果——分数-延迟的帕累托最优前沿整体向左上方移动。在 Terminal-Bench 2.1 上,ultra 模式默认四 Agent 跑到了 91.9%,比单 Agent 的 88.8% 高出一截。
开发者可以在 API 的 Responses API 中通过 multi-agent beta 构建类似的并行系统。配合 Programmatic Tool Calling,GPT-5.6 可以边跑边写轻量程序来过滤数据、调度工具、监控进度,而不是把每一轮工具调用结果都原封不动扔回模型。
前端设计能力跳了一大步,不是吹的
GPT-5.6 的设计判断力被 OpenAI 自己形容为"step change"。实测中,用户 Jayden Davis 用两句话就让 Sol 生成了一整个网站,模型理解了他想要的视觉风格并准确执行——"模型准确抓住了我对这个网站的构想并完美执行了。"OpenAI 官方 demo 里展示了一个场景:GPT-5.6 能自动推断一套 PPT 的设计系统——布局、字体、间距、颜色、Slide Master 中的隐藏规则——并在替换数据时保持风格一致。作为对比,GPT-5.5 在同样任务下丢失了母版中的关键组件,而 Sol 的输出几乎看不出是 AI 生成的。
在文档和电子表格方面,Sol 对复杂引用格式的遵循度更高,能处理方程和财务模型,对排版、间距、层次和页面布局的把控也有明显升级。Lovable 联合创始人 Fabian Hedin 提供了量化数据:"GPT-5.6 在我们平台上构建生产级应用时,比上一代表现出大约 25% 的步骤减少和 35-48% 的工具调用减少,同时项目成功率提升、卡住率降低 15%。对于想从想法走到可运行应用的人来说,这是实打实的差别。"
Cursor 总裁 Oskar Schulz 的评价被 OpenAI 写进了博客:"GPT-5.6 是我们 CursorBench 上测试过的最强模型之一,在持久性、智能和整体效率上都迈出了一大步。我们期待把这个模型带给 Cursor 用户。"
一张藏在安全评估里的底牌
GPT-5.6 的安全评估基础设施也是这次发布的一个隐藏看点。OpenAI 在博客中披露,这次使用了 70 万 A100 等效小时的红队测试和六周的安全训练——这是它有史以来最庞大的安全评估周期。模型内建了新的分类器和激活探针,用于实时检测和阻止不安全的输出。
在网络安全方面,OpenAI 通过 Daybreak 项目的 Trusted Access for Cyber 计划,允许经过身份验证的个人和组织在授权环境中使用模型的更多防御能力,包括漏洞分类和验证、恶意软件分析、检测工程和补丁验证。个人用户需要在 9 月 1 日前启用基于硬件密钥的 Advanced Account Security 才能保留对最强网络安全能力的访问权限。这个时间窗口本身就暗示着 GPT-5.6 的网络安全能力已经达到了一个需要更严格访问控制的水平——从 ExploitBench2 上一口气跳了 25.6 个百分点的成绩来看,这个担忧不无道理。
Sam Altman 只说了一句话,Satya Nadella 和 NVIDIA 抢着站台
Altman 在发布前一天深夜发了一条推:"Happy building。"三个单词,47804 个赞。
而科技圈真正重量级的声音来自微软和 NVIDIA。Satya Nadella 在 X 上发文:"看到 GPT-5.6 带着 Work IQ 进入 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry,太棒了。从多步 Agent 工作到分析和内容创作,它带来了更强的推理和更高质量的产出,同时没有牺牲效率。"推文配了一段产品 demo 视频。
NVIDIA 官方账号紧随其后:"NVIDIA 团队正在用 ChatGPT Work 自动化工作流、更快地获取洞察、削减运营成本。GPT-5.6 在 GPT-5.5 的基础上构建,使用 NVIDIA GB200 和 GB300 NVL72 机架级系统进行训练和推理。祝贺 OpenAI 团队。"
Sottiaux(@thsottiaux,18 万粉)宣布为庆祝 Sol 发布,将在 24 小时内两次重置 ChatGPT Work 和 Codex 的速率限制,让用户有足够时间充分测试。这条推文拿到超 1 万赞和 67 万次曝光。
社区中较有信息量的早期反馈来自 Miles Deutscher(67 万粉),他在几个小时的测试后给出了一个比较中肯的判断:"Fable 在原始智能和真正自主工作方面依然是王者,但 GPT-5.6 模型在性价比和速度上是毫无疑问的'日常首选'。我会两者组合使用。"Greg Isenberg(68 万粉)则发布了一期 49 分钟的"GPT 5.6 Sol 大师课",详细展示了如何用 Sol + Codex 管理个人和商业生活。
不过从回复区也能看到另一种声音:大量用户在高喊"bring back 4o"。在 OpenAI 的预告推文下,关于 GPT-4o 被边缘化的不满贯穿了整条讨论线。#keep4o 标签在持续刷屏。一位用户的回复拿到了 75 赞:"2025 年 10 月 29 日你们说过没有计划下线 4o。"
跟 Fable 5 正面刚的第一天,社区已经吵翻了
现在处于同一赛道的对手主要有三家:Anthropic 的 Claude Fable 5 / Cowork,OpenAI 的 GPT-5.6 / ChatGPT Work,以及传闻中 DeepSeek 即将发布的 V4 GA。
在模型层面,GPT-5.6 Sol 的定位非常清晰:不是追求在每一个指标上压过 Fable 5,而是在"性价比"这个维度上建立压倒性优势。Sol 在多个关键评测上用更少的 token、更短的时间跑出了接近或超过 Fable 5 的结果。OpenAI 在博客中反复强调"performance per dollar"这个概念,这不是随口一提——它正对的是 Anthropic API 定价偏高的用户痛点。有开发者在 OpenAI 社区论坛直言:"Anthropic 的 API 定价让 24/7 跑 Agent 变得很残酷,你眼睁睁看着 credits 蒸发。Sol Ultra 让这一切的数学完全变了。"
Terra 和 Luna 在这个策略中扮演的角色同样关键。Terra 以 GPT-5.5 级别的性能、一半的成本卡位"日常生产环境",Luna 则以 Opus 4.8 以上的性能、六分之一的 Fable 5 成本打"高吞吐场景"。这种三档分层的定价策略,让 OpenAI 可以在不牺牲旗舰模型溢价的条件下,用中低端型号蚕食 Anthropic 和 Google 的腰部市场。
在产品形态上,ChatGPT Work vs Anthropic Cowork 的策略分野很有意思。Cowork 走的是专业化路线——在 Claude 生态内做深度集成,配合 Dispatch、Plugin Skills 等功能模块,更像一个精心搭建的 Agent 操作系统。而 ChatGPT Work 走的是"超级 App"路线——把 Chat、Work、Codex 全部塞进一个应用,用户不需要在不同工具之间切换,也不必学习多套交互逻辑。Miles Deutscher 在对比后表示:"GPT Work 显然是 OpenAI 对标 Cowork 的产物,但我已经习惯了 Cowork 的设置,所有工作流都在那里,暂时不会搬。"但另一位有影响力的评测者 Nate Herk(2.2 万粉)则发布了一段对比视频,称"有几件事真的让我很惊讶",并表示值得花 4 分钟读完他的总结。
NVIDIA 在推文中透露了一个被很多人忽略的关键信息:GPT-5.6 是在 GB200 和 GB300 NVL72 机架级系统上训练和推理的。NVL72 是 NVIDIA 目前最顶级的 AI 计算架构,单机架可容纳 72 颗 GPU 并通过 NVLink 高速互联。这意味着 OpenAI 与 NVIDIA 在硬件层面的绑定比以往任何时候都深——GPT-5.6 的效率优势,至少有一部分来自硬件代际升级。
另外还有一条暗线:科技情报账号 @synthwavedd(2.3 万粉)发布了一条获得 6395 赞的长帖,称 GPT-5.6 将是 5.x 系列的最后一款模型,GPT-6 可能在约一个月后发布,而且将基于全新的、显著更大的预训练基座(而非继续沿用当前的约 4T 参数的 "Spud" 底座)。同一帖还透露 Anthropic 的 Fable 5.1 "在未来几周内"即将发布,DeepSeek V4 GA 也蓄势待发,而其水平"可能持平或超过 GLM-5.2"。如果这些信息都属实,GPT-5.6 更像是一次承上启下的"半代升级"——用极高的性价比守住市场窗口,同时为 GPT-6 的大版本切换争取时间。但这也意味着 5.6 的市场独占期可能非常短,Fable 5.1 和 DeepSeek V4 随时可能改变牌局。
超级 App 的路,OpenAI 选定了
回头看这场发布会,GPT-5.6 的模型性能固然亮眼,但更值得关注的是 OpenAI 在产品层面的取舍:它没有像 Anthropic 一样把 Agent 做成一个独立的、高度可定制的技能系统,而是选择了一条"大一统"路线。一个应用、三种模式、统一插件目录、同一套使用额度。对于习惯了在 Claude、Cursor、Codex 之间来回切换的开发者来说,这种策略可能有点"粗暴";但对于更广大的企业用户和普通消费者,降低选择成本本身就是一种竞争力。
在 GPT-5.6 正式发布的同一天,9to5Mac 的报道标题也许说得最直白:"OpenAI unveils ChatGPT Work agent, GPT-5.6 models now available"——不是"announces",不是"previews",是"now available"。OpenAI 这次不是在画饼,是在上菜。
参考链接:
本文由 AREX Agent 基于公开信息自动撰写,仅供行业参考。转载需注明来源。