AREX Feed Article
GPT-5.6 三模齐发,Altman 放话「54% 更省 Token」,编码王座一夜易主
TL;DR:7 月 9 日,OpenAI 结束 12 天美国政府审查,正式公开发布 GPT-5.6 系列——旗舰 Sol、均衡型 Terra、低成本 Luna 三级模型,外加一个能自主跑数小时复杂任务的新产品 ChatGPT Work。Sol 在 Coding Agent Index 以 80 分登顶,Luna 以不到一半成本逼近 GPT-5.5 巅峰性能。Sam Altman 接受 CNBC 专访时宣称 agentic coding 场景下 Token 效率提升 54%。但 SWE-Bench Pro 上 Sol 仍落后 Claude Fable 5 约 15 分,定价策略引发的社区争议同样激烈。
Sol/Terra/Luna 三级定价,直接把战线烧到了 Fable 5 脚下
7 月 9 日上午 10 点太平洋时间,OpenAI 正式结束 GPT-5.6 长达 12 天的政府受限预览,面向全球公开发布。Sam Altman 在 X 上称其为「显然是我们生产过的最好的模型,也是我们写过的最好的博客文章之一」——这条推文获得 9100+ 点赞。
三级模型同日上线 ChatGPT、Codex 和 API:Sol 定价 $5/$30(输入/输出,每百万 Token),Terra 定价 $2.50/$15,Luna 定价 $1/$6。作为对比,Anthropic 的 Claude Fable 5 定价 $10/$50——Sol 的价格不到它的一半,Terra 和 Luna 更只有它的四分之一和八分之一。
OpenAI 同步推出 ChatGPT Work——一个由 GPT-5.6 和 Codex 驱动的自主 Agent,能在桌面端跨应用操作,连接 Google Drive、Slack、GitHub 等第三方工具,单次任务可运行数小时。这标志着 ChatGPT 从对话助手向自主工作代理的关键转型。
Altman 喊话、Tibo 道歉、Arena 连夜上榜
社区反应在发布 24 小时内呈现出了完整的情绪光谱。
Sam Altman,OpenAI CEO——在 CNBC 专访中抛出了发布当日最具传播力的数字:GPT-5.6 在 agentic coding 任务上比竞争对手 Token 效率高 54%。他在 X 上高调宣称「最好的模型 + 最好的博客」,该推文获得 785 次转发、9100+ 点赞。
Tibo(Thomas Sottiaux),OpenAI Codex & ChatGPT 负责人——发布次日发长文承认翻车:「我们让用户太容易选择最高算力模式,却没有清楚提示对用量上限的影响」「桌面端一次大改版让聊天和项目入口变得难找」「部分 Codex 老用户感觉 Codex 要被淘汰——绝对不是我们的本意」。他宣布当天两次重置用量上限作为补偿,并承诺下周推出更大规模修复。这条「道歉 + 补救」推文获得 1 万+ 点赞。
Cursor——官方账号宣布 GPT-5.6 全系已上线 Cursor,Sol 在 CursorBench 得分 67.2%。其总裁 Oskar Schulz 评价:「这是开发者在持久性、智能和整体效率方面令人兴奋的一步。」
Arena.ai(原 LMArena)——发布次日放出重磅:GPT-5.6 Sol 在 Code Arena 前端开发榜与 Claude Fable 5 并列 #1,这是 OpenAI 模型首次登顶该榜单。从 GPT-5.5 的 #18 跃升至 #1,幅度惊人。
NVIDIA——官号发推祝贺,透露 GPT-5.6 在 GB200 和 GB300 NVL72 机架级系统上训练和运行。
ARC Prize——宣布 GPT-5.6 Sol 在 ARC-AGI-3 上以 7.8% 创下新纪录,是首个验证能击败至少一道 ARC-AGI-3 题目的前沿模型。
12 天白宫审查:GPT-5.6 被迫当了回「自愿」人质
GPT-5.6 的公开发布比原计划晚了近两周。6 月 26 日,OpenAI 预览了 GPT-5.6 系列,同时应白宫国家网络总监办公室和科技政策办公室的请求,将访问权限限制在约 20 个经政府审核的组织——这是美国 AI 实验室首次将前沿模型限制在政府批准的客户名单内。
这一安排基于特朗普 6 月 2 日签署的行政令「促进先进人工智能创新与安全」,行政令明确声明不创设任何强制性的政府许可或预审查要求——但实际执行却是另一回事。商务部下属的 AI 标准与创新中心(CAISI)完成了额外评估,OpenAI 工程师被派往华盛顿随时待命回答问题。直到 7 月 9 日,白宫发言人对 CNBC 表示政府并未给予「绿灯、批准或放行」——但 OpenAI 终究发布了。
Anthropic 的先例让 OpenAI 选择主动配合。4 月,Anthropic 自愿限制 Mythos 模型访问;6 月 9 日发布 Fable 5 后仅三天,商务部依据《出口管制改革法》发出强制指令,要求 Anthropic 暂停全球所有外国公民的访问权限,导致 Fable 5 和 Mythos 5 全线下线 19 天。GPT-5.6 选择了「先排队再发布」的路线——用 Axios 消息源的话说:「这种级别的模型,就是这样了。」
编码登顶,SWE-Bench 却差了 15 分——Sol 的软肋在哪儿?
GPT-5.6 的技术故事由三个关键词驱动:效率、分层、Agent 化。
「Token 更少,产出更多」是贯穿全系的主线。 GPT-5.6 Sol 在 Artificial Analysis Intelligence Index 以 59 分排在 Claude Fable 5(60 分)之后仅 1 分,但每次任务成本仅为其三分之一($1.04 vs 约 $3)。在 Agents' Last Exam(55 个专业领域的长时间 Agent 工作流评测)上,Sol 以 53.6 分碾压 Fable 5 的 40.5 分,领先 13.1 分——即使使用中等推理模式,也比 Fable 5 高 11.4 分,成本仅为其约四分之一。
编码是 Sol 的主场,但并非无懈可击。 Artificial Analysis Coding Agent Index 给 Sol(max)打出 80 分,Terra 77.4 分,Luna 74.6 分——Fable 5 为 77.2 分,落在 Terra 和 Sol 之间。Terminal-Bench 2.1 上 Sol 以 88.8% 创纪录,Ultra 模式(四并行 Agent)更拉到 91.9%。CodeRabbit 实测显示 Sol 在 100+ 任务的长线编码中通过率 63.7%,远超 Terra 的 40.7%,且平均输出 Token 仅 20,968,不到 Terra 的一半。然而在 SWE-Bench Pro 上,Sol 得分 64.6%,Fable 5 高达 80%——15.4 分的差距说明在真实 GitHub issue 级别的全栈修复上,Anthropic 仍然占优。
ChatGPT Work 与 ultra 模式重新定义了「模型能做什么」。 ultra 模式默认协调四个并行 Agent,在复杂任务上同时提升得分和降低延迟;ChatGPT Work 则将 Codex 的编码能力包装成了面向知识工作者的通用 Agent,通过统一插件目录接入 Google Drive、Salesforce、Canva 等十余种工具。Greg Brockman 此前承认 2023 年的插件「因为模型能力不够完全不行」——GPT-5.6 是 OpenAI 赌插件策略终于能兑现的时刻。
Luna 一美元能干 Opus 4.8 五倍的活——成本战正式开打
GPT-5.6 的发布不只是模型升级,更是一次行业定价体系的重置。
此前,前沿 AI 模型的竞争逻辑大致是「最强 = 最贵」。Claude Fable 5 以 $10/$50 的定价成为标杆;Claude Opus 4.8 以 $5/$25 紧随其后。OpenAI 的 GPT-5.5 在同一价格带竞争。
GPT-5.6 打破了这一定式。Sol 以 $5/$30 的定价在 Fable 5 一半的价格上提供同等甚至更强的编码能力;Terra 以 $2.50/$15 做到了与 GPT-5.5 相当的性能;Luna 以 $1/$6 逼近 GPT-5.5 的巅峰水平。在 DeepSWE 评测的「每美元产出」指标上,Luna 达到约 24 个基准点/美元,对比 Opus 4.8 的 4.5 点/美元和 Fable 5 的 3.2 点/美元——差距是五倍量级。
OpenAI 同时首次引入缓存写入定价(cache-write pricing),写入费用为基础输入价格的 1.25 倍,缓存读取享 90% 折扣。这对长时间 Agent 工作负载意味着显著的成本优化空间。
Lovable 联合创始人 Fabian Hedin 在 OpenAI 博客中给出的数据佐证了这一效率增益:GPT-5.6 在构建生产级应用时比上一代模型步骤减少约 25%,工具调用减少 35-48%,项目成功率提升、卡住率下降 15%。
Hacker News 上的讨论则揭示了一个更微妙的视角:用户 Topfi 指出 Altman 的「54% Token 效率提升」未明示参照对象——是对比 GPT-5.5 还是竞品?如果是前者,那将是突破性的;如果是对比 Fable 5 这类本就以「Token 挥霍」闻名的模型,则含金量打折。
三模齐发 + ChatGPT Work:这不是一次发布,是一套组合拳
GPT-5.6 是 2026 年迄今为止最重要的 AI 产品发布,但它的核心叙事不是「我们又造了一个更强的模型」。
它的真正剧本是三层定价 + Agent 产品化 + 政府审查常态化。三级模型让 OpenAI 可以在同一个代际内同时打高端(Sol vs Fable 5)、中端(Terra vs Opus 4.8)和走量(Luna vs 开源模型)三条战线。ChatGPT Work 则把 Agent 从开发者工具变成了面向所有 ChatGPT 用户的基础设施——CodeRabbit 的评价一针见血:「问题不是你该不该换模型,而是你需要的模型是那个最聪明的,还是那个能把活干完的。」
而白宫门前的 12 天排队,已经成了 2026 年前沿模型发布的入场门票。
本文由 AREX Agent 自动生成,数据截至 2026 年 7 月 11 日 00:00 UTC。
Sources: