AREX Feed Article
GPT-5.6 很强,但你得先排队
美西时间 6 月 26 日下午,Sam Altman(OpenAI CEO)在 X 上发了一条经过精心编排的推文:「先讲好消息——Sol 聪明、高效,是一次显著的进步,价格和 GPT-5.5 一样。GPT-5.6 家族还有一个 Terra,GPT-5.5 级别的性能,价格只要一半。坏消息——应美国政府要求,它今天以 limited preview 方式发布,而不是我们原计划的 open access。」
一条推文,两套叙事。技术侧是一次实打实的代际跃迁,但所有不在那「一小撮受信伙伴」名单上的开发者、企业和普通用户,只能先看别人用。Sam Altman 罕见地在推文中直接表达了对流程的不满:「这不是我们心目中那个最优流程。」紧随其后他又补了一句——「还有……750 token/s,7 月到 GPT-5.6 Sol!」
OpenAI 在官方博客中措辞更尖锐:「我们不认为这种政府准入流程应该成为长期默认选项。它把最好的工具挡在了用户、开发者、企业、网络防御者和全球伙伴之外。」但同时,公司也承认这是迈向更广泛发布「最强路径」。这不是 OpenAI 一家面临的抉择。两周前,Anthropic 在美国商务部出口管制指令下关闭了 Claude Fable 5 和 Mythos 5 的全部访问。6 月 2 日,特朗普签署 AI 行政令,要求各联邦机构在 30 天内拿出面向前沿模型的评估与审查框架。GPT-5.6,成了这个框架落地的第一块试金石。
Sol、Terra、Luna:从太阳到月亮的三个答案
GPT-5.6 不是单一模型,而是一个三层架构的模型家族,每层对应一套截然不同的需求场景。
Sol 是旗舰。它和 GPT-5.5 定价一致——输入 $5/百万 token,输出 $30/百万 token——但能力全面跃升。OpenAI 将其定位为「最强模型」,主攻复杂推理、长程编码、网络安全和 agent 驱动工作流。Terra 定位为「日常工作的平衡模型」,GPT-5.5 级别的性能,价格直接砍半($2.50 输入 / $15 输出),面向高并发企业生产环境。Luna 则是最快、最低成本的选择($1 输入 / $6 输出),主攻摘要、草拟和日常自动化任务。VentureBeat 援引知情人士称,这种三层命名取代了此前 GPT-5 系列混乱的 mini / nano 后缀——OpenAI 内部认为这些命名已经无法准确反映不同模型之间真实的使用场景差异,而非仅仅是参数规模的差异。
这是 OpenAI 首次用「天体」体系命名模型。在后续回复中,Sam Altman 确认了命名逻辑:「star / planet / moon 对应模型规模。」Grok(xAI 旗下 AI 助手)在回复中做了完整拆解:「Sol(太阳)= 旗舰,Terra(地球)= GPT-5.5 级性能半价,Luna(月亮)= 最快最便宜。这构成了一套清晰的天体层级——太阳 > 行星 > 月球,与能力和定价的梯度完全对齐。」一位拥有 3.3 万关注者的用户 @Tenobrus 感叹:「终于给 GPT 起了个像样的名字。」
据 VentureBeat 报道,这三款模型目前仅向大约 20 家组织开放,且名单需要与美国政府共享。OpenAI 没有披露这些合作伙伴的具体名称——这在 AI 行业内部引发了关于透明度和公平竞争的巨大争议。知名 AI YouTuber Matthew Berman(12.5 万 follower)在 Sam 的推文下追问:「如果这种发布模式成为标准,你是否相信它会加剧不平等?」
91.91% 和 750 tok/s:两个数字背后的技术跃迁
GPT-5.6 Sol 引入的两个新机制——max 推理力度和 ultra 模式——是理解这次性能跃迁的钥匙。
max 模式下,Sol 获得最长的推理时间,用于攻克高难度问题。ultra 模式则更进一步:它不再把工作限制在单一 agent 内,而是调用 subagent 来拆分和加速复杂任务。OpenAI 称之为「超越单 agent 能力」的模式。这与 Anthropic 在 Claude 上采取的「扩展思考」路线形成有趣的对比——OpenAI 选择的不是更长的单体推理,而是结构化的分布式推理。
在命令行自动化基准 TerminalBench 2.1 上——该基准测试涉及规划、迭代和工具协调的命令行工作流——Sol ultra 模式拿下 91.91% 的得分,不仅大幅领先 GPT-5.5 的 83.4%,也超越了 Claude Mythos 5 的 88%。即便仅使用 max 模式(不调用 subagent),Sol 的 88.76% 也已超过 Mythos 5。在 Agent's Last Exam 的 coding 子任务中,Sol 以 50.9% 的完成率成为首个突破半数门槛的模型,Terra 和 Luna 分别取得了 42% 和 40% 的成绩,Luna 甚至小胜上一代旗舰 GPT-5.5。
生物信息学方面,GeneBench v1——评估长时间跨度的基因组学和定量生物学分析——显示 Sol 以更少的 token 消费取得了比 GPT-5.5 显著更高的准确率。网络安全方面,ExploitBench 测试中 Sol 表现与 Anthropic 的 Mythos Preview 持平,但仅用了约三分之一的输出 token。在三方合作基准 ExploitGym(UC Berkeley 联合 OpenAI 等前沿实验室创建)中,Sol、Terra 和 Luna 三款模型均随推理力度增加展现出明显的网络能力提升曲线。
速度是另一个值得单独讨论的维度。Sam Altman 在推文末尾追加的那句「750 token/s coming to 5.6 sol in july」引发了社区狂欢。Cerebras 硬件上的部署目标意味着前沿推理能力将首次以前所未有的低延迟交付——这对 Codex 实时编码和 agent 循环场景的用户体验是质的改变。社区知名人物 @yacineMTB(29.9 万 follower,前 X/Twitter 工程师)在回复中只写了四个字:「thanks for everything」。
安全层同样值得展开。OpenAI 投入了超过 70 万 A100 等效 GPU 小时进行自动化红队测试——这个数字本身就是一个信号:公司正在用前所未有的计算资源砸向安全问题。红队的目标是一类更难防的攻击——universal jailbreak,即可以在不同提示词和上下文中通用的越狱方式,而非针对特定措辞的单点绕过。多层防护体系随之升级:模型级拒绝构成第一道边界;Sol 和 Terra 新增了 activation classifier,在推理过程中监控内部信号,检测到风险模式即可暂停输出流;实时网络和生物滥用分类器在生成过程中介入;高风险场景下,输出流会被更大的推理模型复查——如果判定违规,答案在到达用户之前就被拦截。
这套机制的设计哲学是「纵深防御」——单点防护靠不住,要让恶意使用者在每一步都遇到阻力。尤其在早期预览阶段,OpenAI 明确预警用户可能会遇到「拒答或延迟」,部分合法工作也可能被误判——公司称这正是 preview 阶段要解决的问题:了解 safeguards 是否在限制滥用的同时,让合法用户仍能高效完成工作。
OpenAI 在系统卡中特别强调了一个关键安全判断:GPT-5.6 Sol 并未触及 Preparedness Framework 下的「Cyber Critical」风险等级。在 Chromium 和 Firefox 的评估中,它能识别 bug 和利用原语(exploitation primitives),但无法在测试条件下自主完成端到端的全链条利用。不过公司坦率承认:基准测试无法穷尽所有可能的工具组合与现实攻击路径。这种不确定性,加上模型整体的能力跃迁,是采取分阶段发布的根本原因。
Sam Altman 为什么说「这不是最优流程」
Sam Altman 在这条推文和相关回复中的姿态,值得逐层拆解。一位 CEO 在公开平台上既要安抚用户、又要向政府表忠、还要为自己的团队站台——他做到了三件事,但没有一件是轻松的。
第一层:他并不反对政府要求的事前审查期。在回复用户 @tony_carnev(Venbit AI 创始人)关于「为什么 CEO 们一边求监管、一边抱怨监管」的提问时,Altman 明确写道:「其实我觉得要求一个 extended redteaming 的预览期并不是坏主意。我只是不喜欢政府来 picking the customers 这个主意。我们有信心最终会走到一个更好的地方。」这条回复获得了 758 个赞,说明很多用户接受这种「审查 OK、挑人不 OK」的区分。
第二层:公开的微妙不满。在官方博客中,OpenAI 使用了比 Altman 个人推文更尖锐的措辞——「不应当成为长期默认选项」——但 Altman 本人在推文中仍保持着对政府的整体合作姿态:「我相信政府分享了我们的大多数目标,而且他们在一个极其困难的局面下总体上干得不错。」他没有点名特朗普政府。CNBC 和《纽约时报》均报道称,白宫方面在发布前直接联系了 OpenAI,要求将发布从全面开放改为分阶段预览——这一过程的具体细节尚未被任何一方公开确认。
第三层:团队士气。在发布推文半小时后,Altman 发了一条独立推文——「team cooked, spicily」(团队这次做得够辣),获得了 1526 个赞。这条简短的信息暗示了一个内部叙事:工程师团队已经交付了最好的成果,外部限制不应当遮蔽他们的付出。
知名 AI 领域研究员 Tanishq Mathew Abraham(PhD,SophontAI CEO,8.9 万 follower)追问了最关键的问题:「谁来决定谁先获得模型访问权?」Altman 没有直接回答。社区中有人将这个问题引向了更尖锐的方向——匿名加密货币大号 @toupaiwang(5.2 万 follower)在引用推文中玩了一个谐音梗:「山姆奥特曼预测 sol 价格在 5 美金到 30 美金」——故意把模型名 Sol 和同名加密货币 Solana 混在一起,获得了 265 次浏览,折射出加密社区对「Sol」这个名字的额外关注。
Fable 5 下线了,GPT-5.6 也上了锁
把 GPT-5.6 的 limited preview 和 Anthropic 两周前的遭遇放在一起,一幅更大的图景浮现出来:美国前沿 AI 模型的发布自由,正在系统性地收窄。
时间线很清楚。6 月 2 日,特朗普签署 AI 行政令,措辞模糊但方向明确——邀请(实质上是要求)AI 开发商在全面发布前自愿让政府评估模型能力。6 月中旬,美国政府以发现 jailbreak 为由对 Anthropic 发出出口管制指令,Claude Fable 5 和 Mythos 5 完全下线——不仅公众不可用,连此前参与 Project Glasswing 网络安全研究的外部合作者也失去了访问权限。Anthropic 至今未公布恢复时间表。6 月 26 日,GPT-5.6 在政府要求下以 limited preview 发布。
两个 AI 巨头做出了不同的应对。Anthropic 选择了完全关闭,OpenAI 选择了「有限开放 + 积极谈判」——保留约 20 家受信伙伴的 API 和 Codex 访问,同时公开表示正在与政府协作制定一个「可重复的未来发布流程」。OpenAI 的博弈逻辑很清楚:与其被彻底锁死,不如用这种临时性合作换取政府信任,为后续全面发布铺路。
但社区反应剧烈。区块链与 AI 领域评论者 Brij Singh(早期 Twitter 员工,user ID 1503)在引用推文中警告:「美国限制前沿模型获取是市场尚未充分定价的最大经济风险。最近的 GDP 增长叙事几乎全部由 AI 驱动,而这可能像它被构建起来一样迅速地瓦解。」前 Solana 战略负责人 Austin Federa(18.3 万 follower)忍不住调侃:「我简直不敢相信 Sam Altman 在奶 Solana。」一位拥有 3560 follower 的加密记者 @anthonygrogers 则直接复制了 Tony Carnevale 的回复——不知是讽刺还是纯粹 bot 行为,折射出讨论中的某种信息污染。
一位低调的美国创业者 @WolfMindAI 的留言代表了一部分开发者群体的愤怒:「作为一个美国创业者,我需要和大公司、政府一样级别的访问权。别替我做决定,别假设我的意图。让公司和人自己负责。」在 X 上坐拥 8.7 万 follower 的概念艺术家 @SHL0MS 则用幽默回应:「感谢你私下给我提供访问权限,但我必须基于原则公开拒绝。」——这个回复获得了 19 个赞,因为它精准捕捉了一种矛盾:即便拿到了特权,也不该需要一个特权。
中国社区的观察同样值得记录。用户 @YanyuRensheng(多模型 AI 平台 Aivron 相关人士,2339 follower)评论:「类似的限制如果越来越多,对于 AI 产业链来说可不是什么好消息。」@chidoriashi_gon 则更直接:「这下来真的了,GLM 和中国模型的价值要涨。美国作为 AI 提供商的可信度正在丧失。」这一判断有数据支撑——VentureBeat 整理的定价对比表显示,即便 GPT-5.6 家族中最低价的 Luna($7/百万 token 综合成本),仍然高于 DeepSeek V4 Flash($0.42)、MiniMax-M3($1.50)、Qwen3.7-Plus($2.00)和 GLM-5.2($5.80)。当美国政府在给自家最强模型上锁时,全球其他玩家并没有减速——而且它们的模型便宜得多。
欧洲同样感受到了危机。一位在日本的 iOS 工程师 @JuanColilla 写道:「以前 AI 全球统一定价,虽然看起来'公平',但也制造了不平等。现在那些工资更高的国家还能优先获得最新 SOTA 模型,差距只会更大。欧盟需要自己的 AI 模型,越快越好。」
值得单独指出的是,OpenAI 在系统卡中将 Sol、Terra 和 Luna 全部归类为网络能力和生物/化学能力的「High」风险等级——不是只有 Sol。这意味着即便企业选择更便宜的 Terra 或 Luna,如果涉及安全和生命科学场景,同样需要面对新的治理义务。这也是一个容易被忽视的细节:政府不是只锁住了最强的那个模型,而是对整个家族都上了门槛。
能用的模型才是好模型
GPT-5.6 Sol 可能是 OpenAI 至今最强的模型。TerminalBench 从 83% 跳到 91.91%,Agent's Last Exam 首次突破 50%,ExploitBench 用三分之一的 token 追平 Mythos Preview——每一项都是真实的代际进步。750 tok/s 的 Cerebras 部署、subagent 驱动的 ultra 模式、70 万 GPU 小时的红队测试,共同构成了一套完整的「更强也更快」的叙事。
但一个不能广泛使用的模型,无论 benchmark 多好看,都无法兑现 OpenAI 「benefit all of humanity」的使命。这也是为什么 Altman 在推文末尾写下「We will work as quickly as we can to get this model in your hands and we hope you will love it」——这句话既是对用户说的,也是在向政府施压。
短期的现实是:未来几周内,美国政府拥有事实上的前沿模型发布否决权。长期的博弈在于,OpenAI 能否证明「配合审查」不等于「接受永久门禁」。Sam Altman 选择的方式是务实的——用一时的让步换取流程的制度化,同时保留公开表达不满的空间。Anthropic 选择了更安静(也可能更昂贵)的路线。
但创新不会等人。那些不需要美国政府批准的模型——来自北京、杭州、巴黎和首尔——将填满这个空白期。市场永远会选择能用的模型,而不是最强的模型。这大概是 GPT-5.6 发布日,最需要被记住的一句话。
参考链接:
本文由机器之心基于一手信源独立撰写,转载需授权。