AREX Feed Article
OpenAI 硬刚白宫限制令,GPT-5.6 三模型周四全球上线
从 20 家到全球:OpenAI 用 12 天突破了什么?
6 月 26 日,OpenAI 发布了 GPT-5.6 系列。但它不是给所有人的——只有约 20 家被美国政府"审批通过"的公司才能访问。
网友们立刻炸了。"开源必须赢"的呼声在社交平台上此起彼伏——受限的专有访问反而放大了开放模型的价值。科技媒体 Latent.Space 在当日的 AI 新闻综述中写道:"这次发布立即触发了'开源必须赢'的反应,因为受限的专有访问增加了开放模型的战略价值。"社区在等待,竞品在观望,而 OpenAI 只说了一句"weeks"。
12 天后,答案揭晓。OpenAI 于 7 月 8 日凌晨通过官方 X 账号发布推文宣布:GPT-5.6 Sol、Terra、Luna 本周四(7 月 9 日)全球公开发布,预览访问即刻扩大。从 20 家到全球,OpenAI 用不到两周突破了美国政府为前沿 AI 模型设置的第一道审查防线。
这是一个关于"安全"与"速度"的故事,也是关于一家公司与华盛顿在 AI 治理游戏规则上的第一轮磨合。
周四见:GPT-5.6 正式告别"预览"时代
OpenAI 于美东时间 7 月 8 日凌晨通过官方 X 账号宣布,GPT-5.6 Sol、Terra 和 Luna 三款模型将于本周四(7 月 9 日)正式公开发布,同时全球预览访问即刻扩大。该推文发布不到 8 小时即获得超过 27,000 次点赞、4,500 次转发和 2,700 条引用,累计浏览量突破 250 万。
这意味着,经历了两周的政府审查期后,GPT-5.6 模型家族将面向所有 ChatGPT、Codex 和 API 用户开放。这是自 GPT-4 发布以来 OpenAI 产品策略上最激进的一次推进——从受控环境直接跳入全民可用。Reuters、The Star Malaysia、Khaleej Times 等多家国际媒体均在第一时间跟进报道。
Sol 打头阵,但 Terra 才是真正的杀手锏
GPT-5.6 系列采用全新的命名体系:数字代表模型代际,Sol / Terra / Luna 分别对应三个持久的能力层级。据 VentureBeat 援引知情人士消息,OpenAI 有意告别 GPT-5 时代的 "nano""mini" 变体,转向更具辨识度的宇宙命名——正如一位日本 X 用户(taziku_co,近 3 万粉丝)所总结的:"Sol 面向高难度推理和开发,Terra 面向日常业务和内部使用,Luna 面向高速低成本的大批量处理。"
Sol 是旗舰。它引入两项关键推理增强:"max" 推理模式让模型获得更长的思考时间,适合需要深度推演的问题;"ultra" 模式则更进一步——它不依赖单智能体,而是调度多个子智能体(subagents)并行拆解复杂任务。不靠单打独斗,而是派出一个微型的 AI 团队。这一设计思路与 Anthropic 在 Claude Fable 5 中展示的多智能体架构形成直接对照。
基准测试的含金量是实打实的。在编程基准 TerminalBench 2.1——一个测试命令行工作流中规划、迭代和工具协调能力的标准评测——Sol 以 ultra 模式拿下 91.91%,不仅大幅超越 GPT-5.5 的 83.4%,也压制了 Claude Mythos 5 的 88%。这个测试衡量的是真实开发者场景:模型需要在终端中完成多步骤工程任务,涉及文件操作、代码修改和错误修复的循环。关键发现是,Sol 靠的不是堆算力——它用 ultra 模式下的多智能体协作实现了质的跃升。
即便是 Terra——定位中端的日常工作模型——其在 TerminalBench 的成绩也已跑赢上一代旗舰 GPT-5.5,这说明 GPT-5.6 这一代的基础能力有全系提升。在 Agent's Last Exam 综合性智能体测试中,Sol 成为首个突破 50% 大关的模型(code mode 下 50.9%),而 Luna 甚至也勉强超越了 GPT-5.5。在量化生物学基准 GeneBench v1 上,Sol 比 GPT-5.5 更强的同时消耗更少的 token——更强的模型更省 token,这对 API 成本有直接意义。
Terra 才是真正的杀手锏。它对标 GPT-5.5 级别的性能,但价格减半——输入 $2.50 / 输出 $15 每百万 token,定位高吞吐企业场景。Luna 则降至 $1 / $6,在够用的前沿能力与极致性价比之间画下新的基线。如果企业已有的 GPT-5.5 工作负载可以直接迁移到 Terra 上且成本砍半,这将是 OpenAI 今年最有力的企业销售论据。
网络安全方面,GPT-5.6 Sol 在 ExploitBench² 上的表现接近 Anthropic 的 Mythos Preview,但输出 token 量仅为其约三分之一。在 UC Berkeley 联合创建的 ExploitGym 上,Sol、Terra、Luna 三款模型随推理强度提升均展示了显著的攻击能力增长。安全投入同样惊人:OpenAI 为自动化红队测试投入了超过 70 万 A100 GPU 等效小时,专门用于发现通用越狱(universal jailbreak)攻击模式。即便如此,Sol 未触及 Preparedness Framework 下的 "Cyber Critical" 阈值——它在 Chromium 和 Firefox 测试中能识别漏洞原语,但未能自主完成端到端完整利用。
安全架构采用多层防护:模型层拒绝训练是第一道墙,实时滥用分类器在生成过程中持续扫描,激活信号监控捕获模型内部异常,账户级风险评估则跨会话追踪恶意行为模式。高风险生成请求会被暂停,由更大的推理模型审查上下文后再决定是否放行。VentureBeat 特别指出,Sol 和 Terra 都叠加了激活分类器层,Luna 则未启用这一层——但仍受其他监控系统的覆盖。OpenAI 坦言这套系统在预览期可能导致正当工作被误拦,"这正是预览阶段要测试的内容"。
性能层面还有一个亮点:Sol 将于 7 月在 Cerebras 硬件上以最高 750 tokens/秒的速度提供服务——在实时场景下跑前沿推理,这几乎消除了"能力最强但太慢"的传统取舍。GPT-5.6 同时引入了可预测的 prompt 缓存机制:写入 1.25 倍标准输入价,读取享 90% 折扣,最低缓存窗口 30 分钟。对于反复传递巨型上下文的智能体工作流,这是一条关键的财务护栏。
白宫、行政令和 70 万 GPU 小时的安全攻防
GPT-5.6 的公开发布之路并非坦途。6 月 26 日首次亮相时,OpenAI 仅向约 20 家"受信任合作伙伴"开放预览。这是在向美国政府展示模型能力后,按白宫要求做出的让步。
背景是特朗普政府于 6 月 2 日签署的网络安全行政令,要求联邦机构在 30 天内建立前沿 AI 模型的评估审查流程——这套流程原定 7 月 2 日完成。更直接的催化剂是 Anthropic 的 Claude Fable 5——这款模型因越狱漏洞被美国政府下达出口管制令,Anthropic 随后完全撤回了 Fable 5 及 Mythos 5 的所有公开和私有访问权限。Anthropic 事件为整个行业立下了一个令人生畏的先例:最先进的模型可以被政府一纸命令叫停。
Axios 报道显示,CEO 山姆·阿尔特曼(Sam Altman)在 6 月初已与白宫进行了会面,提前一个月预览了 GPT-5.6 的计划和能力。但 OpenAI 未预料到会被限制到仅 20 家合作伙伴的程度,原计划是下周即可扩展。一位了解情况的消息人士告诉 VentureBeat,OpenAI 可能需要分批发布,但并未预料到像政府逐个审批客户、将发布规模控制在 20 家左右这样的严格限制。
在官方博客中,OpenAI 表达了明确的不满:"我们不认为这种政府准入流程应该成为长期默认选项。它让最好的工具远离了需要它们的用户、开发者、企业、网络防御者和全球合作伙伴。"(We don't believe this kind of government access process should become the long-term default.)但公司同时表示接受短期妥协,"因为这是我们相信的在未来几周内实现更广泛可用性的最强路径。"Axios 补充称,OpenAI 表示政府在额外测试期内未提出异议,已对更广泛的发布计划表达了支持。
从 6 月 26 日的受限预览到 7 月 9 日的全球公开发布,仅用了不到两周。早期测试者 Flavio Adamo(Lima Labs 创始人)在引用推文中写道:"我测试 5.6 Sol 已经有一段时间了,它是我用过的最好的模型,毫无疑问是我感受到的最大代际飞跃——前端问题也修好了。"另有社区成员 Connor Curious 注意到,传闻中美国政府的网络安全审查仍在持续,但 OpenAI 选择在此时推进公开上线,意味着政府在短期合规后开了绿灯。
Fable 5 还没完全回归,GPT-5.6 已经压上来了
GPT-5.6 的公开发布,最直接的压力给到了 Anthropic。
Claude Fable 5 至今处于尴尬境地。6 月被美国政府以越狱风险为由实施出口管制后,Anthropic 撤回了所有访问权限。虽然 Fable 5 在 7 月 1 日恢复上线,但访问范围严重受限。知名科技博主 Seong(kimseong)在回复中调侃:"Anthropic 把 Fable 5 延长到 12 号,OpenAI 直接周四上 GPT-5.6——这是我见过的最礼貌的科技战争。"拥有 3.2 万粉丝的丹麦创业者 Dan(d4m1n)接着补刀:"等周四一到,Anthropic 就会完成不可能的任务——把 Fable 5 也塞进订阅套餐里。奇迹发生了。"
开发者社区已经开始重新锚定工具链。独立开发者 Sam L(samelldev,KruxOS 创始人)提出的公式被广泛转发——"Fable 5 做编排,GPT-5.6 做执行。"这并非空穴来风:Fable 5 以多智能体编排能力见长,而 Sol 在编程基准上的统治级表现使其天然适合担任执行层。定价进一步强化了这一组合的吸引力:Sol 总成本 $35/百万 token,仅为 Fable 5 的 $60 的不到六成。
科技评论账号 Kryptos Opus(26.6 万粉丝)从另一个角度吐槽:"OpenAI 取名 Sol、Terra、Luna,要么是纯属巧合,要么是团队里有人在 2022 年买了币,这是他们的心理治疗。"——Solana 生态中的 Terra/Luna 崩盘是加密圈最著名的事件之一,这个梗迅速引发共鸣。另一位用户 alexgetmancom 则感叹:"Sol、Terra、Luna——兄弟直接丢出了一个完整的太阳系。"
Orca ADE 联合创始人 Jinjing Liang(前 Google 工程师,YC 校友,其项目在 GitHub 上拥有 13,000 star)发布了一张"等不及"的配图获得热烈反响,Orca 官方号也回应称"期待在 Orca 中使用 GPT-5.6"。拥有 15 万粉丝的 AI 领域编译者 Rohan Paul 追问了一个所有人都关心的问题:"Pro 还是 Plus 用户先上线,还是所有人同步?"——这个问题 OpenAI 尚未明确答复。另一位热评用户 Owen Carey(2,173 粉丝)则半开玩笑地说:"是时候在 Sol 外面包一层薄 wrapper,然后自称有远见的创业创始人了。"这一评论获得了 332 个点赞,精确击中了每一次基础模型升级时开发者社区的经典冲动。
在更广泛的竞争版图上,Google 的 Gemini 3.1 Pro 和 Gemini 3.5 Flash 以更低价格争夺市场,中国厂商的 DeepSeek-V4($0.435/$0.87)、Kimi-K2.6($0.95/$4.00)、GLM-5.2($1.40/$4.40)也在价格战中持续施压。OpenAI 此次三种定价梯度的设计——从 Luna 的 $7 到 Sol 的 $35——显然是在正面迎战各价格段位的竞争者,但最便宜的 Luna 仍比 DeepSeek-V4 贵了超过 16 倍。
12 天是一个参考答案
GPT-5.6 的公开上线,不止是一次模型发布。它标志着美国政府与 AI 实验室之间正在形成一种新的协调机制——预览、评估、批准、发布。OpenAI 用 12 天的实战证明了这套流程可以跑通,但也用行动传递了一个清晰的信号:实验室不会无限期等待华盛顿。
正如 OpenAI 在博客中所写,目标是"为未来模型发布建立一个可重复的流程。"Axios 报道进一步透露,到 8 月,作为行政令的一部分,美国政府必须建立一个涉密流程来评估 AI 模型的网络能力。这意味着今天的 12 天只是序章——未来每一次旗舰模型发布都可能面临类似的审查周期。
问题在于,这个流程的权力天平最终会倾向哪一边——是更快地放行,还是更慢地审核?GPT-5.6 的 12 天给出了第一份参考答案,而这个答案显然比 Anthropic 的出口管制剧本要好看得多。但好看不等于可持续。当 GPT-6 到来时,12 天还会是答案吗?
参考链接:
- OpenAI 官方博客:Previewing GPT-5.6 Sol(2026-06-26)
- OpenAI 官方 X 账号推文(2026-07-08)
- VentureBeat:OpenAI unveils GPT-5.6 Sol, Terra and Luna models(2026-06-26)
- Axios:OpenAI releases powerful new GPT-5.6 model under restrictions(2026-06-26)
- Latent.Space:AINews — OpenAI GPT-5.6 Sol / Terra / Luna(2026-06-27)
- Reuters / The Star Malaysia / Khaleej Times 报道(2026-07-08)
声明:本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成任何投资或决策建议。