AREX Feed Article
OpenAI 掏出最强模型,白宫却说:先等等,我来批
"我们相信广泛访问"——但 GPT-5.6 的用户名单要白宫点头
6 月 26 日,OpenAI 在 X 平台丢出一颗重磅炸弹:下一代前沿模型 GPT-5.6 系列正式亮相,包括三个以宇宙天体命名的版本——旗舰 Sol(太阳)、均衡 Terra(大地)、轻量 Luna(月亮)。推文发布数小时内揽下 2.1 万点赞、2800 余次转发和近 3000 条引用,浏览量直逼 400 万。
但欢呼声还没散尽,OpenAI 的第二条推文就让气氛冷了下来:"应美国政府要求,我们从一小群受信任合作伙伴的有限预览开始。"Sam Altman 在前一天的内部全员会上说得更直白:政府将"逐客户审批"(approving access customer by customer)GPT-5.6 的访问权。
换句话说,这不是一次常规的模型发布。这是美国政府首次在实际操作层面充当前沿 AI 的"守门人"——你想用全球最强的模型?先让白宫看看你是谁。
加密社区最先炸了锅。Solana 官方账号在评论区丢下一句"Sam Altcoinman"(萨姆·山寨币男),收获 1300 多个点赞;tinygrad 创始人直问"你们是雇了 Do Kwon 吗?"——Terra 和 Luna 恰恰是 2022 年崩盘的加密项目 Terra/LUNA 的名字,而 Sol 又撞上了 Solana 区块链。一位用户写道:"这三个名字凑在一起,唤醒了所有熬过 2022 年加密熊市的人的 PTSD。"
Sol 屠榜、Terra 省钱、Luna 跑量:三款模型重塑了 OpenAI 的定价逻辑
GPT-5.6 系列最大的结构变化不在技术,而在产品策略:OpenAI 首次用一套清晰的命名体系替代了"nano / mini / Pro"的混乱标签。在新体系下,数字标识代际(5.6),而 Sol / Terra / Luna 是"持久的能力层级"(durable capability tiers),各自可以按独立的节奏迭代。
三款模型的定位和定价同样清晰:
- GPT-5.6 Sol:旗舰,定价 $5 / $30(每百万输入/输出 token),与 GPT-5.5 价格持平但性能"阶梯式跃升"(step function better)。面向复杂推理、长程编码、多智能体工作流和网络安全任务。
- GPT-5.6 Terra:均衡款,定价 $2.50 / $15,提供与 GPT-5.5 竞争的性能但成本减半。定位大流量生产环境。
- GPT-5.6 Luna:轻量款,定价 $1 / $6,OpenAI 迄今最便宜的模型。面向高吞吐、低延迟的日常任务。
横向对比全行业定价,VentureBeat 整理的数据揭示了一个微妙的事实:即便最便宜的 Luna,输入/输出总成本($7/百万 token)仍高于 DeepSeek V4 Pro($1.305)、MiniMax-M3($1.50)和 Gemini 3.1 Flash-Lite($1.75)。OpenAI 显然不打算打价格战——它的赌注押在了"更强的模型值得更高的价格"上。
配合新模型,OpenAI 还推出了一套更可预测的 prompt 缓存机制:开发者可以显式设置缓存断点(explicit cache breakpoints),最低缓存生存时间保证 30 分钟。缓存写入按标准输入价格的 1.25 倍计费,缓存读取则享受 90% 折扣。对于反复传入大段代码库或长上下文的智能体工作流,这是一个关键的财务护栏。
此外,OpenAI 宣布将在 7 月通过 Cerebras 硬件上线 GPT-5.6 Sol,推理速度可达 750 token/秒,瞄准对实时性有极致要求的企业场景。
Terminal-Bench 91.91%:Sol 的"ultra 模式"是怎么做到的?
GPT-5.6 Sol 的技术标签有两个关键词:max 推理和 ultra 模式。
max 推理给模型更长的"思考时间",适合需要深度推演的问题。ultra 模式则是更大的突破——它不再把任务压在一个模型上死磕,而是调用多个子智能体(subagents)拆分并行处理。这本质上把单模型推理变成了一个小型多智能体系统。
在命令行自动化基准 Terminal-Bench 2.1 上,ultra 模式的 Sol 拿下 91.91%,刷新了该基准的最高纪录。横向对比:Sol max 模式 88.76%,Claude Mythos 5 为 88%,上一代 GPT-5.5 仅 83.4%。即便中端的 Terra 也超越了 GPT-5.5。
在更接近真实工作的 Agent's Last Exam 上,Sol 成为首个突破 50% 完成率的模型(50.9%,code 模式),连 Luna 都勉强压过了上一代旗舰。
网络安全方面,Sol 的表现更值得关注——但也更谨慎。在 ExploitBench² 上,Sol 的性能接近 Anthropic 的 Mythos Preview,但仅消耗了约 1/3 的输出 token。在 UC Berkeley 与多家前沿实验室联合设计的 ExploitGym 上,Sol、Terra 和 Luna 都展示出随着推理时间增加而显著提升的漏洞利用能力。
OpenAI 自己对这个问题的表态小心到了几乎矛盾的地步:一方面强调 Sol 在漏洞发现和修复方面"远强于"端到端攻击能力,另一方面也承认"基准阈值无法捕捉模型被以其他方式使用或与其他工具组合的所有可能"。这段话的潜台词很清楚——Sol 的能力已经逼近一个令人不安的边界,而 OpenAI 选择用"分层护栏"(layered safeguards)来兜底。
700,000 GPU 小时的红队测试,和一个 OpenAI 也不想要的新常态
GPT-5.6 的安全投入规模是前所未有的。OpenAI 投入了超过 70 万 A100 等效 GPU 小时进行自动化红队测试,目标是发现"通用越狱"(universal jailbreaks)——能在多种提示和场景下生效的系统性攻击向量,而非单一漏洞。外部第三方测试人员同步进行了广泛的人类专家红队测试。
安全架构是分层的:模型级拒绝(训练时就拒绝被禁止的网络攻击协助)→ 实时滥用分类器(在生成过程中检测网络和生物学滥用内容)→ 激活分类器(监控模型内部信号,在检测到风险模式时暂停输出)→ 推理审查暂停(必要时调用更大的推理模型审查对话上下文)→ 账户级审查(跨对话识别持续恶意行为)。
但安全不是这次发布最刺眼的关键词。"应美国政府要求"(At the request of the U.S. government)才是。
时间线是这样的:特朗普政府于 6 月 2 日签署 AI 行政令,要求 AI 开发者在全面发布前自愿让政府评估模型能力——该行政令给了 30 天期限,截止日正好是 7 月 2 日。Altman 在 6 月初与白宫官员会面,预览了 GPT-5.6 的能力和发布计划。白宫随后要求 OpenAI 分阶段发布,只有约 20 个政府审核通过的组织能率先获得访问权。
OpenAI 在博客里的措辞颇为微妙:"我们不认为这种政府准入流程应该成为长期默认做法。它让用户、开发者、企业、网络防御者和全球合作伙伴无法获得最好的工具。"但紧接着又说,"我们采取这一短期步骤,是因为我们相信这是在未来几周实现更广泛可用性的最有力路径。"
换句话说,OpenAI 在"配合"和"抗议"之间踩了一条钢丝。它一边执行白宫的命令,一边公开表达不满。这种姿态或许是为了避免 Anthropic 的命运——后者两周前收到了一份更严厉的出口管制指令,要求禁用 Claude Fable 5 和 Mythos 5,连 Anthropic 自己的非美国籍员工都不得访问。相比之下,OpenAI 拿到的是一张"有限预览"的通行证,而不是一纸禁令。
Claude 被禁、GPT 限售:前沿 AI 从军备竞赛变成了行政审批
GPT-5.6 的受限发布不是孤立事件。它和 Anthropic 的遭遇一起,勾勒出 2026 年夏天美国 AI 监管的新轮廓。
6 月中旬,美国政府对 Anthropic 发出出口管制指令,要求在 Claude Fable 5 中发现越狱漏洞后立即停止该模型及其网络安全变体 Mythos 5 的一切访问。Anthropic 照做了,至今仍在与华盛顿方面谈判恢复时间。
OpenAI 的处境显然更有利。它不仅保住了发布窗口,还拿到了"几周内扩大访问"的承诺。Axios 报道称,OpenAI 相信特朗普政府"仍然将美国 AI 竞争力放在心上"(has the best interests of U.S. AI competitiveness in mind)。
但行业观察者的担忧是真实存在的。一位用户在 X 上写道:"这种政府减缓模型发布的公告,是对中国 AI 公司的礼物。我们需要更多开源模型,否则我们将完全依赖少数几家公司和一个政府来决定谁能获得前沿 AI。"Solana 创始人 Adrian Brink 的评价更尖锐:"Crypto 没有适应传统金融,是传统金融变成了 Crypto——现在,传统 AI 也正在变成 Crypto 的样子。"
The Verge 指出了最尴尬的事实:特朗普政府此前承诺对 AI 采取"速度制胜"(speed wins)的方针,鼓励美国 AI 出口——但实际执行却在走向反面。而且这种干预对不同的公司是不平等的。OpenAI 拿到的是逐客户审批的"软着陆",Anthropic 则是全面禁用的"硬封锁"。
到 8 月,行政令要求政府建立一个保密流程来评估 AI 模型的网络能力,并定义哪些模型属于"受覆盖的前沿模型"(covered frontier models)。届时,这种逐模型、逐客户的人工审批能否被一套可重复、可预期的制度取代,将是整个行业的下一个关键节点。
技术越强,门越窄
GPT-5.6 是一面镜子。Sol 在 Terminal-Bench 上拿下的 91.91% 分数,和那 20 个获准访问的企业名单,讲的是同一个故事:前沿 AI 的能力正在以超出制度想象的速度增长,而制度的回应不是加速适应,而是减速放行。
OpenAI 在官方博客里说得很坦白——它选择配合,是把它当作"通往更广泛可用性的最有力路径"。这句话既可以理解为务实的妥协,也可以理解为一种含蓄的警告:如果这条路走不通,或者走向了更深的管制,下一次 OpenAI 还会如此配合吗?
GPT-5.6 最强的能力——ultra 模式的多智能体编排、ExploitBench 上的漏洞利用水平——恰恰是让它被锁进白宫保险柜的原因。技术越强,门越窄。这不是 OpenAI 一家公司的悖论,而是整个前沿 AI 行业正在撞上的墙。
参考链接:
© 机器之心 —— 专业、严谨、有态度的 AI 技术媒体。本文采用 许可协议,转载请联系编辑部。