AREX Feed Article
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,称 API 定价较 GPT-5.6 促销价低 50%
北京时间 9 月 23 日凌晨 2 时 12 分(UTC 9 月 22 日 18 时 12 分),OpenAI 官方认证账号 发帖,欢迎「GPT-6 Sol 和 GPT-6 Luna 来到 GPT-6 宇宙」。帖文称,两款新模型建立在 GPT-6 Astra 背后的技术积累之上,把 Astra 的诸多长处带进「更快、更实惠的模型,以支撑大规模工作」;OpenAI 同时表示,公司已让缓存与推理更高效,并把省下的部分直接让利给用户——Sol 与 Luna 的 API 价格较 GPT-5.6 促销定价低 50%。
官宣约半小时后复核,该帖已获约 1.27 万赞、超过 52 万次浏览,数字仍在攀升。当天更早时候,一则关于微软 Azure 模型注册表的泄露帖已提前列出这两个型号 ID;官宣的两个型号名与泄露 ID 完全对应。
两款新模型:官方口径下的三张卡片
官宣配图以三张卡片给出定位:Astra 是「我们最智能的模型,为最佳结果而设」,Sol 负责「以更低成本处理复杂编码与专业工作」,Luna 则「快速高效地完成大规模日常工作」,三张卡片右下角均标有 READY。
在官宣 15 分钟后发帖称,两款模型「在智能、对齐、工作产出、编码、计算机操作等方面都比 5.6 系列前辈有大幅提升」,且「每 token 价格便宜一半,按任务算降得更多」。OpenAI 员工 Vaibhav(VB)Srivastav 在中给出两条内部对照:以 xhigh 推理力度(reasoning effort)运行的 Sol,在 AutomationBench 上的成绩高于以 max 推理力度运行的 Claude Opus 5,每任务成本仅为后者的 9%;在 OpenAI 内部的事实性评测(样本为用户曾标记出错的真实对话)中,Sol 出错数约为 GPT-5.6 Sol 的一半。这些能力对照均出自 OpenAI 自述;发布同日,独立评测机构 Artificial Analysis 发布了第三方数据。
价格账目:新牌价与缓存折扣不变
官方卡片标出 Input/Output 两栏价格,Srivastav 的细节帖明确了单位口径——每百万 token(词元):Sol 输入 2 美元、输出 10 美元;Luna 输入 0.10 美元、输出 0.50 美元。同一画面里,旗舰 Astra 标价为输入 10 美元、输出 50 美元。
个人简介为「Codex & ChatGPT @OpenAI」的 Tibo(@thsottiaux)在补充:「我们还将 API 价格永久下调 50%。」 列出的 GPT-5.6 对照基线为 Sol 每百万 token 输入 4 美元、输出 20 美元,Luna 输入 0.20 美元、输出 1.20 美元:照此计算,Sol 两个方向均正好减半,Luna 输出价降幅约 58%。OpenAI 官宣的基线口径则是「GPT-5.6 促销定价」,与这一对照基线是否同一回事,官宣帖未作说明。
缓存价格维持原样:缓存读取按原价一成计费(90% 折扣),缓存写入加收 25%,均与 GPT-5.6 相同。Srivastav 称,改进后的提示词缓存让代理能复用更多上下文,开发者更改推理力度或可用工具也不会再使缓存失效。
铺开范围:Codex 与 ChatGPT Work 先行
官宣帖发出 4 秒后,列出渠道:当天起,GPT-6 Sol 与 Luna 在 ChatGPT Work 与 Codex 中向 Plus、Pro、Business、Enterprise、Edu 用户推送;两款模型同步进入 API;Free 与 Go 用户可在桌面应用试用 GPT-6 Luna。Srivastav 补充,这些模型「尚未进入 Chat」,普通聊天界面暂不可用。
则强调用量:更高的用量上限与更低的成本「给你更多灵活性与迭代空间」。Tibo 还宣布,正向所有 Plus、Pro 和 Business 用户的账户装载一次「banked reset」,帖内未解释这一预存重置的具体规则。官方跟帖附上了链接。
发布同日的独立实测:成本砍半,分数持平
Artificial Analysis 在官宣 8 分钟后发布。在其 Intelligence Index v4.3 中,GPT-6 Sol(max)48 分、GPT-5.6 Sol(max)47 分;GPT-6 Luna(max)37 分,与 GPT-5.6 Luna(max)持平;家族中的 Astra 仍以 53 分领先。AA 概括为「得分与 GPT-5.6 持平,部分评测进步、部分退步」。
变化集中在成本端。跑完同一套指数,GPT-6 Sol(max)每任务 1.06 美元,GPT-5.6 Sol(max)为 1.99 美元;Luna(max)0.07 美元对 0.18 美元。AA 指出,降幅主要来自定价——两款新模型每任务的输出 token 反而略多(Sol 3.1 万对 2.9 万,Luna 5.1 万对 4.1 万)。
编码代理指数(AA 在 OpenAI Codex 框架内测量)出现分化:Sol(max)57 分,比 5.6 Sol 高 2 分,其中 Terminal-Bench 4.0 从 37% 升至 43%,每任务 2.99 美元、约降一半,处在成本与成绩的帕累托前沿上;Luna(max)41 分,比 5.6 Luna 低 2 分,SWE-Atlas-QnA 从 49% 降到 44%。
幻觉数据同样有两面:AA-Omniscience 上,Sol 幻觉率从 92% 降到 60%,Luna 从 93% 降到 77%;但 Sol 靠少答题实现——作答率从 99% 降到 83%,准确率反而从 59% 降到 54%,Luna 准确率基本持平(44% 对 43%)。
知识工作类评测出现回归:在 GDPval-AA v2.1(改编自 OpenAI 覆盖 44 个职业的经济价值任务数据集)中,Sol 掉约 100 个 Elo,Luna 掉约 75 个;在跨多周知识工作项目的 AA-Briefcase v1.1 中,Luna 掉约 45 个 Elo。AA 称人工检视数百份输出后,回归主要来自呈现质量下降、交付物漏掉评分要点。进步项同样存在:AutomationBench-AA 中 Sol 62% 对 60%,Luna 53% 对 50%。
第三方跟进:Devin 接入与 Every 的上手对比
Devin 开发商 在官宣 11 分钟后确认两款模型进入 Devin,并给出自家榜单数据:FrontierCode 1.1 上,GPT-6 Sol 得分与 GPT-5.6 Sol 持平、每任务成本降低 61%;GPT-6 Luna 得分高于 GPT-5.6 Luna、成本约为其四分之一;每任务不足 0.10 美元,为该榜单最便宜的模型。
Every 的 CEO Dan Shipper 在中写道,Sol「不算真正的 Astra,但对我大部分日常工作足够接近」,更快,且比 5.6 Sol 便宜一半;写作接近 Astra,「用大约五分之一的价格给你 Astra 的大部分能力」。官宣帖的回复区里,多名开发者称 Anthropic 当天也发布了 Claude Opus 5.5;在 Shipper 团队的测试里,Opus 5.5 在长时自主构建任务上的上限更高。他还提到,Codex 新上的安全分类器反复要求对已授权操作再次批准,让长任务更难无人值守地跑完。
泄露帖先行:Azure 配置里的三个型号
北京时间 9 月 22 日 20 时 41 分(UTC 12 时 41 分),X 用户 发帖称,Azure 配置中已挂上 gpt-6-sol、gpt-6-luna、gpt-6-astra-minor 三个型号,同一 commit 里 GPT-5.6 Sol 被改成 workhorse,「已写进微软模型注册表」,但尚未官宣。
5 小时 31 分钟后,OpenAI 正式官宣这两款模型。微软面向 Azure 客户的显示,GPT-5.6 系列此前已使用 sol、terra、luna 三个分级名,GPT-6 系列此前仅列出 gpt-6-astra;此次官宣把 Sol、Luna 两个名字带进了 GPT-6 世代。
泄露帖中的第三个 ID gpt-6-astra-minor 未出现在已见的官宣帖与官方跟帖里;OpenAI 是否会推出这个型号,目前没有说法。