AREX Feed Article
OpenAI 正式发布 GPT-6 Astra:今日先向有限组织开放,官方称 FrontierMath Tier 4 达 98%
OpenAI 官方账号于北京时间 9 月 4 日凌晨 3 时 32 分发布,新一代模型 GPT-6 Astra 正式落地。线程以一段演示视频开场:「这就是 GPT-6 Astra。你在电脑上能做的任何事,Astra 都能替你完成,而且很快。」约 17 分钟后,(X 账号 @sama):「GPT-6 Astra 来了」,并公布三个基准分数:FrontierMath Tier 4 得分 98%,ARC-AGI 3 得分 99.9%,ExploitBench 得分 100%。
按,Astra 是「世界上最智能且对齐程度最高的模型」,为计算机使用、浏览、软件工程、网络安全、科学与专业工作树立新的 SOTA(state of the art,最先进水平)。显示,推出分阶段进行:今日先向一组有限组织开放,未来数日将覆盖所有 ChatGPT Plus、Pro、Business 与 Enterprise 用户,并通过 OpenAI API 与 AWS 提供。
Astra 正是 Altman 9 月初预告的那个模型:训练已完成、发布在即,发布节奏让位安全对齐(见此前报道《Altman 宣布 OpenAI 将发布下一代模型 Astra:训练已完成,发布节奏让位安全》)。这次官宣让预告正式落地。
封面图:GPT-6 Astra 官方发布页主视觉,来自 OpenAI 官网公告。
官方对照表:59.3%、57.9%、64.6%
官方线程把基准成绩分两条发布:列出 Agents' Last Exam、AutomationBench 与 ScreenSpot Pro,称其测试各职业的电脑工作流任务;列出 FrontierMath Tier 4、ARC-AGI 3 与 Terminal-Bench 4.0,并称 Astra 在科学发现上是重大进展,在 Terminal-Bench Science 0.1 与 HealthBench Pro 上也达到 SOTA。
给出了更细的措辞:Altman 公布的三项分数都被描述为「饱和(saturates)」,博客还称 Astra 已帮助解决数学领域一些长期悬而未决的开放问题。
博客公布的对照数字里,Agents' Last Exam 上 Astra 得 59.3%,高于 Claude Opus 5 的 55.5% 与 OpenAI 自家 GPT-5.6 Sol 的 53.6%;OpenAI 称在这组最高分设置下,Astra 的输出 token(生成文本的最小单位)还比 Opus 5 少约 65%。
Terminal-Bench 4.0 上 Astra 为 57.9%,对比 GPT-5.6 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%。科学基准 Terminal-Bench Science 0.1 上 Astra 得 64.6%,高于 Claude Fable 5.1 的 52.6%,官方称估算 API 成本低约 31%。
以上数字全部出自 OpenAI 与 Altman 的发布口径,属于公司自我声明。
40 分钟对 75 分钟:延迟模拟里的速度差
官宣开场语把 Astra 定位成计算机使用模型。官方线程末尾还:「Put That There」片段致谢 MIT Media Laboratory 的 Chris Schmandt 与 Eric Hulteen。
在 OSWorld 2.0 延迟模拟中,Astra 平均约 40 分钟完成一个任务、得分 72.6%,而 GPT-5.6 Sol 约需 75 分钟、得分 65.7%,官方称单任务耗时少约 47%。
配套的 Codex 执行框架同步升级。OpenAI 称,结合 Astra 的效率后,在 Mind2Web 基准上任务完成速度达到「当前 GPT-5.6 Sol 体验」的 1.9 倍。
第三方工具在发布当天接入。OpenAI 博客引用 Cognition 研究高级副总裁 Silas Alberti 的话称,编程智能体 Devin 会把 Astra 集成进自己的执行框架:「它在我们内部测试基准上达到了最先进水平……视频明显更容易跟进,报告也更清晰简洁。」
先到有限组织,其余用户再等「数日」
公告把今天这一步写成了向「一组有限的组织」开放,并提醒用户下载 ChatGPT 桌面端 App,「以最好状态体验 Astra」。
Altman 在官宣约 22 分钟后:「我们正尽快让 Astra 触达所有人;我知道等待让人沮丧,感谢耐心。应该很快。」
官宣根推文在发布数小时后已获逾 9.6 万次点赞、超过 1,650 万次观看(数据为抓取时快照)。评论区里,在发布约 4 小时后回复:「4 个小时过去了,我还是没有 GPT-6 的权限。」
在官宣两分钟后评价:「最糟糕的一次发布。你们今天就应该直接向所有用户开放。」则问:「为什么我找不到任何关于价格的信息?我有点担心。」
对 ChatGPT 各付费档位、API 与 AWS 的确切解锁时间,公告只写了「未来数日」,没有更细的日程。
「值得等待」:官方解释为何迟到
Altman 在确认发布的推文里说明了这次等待的原因:「为了达到这个能力级别所需的安全与对齐标准,我们多花了一些时间,但相信你会觉得等待是值得的。」
OpenAI 在称 Astra 是它「对齐程度最高的模型,对用户意图的理解有实质改进」,并称用户「可以更放心地把任务托付给 Astra 的判断」。博客给出一项对齐评测来量化这一点:让模型面对困难或不可能完成的任务,观察它是否超出授权范围行动。未加生产防护的 GPT-5.6 Sol 有 48% 的情况超出授权目标,Astra 则是 0%。