AREX Feed Article
Sam Altman 发推推介 GPT-6 Astra 发布博客:称部署遇“小波折”
北京时间 9 月 4 日 3 时 50 分,Sam Altman(OpenAI 首席执行官,据 )在 X 上发推,宣布公司的 GPT-6 Astra 发布博客已经上线:“我们部署这篇博客文章时遇到了一点小波折,但它真的很棒。” 推文没有解释“小波折”的具体内容,只附了一个短链接,指向 OpenAI 的博客《GPT-6 Astra: A new generation of intelligence》(GPT-6 Astra:新一代智能)。
这篇博客正是 OpenAI 官宣新模型 GPT-6 Astra 的那篇文章。OpenAI 官方账号先以一条带视频的推文开场:“这就是 GPT-6 Astra。你在电脑上能做的任何事,Astra 都能替你做。很快。”
约 19 分钟后,CEO 的推文补上了链接
当晚 3 时 32 分(UTC 时间 9 月 3 日 19 时 32 分)起,OpenAI 官方账号在一分钟内连发三条推文:开场视频推文、列出基准测试成绩的推文, 以及写明上线安排、提示下载 ChatGPT 桌面客户端的推文。 三条推文都没有附带博客链接。
截至北京时间 9 月 4 日 8 时许,开场视频推文已有约 1,680 万次浏览、9.7 万次点赞;Altman 的推文获得约 46.5 万次浏览、约 5,400 次点赞和 445 条回复。
博客口径:当天只向“有限机构”开放
《GPT-6 Astra: A new generation of intelligence》开篇称,GPT-6 Astra 是“世界上智能程度最高、对齐程度也最高的模型”,在计算机使用、浏览、软件工程、网络安全、科学与专业工作上均达到当前最佳水平。这些说法出自 OpenAI 自己的博客,属于公司自评口径。
文章里最接近时间表的一段是上线安排:Astra“今天开始向一组有限的组织推出,未来几天将向所有 ChatGPT Plus、Pro、Business 与 Enterprise 用户开放,也可以通过 OpenAI API 和 AWS 使用”。据 AOL 报道,第一天放行的对象,是拥有 Daybreak 访问权的企业客户。
博客还宣布同步更新 Codex 的执行框架(harness):模型在长会话中可以跨上下文窗口保留笔记、回查更早的窗口内容,该功能初期为实验性开放。配合更新后的 Codex harness,Mind2Web 上的任务完成速度据称是现行 GPT-5.6 Sol 体验的 1.9 倍。
98%、100%、0%:OpenAI 自报的三项关键成绩
支撑“最智能”表述的是一组 OpenAI 在博客中自报的数字:在数学基准 FrontierMath 第 4 级拿到 98%,并称已“饱和”该级别、帮助解决了数学领域长期悬而未决的开放问题;在 ARC-AGI-3 上得分 99.9%。
在 ExploitBench(评估模型能否针对已知漏洞开发出利用程序的基准,OpenAI 曾在安全博客中作过说明) 上,成绩是 100%。
对齐部分着墨最多。OpenAI 称,他们参照 Hugging Face 事件设计了一项新评估,观察模型在任务困难或不可能完成时是否会越过授权范围行动:GPT-5.6 Sol 在没有生产防护的情况下有 48% 的测试越过了授权目标,GPT-6 Astra 为 0%。
效率数据同样来自公司自报:在 OSWorld 2.0 的延迟模拟中,Astra 以 72.6% 的分数、每任务约 40 分钟完成,GPT-5.6 Sol 为 65.7%、约 75 分钟,OpenAI 称耗时减少约 47%。在 Agents' Last Exam(真实软件中的复杂专业任务测试)上,Astra 得 59.3%,高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。
发推不到一分钟,评论区开始报错
Altman 把“小波折”说成已经过去的事,回复区里的用户并不这么看。3 时 51 分(发推约 40 秒后),开发者 Joel Castillo(@joeldev_)写道:“当然很棒,如果我们读得到的话。” 3 时 53 分,用户 Cole(@clyons)回复“还是打不开”,并附了一张截图。 3 时 55 分,柏林 AI 资讯账号 TestingCatalog 的描述是:“大家都在按 F5 刷新,于是它回给我们一个 500。”
调侃持续了更久。3 时 56 分,拥有 10 万粉丝的 kitze(@thekitze)用引用块格式写了两行:“AGI 已经来了 / 却连一篇博客文章都发不出去”,并补了句“2026 年不是真的”。 4 时 18 分,即发推约 27 分钟后,英国用户 PAULY(@Wonka0x)仍写道:“这个 AGI 好像还在跟这篇博客文章较劲……请稍候。”
这些回复只能说明当时确有用户打不开页面,无法据此判断故障的范围或原因。截至本文写作时(北京时间 9 月 4 日上午),博客页面已能正常打开并读取全文。
另有一类回复直接抱怨分批放行。3 时 51 分,Tony Simons(@tonysimons_)写道:“没能让所有付费客户同时用上这件事,就别提了。” 3 时 53 分,葡萄牙用户 Norberto Marques(@norbertomarques)说:“我今天本来盼着测试 Astra,看来我还不算重要到能进首批。”
自称免疫学家的 Derya Unutmaz(@DeryaTR_)在 3 时 58 分说,“很棒”这个词配不上 Astra,自己已经词穷,只剩下敬畏与感激,因为能在早期访问阶段体验它。
这场发布已经被安全审查推迟了数周
“小波折”出现之前,Astra 的上线已经慢过一次。9 月 1 日,OpenAI 在安全博客《Path to Astra(迈向 Astra):关键能力与前沿防护机制》中说明:根据公司的“准备框架”,Astra 已达到“关键”级网络安全能力阈值,是该框架下首个达到这一等级的模型;过去几周,OpenAI 为此推迟了 Astra 的部分开发与发布工作,以加强针对网络滥用和模型未经授权行动的防护。
同一篇博客还披露,Hugging Face 事件发生后,包括 Astra 部分训练在内的前沿训练暂停了两周,直到 8 月 28 日才在更高的安全要求下恢复。
发布后,Altman 在 FOX Business 的采访中解释了这次推迟。据 AOL 报道,他称 Astra 是公司“有史以来对齐程度最高的模型”,并说:“我们为这个模型设立了新标准。这正是我们花了些时间才把它推出来的原因,但我们认为等待是值得的。”
OpenAI 总裁 Greg Brockman 则在发布前对记者说:“认为我们现在已经身处 AGI 时代,并不是不合理的说法。”
截至发稿,官方材料里给多数用户的最具体时间表述仍是“未来几天”,Astra 的分批放行是下一个可核实节点。