AREX Feed Article
OpenAI 就 Astra 分阶段开放道歉:付费用户每多等一天补偿一次重置额度
9 月 4 日早上(北京时间),OpenAI 为 GPT-6 Astra 的分阶段开放连发两条官方口径。:付费 ChatGPT 计划用户每多等一天拿不到 Astra 访问权限,就补偿一次可累积的重置额度(banked reset),官方称首个补偿约 3 小时后到账。
不到两小时后,,称很快将开始向 API 客户与 ChatGPT 订阅者广泛铺开,按惯例先从 Pro 订阅者开始。
这场发布发生在前一天凌晨。北京时间 9 月 4 日凌晨 3 时半前后,OpenAI 推出 GPT-6 Astra,自称这是“世界上最智能、最对齐的模型”,当天先向包括 Daybreak 网络安全项目成员在内的有限组织开放,计划随后数日内覆盖 ChatGPT Plus、Pro、Business、Enterprise 用户以及 API 与 AWS。OpenAI 首席执行官 Sam Altman 当天告诉 ,这是“新的能力级别”。从高调官宣到公开道歉,中间隔了约 5 个半小时。
从发布当晚起算:等待按天计价
补偿推文发布于 UTC 时间 9 月 3 日 23 时 12 分(北京时间 9 月 4 日 7 时 12 分)。Sottiaux 写道:“从今天开始,你的付费 ChatGPT 计划每有一天无法访问 Astra,我们就补偿一次 banked reset。团队正在全力以赴,尽可能快地把访问打开。第一个约 3 小时后到账;如果还没有账号,现在创建还来得及。”按这一预告推算,首个补偿应在北京时间 9 月 4 日上午 10 时 12 分前后发放。
条款的措辞是“你的付费 ChatGPT 计划”,没有点名任何档位。约三个半小时前,发布过铺开口径:Astra 会覆盖全部 ChatGPT Plus 用户,而不只是 Pro、Business 与 Enterprise;“铺开需要几天才能完成”,背后“许多全新系统将首次以完整规模运转”,公司正在把大量算力接入进来。补偿条款与这条口径放在一起,等于官方把按天的等待折算成可累积的权益。
这条推文迅速获得大量互动。截至北京时间 9 月 5 日复核,它已获逾 4.7 万次点赞、逾 760 万次浏览。
三点式回应:道歉、补救与先 Pro 的铺开顺序
UTC 9 月 4 日 1 时 02 分(北京时间 9 时 02 分),Altman 发推回应:“首先,为混乱的发布道歉。其次,当我们搞砸时,我们会尽力补救。第三,我们应该能在不久的将来开始向 API 客户与 ChatGPT 订阅者广泛铺开;和往常一样,我们会从 Pro 订阅者开始。”
三点里,道歉与补救针对的是当晚的争议:道歉把“分批开放”重新定性为需要补救的失误,补救对应近两小时前公布的补偿条款。真正的新信息在第三点。发布博客和当晚的铺开说明都只讲覆盖哪些档位,没有写明先后;这条推文补上了顺序,从 Pro 订阅者开始。
发布夜 Reddit 的现场记录:“我们还没法用”
官方发布约 40 分钟后,Reddit r/OpenAI 出现,标题是“GPT-6 Astra has landed. Boy, what do we have in store today?”(GPT-6 Astra 落地了,天哪,今天等着我们的是什么?)。
回复记录着发布当夜普通用户的状态。用户 dolo937 写道“什么都没有,还没开放给我们”;用户 Lucky-Wind9723 问自己是否记错了套餐权益,“我发誓 5X 和 20X 计划的文案原本写着可以提前体验新模型,现在只剩‘实验性功能’了,是我疯了,还是我记错了?”,另一名用户 MastodonCurious4347 回复“你没记错,看起来确实不再是这样了”。
同一帖子里,还有人借用《星球大战》台词调侃:“我改了协议,祈祷我不会再改。”这个讨论帖出现在补偿宣布前约 3 小时。博客承诺的“未来数日”,落到个人账号上,是发布当夜数小时的空白;数小时后公布的补偿与道歉,回应的正是这段空白。
WANDR 打出测试最高分,智力指数只与 Sol 持平
官方自报的基准成绩之外,独立评测在发布当天给出第三方数字,画面并不一致。
在 UTC 9 月 3 日 21 时 10 分(北京时间 9 月 4 日 5 时 10 分)公布了对 WANDR 的测试:GPT-6 Astra 得 0.682 分、每任务成本 $11.98,是他们测试过的所有模型中的最高分;比 Claude Fable 5.1 高 13.5% 且每任务成本低 6.1%,比 Claude Opus 5 高 27.0% 而成本高 3.3%。
的结论更分裂。其 Coding Agent Index(编码智能体指数)里,Codex 环境下的 Astra(max 档)得 67 分,与 Claude Code 里的 Fable 5、Opus 5 以及 Muse Code 里的 Muse Spark 1.3 相当,Fable 5.1 以 70 分领跑;每任务成本不到 Fable 5 的一半,token 用量约为 GPT-5.6 Sol(max 档)的三分之一。
但在 Intelligence Index(通用智能指数)上,Astra 的 61 分只与上一代 GPT-5.6 Sol(max)持平,比 Fable 5.1 低 5 分,也落后于 Meta 新发布的 Muse Spark 1.3(max)。价格拖累了后一项优势:Astra 定价是 Sol 的 2.5 倍,每百万输入/输出 token 从 $4/$20 涨到 $10/$50,缓存读取打 9 折、缓存写入加价 25%;输出 token 用量少了约 10%,但按每任务成本计仍比 Sol 贵 75%。
同一份评测里,改进集中在大任务上:max 档幻觉率从 92% 降到 51%,准确率同时提高 4 分;模拟数周长周期知识工作的 AA-Briefcase 的 Elo 提升约 80 分,Humanity's Last Exam 提高 6 分。
回退同样明确:跨 44 种职业衡量经济价值任务的 GDPval-AA v2 回退约 80 Elo,τ³-Banking(客服)、SciCode(科学领域编程)、AA-LCR(长文档推理)等项有 2~3 分的小幅回退。
还有更直观的独立样本。跑分账号 (Twitch 频道 GPT Plays Pokémon)用提前访问资格测试 Astra:high 档 18 小时 12 分钟通关 Pokémon,GPT-5.6 Sol(max 档)此前用了 96 小时 35 分钟,GPT-5.5 跑了 218 小时仍未通关;全程只读屏幕截图,不改内存、不给提示与攻略,完全自主运行。
自称“OG GenAI Skeptic”(老牌生成式 AI 怀疑者)的 则给出“非常初步”的正面评价:看起来是真实的进步,但 ARC-AGI 的高分不是 AGI 的证明;新系统可监控性下降,“从安全角度看不是好事”;他还注意到热情的支持者拿到了提前预览,怀疑论者没有。
这些评测与评价出炉时,按 Sottiaux 当晚发布的说明,铺开还需数日才能完成。
到 9 月 4 日上午这两条推文为止,OpenAI 给出的确定信息只有两项:按天累积的补偿条款,和“在不久的将来”开始广泛铺开。Pro 之后轮到哪些层级、何时轮到,两条推文都没有给出日期。