AREX Feed Article
OpenAI 发布 GPT-6 Astra:独立智能指数 61 分持平上代、落后 Fable 5.1 与 Muse Spark 1.3
9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra,主打无需人工干预、长时间自主完成复杂多步任务的智能体(agent)能力。韩国科技媒体 The Elec 在 9 月 8 日上午(韩国时间 11:32)更新的报道中写道,独立评测机构 Artificial Analysis(AA)的综合智能指数(Intelligence Index)给 Astra 打出 61 分,与上一代 GPT-5.6 Sol 持平,落后 Anthropic 的 Claude Fable 5.1(66 分)与 Meta 的 Muse Spark 1.3(62 分),编码智能体指数(Coding Agent Index)同样未居榜首。
OpenAI 自己的说法是另一套:官方称 Astra 是“世界上最智能、最对齐的模型”, 并公布了一批在 Terminal-Bench 4.0、OSWorld 等任务上刷新纪录的数字。The Elec 报道称,OpenAI 把 Astra 描述为 semi-AGI(准通用人工智能),CEO Sam Altman 形容它代表“新的能力层级”,预期将带来创业、创造力、经济增长与科学发现的繁荣。两套口径在同一周出现,结论相反。
Artificial Analysis Intelligence Index 榜单截图:GPT-6 Astra(max)为 61 分(箭头所指)。(图片来源:The Elec 报道配图,数据出自 Artificial Analysis)
指数停在 61 分,综合智能没有比 Sol 前进
AA 在 9 月 3 日发布的评测文章里写得更直接:Astra 在综合智能指数上与 GPT-5.6 Sol 同为 61 分,比 Claude Fable 5.1(max with fallback)低 5 分,也落后于 Meta 刚发布的 Muse Spark 1.3(max)。
按 The Elec 的梳理,Fable 5.1 比 Astra 早两天发布,拿下 AA 指数迄今最高的 66 分;Muse Spark 1.3 次日发布,以 62 分首次进入 60 分档,排在 Fable 5.1 与 Claude Opus 5 之后列第三。
61 分没有变化,不代表所有子项都没进步。AA 的数据显示,Astra 在 Humanity's Last Exam 上比 Sol 高 6 分,但在衡量 44 种职业经济价值任务的 GDPval-AA v2 上掉了约 80 Elo,τ³-Banking(客服)、SciCode(科学领域 Python 问题)、AA-LCR(长文档长上下文推理)等也有 2~3 分退步,进步与回退在指数里相互抵消。
编码智能体指数上,位置同样靠后。AA 称,在 OpenAI 的编程工具 Codex 环境中,Astra 得 67 分,而 Claude Code 里的 Claude Fable 5.1 以 70 分领跑;The Elec 引用的 AA 榜单显示,这一分数比 GPT-5.6 Sol 高 2 分,但排在 Claude Opus 5 与 Muse Code 中的 Muse Spark 1.3 之后。
Artificial Analysis Coding Agent Index 榜单截图:Codex 中的 GPT-6 Astra(max)为 67 分(箭头所指)。(图片来源:The Elec 报道配图,数据出自 Artificial Analysis)
衡量长程智能体工作的 AA-Briefcase(四个持续数周的知识工作项目、共 91 项任务)上,Astra 也没能排到最前:分数较前代上升约 80 Elo,但仍低于 Anthropic 的 Claude Fable、Opus 以及 SpaceX 的 Grok 4.6。
提价 2.5 倍之后,AA 算出每任务成本高 75%
AA 对 Astra 的主要批评在价格。Astra 在 OpenAI API 的标准定价是每百万输入/输出 token 10 美元/50 美元;AA 指出,GPT-5.6 Sol 目前的促销价为 4 美元/20 美元,Astra 全线涨了 2.5 倍。
AA 测算,最高推理强度(max)下 Astra 的输出 token 比 Sol 少约 10%,但每个任务的实际成本仍比 Sol 高 75%,价格涨幅远大于 token 效率收益。
成本结论会因任务类型反转。AA 称,在 Codex 环境下 Astra 用的 token 只有 Sol(max)的三分之一、Claude Opus 5(xhigh)的五分之一。
编码智能体指数上,AA 称 Astra 与 Sol(max)的每任务成本几乎相同,指数得分更高;与 Claude Fable 5 同分时,每任务成本不到 Fable 5 的一半。The Elec 的概括是:Astra 当编码智能体用相对省钱,做通用推理与知识工作则明显更贵。
AA 评测中 Astra 的亮点之一是幻觉率。在衡量知识可靠性与幻觉的 AA-Omniscience 上,Astra 最高强度设置的幻觉率从 92% 降到 51%,准确率还提高了 4 个百分点。
The Elec 解释了这套计分逻辑:幻觉率只统计模型尝试作答中答错的比例,拒绝回答不计入分母。The Elec 分析认为,如果 Astra 只是变得更谨慎、更多拒答,正确数会同步下降,准确率应跟着下滑;准确率不降反升,说明模型区分“知道”与“不知道”的能力(校准,calibration)有所改善,而非单纯变保守。
OpenAI 自家表格里,任务榜几乎全线新高
OpenAI 发布博客给出的是另一番图景:官方称 Astra 是迄今最强的软件工程模型,也是最强的 computer use(计算机操作)模型。
官方数据里,复杂终端任务基准 Terminal-Bench 4.0 得分 57.9%,上一代 Sol 为 37.3%,官方对照表中 Claude Fable 5.1 为 55.8%。
官方对照表中,直接操作电脑界面的 OSWorld 得分 72.6%,对 Sol 的 65.7%,同一任务耗时约 40 分钟对 75 分钟,快约 47%;像人一样操作网页的 Mind2Web,任务完成速度快 1.9 倍;科学场景的 Terminal-Bench Science 0.1,官方称 Astra 以 64.6% 居对比模型之首(Claude Fable 5.1 为 52.6%)。
GPT-6 Astra 的 Terminal-Bench Science 0.1 评测结果。(图片来源:The Elec 报道配图,数据出自 OpenAI)
长上下文是另一个卖点。按官方文档,Astra 支持 105 万 token(1.05M)的上下文窗口,最大输出 128,000 token。OpenAI 用“8-needle”设置公布的 MRCR v2 长上下文检索结果显示:256K~512K 区间准确率 100%,512K~1M 区间 96.3%;同口径下 Sol 为 91.5% 与 73.8%。
配合 Codex 的异步工具调用(Async tool calling)与中途转向(Mid-turn steering),模型可以在等待用户回答时继续推进不相关的任务,也可以在任务进行中接收新指令并保留已完成的工作。
分歧的机制由此清楚。AA 的文章把指数分数与每任务成本放在一起看:综合智能指数覆盖数学、客服、科学编程与经济价值任务等更宽的面,编码场景则单独核算 token 效率与价格;OpenAI 的博客挑出它最强的任务,报最高设置的成绩。OpenAI 自己的对照表里也印着 AA 的指数:Intelligence Index v4.1.1 一栏写 GPT-6 Astra 61.2、Claude Fable 5.1 65.7,与 AA 公布的 61 与 66 一致(四舍五入差异)。也就是说,61 与 66 这两个分数本身没有争议,争议在于指数纳入哪些评测、成本按哪种场景计算。
首个“Critical”评级,测试中发现两个零日
这次发布真正的新机制在安全侧。按 The Elec 的报道,Astra 是 OpenAI 网络安全 Preparedness Framework(自愿性前沿模型安全风险管理框架)下首个达到“Critical”(严重级)的模型。
该级别的定义是:模型无需逐步人工指令,就能在防护良好的加固系统上发现此前未知的漏洞(零日),并将其发展为可用的漏洞利用程序(exploit);或只凭高层级攻击目标,就能设计并执行新的攻击策略。
OpenAI 在发布博客里补充了测试细节:内部评测中,Astra 发现并利用了两个此前未知的零日漏洞,OpenAI 称已向维护方披露。OpenAI 还称,在专家主导的评估中,它制造出逃出浏览器沙箱、在宿主机上执行命令的漏洞利用链;无生产防护设置下,它在漏洞利用基准 ExploitBench 上得分 100%,GPT-5.6 Sol 为 78.5%。
OpenAI 称它同步加装了护栏:训练模型拒绝有害的网络攻击请求,公开版本增加系统级防护与监控,并加入阻止未授权活动的机制。限制更少的版本将通过 Daybreak 提供给网络安全防御人员,OpenAI 计划在未来几周内逐步放开。
与 Critical 评级并列的,是 OpenAI 公布的对齐测试:一项受 Hugging Face 事件启发的评估中,面对困难或不可能的任务,无生产防护的 GPT-5.6 Sol 有 48% 的尝试越出授权目标,Astra 为 0%。
Meta 的“缩小差距”说法获得了更多关注
按 The Elec 的观察,这一轮发布潮的聚光灯顺序与预期相反:Muse Spark 1.3 发布时本被认为会在 OpenAI 次日亮出旗舰后失去关注,结果 Meta 关于 Muse Spark 1.3“缩小了与前沿模型的差距”的说法反而获得了更多关注。
这场较量的背景是追赶。The Elec 转引路透社的报道称,OpenAI 正加速追赶 Anthropic,后者在企业客户市场的份额不断扩大;海外媒体把 Astra 视为 OpenAI 从 Anthropic 手中夺回 AI 领先地位的努力。
对 OpenAI 来说,围绕 61 分的检验尚未结束:按发布当天公布的计划,Astra 先向有限机构开放,未来数日将覆盖全部 ChatGPT Plus、Pro、Business 与 Enterprise 用户,并通过 OpenAI API 与 AWS 提供。全量开放后的实际使用数据,将是 61 分之外下一批可核对的内容。