AREX Feed Article
Artificial Analysis 实测 Grok 4.6:61 分追平 GPT-5.6 Sol,打平 Fable 5 只需五分之一成本
8 月 12 日,独立评测机构 Artificial Analysis 先发布,再连发两条推文,公布 SpaceXAI 模型 Grok 4.6 的实测结果。第一条的核心是:在它的 Intelligence Index 上,Grok 4.6 得 61 分,与 GPT-5.6 Sol (max) 持平,排在 Claude Opus 5(max,63 分)与 Claude Fable 5(max with fallback,62 分)之后,刚好压过 Kimi K3;按 AA 的测量,Grok 4.6 每任务成本 0.84 美元,与 Kimi K3 相同,智能分数略高。
同一天稍晚的第二条给出另一组对照:在 AA 的私有长程基准 AA-Briefcase 上,Grok 4.6 与 Claude Fable 5 的置信区间重叠,统计上打平;每任务成本 4.42 美元,约为 Claude Fable 5(22.30 美元)的五分之一,也低于 Claude Opus 5(17.79 美元)和 Kimi K3(6.73 美元)。
61 分追平 GPT-5.6 Sol,离 Opus 5 还差两分
61 分是 Grok 4.6 发布一个多月后的测量:比 Grok 4.5 高 5 分,比 Grok 4.3 高 23 分。AA 据此给出的判断是,SpaceXAI 重回智能前沿,与 OpenAI 并列,仅落后 Anthropic(brings SpaceXAI back to the intelligence frontier alongside OpenAI, behind only Anthropic)。
这个指数在 AA 上的当前版本是 v4.1.1,由九项评测复合而成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR。61 分是九套题合成的一个复合分数。
GDPval-AA v2 Elo 1753:只落后 Claude Opus 5
长文把 Grok 4.6 最强的部分归结为 agentic 工作。GDPval-AA v2 是 AA 所称衡量真实世界 agentic 知识工作的首要指标(our leading measure of real-world agentic knowledge work),Grok 4.6 在它上面拿到 Elo 1753,只落后 Claude Opus 5,与 Claude Fable 5、Qwen3.8 Max 的置信区间重叠。
另外两项 agentic 分数:τ³-Banking 50.7%,与 Qwen3.8 Max(51.3%)同处前两名;Terminal-Bench v2.1 88.4%,与领先模型同档。文章的判断是,很少有模型能同时在知识工作、客服和终端操作三类任务上有竞争力,叠加定价之后,Grok 4.6 在 Intelligence Index 里的每一项 agentic 评测上都落在成本-性能 Pareto 前沿上。
价格没涨,还进了成本-智能 Pareto 前沿
定价与 Grok 4.5 完全一致:输入/输出每百万 token 2/6 美元,比 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)低 60% 以上。上下文窗口维持 500k token 不变。变贵的是 cache hit 折扣,从 Grok 4.5 的每百万 0.3 美元涨到 0.5 美元。
AA 实测每任务成本 0.84 美元,与 Kimi K3 相同而智能略高,因此落在 Intelligence vs. Cost per Task 的 Pareto 前沿上。文章特意点出这层反常:前沿模型跨代通常伴随涨价(unusual at the frontier),Grok 4.6 用不变的价格换来 5 分的指数提升。
AA-Briefcase 首测:打平 Fable 5,成本是其五分之一
第二条推文公布的是 Grok 4.6 在 AA-Briefcase 上的首次测量。按 AA 的定义,这个基准考长程 agentic 知识工作,要求模型交付表格、演示文稿、备忘录这类成果;测试集不公开,用于防止污染。
Grok 4.6 的 AA-Briefcase Elo 是 1577,排在 Claude Opus 5 家族之后,与 Claude Fable 5 旗鼓相当(neck and neck),置信区间重叠。文章补充说,它在 rubric 评分、演示质量和分析质量三个维度上表现一致,没有哪一项强到可以掩盖另一项的短板。
成本是这条推文的核心:每任务 4.42 美元,对比 Claude Fable 5 的 22.30 美元、Claude Opus 5 的 17.79 美元、Kimi K3 的 6.73 美元。AA 同时记录了回合效率:Grok 4.6 平均用约 53 个回合、约 0.5B 输入 token 完成任务,Claude Opus 5 (max) 是约 103 个回合、约 2.0B token。文章的算账是,长程任务上下文累积很快,用一半回合、四分之一输入 token 拿到可比的答案,成本优势超出每 token 定价本身。
889 万次浏览,和三个需要说明的口径
截至 8 月 14 日抓取时,第一条推文显示约 889 万次浏览、3,399 个赞、360 次转发;第二条推文约 5.3 万次浏览、761 个赞。两条推文结尾都点名 SpaceXAI 和 Elon Musk,第一条祝贺发布,第二条称这次发布 Impressive release。
三个口径需要说明。第一,全部分数出自 Artificial Analysis 一家机构的独立自测,是它的声明;AA-Briefcase 题目不公开,外界无法用同一套题复核这场「打平」。第二,置信区间重叠的意思是统计上无法区分高低,不等于 Grok 4.6 超过了 Claude Fable 5。第三,模型页上(Grok 4.6 (high))还标着 Speed 65.1 和每任务 22k token,这组数字同样来自 AA 的测量。
价格部分可以直接对照:Grok 4.6 每百万输出 token 6 美元,GPT-5.6 Sol 是 30 美元;AA-Briefcase 上与 Fable 5 打平的账单,是 4.42 美元对 22.30 美元。而题目本身不公开,这场打平暂时没有第三方能用同一套题复核。