AREX Feed Article
Grok 4.6 并列登顶 Agentic Index:59 分追平 Opus 5 Max,每任务成本 0.84 美元
8 月 17 日,X 账号 changis_k 发布推文称,xAI 的 Grok 4.6 在 Artificial Analysis Agentic Index 上以 59 分并列第一,与 Claude Opus 5 Max 同分。该指数衡量 tool use、planning、autonomy 与复杂问题求解能力,而不是单题作答。推文给出的效率对比是:Grok 4.6 平均约 53 轮、约 5 亿 input token 完成一项任务,Claude Opus 5 Max 要约 103 轮、约 20 亿 token;每任务成本 0.84 美元,落在「智能 vs 每任务成本」的帕累托前沿上()。 也列出了相同结果:Claude Opus 5(Max Effort)59 分、Grok 4.6(high)59 分、Claude Opus 5(Xhigh Effort)58 分。
Grok 4.6 是 xAI 上周发布的前沿模型,定价维持每百万 token 输入/输出 $2/$6;8 月 14 日, 宣布它上线 Copilot 的 Pro、Pro+、Max、Business、Enterprise 全部 SKU,称其「为 agentic 编码和复杂多步工作流设计」,内部测试在终端类编码任务与长周期 agentic 工作流上表现强劲;8 月 15 日,。则给出了另一组数字:Intelligence Index 61 分、每任务成本 0.84 美元。如今,它在独立榜单上与 Opus 5 Max 并列榜首。
59 分并列第一:Grok 4.6 与 Opus 5 Max 同登榜首
changkis_k 的简介自称关注 Pre-IPO 与私募市场(@openstocks_hq、@allocationsinc),并非 Artificial Analysis 官方账号;但榜单本身证实了它的说法。按 AA 官方 FAQ,Agentic Index 由 GDPval-AA v2 与 τ³-Banking 两个基准等权平均而成,与 Intelligence Index 同尺度;FAQ 列出的前三名是 Claude Opus 5(Max Effort)59 分、Grok 4.6(high)59 分、Claude Opus 5(Xhigh Effort)58 分。changkis_k 这条推文获得了约 370 万次浏览。
这个位置比 Grok 4.6 在综合智力榜上的排名更靠前。AA 8 月 12 日的分析给出:Intelligence Index 61 分,与 GPT-5.6 Sol(max)持平,排在 Claude Opus 5(max,63)和 Claude Fable 5(max with fallback,62)之后;在 agentic 单项上,GDPval-AA v2 的 Elo 1753 仅次于 Claude Opus 5,与 Fable 5、Qwen3.8 Max 的置信区间重叠,τ³-Banking 50.7% 位居前二,Terminal-Bench v2.1 88.4% 与领先模型持平。AA 的总结是:Grok 4.6 最强的结果来自 agentic 工作,而非静态推理。
同一个 59 分,Opus 5 Max 跑 103 轮,Grok 4.6 只跑 53 轮
changkis_k 推文里最有信息量的是效率对比:53 轮对 103 轮、5 亿对 20 亿 input token、每任务 0.84 美元。这组数字能在 AA 8 月 12 日的文章里找到出处:在 AA-Briefcase(AA 自有的长时程 agentic 知识工作基准)上,Grok 4.6 的 Elo 为 1577,处于 Fable 5 档次、落后于 Opus 5 家族,但「显著省轮次」——文章给出与 changis_k 完全相同的 53 轮/5 亿 vs 103 轮/20 亿 token 对比,并解释:长时程 agentic 任务会快速累积上下文,能以一半轮次、四分之一输入 token 拿到相近答案的模型,成本优势远超单 token 定价本身。
成本端的账在 changis_k 的推文里写得更直白:「企业买 agent 是按完成任务付费,不是按基准分数付费。轮次效率决定长流程在规模上是否付得起。」他的结论是:「两家实验室现在并列该指数榜首,成本结构却完全不同。买家第一次在 agentic 部署上有了真正的价格选择。」
Baker 称「远超 Fable 5」,Musk 却说 Fable 5 整体更聪明
8 月 15 日,播客剪辑账号 (简介自称 Podcast Clipper,约 92.6 万粉丝)贴出 Gavin Baker 在 All-In 播客上谈论 Grok 4.6 的片段,并注明完整节目见 @theallinpod。Baker 是 ,其 X 简介写着 "Managing Partner & CIO, @atreidesmgmt",并注明 "views my own"。片段里他说:「这相当惊人……你远超 Fable 5,我想多数人会同意它是金标准……几乎没有投资人讨论 Grok,而它在很多指标上帕累托占优……也许人们开始考虑 SpaceX 的时候,也该考虑 Grok。」
Musk 当天回复(,约 1.5 万点赞、约 260 万次浏览):「值得试试 Grok 4.6。Fable 5 整体上更聪明,但 Grok 快得多、成本更低。Grok 4.7 有很好的机会在智能上超越现有全部模型。」两人口径并不一致:Baker 说 Grok 远超「金标准」Fable 5,Musk 自己则承认 Fable 5 整体更聪明。榜单给出的画面也更细:被 Baker 称为金标准的 Fable 5 不在 Agentic Index 前三(59/59/58 之外),但它在 Intelligence Index 上的 62 分仍排在 Grok 4.6 的 61 分之前。
「Grok 4.7 有机会超越所有模型」:没有时间表的预告
8 月 15 日,Musk 发推称「Grok has improved massively」(,约 600 万次浏览);8 月 17 日称「Grok 4.6 is smart, super fast & affordable」(,约 430 万次浏览),当天深夜又称「Grok is very good at agentic tasks!」(,约 320 万次浏览)。
这些推文都是 Musk 的主张,不构成独立验证;「Grok 4.7 有机会超越现有全部模型」同样没有时间表,也没有给出衡量标准。
并列 59 分,但「谁第一」的表述并不一致
changkis_k 说 Grok 4.6「登上榜首(并列)」,AA 官方 FAQ 的措辞则是「Claude Opus 5(Adaptive Reasoning, Max Effort)目前拥有最高的 Agentic Index 分数,59 分」。分数一致,口径不同:AA 把 Opus 5 Max 放在列表最前。另一个需要留意的细节:53 轮/5 亿 token 的效率数字,changkis_k 放在 Agentic Index 的叙述里,AA 自己的文章则把这组数字挂在 AA-Briefcase 名下,引用时需注意出处。
对买家来说,目前可核实的是:并列 59 分,Grok 4.6 每任务 0.84 美元、定价 $2/$6,Opus 5 Max 定价 $5/$25。而按 AA 的说明,榜单会随新模型发布持续更新。截至 8 月 18 日,AA 页面列出的前三仍是 59、59、58。