AREX Feed Article
Grok 4.6 上线 Perplexity:WANDR 与 Fable 5 同分,任务成本低逾 60%
在 8 月 13 日 18:39(UTC,下文时间同)宣布,Grok 4.6 现已上线 Perplexity 与 Perplexity Computer,并同步给出自家 WANDR 基准的成绩:模型位于性能与效率的帕累托前沿,以与 Fable 5 相当的分数、低逾 60% 的成本完成同等任务。随公告附上的图表写明了两组关键数字:Grok 4.6 与 Fable 5 同为 0.496 分,前者每任务成本 $7.58,后者 $20.30。
Grok 4.6 由 SpaceXAI(原 xAI, 称其为 Elon Musk 的公司)于 8 月 12 日,官方称其提供前沿智能、较 Grok 4.5 显著提升且价格不变;VentureBeat 汇总的 API 起步价为每百万输入 token $2、输出 $6,并刊载了 SpaceXAI 随发布公开的基准对比表(见下图),将 Grok 4.6 与 Grok 4.5、GPT-5.6 Sol Max、Fable 5 Max 并排对比。8 月 13 日,SpaceXAI 官方账号先在 18:04 宣布 ,约 35 分钟后 Perplexity 跟进。
0.496 同分,每任务成本差约 2.7 倍
Perplexity 公告的措辞是“matching Fable 5 results at over 60% lower cost”,即与 Fable 5 成绩相当、成本低逾 60%。其附带的图表题为“Grok 4.6 on WANDR”,副题注明“WANDR score vs. cost. August 2026.”,横轴是每任务成本,纵轴是分数。
图上一共六个模型点:GPT-5.6 Terra 0.399 分、$1.98;GPT-5.6 Sol 0.426 分、$4.99;Grok 4.6 0.496 分、$7.58;Opus 5 0.537 分、$11.60;Sonnet 5 0.309 分、$5.75;Fable 5 0.496 分、$20.30。
按图表数字计算,Fable 5 的每任务成本是 Grok 4.6 的约 2.7 倍,Grok 4.6 低约 62.7%,与公告“低逾 60%”的说法一致。一条青色折线穿过 GPT-5.6 Terra、GPT-5.6 Sol、Grok 4.6、Opus 5 四个点,Grok 4.6 被高亮圈出,Sonnet 5 与 Fable 5 落在折线下方。分数最高的是 Opus 5(0.537),它的成本也更高($11.60)。
WANDR 是 Perplexity 7 月发布的开源基准与评测框架,全称 Wide ANd Deep Research。据 ,它围绕 500 个知识工作数据收集任务构建:“wide”要求发现大量合格实体,“deep”要求每条记录都有可核验的证据。评分时逐条记录重新抓取引用页面,检查摘录是否真实存在、是否支撑对应主张;中位任务要求 50 个成员、共 245 条记录。
Grok 4.6 的 0.496 分来自 Perplexity 自家基准与自家评测流程,公告只附了这张图,没有给出任务选取与评测配置的细节。
以 orchestrator 身份,向 Pro 和 Max 用户开放
Perplexity 联合创始人兼 CEO Aravind Srinivas 在 18:46 补充了两个信息:Grok 4.6 在 WANDR 上是以 orchestrator(编排器)的身份跑分的,原话是“benchmarked it as an orchestrator on our Wide-And-Deep-Research benchmark using the Perplexity Computer harness”;开放范围是 Perplexity 上所有 Pro 和 Max 用户。
公告点名的两个入口是 Perplexity 与 Perplexity Computer,后者就是这次评测所用的 harness。Grok 4.6 在评测中扮演 orchestrator:WANDR 的任务要求大范围收集实体并为每条记录附上可核验证据,衡量的是模型编排整条流程的能力。
Opus 5 分数更高:帕累托前沿不是最高分
X 用户 X Freeze(约 25.8 万关注者)在 19:31 拆解这张图:“Both score exactly 0.496”(两模型恰好同为 0.496 分),并把每任务成本并列:Grok 4.6 为 $7.58,Fable 5 为 $20.30。他据此称 Grok 4.6 “comfortably outperforms GPT-5.6 Sol”(图表中 GPT-5.6 Sol 为 0.426 分、$4.99)。这是第三方账号对官方图表的解读,不是独立评测。
Elon Musk 在 8 月 12 日 17:04 发推称“Grok 4.6 is objectively #1 when considering intelligence, speed & cost”(综合智能、速度与成本,),8 月 13 日 04:36 又:“Grok 4.6 has a great sense of humor”(Grok 4.6 幽默感出色)。两条都先于 Perplexity 公告发布,都是 Musk 本人的判断,未附任何评测来源,与 Perplexity 图表中 Opus 5 分数更高的事实并存。
“帕累托前沿”的正确读法是:在分数与成本两个维度上,没有其他模型同时优于 Grok 4.6;它并不表示 Grok 4.6 得分最高,图表中 Opus 5 的分数更高(0.537)。公告没有回答:低逾 60% 的成本优势会以什么形式折算进订阅账单或配额。