AREX Feed Article
xAI 放出 Grok 4.6:同价升级,十项基准全超4.5
北京时间 8 月 12 日 23:32,xAI 官方账号 发推宣布 Grok 4.6 上线,称其具备「frontier intelligence」,是较 Grok 4.5「at the same price」的显著升级。发布约四小时后,这条推文的浏览量超过 730 万,点赞 2.1 万。
价格写在里:每百万输入 token 2 美元、输出 token 6 美元,官方还自称这是其他前沿模型的一半。同时挂出一张十行基准对比表,Grok 4.6 的分数全部高于 4.5,一行不落。
三分钟后,kimmonismus 把领先项和落后项各数了一遍
拥有 13.3 万粉丝的科技分析师、@getsuperintel 主编 在官宣三分钟后发推:「Grok 4.6 released, absolutely insane crazy jump! xAI was cooking!」
他对照官方数据数了一遍:4.6 在 AA Intelligence Index 上以 61 分打平 GPT-5.6 Sol,在 CursorBench、FrontierCode、AA-Briefcase 上领先,在 DeepSWE 与 Terminal-Bench 上仍落后。
他自己划了条底线:这些都是公司自报结果,但较 Grok 4.5 的提升几乎覆盖全部公开评测。
X 简介自称「OG OpenAI prompt whisperer」、拥有 67.8 万粉丝的 只回了一句「Fixed it for you:」,附上一张四家模型并排的对比表图,这条回复拿到 1336 个赞。
27 天前的 Grok 4.5 就是 $2/$6,这次价签没动
Grok 4.5 发布于 7 月 16 日,写明 API 定价为每百万输入 token 2 美元、输出 token 6 美元,主打 coding、agentic 与知识工作,并且是与 Cursor 一起训练的。所以 4.6 推文里的「same price」,指的就是这套价格分文未动。
4.6 公告第一段把重点放在「long-running agents」和更大野心的交互、视觉工作:能跨很多步完成研究、跨代码库工作,或把一个想法做成可用的应用。
这个方向恰好对上 4.5 丢分最多的地方。对比表里,Grok 4.5 High 在 DeepSWE v1.1 上只有 54%、在 Terminal-Bench v3.0 上只有 15.7%,是它与 GPT-5.6 Sol 差距最大的两行。
十行全超 4.5,长程 agent 两行仍落后 GPT-5.6 Sol
列出十项 coding 与知识工作基准,Grok 4.6 High 相对 Grok 4.5 High 全部更高。百分点提升最大的是三行:DeepSWE v1.1 从 54% 到 65.9%,APEX-Agents 从 47.1% 到 57.5%,Terminal-Bench v3.0 从 15.7% 到 26%。
九基准综合分 AA Intelligence Index 从 56 升到 61,与 GPT-5.6 Sol 打平。
补课的两行仍然落后:DeepSWE 上 65.9% 对 GPT-5.6 Sol 的 73%,Terminal-Bench 上 26% 对 34.6%。
训练口径上,公告称 4.6 做了比 4.5 更长的补充训练,使用人工筛选的模型生成数据与高质量工程数据,并用 Grok 4.5 重新生成 SFT 轨迹、以模型检查过滤问题轨迹;强化学习覆盖 kernel 优化、web 开发、CAD 等环境。
xAI 还观察到,长轨迹里模型开始更多地自我测试、先验证再往下走。安全方面,公告称护栏随能力重新校准,并做了迄今规模最大的一套发布前测试。
首发周双倍额度:Cursor、Grok Build 与 API 同步开跑
4.6 当天就在 Cursor 与 Grok Build 上线,API 及 OpenRouter、Vercel、Cloudflare 等渠道同步开放;已经写明「Now powering Grok Build」。
促销也一并跟上:发布后第一周,Grok Build 与 Cursor 内包含的用量翻倍。定价从每百万输入 token 2 美元、输出 token 6 美元起,另有一个价格翻倍的 fast 版本。「其他前沿模型的一半」这个说法,xAI 没有在公告或推文里展开对照。
十行最高分,Grok 4.6 只占三行
同一张表里,每行最高分被加粗。数一遍:Grok 4.6 在 GDPVal-AA v2(1753)、AA-Briefcase(1577)与 Harvey LAB(15.8%)三行居首。
Fable 5 Max 拿下 AA Intelligence Index、CursorBench、FrontierCode、APEX-Agents、APEX-SWE 五行;GPT-5.6 Sol 拿下 DeepSWE 与 Terminal-Bench 两行。
表下脚注写明,第三方模型成绩取自各厂商自报或公开结果中的最佳值。整张表都是厂商口径。在外部复测与第三方榜单回填之前,xAI 说的「显著提升」锚定的是自家上一代;对 GPT-5.6 Sol 和 Fable 5 Max 的每一项领先,都还停在自报数字上。