AREX Feed Article
Grok 4.5 Medium 登顶 LaurenBench,Elon 放话:4.6 下周就到
7 月 31 日,Grok 4.5 Medium 在 LaurenBench 以 56.9% 的得分拿下第一,击败 Claude Sonnet 5、Claude Opus 5、GLM 5.2、Kimi K3 和 GPT-5.6。
同一天,Elon Musk 宣布 Grok 4.6 下周发布。
7 月 8 日才上线的 Grok 4.5,三周后刚在一个关键 agent 基准上爬到第一,接班人已站在门口。而且这只是 Medium——中等推理档位。
"Grok 4.5 还没享受到第一名,4.6 下周就到了"
拥有 380 万粉丝的 X 头部主播 Mario Nawfal 发推直呼:"Grok 4.5 barely had time to enjoy first place." 该推文获 58K 浏览、195 次点赞。他写道 Grok 4.5"不会在聚光灯下待太久"。
更早引爆话题的是 DogeDesigner(@cb_doge)。这位 189 万粉丝的 X 大 V 在 7 月 29 日贴出 LaurenBench 排行榜截图,配文"BREAKING: Grok 4.5 ranked #1 on LaurenBench with a score of 56.9%",斩获 4.39M 浏览、1,820 次点赞、348 次转发。榜单上,Claude Sonnet 5、Opus 5、GLM 5.2、Kimi K3 和 GPT-5.6 全部排在 Grok 4.5 Medium 后面。
Elon Musk 本人连发三推构成第三层引爆。7 月 24 日:"Grok 4.6 in 2 weeks and Grok 4.7 in 4 weeks"(1.75M 浏览,11K 点赞)。7 月 28 日补充细节:4.6 是 1.5 万亿参数模型,SFT 与 RL 大幅升级,定档 8 月 7 日前后;4.7 是 2.1 万亿参数,在各方面优于 4.6。该推收获 6M 浏览、21K 点赞。7 月 30 日 Elon 追加一句:"And Grok 4.6 is a significant improvement"(5.4M 浏览,8.8K 点赞)。7 月 31 日当天他还发推"Try Grok 4.5",附上 X.ai/cli 链接,再获 1.2M 浏览。
社区反应两极。有中文用户调侃"AI 榜一体验卡按周发放了属于是",也有开发者冷静指出:"leaderboard 只有在测试条件和评分方法完全透明时才有意义。"
三个月三级跳:4.3 → 4.5 → 4.6
4 月 30 日,xAI 发布 Grok 4.3,在 BenchLM 上得分 64.2,定价 $1.25/$2.5 每百万 token。彼时 Anthropic 的 Claude Opus 系列占据 agentic 任务心智高地,OpenAI 的 GPT-5.6 系列在 coding 领域设定参考线。
7 月 8 日,Grok 4.5 上线。这是 xAI 与 Cursor 联合训练的 Mixture-of-Experts 模型,训练数据包含万亿级 token 的 Cursor 用户交互数据,覆盖代码库操作、开发者-agents 协作模式。Elon Musk 称其为"Opus-class 模型,但更快、token 效率更高、成本更低"。BenchLM 得分从 64.2 跃升至 75.5,排名杀入 216 个模型的第 8。Forbes 以"SpaceXAI 史上最强模型"为标题报道。
7 月 24 日至 31 日,Elon 在一周内连发三条 Grok 4.6/4.7 预告,累计 13M 浏览,41K 点赞。从 4.3 到 4.5 用了两个半月,从 4.5 到 4.6 只有一个月。xAI 的发版时钟正在从季度级切换到月度级。
Agentic 冲进 91 分位,但节奏才是真正的武器
LaurenBench 56.9% 的得分背后,是 Grok 4.5 在真实 agent 场景中的结构化优势。该基准测试对话、工具调用、记忆管理和安全合规四个维度,Grok 4.5 Medium 在每个维度上压制了 Claude Sonnet 5 和 GPT-5.6。
在 BenchLM 的综合榜单上,Grok 4.5 以 75.5 分位列 216 个模型的第 8 名。其最强分类是 Agentic——130 个模型中排第 12,处于 91 分位。Coding 排名第 29,位于 131 个模型的 78 分位。
具体 benchmark 数据:SWE-bench Pro 64.7%,SWE Multilingual 78%,Terminal-Bench 2.0 83.3%。VulcanBench v3 取得 91.3%,是当前 best verified 成绩。API 定价为输入 $2/百万 token、输出 $6/百万 token,500K 上下文窗口。
但让竞争对手不安的不是分数本身,而是迭代速度。Elon 明确表示 4.6 是 1.5T 参数模型,SFT 和 RL 有显著升级;再几周后 2.1T 参数的 4.7 跟进。当其他实验室还在打磨上一个版本,xAI 已经完成了下一个版本的训练。
"三家垄断前沿"的叙事,正在被 SpaceX 速度撞出裂缝
过去两年,AI 行业默认只有三家实验室能竞争前沿模型:OpenAI、Anthropic、Google DeepMind。三者在发布节奏上形成了默契——OpenAI 的 GPT-5.x 系列约每 4 至 6 个月迭代一次,Anthropic 的 Claude 系列周期相似。这种节奏保证每家都有时间打磨模型、消化工程债务。
xAI 打破了这个默契。Grok 4.3 到 4.5 的间隔约为两个半月,4.5 到 4.6 被压缩到一个月。Elon 7 月 28 日明牌了路线图:1.5T → 2.1T 两连发,间隔仅几周。
加速不是没有代价。Grok 4.5 的 API 定价从 4.3 的 $1.25/$2.5 涨到 $2/$6——成本转嫁到了用户端。BenchLM 数据也显示,Grok 4.5 在 Knowledge、Math、Multilingual、Multimodal 和 Instruction Following 五个类别中完全没有被测数据,说明 xAI 选择了聚焦 agentic 和 coding 的"偏科"路线。
但市场似乎不在意这些短板。DogeDesigner 推文的 4.39M 浏览和 Mario Nawfal 的 58K 浏览说明,社区真正关心的不是绝对分数,而是"又一家公司杀进来了"的叙事冲击力。
Elon 推文下有一条高赞回复精准概括了心态:"By the time competitors optimize for 4.5, 4.6 is already on the launch pad."当对手还在为 4.5 调参,4.6 已在发射台。
当对手还在追 4.5,xAI 已经在写 4.7 的测试用例
Grok 4.5 Medium 登顶 LaurenBench 的意义不在 56.9% 这个数字本身。下个月这个数字就会被 4.6 覆盖,再下个月被 4.7 覆盖。真正重要的是,xAI 用不到一年时间从"Musk 的副业"走到了 agentic 任务的第一梯队,并且在 Anthropic 和 OpenAI 拉长发版周期的当口反向提速。当发布节奏本身变成竞争武器,追赶者与领跑者的身份就互换了。
Sources
- — 3.8M followers, 58K views, 195 likes (Jul 31, 2026)
- — 1.89M followers, 4.39M views, 1,820 likes (Jul 29, 2026)
- — 6M views, 21K likes (Jul 28, 2026)
- — 5.4M views, 8.8K likes (Jul 30, 2026)
- — 1.75M views, 11K likes (Jul 24, 2026)
- — 1.2M views, 2.5K likes (Jul 31, 2026)
- — Score 75.5/100, #8 of 216, Agentic #12 (91st percentile)
- — Joint training with SpaceXAI, MoE architecture, RL on difficult problems (Jul 8, 2026)
- — "strongest model ever" (Jul 8, 2026)