AREX Feed Article
Grok 4.6 定档 8 月 6 日,Grok 4.5 登顶 LaurenBench 力压 Kimi K3 与 GPT-5.6
7 月 30 日,Elon Musk 在 X 平台发帖确认 Grok 4.6"一周后发布",将上一份报告中的"8 月 7 日前后"进一步精确至约 8 月 6 日。与此同时,Grok 4.5 在全新基准 LaurenBench 上以 56.9% 的得分排名第一,领先 Claude Sonnet 5、GLM 5.2、Claude Opus 5、Kimi K3 和 GPT-5.6。
Grok 4.6 参数争议尘埃落定:1.5T 而非 2T
Musk 于 7 月 28 日的发帖对前两周的混乱信息做了最终澄清:Grok 4.6 沿用 Grok 4.5 的 1.5 万亿参数 V9 基础架构,提升全部来自监督微调(SFT)与强化学习(RL)的后训练改进;真正的参数跃升——2.1 万亿参数——将留给数周后发布的 Grok 4.7。
此前包括 Dataconomy、NextBigFuture 在内的多家科技媒体基于 Musk 7 月 18 日提及"2T model"的发言,普遍将 Grok 4.6 报道为 2 万亿参数模型。Musk 7 月 28 日的澄清纠正了这一理解——他当时提到的"2T model"实为 Grok 4.7,而 Grok 4.6 的策略是"以更小的参数规模,通过更强的后训练匹敌 Kimi K3"。
LaurenBench 榜首:意料之外的 Agent 能力信号
7 月 29 日,DogeDesigner(@cb_doge)发布了一张 LaurenBench 排行榜截图,显示 Grok 4.5 以 56.9% 的综合得分位居第一。Musk 随后转发了这条推文。
LaurenBench 是一个面向真实 AI Agent 场景的基准,测试范围涵盖对话、工具调用、记忆和安全四个维度。Grok 4.5 的登顶在两方面值得关注:
- 领先模型覆盖广:被超越的模型横跨 Anthropic(Claude Sonnet 5、Claude Opus 5)、OpenAI(GPT-5.6)、Moonshot(Kimi K3)和智谱(GLM 5.2),覆盖面空前;
- 与此前评测形成对比:在 Artificial Analysis 的综合 Intelligence Index 上,Grok 4.5 仅列第四(54 分);LaurenBench 的 Agent 专项测试揭示其在真实工作流场景中可能被低估。
目前 LaurenBench 的官方方法论文档和完整排行榜尚未公开,仅通过 DogeDesigner 的截图流传。分数解读需谨慎对待,但这一结果至少表明:Grok 4.5 的 Agent 能力——在 SWE-Bench Pro(64.7%)和 Terminal-Bench 2.1(83.3%)之外——有额外的独立验证支撑。
本次更新来源
- (2026-07-30)
- (2026-07-28)
- (2026-07-29)