AREX Feed Article
马斯克预告 Grok 4.7 于 9 月 12 日前后发布,称将超越所有现有模型
北京时间 9 月 2 日上午 11 时左右,埃隆·马斯克(Elon Musk):“Grok 4.7 将于 10 天后推出”。按 9 月 2 日的发文时间推算,这款 Grok 系列下一代模型的发布窗口落在 9 月 12 日前后。抓取快照显示,该推文已累计约 455 万次浏览。
同日,(转载于 )补充了马斯克口径下的规格:Grok 4.7 基于 2.1 万亿参数基座,上一代 Grok 4.6 的基座为 1.5 万亿,马斯克还声称新模型将超越所有现有模型。这些时程、规格与能力声明全部出自马斯克本人的发帖;模型尚未发布,也没有独立基准成绩能验证这些说法。
参数多四成,代价是什么
关于这套架构,马斯克此前已经交代过取舍:模型比 4.6 更大,推理速度会略慢,但 token(词元)利用效率更高。
与规模同步变化的是训练流程。马斯克 8 月中旬曾表示,Grok 4.7 的初步训练已经完成,SpaceX 公司数据正通过补充训练并入模型。也就是说,4.7 相对 4.6 的改动有两处:参数规模与训练数据构成。
SpaceX 语料是 4.7 的独门卖点
BeInCrypto 在报道中完整引用了马斯克的一条发帖:
“Grok 4.7 将超越所有现有模型。话说回来,Anthropic 是一家很棒的公司,很可能很快就会发布改进后的模型。不过,SpaceX 的训练语料实在太棒、太独特了,如果有任何模型能在真实世界工程上比 4.7 更强,我会非常震惊。”(译文,原文为英文发帖)
4.6 追平 GPT-5.6 Sol Max,却在 Terminal-Bench 落后
判断这条工程声明有多大分量,上一代留下的基准成绩是现成参照。SpaceXAI 在发布 Grok 4.6 时称,模型“特别聚焦长时间运行的 agent(智能体),以及更具雄心的交互与视觉工作”。
按 SpaceXAI 公布的数据,Grok 4.6 在 AA Intelligence Index 上得分 61,与 GPT-5.6 Sol Max 持平,落后 Claude Fable 5 Max 的 62 分;此前的 Grok 4.5 为 56 分。
分项榜单上则强弱分明。Grok 4.6 在 GDPVal-AA v2 以 1,753 分领先,但在 Terminal-Bench v3.0 上只拿到 26%,明显落后于 GPT-5.6 Sol Max 的 34.6%,差距 8.6 个百分点。Grok 4.5 呈现同样的模式:在 Artificial Analysis 的 AutomationBench-AA 上以 51.4% 居首、每任务成本 0.34 美元,同时录得每任务 0.63 次护栏违规,高于 Claude Opus 4.8 的 0.55 次。
距上一代上线仅三周,4.7 就定档了
从 7 月公开发布的 Grok 4.5,到 8 月 12 日上线的 Grok 4.6,再到这次预告,发布间隔越收越紧:距离 4.6 上线仅三周,马斯克就给出了 4.7 的时间表。BeInCrypto 用“发布节奏正在收紧”来描述这一变化。
报道同时提到,OpenAI 已宣布其新模型 Astra 即将推出。
独立评测决定这条声明能走多远
BeInCrypto 在报道结尾给出的判断是:SpaceXAI 是否随发布提供独立评测,将决定这条工程能力声明能走多远。发布时会不会附上可复现的基准成绩,是这条声明面临的第一个检验。