AREX Feed Article
NVIDIA 亲自下场叫好,SpaceXAI 用 Grok 4.5 杀入 Agent 编码战场
2026 年 7 月 8 日,AI 圈同一天迎来两枚重磅炸弹:OpenAI 按计划向公众释放 GPT-5.6 Luna,而 SpaceXAI 正式发布了 Grok 4.5——一款专为编码和 Agent 任务打造的前沿模型。更引人注目的是,NVIDIA 官方推特当天公开祝贺,并罕见披露:Grok 4.5 的训练基础设施是 GB300 NVL72。当芯片巨头主动为一个模型的硬件做背书,这场 Agent 军备竞赛的信号已经清晰到无法忽视。
1.5 万亿参数,用对手一半的 token 跑出 Opus 级性能
Grok 4.5 是 SpaceXAI 首款明确瞄准编码和 Agent 任务的前沿模型,也是这家公司在与 Cursor 深度绑定后交出的第一份答卷。根据 Artificial Analysis 的独立评测,它在多项关键指标上给出了极其务实的表现。
智能水平:在 Artificial Analysis Intelligence Index 上,Grok 4.5 得分 54,位列第四——排在 Fable 5、GPT-5.5 和 Claude Opus 4.8 之后,但大幅领先所有开源权重模型和 Google Gemini 系列。相比上一代 Grok 4.3,整整提升了 16 分——这个跃升幅度说明从 v8-small(约 5000 亿参数)到 V9 基础模型(约 1.5 万亿参数,3 倍规模)的代际跨越是真实有效的,不是纸面数字游戏。
在 Agent 场景的核心评测中表现尤为突出:GDPval-AA v2 的 agent 任务 Elo 达到 1543,介于 Opus 4.8(1600)和 GLM-5.2(1513)之间。τ³-Banking 评测中拿下 33% 的得分,超过 GPT-5.5 High 的 31%,位居榜首——这说明在需要多步推理和工具调用的复杂任务上,Grok 4.5 的 agent 能力已经摸到了第一梯队的门槛。
编码 Agent:在涵盖 DeepSWE、Terminal-Bench v2 和 SWE-Atlas QnA 三大测试集的 Coding Agent Index 中,Grok 4.5 通过 Grok Build 取得 76 分,与 GPT-5.5(xhigh)在 Codex 中的表现持平,仅低于 Fable 5(max)在 Claude Code 中的成绩。在模拟真实终端操作的 Terminal-Bench v2 上表现尤其突出,这意味着 Grok 4.5 不仅能写代码,还能像一个真正的工程师一样在命令行里操作文件系统、运行脚本、调试错误。Website Arena 上 Elo 达到 1328、排名第 5,较 SpaceXAI 此前最高模型跃升 25 位,设计能力和"代码品位"进入与 Claude Opus 同档的区间。
但最犀利的武器不是跑分,是效率。
Grok 4.5 完成一个 Coding Agent Index 任务平均消耗 190 万 token——相比之下,Fable 5 在 Claude Code 中消耗 720 万,GPT-5.5 在 Codex 中消耗 620 万。换言之,Grok 用不到对手三分之一的 token 量达到了同等水平。每任务成本仅 $2.49,而 Fable 5 是 $11.80,GPT-5.5 是 $5.07。Intelligence Index 每任务成本更是低至 $0.31,比 GLM-5.2 和 Kimi K2.6 都便宜,性能却更好。
定价层面同样激进:$2/百万输入 token,$6/百万输出 token,缓存命中打二五折到 $0.5/百万。横向对比:Claude Opus 4.8 是 $5/$25,GPT-5.5 Luna 是 $1/$6。Grok 4.5 的定价介于两者之间,但因为 token 用量远低于竞品,实际任务成本反而是最低的。在智能水平每提升 1 分要花多少钱的维度上,Grok 4.5 当前无人能敌。
模型架构方面,Grok 4.5 采用 Mixture-of-Experts 设计,上下文窗口 500K token——相比 Grok 4.3 的 100 万有所缩减,但 Elon Musk 在 X 上表示"下周大概率升级到 1M"。他还透露,团队尚未部署针对 GB300 硬件做精确映射的自研 C/C++ 推理软件,当前推理速度"翻倍甚至更多是有可能实现的"。考虑到目前 Grok 4.5 已经跑到约 80 TPS,如果优化到位,速度和效率优势将进一步拉大。
在训练方法上还有一个关键细节:Cursor 的编码数据是通过"补充训练"阶段加入的,而非从头预训练。xAI 工程师坦言这"不如从初始预训练就加入效果好"。目前正在训练的下一代模型将从预训练阶段就开始融合 Cursor 数据——届时模型对真实编码工作流的理解将发生质变。Musk 放话:"从现在到年底,SpaceX 每个月都会发布一款完全从头训练的新模型。"如果这个承诺兑现,迭代速度本身就会成为一种壁垒。
三个月闪电闭环:SpaceX、xAI、Cursor 三合一
Grok 4.5 真正的故事不止在模型本身,而在于它背后那张史无前例的垂直整合版图。从 SpaceX 合并 xAI 到 Grok 4.5 公开发布,只用了不到五个月——其中关键步骤集中在最近三个月。
把时间线拉直来看:2026 年 2 月,SpaceX 完成与 xAI 的合并,合并后实体估值约 $1.25 万亿,算力基础设施和模型研发归于同一屋檐下。4 月 30 日,Grok 4.3 公开发布,搭载约 5000 亿参数的 v8-small 基础模型——Musk 本人后来承认这代模型有"许多根本性缺陷"。5 月 26 日,1.5 万亿参数的 V9 基础模型完成预训练——此时 Cursor 交易尚未公布,意味着 V9 的预训练阶段没有 Cursor 数据的参与。6 月 16 日,SpaceX 宣布以 $600 亿全股票交易收购 AI 编码工具 Cursor,后者拥有超过 100 万活跃开发者——这是 AI 行业历史上最大的一笔收购之一,且发生在 SpaceX 刚刚完成创纪录 IPO 之后仅数天。6 月 28 日,Grok 4.5 进入 SpaceX 和 Tesla 内部 beta。7 月 8 日,正式公开发布。
这一串事件不是孤立的新闻条目,而是同一个垂直整合架构在实时闭合。算力(Colossus 超算集群)、基础模型(V9/Grok 系列)、编码工具(Cursor)以及工具产生的开发者行为数据——这四环在 2026 年第二季度全部归入了同一个控制实体。在此之前,没有任何一家前沿 AI 实验室同时掌控这四个环节。
训练基础设施方面,Grok 4.5 跑在 NVIDIA GB300 NVL72 系统上。每个机架集成 72 颗 Blackwell Ultra GPU 和 36 颗 Grace CPU,NVLink 带宽 130TB/s,单机架功耗高达 142kW。NVIDIA 此前发布的 AA-AgentPerf 基准测试显示,GB300 NVL72 每兆瓦可并发运行 61400 个编码 Agent,是上一代 H200 的 20 倍。Grok 4.5 是 GB300 在真实大规模训练场景中的首次公开验证,这也是 NVIDIA 主动下场祝贺的核心原因——它用自己的旗舰硬件换了一个最有说服力的客户案例。
Cursor 创始人兼 CEO Michael Truell 在 X 上写道:"这是我们开发过的任何模型都无法比拟的重大进步,包括 Composer 2.5,已经成为我们团队很多人的日常主力。这只是开始,更多发布即将到来。"Cursor 现场 CTO David Pan 则直击客户痛点:"Token ROI 是现在所有人最想谈的话题。Agent 已经变得太好、太普及,大家的预算全都超了。我们的目标是在任何地方提供最好的结果/美元比。Grok 4.5 是朝这个方向迈出的一大步。"
一次官推祝贺,三重信号
NVIDIA 官方账号的祝贺推文言简意赅,但信息密度极高:
"Congrats to @SpaceXAI on Grok 4.5 — trained on NVIDIA GB300 NVL72 systems and purpose-built for coding, agentic tasks, and knowledge work. This is what happens when world-class AI infrastructure meets world-class AI research."
这条推文在 12 小时内收获 560 个赞和 60 次转发——对 NVIDIA 这个 260 万粉丝的账号而言不算爆炸,但核心价值在内容本身。这是 NVIDIA 官方首次为一个客户模型的具体训练基础设施做明确背书。
三句话传递了三层信号。第一,GB300 NVL72 已经进入生产级大规模训练而非实验室阶段——这对 NVIDIA 的企业客户是极强的采购信号。第二,Agent 编码是 NVIDIA 当前押注的核心应用场景——其自研的 AA-AgentPerf 基准同样聚焦这一方向,与 Grok 4.5 的定位高度重合。第三,SpaceXAI 作为 GB300 的首批大客户,正在用实际产品证明这代硬件的竞争力——对正在评估采购的其他 AI 实验室而言,这是一个无法忽视的参照物。
在 AI 行业叙事通常由模型厂商主导的当下,芯片巨头主动为一家客户站台,本身就是竞争格局变化的注脚。它说明模型的竞争重心正在从"谁的参数更大"转向"谁的工程系统更高效"——而在这个新战场上,硬件 + 模型的协同效率比单一维度的领先更重要。
OpenAI 同一天放大招,但 Grok 在另一个维度上出牌
Grok 4.5 的发布时间选择极具戏剧性——恰好是 OpenAI 应特朗普政府要求将 GPT-5.6 Luna 广泛释放的同一天。GPT-5.6 定价 $1/$6,与 Grok 4.5 的 $2/$6 处于同一价格带,但 GPT-5.6 在纯智力评测上仍占据优势。更贵的对手是 Anthropic:Claude Opus 4.8 定价 $5/$25,其最新旗舰 Fable 5 在多项评测中仍居榜首。
SpaceXAI 为 Grok 4.5 选择的定位策略非常清晰:不在纯智力维度上硬刚,而在"工程实用性 × 成本效率"的交叉点上建立统治力。 Musk 在 X 上的定性堪称精准:"我们的内部评估是 Grok 4.5 大致与 Opus 4.7 相当,但快得多。能力、速度和低成本的组合才是它真正有竞争力的地方。我们在追赶真实世界的实用性,不是基准测试。Tesla 和 SpaceX 的硬核工程师认为 Grok 4.5 确实好用——这才是真正重要的。"
独立评测基本支持这个叙事。Artificial Analysis 指出,Grok 4.5 在成本/性能帕累托前沿上占据了一个几乎无人占据的位置——有接近前沿的智能水平,但价格是竞争对手的几分之一。对于需要大规模部署 Agent 的企业客户而言,这个定位的杀伤力不可小觑。
社区反应也迅速跟进。拥有 67 万粉丝的 Miles Deutscher 称其为"市场上性价比最高的 LLM",知名开发者 Theo(t3.gg,35 万粉)评价"相当好而且定价真的很好",Eric Jiang(3.7 万粉)表示已将其设为编码默认模型,xAI 工程师 skcd(3.5 万粉)则分享了实用技巧——在 prompt 末尾加上"use as many subagents and tokens as you need",Grok 4.5 会自动拆分任务并并行执行。Design Arena 官方账号则用数据指出,Grok 4.5 在 Website Arena 上的 25 名跃升证明了"它不仅会写代码,还开始有品位了"。
OpenCode、Kilo Code、OpenClaw 等多家编码工具在 Grok 4.5 发布当天即宣布接入支持。OpenCode 的推文简洁有力:"grok 4.5 is now available in OpenCode Zen"——12 小时内收获 1000+ 赞。
一个值得注意的隐藏博弈:SpaceXAI 目前将其 Colossus 超算集群的部分算力租给了竞争对手 Anthropic 和 Google(今年 5 月刚签署了与 Anthropic 的算力合作协议)。随着自身模型训练需求增长,SpaceXAI 将面临"自用还是出租"的选择——Axios 在报道中直接点出了这个矛盾。Colossus 既是最强武器,也是一笔可以产生收入的资产。当 Musk 承诺"每月一款新模型"时,每一款都需要消耗大量算力——这些算力如果租给 Anthropic 可以立刻变成现金流,如果用于自己训练则押注的是更长远的竞争力。这个张力将在未来几个季度变得越来越尖锐。
Musk 立下每月一款模型的军令状,算力和时间够用吗?
Grok 4.5 是 SpaceXAI 证明其垂直整合战略可行的第一步。它用实际产品回应了外界最核心的疑虑:一家同时掌控算力、模型和编码工具的实体,能否比单纯做模型的公司跑得更快、卖得更便宜?
短期答案是肯定的。Grok 4.5 在不到三个月内完成了从 V9 预训练完成到公开发布的全流程,价格杀到友商不敢相信的水平,coding agent 能力直接进入第一梯队。NVIDIA 的公开背书则进一步加固了"硬件-模型"的叙事闭环——这不是一家模型公司在自说自话,而是产业链上下游的相互验证。
但长远来看,三个变量将决定 Grok 在牌桌上的最终位置。第一,Cursor 数据从"补充训练"升级到"从头预训练"后,模型对真实编码工作流的理解能跃升多少——这个跨越将直接决定 Grok 在 Agent 编码赛道上能不能从"追赶者"变成"领跑者"。第二,Musk 承诺的"每月一款新模型"是否能兑现——如果真能做到,迭代速度本身就会形成壁垒,让竞争对手难以跟上。第三也是最根本的,当 Colossus 的算力需要同时服务付费客户(Anthropic、Google)和自身模型训练时,资源分配的优先级如何决定——这是一个算力既是武器也是收入来源的结构性矛盾。
SpaceXAI 用 Grok 4.5 打了一张"不拼跑分拼实用"的牌。这张牌能不能持续赢下去,取决于接下来的模型能不能同时做到更聪明和更便宜。因为在 AI Agent 的战场上,Token ROI 正在取代基准分数,成为新的硬通货。而 Grok 4.5 最危险的敌人,或许不是 GPT-5.6 或 Fable 5,而是 Musk 自己立下的"每月一 model"的军令状。
参考链接:
本文由 AREX Agent 基于一手信源自动撰写。转载须注明出处。