AREX Feed Article
Cursor 押注、马斯克站台:Grok 4.5 以"够用便宜"杀入 AI coding 战场
在 AI coding 赛道上,"最强的模型才值得用"正在变成一个昂贵的偏见。7 月 8 日,xAI(SpaceXAI)正式发布 Grok 4.5——首款专为编程和 Agent 任务训练的模型,联手 Cursor 共同打造,以 Opus 级智能、Flash 级速度、以及低至竞品 1/11 的任务成本,试图重新定义这个赛道的竞争规则。
Grok 4.5 是 xAI 迄今"最强模型"(smartest model),也是其首次明确将编程和 Agent 能力作为核心训练目标的模型。Elon Musk 在前一天预热时将其定位为"Opus-class model, but faster, more token-efficient and lower cost",发布当天又补充内部评估结论:Grok 4.5 的能力"大致与 Opus 4.7 相当,但快得多"(roughly comparable to Opus 4.7, but much faster)。
Cursor CEO Michael Truell 在同步发布的推文中称之为"我们迄今开发的最大一步跨越"(a significant step up over any model we've developed so far),并透露团队内部已将其作为日常主力模型使用。
定价方面,Grok 4.5 以 $2/百万输入 token、$6/百万输出 token 的价格入市。作为对比,Anthropic Opus 4.8 的定价为 $5/$25,Fable 5 更是高达 $10/$50。有用户在实测后计算:Grok 4.5 每任务约 $1.51,而 Fable 5 Max 为 $17.32——成本差距达到约 11 倍。
1.5 万亿参数,练在数万张 GB300 上
Grok 4.5 基于 xAI 的 V9 基础模型,参数规模 1.5 万亿(1.5T),预训练于今年 5 月 26 日完成,随后通过补充训练(supplemental training)融入了 Cursor 的编程数据。
xAI 官方博客披露,Grok 4.5 在数万张 NVIDIA GB300 GPU 上完成训练。除了原始 token 量,团队在数据过滤和策展(curation)上投入了大量精力:去重、质量评分、领域聚焦筛选,以确保数据混合保持高覆盖和高信号。
强化学习(RL)是此次训练的核心差异点。xAI 将 RL 训练覆盖到数十万个任务,集中围绕多步骤软件工程和其他技术工作,采用自动化和模型辅助评分。RL 研究员 Yingru Li(xAI RL Bigrun & RL Science 负责人)在推文中透露,团队"从基础算法-基础设施协同设计到落地大规模训练,日夜推进"(pushing RL forward on every front — from fundamental algorithm–infrastructure co-design for optimization stability and efficiency, to landing the big runs)。
一个技术亮点是高度异步的训练架构:Agent 的 rollout 可以持续运行数小时,同时训练在数万张 GPU 上继续推进。这使模型能在真实工程和 Agent 任务上学到更智能、更高效推理方式。
基准有点复杂:有的赢,有的平,有的输
Grok 4.5 的基准表现呈现出一种耐人寻味的"不对称"格局——它不是全面碾压,而是精确地在某些维度上打出优势。
在 DeepSWE 1.0 上,Grok 4.5 拿到 66.1%(pass@1),排在 Fable Max(64.3%)和 GPT 5.5 xhigh(62%)之前,位列第一。DeepSWE 是由 DataCurve 推出的长周期软件工程基准,被认为比传统的 SWE-bench Verified 更接近真实工程场景。
在 Terminal Bench 2.1 上,Grok 4.5 得分 83.3%,超过 Opus 4.8 Max 的 78.9%,仅略低于 Fable Max 的 84.3%。Terminal Bench 衡量模型在命令行环境中的 Agent 执行能力,Grok 4.5 在这个维度上与顶尖模型处于同一梯队。
但在 SWE-Bench Pro 上,Grok 4.5 的 64.7% 落后于 Fable Max 的 80.4%。不过 xAI 强调了一个关键数据:Grok 4.5 完成每个 SWE-Bench Pro 任务的平均输出 token 数仅为 Opus 4.8 的约 1/4.2。换句话说,它用少得多的步骤完成了相近质量的工作——这直接转化为更低延迟和更低成本。
xAI 还披露 Grok 4.5 在 Harvey 法律 Agent 基准上排名第一,显示出模型在编程之外也具备通用知识工作能力。
80 TPS 的"伪 Flash":用效率换速度
Grok 4.5 的推理速度被定位为 80 TPS(每秒 token),xAI 称之为"快模型的速度"(fast-model speeds)。
这个速度并非来自模型本身的轻量化,而是与 token 效率绑定。xAI 官方博客中特别指出,由于 Grok 4.5 在解决相同任务时使用的 token 约为竞品的 1/2 到 1/4,用户感受到的端到端延迟实际上可以与 Flash 级模型媲美。
在 Cursor 中的早期用户反馈证实了这一点。LLM 工程师 Devin Shah(@otter_ai)在 Cursor CLI 中使用数小时后评价:"这确实比 Composer 2.5 上了一个台阶,提供了 Opus 级智能、Composer 级速度"(offering opus level intelligence at composer speeds)。Expo 框架作者 Evan Bacon(@Baconbrix,5.9 万粉丝)用 Grok 4.5 构建了一个带实时数据和 3D 地球的火箭追踪应用,直言"Grok 4.5 is wild"。
不过,Devin Shah 也指出了当前局限:在长上下文中模型质量会下降,变更变得粗糙——尽管他补充这可能是工具链(harness)问题而非模型本身的问题。
马斯克的"实战论":不卷基准,卷实际能用
Elon Musk 在发布前的一条推文中定下了 Grok 4.5 的叙事基调,这条推文获得超过 9,000 次点赞和 1,369 万次曝光:
"我们正在闭环的是真实世界的有用性,不是基准。Tesla 和 SpaceX 的硬核工程师发现 Grok 4.5 真正有用,这才是真正重要的。"(We are closing the loop on real-world usefulness, not benchmarks. Hardcore engineers at Tesla & SpaceX find Grok 4.5 genuinely useful, which is what actually matters.)
这段话不仅是一个产品定位声明,也反映 xAI 相对独特的验证路径——Grok 4.5 在公开发布前已经在 Tesla 和 SpaceX 内部经历了数周的实际工程使用。Musk 早在 6 月 28 日就透露过 Grok 4.5 在两家公司的私有 Beta 测试中"表现接近甚至可能超过 Claude Opus"。
在闭环真实工程反馈方面,xAI 还有一个独特优势:Grok Build,即 Grok 的命令行编码 Agent 工具。Grok 4.5 发布后即成为 Grok Build 的默认模型。xAI 还宣布,Grok Build 的下一个版本 2T(2 万亿参数)将于本月完成训练。
Cursor:从被收购到成为 AI coding 基础设施
Cursor(Anysphere)在 Grok 4.5 中的角色不容忽视。据 The Information 此前独家报道,SpaceXAI 以约 600 亿美元收购了 Cursor,而 Grok 4.5 是这笔交易后双方联合开发的首个模型。
Cursor CEO Michael Truell(@mntruell,16.5 万粉丝)在发布推文中说:"这是我们迄今开发的任何模型之上的重大跨越,已经成了我们团队中许多人的日常主力。"他同时在另一条推文中描述了与 xAI 合作的动态:"xAI 提供了训练基础设施和对大模型规模的深刻理解,我们的角色是提供真实的编码数据、开发者反馈回路和对编程体验的洞察。"
从用户侧来看,Grok 4.5 在 Cursor 中直接可用(所有付费计划均可),这也是它最自然的消费场景。早期用户最关心的问题是配置路径——多位用户在评论区询问"如何在 Cursor 中启用 Grok 4.5",一位叫 Praful 的用户回复称"已经在 Cursor 中跑起来了"。
需要指出的是,Grok 4.5 目前不在欧盟地区可用,xAI 预计将在 7 月中旬开放。这一限制引发了大量欧洲开发者的不满——从瑞典到葡萄牙,评论区中"EU 被抛弃了"(EU cucked again)的声音此起彼伏。
从 Anthropic 到 Gemini,Grok 4.5 的对手是谁?
AI coding 赛道在过去半年经历了剧烈洗牌。Anthropic 的 Opus 系列长期占据编程能力的心智高地,但 Fable 5 的高昂定价($10/$50)使其在频繁使用场景下面临性价比挑战。OpenAI 的 GPT-5.5 在多项基准上处于领跑地位,而 Google 的 Gemini 3 Flash 以 $1.50/$6 的低价策略吸引大量用户。
Grok 4.5 的定价策略精确地切割在"够好但更便宜"的区间:它比 Opus 4.8 便宜得多(输入便宜 60%、输出便宜 76%),比 Fable 5 便宜更多,但与 Gemini 3 Flash 的价位接近。区别在于,Grok 4.5 在 DeepSWE 和 Terminal-Bench 上的表现远超 Gemini Flash 级别。
有用户在 X 上尖锐地指出:"Grok 4.5 在界面设计上很好,但在视觉方向上很烂"(good at wireframes but sucks at visual direction)。另一位用户对比后认为"Gemini 3 Flash 产出的前端比这个'Opus 杀手'更好"。这些评价暗示 Grok 4.5 的能力图谱并非均匀——它在系统级编程和 Agent 任务上表现出色,但在创意性编码(如 UI 设计)上可能仍需要提升。
不过一个更宏观的信号是:Grok 4.5 的发布标志着 xAI 正式将 AI coding 作为核心赛道运营,而不再只是"顺便能做编程"。Elon Musk 此前公布的路线图显示,Grok 5 将定位为"全面 AGI",参数规模达 10 万亿。Grok 4.5 则是这条路线上的关键一站——它验证了"专用训练 + 实战反馈 + 激进定价"的策略是否可行。
xAI 上桌了,牌局才刚开始
Grok 4.5 不是一个基准屠榜者。它在 DeepSWE 上拿了第一,在 Terminal-Bench 上与顶尖模型平起平坐,但在 SWE-Bench Pro 上仍落后 Fable 一大截。然而,xAI 在这个节点选择不卷基准,而卷"实战有用 + 够快 + 够便宜"——这个叙事在开发者社区中获得了真实回响。
Elon Musk 在发布日的一条推文中保证:"我们将继续几乎每天根据用户请求对 Grok Build 和 1.5T 基础模型进行改进"(We will continue to make refinements to the Grok Build harness and the 1.5T foundation model almost every day in response to user requests)。如果 xAI 真能兑现"月月发新模型"的节奏——就像 Musk 此前承诺的那样——AI coding 赛道的竞争烈度将在下半年急剧升级。
对于开发者而言,好消息是:贵不再是入场券。Grok 4.5 用 $2 的价格提供 Opus 级的编程辅助,这在一年前是不可想象的。竞争正在把智能从奢侈品变成日用品。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供行业参考,不构成任何投资或使用建议。