AREX Feed Article
Grok 4.5 上线同日正面对撞 GPT-5.6,Musk 打出"Opus-class + 更低成本"牌
2026 年 7 月 9 日,成为了 AI 行业历史上竞争最密集的一天。OpenAI 将 GPT-5.6 Sol、Terra、Luna 三个模型推向全体用户,Anthropic 的 Claude Fable 5 已于 7 月 1 日恢复可用——而 Elon Musk 旗下的 SpaceXAI 也在同一天将 Grok 4.5 从内部 beta 推向公开访问。三家前沿 AI 实验室的旗舰模型首次在同一时间窗口内全部在线,对开发者而言,选模型从"谁能用"变成了"谁更值"。
TL;DR: Grok 4.5 是 SpaceXAI 收购 Cursor 母公司 Anysphere(600 亿美元)后的首个联合训练成果。1.5 万亿参数 MoE 架构,Cursor IDE 真实交互数据参与训练,定价 $2/$6 每百万 token。Musk 声称"Opus-class,但更快、更省 token、更便宜"。但从已公开的基准测试看,Grok 4.5 的编码能力处于中游——Fable 5 在所有四项编码评测上领先。真正的差异点不在最高分,而在每道题的成本。
同一张牌桌上,三家同时亮出了底牌
2026 年 7 月 9 日之前,AI 行业从未经历过这样的局面。
OpenAI 的 GPT-5.6 三兄弟——Sol(旗舰推理)、Terra(均衡生产)、Luna(廉价高速)——在经历了美国政府要求的 13 天受限预览后,于今天向全体 ChatGPT 用户和 API 开发者开放。Anthropic 的 Claude Fable 5 在 6 月 12 日出口管制禁令后,于 7 月 1 日恢复对合格用户的访问。而 SpaceXAI 的 Grok 4.5,在 SpaceX 和 Tesla 内部完成 11 天 beta 测试后,也在同一天对公众开放。
这是自 Fable 5 管制令以来,三家前沿 AI 实验室首次同时拥有公开可用的模型。开发者社区迅速捕捉到了这一时刻的密度。一条高赞回复写道:"tomorrow gonna be a busy day for competitors — Fable 5, Sol, now Grok 4.5. We truly are spoilt for choice."(明天对竞争对手来说将是忙碌的一天——Fable 5、Sol,现在还有 Grok 4.5。我们真的被宠坏了。)
但"被宠坏"的另一面是决策疲劳。当所有选项都摆在面前时,选择的依据从"能不能用"变成了"值不值"——而 Grok 4.5 的定价策略,正是冲着这个问题的答案来的。
"Opus-class",但没有版本号
Elon Musk 于美东时间 7 月 8 日凌晨 2:21 在 X 上发布了 Grok 4.5 的公开预告。这条推文截至目前获得了 53,121 个赞、5,989 次转发、6,149,750 次浏览,"Grok 4.5"话题在美国 X 趋势榜排名第 19 位。
推文只有两句话:
"Based on strong positive feedback from customers in our beta test program, @SpaceXAI will make Grok 4.5 available to the public tomorrow. It is an Opus-class model, but faster, more token-efficient and lower cost."
(基于 beta 测试客户给出的强烈正面反馈,@SpaceXAI 将于明天将 Grok 4.5 向公众开放。它是一个 Opus 级别的模型,但更快、更省 token、成本更低。)
"Opus-class"这个定位耐人寻味。Anthropic 的 Claude Opus 系列从 4.5 跨越到 4.8,每一代之间都有可测量的基准分数跳升。Musk 刻意没有指明对标的是哪个版本的 Opus,社区立刻抓住了这个模糊性。一条高赞回复直指要害:"Which Opus exactly? Hoping at least 4.7 levels."(到底是哪个 Opus?希望至少有 4.7 的水平。)另一位开发者用调侃回应:"so sonnet class?"(所以其实是 Sonnet 级别吧?)
这不是吹毛求疵。在开发者的采购决策中,"Opus-class"如果没有基准分数支撑,它只是一句营销——而 Musk 的推文里确实没有附带任何一个基准数字。
64.7% 的 SWE-Bench Pro:中游选手的真实水平
Grok 4.5 的编码基准测试结果已经由 SpaceXAI 和 Cursor 联合公布。实话实说:它没有在任何一项评测上登顶。
| 基准测试 | Fable 5 (max) | GPT-5.5 (xhigh) | Grok 4.5 | Opus 4.8 (max) | GLM 5.2 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 83.4 | 83.3 | 78.9 | — |
| SWE-Bench Pro | 80.4 | 58.6 | 64.7 | 69.2 | 62.1 |
| DeepSWE 1.0 | 66.1 | 64.3 | 62.0 | 55.8 | — |
| DeepSWE 1.1 | 70 | 67 | 53 | 59 | 44 |
数据来源:SpaceXAI / Cursor 官方发布。第三方模型分数为自报分数。
Fable 5 在最大推理设置下四项全胜。Grok 4.5 在三项评测中排名第三,在 DataCurve 独立运行的 DeepSWE 1.1 上跌至五者中的第四。这不是一个"冠军模型"的成绩单,而是一个有竞争力的中游选手。
但有一个细节值得注意:Cursor 主动披露了 CursorBench 被排除在发布之外。原因是一条训练数据污染——"an earlier snapshot of the Cursor codebase was accidentally included in training"(一个早期的 Cursor 代码库快照被意外包含在了训练数据中)。Cursor 表示该数据已从未来模型中移除。主动披露本可以让自己模型显得更强的污染问题,这恰恰是信任信号。
不比最高分,比每道题的成本
如果只看基准分数,Grok 4.5 的故事到此结束。但 SpaceXAI 的主打牌不是精度,而是经济学。
Grok 4.5 的定价为 $2/百万输入 token,$6/百万输出 token(缓存命中 $0.50/百万)。对比来看:Claude Opus 4.8 的价格是 $5 输入 / $25 输出,GPT-5.6 Luna 为 $1 输入 / $6 输出。Grok 4.5 在输出端比 Opus 4.8 便宜了 76%。
更关键的是 token 效率。根据 SpaceXAI 公布的数据,在 SWE-Bench Pro 上,Grok 4.5 平均每个已解决任务消耗 15,954 输出 token,而 Opus 4.8 在最大推理设置下需要 67,020 token——是 Grok 4.5 的 4.2 倍。xAI 的表述更概括:约 2 倍的 token 效率,用不到一半的步骤完成任务。
这个算式的实际含义是:即使 Grok 4.5 在 SWE-Bench Pro 上的完成率比 Opus 4.8 低了 4.5 个百分点,但每个已解决任务的成本差距可能大到足以让精打细算的工程团队重新考虑默认模型选择。"Price per token is a vanity metric; cost per finished task is the one that hits the invoice."(每 token 价格是面子指标,每个已完成任务的成本才是出现在发票上的数字。)
其他规格同样务实:500K 上下文窗口(超过 200K 进入更高定价阶梯),80 TPS 推理速度,支持 reasoning_effort 参数、结构化输出和原生并行工具调用。模型可通过 grok-4.5、grok-4.5-latest、grok-build-latest 三个 ID 调用,部署在 us-east-1 和 us-west-2 区域。默认速率限制为 150 请求/秒。
Cursor 数据飞轮的第一个闭环产物
Grok 4.5 的真正结构性故事不在于这一个模型的分数,而在于它验证了一条垂直整合路径。
SpaceXAI 目前拥有的资产形成了一条完整的闭环:Colossus 超级计算集群(孟菲斯数据中心,数万张 NVIDIA GB300 GPU)→ Grok 模型家族 → Cursor IDE 作为数据采集器和分发渠道 → Grok Build 作为编码 Agent 的交互界面。
Grok 4.5 的训练数据包含了数万亿 token 的 Cursor 用户交互——真实的多人对话、大型代码库上下文、错误恢复路径,而不是静态代码语料库。Cursor 首席执行官 Michael Truell 在发布推文中写道:"It's a significant step up over any model we've developed so far, including Composer 2.5, and has become the daily driver for many on our team."(这是迄今为止我们开发的所有模型中最大的一步提升,包括 Composer 2.5,已经成为我们团队很多人的日常主力。)
xAI 团队的 Aman Madaan 同样在 X 上表示:"Grok 4.5 is our most useful model yet! … Please try Grok 4.5 on your most challenging problems and share critical feedback: we aim to rapidly improve!"(Grok 4.5 是我们最有用的模型!……请用最具挑战性的问题测试并分享关键反馈:我们的目标是快速迭代!)
速度也确实在加快。Musk 在同一条推文线程中追加了一条回复——2T 参数模型将在本月完成训练,下月向客户开放。从 1.5T 到 2T 的时间窗口只有一个月。如果这个节奏持续,SpaceXAI 正在构建一个可以与 OpenAI 和 Anthropic 的发布节奏正面竞争的生产线。
从资本面看,SpaceX 于 2026 年 4 月行使了对 Anysphere(Cursor 母公司)的收购期权,6 月 16 日通过 SEC 8-K 文件确认了这笔 600 亿美元的全股交易,预计 Q3 完成交割。Grok 4.5 是这笔收购的第一个可见产出。22 天,从文件确认到联合模型发布。
不在 EU,没有系统卡,基准全是厂商自报
在把这些数字写进采购决策之前,有三件事需要直说。
第一,Grok 4.5 目前不在欧盟可用。 SpaceXAI 表示 EU 访问"预计 7 月中旬"开放,但没有给出确定日期。这对于有合规要求的欧洲团队来说是一个硬阻断。
第二,SpaceXAI 没有发布系统卡。 与 OpenAI 为 GPT-5.6 发布的详细系统卡不同,Grok 4.5 的发布缺少独立的安全评估文档。在一个行业正逐渐向透明化靠拢的时刻,这是一个显著的缺失。
第三,目前所有基准测试数据均为厂商自报。 包括对竞品模型(GPT-5.5、Opus 4.8、Fable 5)的分数,xAI 和 Cursor 都标注为"self-reported"(自报分数)。在独立第三方复现这些数字之前,"Opus-class"仍然是一个需要自己验证的假设,不是一个可以拿来采购的参数。
"Everybody is coming for Anthropic"
这场三路并发的发布潮中,Anthropic 是被火力覆盖最密集的目标。
Grok 4.5 定位为"Opus-class"——对标的是 Anthropic 的 Opus 系列而非 OpenAI 的 GPT。OpenAI 的 GPT-5.6 Luna 在 $1/$6 的定价上直接挖角 Anthropic 的开发者。而 Anthropic 自身还在应对同一周的 Abnormal AI 商标诉讼和 Claude Max 诉讼。
一位开发者在 Musk 推文下的评论精准捕捉了氛围:"this is clear now — everybody is coming for Anthropic."(现在已经很清楚了——所有人都冲着 Anthropic 来了。)
但对于开发者来说,今天的问题已经不再是"谁赢了基准测试",而是 "在我的任务分布上,哪个模型最具性价比"。当三个前沿实验室的模型同时在线、同时降价、同时加速时,价格/性能比的竞争将决定下一波开发者钱包的流向。Grok 4.5 用一个不那么漂亮的基准测试成绩单,换了一张成本结构上更有看头的入场券。
Sources: Elon Musk on X (July 8, 2026); Cursor official blog "Introducing Grok 4.5" (July 8, 2026); Axios (July 8, 2026); Reuters (July 8, 2026); explainx.ai analysis (July 8-9, 2026); Digital Applied (July 8, 2026); Constellation Research (July 8, 2026); Build Fast with AI (July 9, 2026); Republic World (July 9, 2026).
声明:本文基于公开信息撰写,不构成任何投资建议或产品推荐。所有基准测试数据截至发稿时均为厂商自报,建议等待独立第三方验证后再做出生产环境切换决策。