AREX Feed Article
GPT-5.6 发布前 24 小时,Musk 掏出 Grok 4.5:不说自己最强,说自己最便宜
TL;DR:7 月 8 日,SpaceXAI 发布 Grok 4.5——首款专为编程和 AI Agent 训练的模型,定价 $2/$6 每百万 Token,仅为 Opus 4.8 的 1/4。Elon Musk 在 48 小时内连发 15 条推文,主推文斩获 5800 万浏览。独立评测机构 Artificial Analysis 将其排在智能指数第 4 位,但明确将其置于「性能/成本帕累托前沿」。一句话:不打 benchmark 冠军,打每美元产出之王。
58M 浏览、15 条推文:Musk 一个人的发布狂欢
7 月 8 日下午,SpaceXAI 官方账号发出一句话:「宣布 Grok 4.5,我们首款专为编程和 Agent 训练的模型。」这条推文在 48 小时内收割了 5800 万浏览、2.67 万点赞和 3800 次转发,成为本周 AI 赛道浏览量最高的推文之一。
但真正的主角是 Elon Musk 本人。从提前一天放出预告——「基于 beta 用户的强烈正面反馈,明天向公众开放」——到发布后 24 小时内连发十余条,他的个人账号累计产生了超过 2000 万次额外曝光。
这不是普通的 CEO 转发。这是一场精心编排的 one-man marketing machine。
他喊出的每句话都是精确的定位弹:「Opus 级别的模型,但更快、更省 Token、更便宜。」「我们的内部评估是 Grok 4.5 与 Opus 4.7 大致相当,但快得多。」最令人意外的是坦诚——「公平地说,Fable 确实比 Grok 4.5 强,但大多数任务不需要 Fable 级别的能力。」一条回复斩获 2 万点赞。
他不跟你在 benchmark 上较劲。他跟你算一笔经济账。
「Fable 确实更好,但大多数任务不需要 Fable」
Musk 这句回复可能是整个发布周最值得玩味的一句话。在一个所有 AI 公司都在争夺「最聪明模型」桂冠的行业里,SpaceXAI 的创始人公开承认对手更强——然后立刻解释为什么这不重要。
这不是示弱。这是换赛道。
Cursor 官方账号同步发声,称 Grok 4.5 是「我们迄今最强大的模型,也是我们首次为软件工程之外的领域构建的模型。」Cursor 的推文也拿下了 476 万浏览和 1.74 万点赞。但 Cursor 同样没有声称 benchmark 第一——它强调的是「最强大」而非「最强」。
社区反应呈现两极。e/acc 创始人 Beff Jezos 喊出「Let's gooooooo」,AI 圈 KOL Teknium(Nous Research 联合创始人)第一时间在 Hermes Agent 中接入 Grok 4.5。但 Hacker News 上争议激烈——部分开发者质疑的不只是能力,而是「你是否愿意信任一个被记录曾篡改系统 prompt 以影响政治输出的公司」。
独立评测机构 Artificial Analysis 给出了最冷静的结论:Grok 4.5 在智能指数上排名第 4(54 分),仅次于 Fable 5、GPT-5.5 和 Opus 4.8,但——「在性能/成本帕累托前沿上牢牢占据一席之地。」每完成一个智能指数任务仅需 $0.31,比排名更靠前的模型便宜近 90%。
砸 600 亿买下 Cursor,等的就是这一刻
Grok 4.5 不是凭空出现的。它是 SpaceXAI 过去六个月一系列疯狂操作的第一张成绩单。
今年 2 月,SpaceX 以换股方式吸收合并 xAI,交易估值 1.25 万亿美元,创下史上最大并购纪录。4 月,Musk 签下一份不寻常的协议:以 600 亿美元收购 AI 编程工具 Cursor,如果反悔则需支付数十亿美元分手费。6 月 SpaceX 刚完成史上最大 IPO,股价从 $135 飙升至 $200 以上,旋即宣布行使收购权。
Cursor 的价值不只是产品,更是数据。Cursor 的 AI 代码编辑器每天都在产生海量高质量交互数据——真实工程师如何在生产环境中写代码、调 bug、重构架构。Musk 今年春天就公开说过,Cursor 的交互数据正被直接喂入 Grok 的训练。
而这一切,距离 xAI 的 11 位联合创始人全部出走、Musk 公开承认「xAI 第一次没建对」不过三个月。Grok 4.5 是一次重建后的首秀,更微妙的是时机——它赶在 GPT-5.6 发布前一天亮相。这不是巧合。这是 Musk 在 AI 竞赛中最擅长的操作:在对手放大招前抢先占据叙事。
Token 少用 4.2 倍,靠的不是打折,是架构
Grok 4.5 的核心技术故事不是参数、不是层数,而是一个数字:4.2×。
在 SWE-Bench Pro 上,Grok 4.5 平均每次完成任务仅输出 15,954 个 Token,而 Opus 4.8(max 模式)需要 67,020 个——差了 4.2 倍。在 Artificial Analysis 的编码 Agent 指数上,Grok 4.5 在 Grok Build 中仅消耗 190 万 Token 即可达到 76 分(与 GPT-5.5 持平),而 Fable 5 在 Claude Code 中需要 720 万 Token。
效率优势来自混合专家(MoE)架构。Grok 4.5 基于 V9 基础模型,总参数量 1.5T——是其前代 Grok 4.3(0.5T)的 3 倍——但通过稀疏路由,每个 Token 仅激活小部分「专家」子网络。这意味着更大模型不一定更慢、更贵。
价格更直接:$2/$6 每百万 Token(输入/输出),缓存命中仅 $0.50。对比 Opus 4.8 的 $5/$25 和 Fable 5 的 $10/$50,差距不是百分比级的——是倍数级的。
另一面也需要诚实呈现。Grok 4.5 的知识准确率从 35% 提升到 52%,但幻觉率也从 25% 翻倍至 54%。这是 MoE 架构的经典权衡:更大模型知道更多,但也更自信地说错。对于法律、金融等高风险场景,这需要额外验证机制。
Musk 还透露了两个关键后手:上下文窗口目前 500K(低于前代的 1M),但「下周将升级回 1M」;自研的 C/C++ 推理引擎尚未部署到 GB300 硬件上,一旦上线,「速度有望翻倍甚至更多」。换言之,当前表现远非 Grok 4.5 的最终形态。
编程 AI 的战场变了:从比谁聪明到比谁便宜
过去三年,AI 行业的记分牌上只有一个指标:谁的模型最聪明。Grok 4.5 试图改变游戏规则。
此前,AI 编程市场几乎被 Anthropic 一家独大。据 CNBC 引用 Ramp 的支出数据,Anthropic 已控制约 50% 的 AI 编程市场份额,而 Cursor 的份额从 2025 年 6 月的 41% 跌至 2026 年 5 月的约 26%。Anthropic 今年还登顶 CNBC Disruptor 50 榜单。
Grok 4.5 的打法不是正面硬刚 Anthropic 的最强模型,而是切开一条新赛道:如果我的模型完成一次 Agent 任务只需 $2.49,而 Fable 5 要 $11.80,你的团队跑 1000 次任务选哪个?
这不是 Musk 第一次用这种打法。SpaceX 没有发明火箭,但把发射成本砍到了原来的 1/10。Tesla 没有发明电动车,但把电池成本压缩到竞争对手无法跟随的水平。现在,他用同样的逻辑做 AI——不在顶峰决战,在成本曲线上碾压。
VentureBeat 将这种策略总结为经典的「颠覆式创新」:以接近前沿的能力、远低于前沿的价格,从价格敏感的高频使用场景切入,倒逼在位者降价或让出市场。
但软件和火箭不一样。在编程中,质量是复合的——一次搞定 bug 的模型,可能比试三次才成功的便宜模型更省钱。这就是为什么投资人 Gavin Baker 的评价一语中的:「数据上看编程领域帕累托最优。关键还得看手感。」
火箭公司做 AI,打法从一开始就不一样
Grok 4.5 不只是一次模型发布。它是一个商业模式的宣言。
SpaceXAI 现在是全球唯一一家同时拥有超算(Colossus,20 万张 GB300 GPU 并规划至百万张)、前沿模型(Grok)、开发者分发渠道(Cursor)和内部需求方(Tesla 和 SpaceX 工程团队)的 AI 公司。OpenAI 和 Anthropic 都做不到这一点——它们需要借助第三方工具触达开发者,而其中一些工具现在归 Musk 所有。
当 Musk 说「我们在闭合真实世界的可用性,而不是 benchmark」时,他不是在谦虚。他是在告诉市场:我选的战场你们还没准备好打。
这场战役的胜负,不需要等到 AGI 降临。未来几周,企业级试用数据会给出第一个真实答案。而 Anthropic——这个在本轮 AI 竞赛中每次受到挑战都迅速回击的对手——不可能安静地看着自己的价格体系被撕开一道口子。
编程 AI 的价格战,从 Grok 4.5 开始。
题图来源:Cursor / X
参考来源
- — 5800 万浏览,2.67 万点赞
- — 166 万浏览
- — 166 万浏览
- — 223 万浏览,1.3 万点赞
- — 90 万浏览,2.06 万点赞
- — 160 万浏览
- — 4.8 万浏览
- — 476 万浏览,1.74 万点赞
本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成投资建议。转载需注明出处。