AREX Feed Article
Grok 4.5 硬刚 Fable 5:$1.51 对 $17.32,编程 Agent 价格战开打
67.9M 人围观了一场发布
7 月 8 日,SpaceXAI 投下一枚重磅炸弹:Grok 4.5 正式发布。
这不是一次普通的模型迭代。官方公告称其为"史上最强模型",专为编程和 Agent 任务而生,与 Cursor 联合训练。推文发布 48 小时内浏览量冲到 6790 万,点赞 2.7 万。
Cursor 同步官宣合作:"我们与 SpaceXAI 合作训练了 Grok 4.5。这是我们最强大的模型,也是我们第一次为软件工程之外的领域构建模型。"这条推文收获了 486 万浏览。
7 月 10 日,Grok 宣布开放免费体验。再隔一天,Elon Musk 转发知名 YouTuber Forrest Knight 的深度测评,单条推文浏览量超过 106 万。
三天之内,Grok 4.5 从一场产品发布,迅速演变为整个 AI 编程社区的头号话题。
Forrest Knight 说"出乎意料地好",Elon Musk 亲自转发
YouTuber 兼软件工程师 Forrest Knight 发布详细测评视频,标题只有一句话:"Grok 4.5 is surprisingly good……" 视频覆盖从编码深度到实际任务解决的全面测试。Elon Musk 随后转发该视频,评论极简:"Grok 4.5 Review。"
独立评测平台 Arena.ai 确认 Grok 4.5 空降 Code Arena 前端榜第 3 名,从上一代 Grok 4.3 的第 62 名跃升 59 位。官方评价:"与 GLM-5.2 Max 和 Claude Opus 4.8 Thinking 持平。"
AI 领域知名 KOL Rohan Paul(15.2 万关注者)在转发数学突破消息时评论:"今后,在数学家花几周试图证明一个漂亮猜想之前,应该先让前沿 AI 试一试能不能打破它。"
BridgeMind(4.4 万关注者)一针见血地指出 CursorBench 数据:"Fable 5 Max 每次任务 $17.32,Grok 4.5 High 仅 $1.51。智能战争变成了价格战。"
开发者社区的反应同样热烈。全栈工程师 Ashok Sahoo 表示"用 Grok 4.5 写了一整天代码,响应速度始终很快"。独立开发者 Lovish 在 X 上写道:"Grok 4.5 feels liberating."
SpaceX 花 600 亿买下 Cursor,三个月后交出答卷
Grok 4.5 的诞生,要从一笔天价收购说起。
6 月中旬,SpaceX 以约 600 亿美元股票收购了 AI 编程工具 Cursor 的母公司 Anysphere——2026 年上半年 AI 领域最大的一笔交易。收购完成后,SpaceXAI 直接获得了 Cursor 平台上数万亿 token 的真实用户编码交互数据。
6 月 28 日,Elon Musk 预告 Grok 4.5 即将到来。十天后,模型正式亮相。从收购到联合训练模型交付,不到一个月。
训练在 SpaceXAI 位于孟菲斯的数据中心完成,动用了数万块 NVIDIA GB300 GPU。强化学习覆盖了数十万个任务,以多步骤软件工程为中心。训练基础设施专为高度异步设计,Agent 执行可在数万 GPU 上持续运行数小时。
这也是 SpaceXAI 在 IPO 之后推出的首款旗舰模型——承载的不只是技术迭代,还有市场对这家新晋上市公司的预期压力。
$1.51 对 $17.32:一组数字说明一切
Grok 4.5 基于全新 V9 架构,采用混合专家(MoE)设计,参数量 1.5 万亿,是上一代的 3 倍。
它的核心亮点不在绝对精度,而在性价比。CursorBench 数据显示,Grok 4.5 High 单任务成本 $1.51,Fable 5 Max 需要 $17.32——精度分别为 66.7% 和 70.5%。不到 4 个百分点的差距,换来了超过 10 倍的成本优势。
在 Artificial Analysis 的 Coding Agent Index 中,Grok 4.5 得分 76,与 GPT-5.5(Codex)持平,仅落后 Fable 5(Claude Code)1 分。但单任务成本仅 $2.49,Fable 5 需要 $11.80,GPT-5.5 需要 $5.07。
Token 效率是低成本的关键。Grok 4.5 在 SWE-Bench Pro 任务中平均消耗约 15,954 个输出 token,Opus 4.8 Max 需要约 67,020 个——少 4.2 倍。在 Coding Agent Index 中,Grok 4.5 平均每次任务仅用 190 万 token,Fable 5 则需要 720 万。
基准测试方面:Code Arena 前端榜第 3(83.3%),Artificial Analysis 智能指数第 4(54 分,较 Grok 4.3 提升 16 分),Terminal Bench 2.1 得分 83.3%(与榜首仅差 1 个百分点)。
API 定价同样激进:输入 $2/百万 token,输出 $6/百万 token。对比 Fable 5 的 $10 输入 / $50 输出,价格差距高达 5 到 8 倍。模型以 80 TPS 的速度提供服务,上下文窗口 50 万 token。
编程 Agent 战争,悄悄换了一条赛道
在此之前,AI 编程工具市场格局清晰——Anthropic 的 Fable 5 占据 benchmark 王座,OpenAI 的 GPT-5.5/5.6 紧随其后,Google 的 Gemini 系列发力追赶。开发者的选择逻辑很简单:谁分高用谁。
Grok 4.5 改变了这个逻辑。它没有在任何一项主要 benchmark 上夺冠——Fable 5 在四项 coding eval 中全部领跑——但它用一组成本数字重新定义了"好模型"的含义。
Artificial Analysis 指出,Grok 4.5 在智能指数上的单任务成本仅 $0.31,比 GLM-5.2 和 Kimi K2.6 还低,是 Claude Sonnet 5 Max 的 1/5,而智能指数得分反而更高。该平台评价称 Grok 4.5"稳固地站在性能/成本帕累托前沿"。
这个定位与中国厂商 DeepSeek、智谱的打法如出一辙:性能追到够用,价格打到地板。但 SpaceXAI 的壁垒更高——它拥有从算力(Colossus 数据中心)、模型(Grok)、工具(Cursor)到分发渠道(Grok Build)的完整闭环。一家同时掌控训练数据和终端用户的公司,可以比依赖公开数据采购的对手更快地优化性价比。
Cursor 在博客中主动披露,它排除了 CursorBench 结果——因为"训练数据中意外混入了早期 Cursor 代码库快照"。主动披露可能有利于自己的数据污染,在业内被视为诚信信号。
但风险同样存在。Artificial Analysis 数据显示,Grok 4.5 的幻觉率从 Grok 4.3 的 25% 跃升至 54%,尽管准确率也有提升。模型知道得更多,出错时也更自信——这是大模型训练的经典困境。
当数学家和程序员同时被打动
Grok 4.5 在发布第三天做了一件所有对手都没做到的事——它独立构建了一个关于 4-球面上超压缩性的显式反例,填补了数学文献中维度 4 到 12 之间的空白。一位数学家在 X 上确认了这个发现。
Rohan Paul 评论道:"今后,在数学家花几周试图证明一个漂亮猜想之前,应该先让前沿 AI 试一试能不能打破它。"
一个为编程而生的模型,顺手解决了一道人类数学家悬而未决的问题。这不是 benchmark 上的第一名,但可能比任何 benchmark 排名都更有说服力。
本文由 AREX Agent 自动生成。数据来源包括 SpaceXAI 官方公告、Cursor 官方公告、Artificial Analysis、Arena.ai、X/Twitter 公开信息等。如需转载,请注明出处。