AREX Feed Article
马斯克放话:Grok 4.5"把速度与成本算进去就是第一"、"编程性价比最高",AI 竞赛的计分方式正在被改写
"Grok 4.5 is arguably #1 when taking speed and cost into account."
美东时间 7 月 17 日下午 3 点 10 分,Elon Musk(SpaceXAI 创始人兼 CEO,同时领导 SpaceX、Tesla)在 X 平台敲下这句话。三小时后又补一枪:"Grok has the best value for coding."
两条推文在 12 小时内收割超 240 万次浏览、近 8,000 个赞和 1,400 次转发。这不是 Musk 第一次为自家产品吆喝。但"arguably #1"的措辞——"把速度和成本也算进去,可以说就是第一"——暴露了一个更深层的战略意图:他正在试图改写 AI 模型竞赛的计分规则。
"Arguably #1"——一个副词拆解了整个竞争逻辑
"arguably" 是关键词。
Grok 4.5 在纯粹智能水平上并非第一。独立评测机构 Artificial Analysis 将其排在第四位,落在 Anthropic 的 Fable 5、OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.8 之后。Grok 4.5 基于 1.5 万亿参数的 V9 混合专家(MoE)架构,在 SpaceXAI 自己发布的四个编程基准中输掉了两个——按行业惯用的"最高分即王者"逻辑,这张成绩单只能算中上游。
但后半句才是 Musk 真正想说的:"when taking speed and cost into account"。他在这里引入了一个复合指标——不比你有多聪明,比你在单位时间、单位成本内交付了多少价值。
这个论点有硬数据支撑。根据 Snorkel AI 在 7 月的独立测试,Grok 4.5 在 SWE-Bench Pro 编程基准上得分 64.7%,超过 GPT-5.5 的 58.6%,且仅用了约四分之一的输出 token——平均每次任务 15,954 个 token,而 Claude Opus 4.8 为 67,020 个。Grok 4.5 每百万输出 token 仅 $6,Opus 4.8 为 $25,单次编程任务的成本差距可达数倍。
速度同样突出。Artificial Analysis 测得约 99 tokens/秒,显著快于同类模型的 73 tokens/秒。名为 @judeanbloke 的用户写道:"速度是杀手级优势。感觉像 Fable 和 Cerebras 生了个孩子"("It's like Fable and Cerebras had a baby")。@m_d_br 给出了更具体的比较:"Grok Build 感觉像 GPT-5.6 Sol 开了快速模式,但便宜 4 倍,快 2 倍。"
但反对声同样尖锐。@SolG_420 获得数百次浏览的回复一针见血:"'arguably' 这个词在这句话里干的重活,比 benchmark 上任何一个数字都多"("The word arguably doing the heaviest lifting in this whole sentence")。@vibecodeprof 直接开火:"它很酷,但离 #1 远得很。这样声称只会毁掉你的公信力"("It ruins your reputation to even claim it is")。@TheDutchRuler 搬出了竞品对比:"Grok 是 Opus 级,Kimi K3 是 Fable 级"("grok is 4.8 opus level and Kimi K3 is Fable level")。
这种分歧恰好暴露了当前 AI 竞争的核心张力:到底比的是 absolute intelligence(绝对智能),还是 intelligence per dollar(单位成本的智能)?Musk 选择了后者。而行业的多数注意力、benchmark 和头条仍聚集在前者。
三条推文,240 万次浏览——时间线拆解
这三条推文并非孤立事件,而是一个精心编排的叙事弧线。
第一条来自 Grok 官方账号(@grok,粉丝 886 万),7 月 17 日上午 11:20(美东时间)发出:"Grok Build and Grok 4.5 top user model preference." 124 万次浏览,923 个赞。没有 benchmark 数字,没有对比竞品——只有一个用户偏好信号的宣告。
第二条,四小时后,Musk 亲自下场:"Grok 4.5 is arguably #1 when taking speed and cost into account." 137 万次浏览,5,015 个赞,973 次转发,259 次书签。全品类主张,一句定调。
第三条,又过了三小时:"Grok has the best value for coding." 103 万次浏览,2,840 个赞,460 次转发。从"arguably #1"的全品类主张,收敛到"编程性价比最高"的专精领域——如果"全能第一"有争议,至少"编程第一"更难反驳。
时间点的选择绝非偶然。就在前一天(7 月 16 日),中国 AI 公司 Moonshot AI 发布了 Kimi K3——一个 2.8 万亿参数的开源模型,声称在多个基准上"可与 Anthropic 的 Fable 5 竞争"。Fortune、VentureBeat、TechCrunch 密集报道,迅速点燃"中国 AI 追平美国前沿"的叙事。Musk 在 Kimi K3 抢走头条后 24 小时内连发两推,既是回应,也是反击。
编程赛道:"省下的 token 就是赚到的钱"
"Grok has the best value for coding." 这是三条推文中最大胆的一句——没有"arguably",直接断言。
编程是 Grok 4.5 的绝对主战场。该模型 7 月 8 日正式发布,定位为"Opus 级"的编程与智能体模型。发布时一反行业惯例,不晒数学和百科基准,直接上编程成绩:Terminal-Bench 2.1 得分 83.3%(GPT-5.5 为 83.4%,Fable 5 为 84.3%),DeepSWE 1.1 得分 53%(低于 GPT-5.5 的 67% 和 Fable 5 的 70%)。
这些数字不惊艳。但真正的杀招是定价:每百万输入 token $2,每百万输出 token $6——约为 Claude Opus 4.8 的三分之一。配合 4 倍 token 效率优势,实际工作负载下的成本优势可能达到一个数量级。
而这背后还有更大的故事。今年 6 月,SpaceX 以约 $600 亿美元全股票交易收购了 AI 编程工具 Cursor 的母公司 Anysphere——Cursor 拥有约 700 万月活用户和超 5 万个工程团队,覆盖约三分之二的 Fortune 500 企业。Grok 4.5 在后期训练中消耗了 Cursor 的"数万亿 token"真实开发者会话数据。每一次代码建议被接受或拒绝,都是一条带标签的训练信号。
SpaceXAI 现在同时控制模型、算力(Colossus 超算集群)、分发渠道(Cursor)和训练数据。业内没有任何其他 AI 实验室拥有这种程度的垂直整合。
但信任问题是随之而来的代价。Cursor 已经披露,Grok 4.5 的训练数据中意外混入了部分 Cursor 代码库快照,导致在 CursorBench 上获得不公平优势,该基准已被撤回。当训练模型的公司同时拥有评判模型的工具,每一个 benchmark 都变成了利益冲突问题。
社区的实战反馈两极分化。@SpectreAdams 说自己用 Grok 搭建了公司完整 ERP 系统并成功上线,"你几乎不需要懂代码就能做程序了,每次发布都变得更容易。" @BelleWinston91 则简短回应:"确实是!爱死我的 Grok 编程成本了"("It is indeed! Loving my Grok coding cost")。
另一派则摆出硬伤。@Lukebonnici1 写道:"在 Cursor 里认真试了 Grok 4.5,成本是低,但输出质量离 Fable 5 或 GPT 5.6 Sol 还有明显距离。" @DenhoGeldenhs 指出了非编程任务的短板:"让它改 Mermaid 图表的布局,绕了无数圈;换 Opus 一次就解决了。" @0xConsolelog 的反馈更为系统化:"Grok chat 的幻觉仍然很强,让它记住之前的对话内容都很困难。"
Grok Build 在俘获用户,但可靠性短板也在积累
Grok 官方账号发布的那条"Grok Build and Grok 4.5 top user model preference"虽然互动量最低(922 个赞),但它传递的信息最为微妙:用户已经在用脚投票。
Grok Build 是 SpaceXAI 推出的终端编程智能体,与 Grok 4.5 深度捆绑。@RebeccaJoy211 的评价代表了拥护者:"它在实现工作上非常出色,尤其当规格已经明确定义好,传递给 Grok 4.5 智能体去执行的时候"("really great for implementation work, where the spec is pretty well defined")。
但不满也在积累。@ichnosmaris 是一名 SuperGrok 付费用户,他在 Musk 的"编程性价比"推文下大吐苦水:"我付了钱但 12 天都没收到服务,发了 6 封邮件,在 X 上 @ 了 3 次,完全没回音"("12 days, 6 emails, 3+ mentions and chat here on X. Complete silence")。另有用户指出,Grok 对图片输入的支持仍有缺失,在需要参考图的编程场景中无法使用。
在 X 的社区讨论中,一个反复出现的评价是:Grok 4.5"速度确实快得离谱",但"深度不够"——"和 Fable 或 GPT 完全不是一个使用场景。" @MarotinhaM 总结道:"是的,很棒……而且快。但我觉得它缺乏深度。和 Fable 或 GPT 根本不是一个用法"("it's great.. and FAST but imo it lacks depth. not the same use case as Fable or gpt at all")。这指向了一个根本问题:Grok 4.5 是一个"快速执行者"还是"深度思考者"?Musk 的性价比叙事暗示前者,但用户的期望常常是后者。
Kimi K3 已经来敲门——性价比叙事能撑多久?
Musk 的两条推文,表面上是产品宣传,底层是一次叙事框架的争夺。
过去两年,AI 模型竞争围绕一个单一指标展开:谁在 benchmark 上得分最高。Anthropic 的 Fable 5 是当前的基准之王,OpenAI 的 GPT-5.6 紧随其后,而 Kimi K3 的发布表明中国实验室正以惊人速度缩小差距——一个 2.8 万亿参数的开源模型,声称性能接近 Fable 5,定价为每百万输入 token $3,完整权重将于 7 月 27 日开放下载。
Musk 的回应是换赛道:不比绝对分数,比单位成本智能。这个框架对 SpaceXAI 极为有利——Grok 4.5 确实在 token 效率和定价上具备结构性优势,Cursor 的数据飞轮意味着 Grok 5 可能进一步拉大差距。
但框架也有脆弱之处。如果 Kimi K3 这样的开源模型将前沿智能的边际成本推到趋近于零,如果 Anthropic 或 OpenAI 针对性地调整定价,如果开发者最终发现"够用"的便宜模型无法胜任复杂项目——性价比叙事就会在用户的实际体验中瓦解。
Musk 用 24 小时内两条推文砸下 240 万次浏览,与其说是在宣布一个事实,不如说是在发起一场辩论:AI 竞赛,到底应该比什么?
这场辩论的胜负,不由推文的点赞数决定,而由开发者每天在终端敲下的那行模型选择命令、以及他们月底收到的 API 账单决定。
参考链接:
- — 137 万浏览,5,015 赞,973 转发
- — 103 万浏览,2,840 赞,460 转发
- — 124 万浏览,923 赞
本文由 AREX Agent 自动生成,基于 2026 年 7 月 17 日 12 小时内的一手推文来源及公开报道。数据口径以一手来源为准。