AREX Feed Article
Grok 4.5 跳过 GitHub 学了你怎么写代码,还要每月发一款新模型硬刚 Opus
AI 公司的研发节奏,凭什么由一家火箭公司来定?
直到 2025 年夏天,AI 行业的默认节奏仍然是:一年一款大模型,中间穿插几次小版本迭代,偶尔发一篇技术报告。OpenAI、Anthropic、Google DeepMind 概莫能外。
2026 年 6 月 28 日,Elon Musk 在 X 平台扔出了一条让这个共识瞬间过时的推文。Grok 4.5 已在 SpaceX 和 Tesla 内部进入私测阶段,基于 1.5 万亿参数 V9 基础模型,在补充训练中加入了大量 Cursor 开发者工作流数据。最关键的句子在末尾:"Completely trained from scratch new models will be released by SpaceX every month this year."——今年起,SpaceX 每月发布一款从零训练的完整新模型。
一个月一款。这不是小版本更新,不是 LoRA 微调,不是检查点热更新。是从头训练。在一个前沿模型动辄消耗数亿美元算力、训练周期以月计的行业里,这个承诺本身就是一个用火箭工业的逻辑向整个 AI 行业下的战书。
Grok 4.5:1.5T 参数、Cursor 数据、对标 Opus
Musk 原话的信息密度极高。
"Grok 4.5, based on our 1.5T V9 foundation model, with Cursor data added in supplemental training, is now in private beta at SpaceX & Tesla. Early evals show performance close to, perhaps exceeding Opus."
翻译过来就是三个事实。第一,Grok 4.5 的基座是 V9-Medium,1.5 万亿参数,约三倍于当前 Grok 生产环境使用的 v8-small(约 5000 亿参数)。第二,它的独门武器是 Cursor 数据——不是 GitHub 上的公开代码仓库,而是真实开发者在 AI 编辑器里的每一次接受、拒绝、修改和重构。第三,早期评估显示,性能已接近甚至超越 Claude Opus。
Musk 没有说具体是哪个 Opus。当前 Claude Opus 系列已迭代到 4.8,社区普遍猜测对标的是 Opus 4.6 或 4.8。AI 新闻账号 @testingcatalog(68412 粉丝)在引用推文中追问:"Which Opus?如果是最新版,那就厉害了。"AI 领域 KOL Chubby(@kimmonismus,121979 粉丝)引述推文称:"如果 Grok 4.5 在关键基准上超越了 Opus 4.8,那将是一个值得欢迎的发布。"
此外,Musk 还透露强化学习仍在持续显著提升模型性能,"the Grok Build harness gets better every day"。Grok Build 是 xAI 的终端编程代理,目前运行在较早模型上,V9-Medium 有望在发布后自动替换其底层模型。
Cursor 的训练数据,比 GitHub 多了什么?
理解 Grok 4.5 的真正技术杀伤力,不能只看参数量。
xAI 在 2026 年 5 月 25 日首次宣布 V9-Medium 完成训练时,Musk 坦言前代模型 v8-small 在训练数据的"质量、全面性和平衡性"上存在明显短板。V9-Medium 的根本策略不是堆更多 GPU,而是换一条数据赛道。
关键在于"补充训练"阶段加入了 Cursor 数据。GitHub 上的代码是"成品博物馆":干净的 commit diff、删除了死胡同的最终结果,模型只能学到"代码长什么样",学不到"人怎么写出代码"。Cursor 捕获的是完全相反的信息流:一个开发者用自然语言描述需求,模型给出修改建议,开发者接受、拒绝、改写——然后发现这个改动破坏了三个文件外的某个功能,再纠正回来。
Toward AI 在 6 月中旬的技术分析中指出,这是一种被称为"compaction-in-the-loop RL"的训练机制——模型被训练将数千 token 的工作上下文压缩到约 1000 token,然后检验它能否在压缩后继续完成长程编程任务。如果压缩丢掉了关键变量名或之前的 bug 修复,任务失败,模型收到负向奖励。V9-Medium 从数百万次真实 Cursor 会话中学到的,是开发过程中真正需要保留的信息——这在任何公开代码仓库中都找不到。
TechTimes 6 月 16 日的报道补充了一个关键背景:SpaceX 已于 6 月 10 日签署了以 600 亿美元收购 Cursor 母公司 Anysphere 的最终协议。这意味着 xAI 不仅使用 Cursor 数据训练模型,还直接拥有了这个数据管道本身——超过 100 万开发者,64% 的财富 500 强企业部署,年化收入 40 亿美元。
这同时带来了争议。多个开发者社区质疑:哪些代码被纳入训练?私有仓库和企业代码库是否在不知情的情况下被使用?Towards AI 的评论指出,xAI 虽声称数据为"授权获取",但"从 Cursor 获得授权"和"写出那段代码的开发者同意"不是一回事,两者之间的缝隙恰好是诉讼的温床。
V9-Medium 针对 NVIDIA Blackwell GPU 做了深度优化。Blackwell 相比上一代 Hopper H100 每瓦性能提升约 2.5 倍,这对推理经济性至关重要——一个 1.5T 参数的稠密模型要在消费者产品中以有竞争力的延迟和成本运行,离不开 Blackwell 架构的支持。Colossus 2 超算集群建在统一的 Blackwell 硬件上,专门为这个规模的训练任务设计。
当前编程基准上,Claude Opus 4.6 和 Gemini 3.1 Pro 的 SWE-bench Verified 分数约在 80–81%,GPT-5.5 达到 88.7%,而现有 Grok 4 系列约在 72–75%。Grok 4.5 的具体分数尚未公开,但已有独立研究者指出 SWE-bench 存在日益严重的污染问题——模型可能部分回忆了泄露到训练数据中的任务,而非真正展示软件工程能力。在私有、未见过的代码库上,所有模型的性能都会大幅下降。对于开发者而言,在自己的代码仓库上实测 Grok 4.5,会比任何公开基准更有意义。
一个 AI 帝国的基建:Colossus、Cursor 和每月一款的承诺
Grok 4.5 背后站着的不是一家单纯的 AI 实验室,而是一个正在将算力、数据和分发渠道垂直整合的工业体系。
从硬件层看,xAI 的 Colossus 2 超算集群位于孟菲斯,全市统一部署 Blackwell GPU。此前 Colossus 1 因混合架构效率不足而被移交给 Anthropic 做推理容量——而 Colossus 2 的设计目标就是为 1.5T 乃至未来的 6T 参数旗舰模型(Grok 5)提供训练支撑。Musk 此前透露 Grok 5 的总参数量约在 6 万亿,采用 MoE 架构,目前仍在训练中,预测市场给其在 6 月底前交付的概率仅约 12%。
从数据层看,SpaceX 收购 Cursor 将训练数据管道变成了自营资产。这是一步同时锁死数据来源和分发渠道的棋——Cursor 超过 100 万开发者既是训练数据的生产者,也是 Grok 模型的潜在用户。目前 Cursor 仍支持 Anthropic 的 Claude 和 OpenAI 的 GPT,但业界普遍预期 SpaceX 最终会让 Grok 成为默认选项。收购协议中包含 40 亿美元的监管终止费和 100 亿美元的通用终止费,显示 SpaceX 对反垄断审查已有充分预案。
从分发层看,Grok 4.5 将通过三个渠道同时触达用户:X 平台自动推送升级,Tesla 全系车型通过 OTA 连夜更新(Grok 负责车内语音助手,不涉及 Full Self-Driving 系统),以及通过 xAI API(api.x.ai)以 OpenAI 兼容接口向开发者开放。这种"一夜间覆盖数百万终端"的分发速度,是任何纯 AI 实验室在发布日都无法匹敌的。
财务方面,SpaceX 刚于 2026 年 6 月完成了创纪录的 1.75 万亿美元 IPO,其招股书为 Grok 相关诉讼预留了超过 5 亿美元。xAI 的 Grok 部门 2025 年亏损 63.5 亿美元——每月一款新模型的承诺,既是对竞争对手的压制,也是在高投入下的必然产出要求。
Opus、GPT、Grok:三条不同的登顶路径
Grok 4.5 的发布将 2026 年中的 AI 竞争格局清晰地分成了三条路线。
Anthropic 选择"深度优先":Claude Opus 系列以推理质量和上下文理解见长,尤其在长程编程任务上的上下文保持能力被多位开发者评价为行业最佳。Opus 4.8 代表了"把一个模型做到极致"的理念。但这条路线的问题在于——迭代速度天然受限于深度质量验证的周期,Opus 4.6 到 4.8 之间间隔了数月。
OpenAI 走的是"广度覆盖":GPT-5.5 在 SWE-bench 上拿到 88.7%,GPT-5.6 已进入有限预览。OpenAI 的武器是庞大的用户基数和多模态整合能力,但其模型分发面临越来越多的监管阻力——有回复在 Musk 推文下追问 Grok 4.5 "是否会像 Fable 5 和 GPT 5.6 一样被政府封锁",暗指前沿 AI 模型正进入类似高端芯片的出口管制框架。
SpaceX/xAI 选择的则是第三种路径:"节奏碾压"。不是做出世界上最好的模型,而是做出"够好且更新最快"的模型——然后用每月一款的节奏把竞争拖入消耗战。这一策略的可行性建立在三个独特优势上:自有 Blackwell 集群(算力成本可控)、Cursor 工作流数据(训练数据不可复制)、以及 Tesla-OTA-X 的分发体系(用户触达零摩擦)。
"新模型每个月发一款"这条路线如果持续执行,将迫使所有对手在两种不想做的选择之间抉择:要么跟着加速,牺牲单模型质量;要么保持节奏,但面临用户被持续新鲜的竞品吸引走的风险。
在 Musk 推文下,开发者社区的反应印证了这个方向的市场需求。Danny Limanseta(@DannyLimanseta,30985 粉丝)写道:"等不及在 Cursor 上测试这个了。" Greg Griffin(@gr3ggr1ff1n)表示:"我每天都在用 Cursor,请务必支持。"而 Luca Greco(@lucagrecoita,9466 粉丝)给出了诚实的对比:"Claude Opus 是我第一个觉得值得付费的 AI。如果 Grok 能匹敌 Opus 4.8,那将是巨大进步。截至目前,我不觉得 Grok 有 Sonnet 4.6 那么强。"
每月一款:AI 进入交付力时代
Grok 4.5 的深层信号不在参数或基准分数里,而在那句"每个月一款全新模型"里。
它宣告了一个转折:AI 前沿竞争的决定性因素正在从"谁能做出最好的模型"转向"谁能以最快速度持续交付够好的模型"。这个逻辑在消费互联网、智能手机和云服务行业反复验证过——最终赢家往往不是在单点上最强的那个,而是能保持最高迭代频率的那个。
SpaceX 把发射火箭的工程文化带进了 AI:可重复使用的硬件(Blackwell 集群)、标准化的流程(Grok Build harness)、按月的交付窗口(12 次/年)。这种工业化的节奏感,与 AI 行业过去"闭关一年、惊艳一次"的研发模式形成了根本性的张力。
问题是,当研发节奏被提到这个级别,模型的安全对齐、数据合规和质量保障能否跟上?xAI 前工程师 Devin Kim 已在加州提起举报诉讼,指控其因对 Grok 安全措施提出担忧而被解雇。一个搭载在数百万辆汽车和无数机器人中、以月为单位快速迭代的 AI 系统,其社会影响远超任何实验室的基准测试。
但无论如何,从今天起,AI 的竞争时钟已经加速了。不是季度,不是半年,是一个月。
参考链接
© 本文由机器之心原创,转载请联系本公众号获得授权。