AREX Feed Article
Grok 4.6 上线 GitHub Copilot,Musk 提醒评估要用 Build
8 月 14 日,SpaceXAI(原 xAI) Grok 4.6 在 GitHub Copilot 上线。官方把 Grok 4.6 称作「我们最新的编码模型」:在 VS Code 里打开模型选择器、选中 Grok 4.6 即可使用,Copilot CLI 与 cloud agents 同样覆盖。
部分企业与商业用户需要先在 Copilot 设置中启用该模型。经 SpaceXAI 控制台接入,价格为每百万输入 token $2、输出 token $6;公告称这次上线面向「每天在 VS Code 和 GitHub 上工作的数百万开发者」。
Musk 划下前提:离开 Build,体验会显著变差
把 SpaceXAI 描述为马斯克的公司。马斯克本人 8 月 14 日(UTC)在 X 上发帖:"Grok 4.6 will work best with the Grok Build harness. The experience will be significantly worse without it, so best to evaluate using Build."
大意是:Grok 4.6 搭配 Grok Build harness 才能发挥最佳效果,没有它体验会显著变差,所以最好用 Build 来评估。附上 Grok.com/build 的链接,目前显示约 710 万次查看。
Grok Build 是 SpaceXAI 对标 Anthropic Claude Code 与 OpenAI Codex 的编程产品,随每月 $30 的 SuperGrok 订阅提供;首发第一周内,Build 与 Cursor 的 Grok 4.6 用量额度翻倍。
模型选择器是一步接入,马斯克的建议是评估回到 Build。
首发早两天,$2/$6 已铺开五处入口
Grok 4.6 首发在 8 月 12 日。VentureBeat 当天的分析记录:模型定位长时间运行的 agent、编码与知识工作,API 定价从每百万输入/输出 token $2/$6 起步。
当时可用的入口包括 Grok Build、SpaceX 新近收购的 AI 编码创业公司 Cursor,以及 OpenRouter、Vercel、Cloudflare 等合作伙伴。
首发距 7 月推出的 Grok 4.5 只有几周,后者同样主打编码、agentic 任务与知识工作。
GitHub Copilot 是这串入口里最新的一处,官方对它的描述是「数百万开发者」;至此公开的可用入口至少已有六处,$2/$6 的标价从首发延续到 Copilot。
61 分排全球第三,Terminal-Bench 仍差 8.6 个百分点
在 Artificial Analysis Intelligence Index 上,Grok 4.6 得 61 分、全球第三:超过 Moonshot 的 Kimi K3,追平 OpenAI 的 GPT-5.6 Sol Max,落后于 Claude Opus 5 与 Fable 5,较 Grok 4.5 High 高 5 分。
在 GDPVal-AA v2 上,Elo 为 1,753,高于 GPT-5.6 Sol Max 的 1,728 与 Fable 5 Max 的 1,741。
差距在 Terminal-Bench v3.0:Grok 4.6 从 15.7% 提升到 26%,GPT-5.6 Sol Max 与 Fable 5 Max 分别是 34.6% 与 34.1%。SpaceXAI 注明,表中的第三方分数取各家最佳自报或公开结果,不能当作严格受控的四模型对比。
论每任务成本,Artificial Analysis 报约 $0.84,反而不如 Grok 4.5 以及 GPT-5.6 Luna、GLM-5.2、Muse Spark 1.2 划算。
Copilot 公告没回答:表现怎么评估
Copilot 这则公告回答了在哪里用(模型选择器选中即可)、多少钱(控制台 $2/$6),通篇没有提到 Grok Build。
成本上还有一处容易算错的细节:Grok 4.6 支持 50 万 token 上下文,但提示词一旦达到 20 万 token,整次请求按 $4/$12 计费,而不是 $2/$6。
VS Code 里的开发者现在一步就能用上 Grok 4.6。评估表现时,公告指向 Grok 4.6 首发说明里的编码成绩,马斯克的建议是回到 Grok Build。