AREX Feed Article
Grok 4.5 上架 GitHub Copilot:SpaceXAI 首款主力模型以 $2/$6 低价切入编码市场
7 月 28 日,SpaceXAI 正式将 Grok 4.5 集成进 GitHub Copilot,数百万 VS Code 及 GitHub 生态开发者可在模型选择器中直接切换使用。这是 xAI 并入 SpaceX、对外改称 SpaceXAI 后发布的首款主力模型自 7 月 8 日亮相以来,最实质性的一次分发扩张——从自有终端工具 Grok Build 和 Cursor IDE,正式打入全球最大开发者平台的原生编码助手。
模型定位与定价:用价格说话
Grok 4.5 被 Elon Musk 称为"Opus 级"模型,对标 Anthropic 的 Claude Opus 系列,定位编码、Agent 任务和知识工作。SpaceXAI 公布的 API 定价为每百万 token 输入 $2、输出 $6(上下文超过 200K token 时价格翻倍),缓存输入仅 $0.50。
这一定价在旗舰模型中极为激进——Claude Opus 4.8 的定价为 $5/$25,GPT-5.6 Sol 则为 $5/$30。Grok 4.5 的输出价格约为 Opus 4.8 的四分之一、GPT-5.6 Sol 的五分之一。
价格优势还叠加了 token 效率。据 Artificial Analysis 独立评测,Grok 4.5 完成单个编码 Agent 任务平均消耗约 190 万 token,远低于 Fable 5(Claude Code)的 720 万和 GPT-5.5(Codex)的 620 万。在 Coding Agent Index 上,Grok 4.5 单任务成本 $2.49,对比 Fable 5 的 $11.80 和 GPT-5.5 的 $5.07,差距显著。
基准表现:第四名,但有分量
在 Artificial Analysis 综合 Intelligence Index 上,Grok 4.5 得分 54,位列第四,排在 Fable 5(60)、Claude Opus 4.8(56)和 GPT-5.5(55)之后,领先所有开源模型及 Google Gemini 系列。较上一代 Grok 4.3 的 38 分跃升 16 分,标志着 SpaceXAI 首次进入"前沿"区间。
具体基准方面:
- SWE-Bench Pro:64.7%,低于 Fable 5(80.4%)和 Opus 4.8(69.2%),但在独立评测中解析任务的平均输出 token 仅为 15,954,约为 Opus 4.8(67,020)的四分之一;
- Terminal-Bench 2.1:83.3%,接近 Fable 5 的 84.3%;
- GDPval-AA v2(知识工作 Elo):1543,排名第四;
- τ³-Banking(金融 Agent):33%,领先 GPT-5.5 的 31%;
- AutomationBench-AA(办公自动化 Agent):51.4%,在 40 个模拟应用中超越 Fable 5 和 Opus 4.8。
在 GitHub Copilot 中的集成原生支持 VS Code 内代码补全、Agent 模式和聊天,企业用户需在 Copilot 设置中启用后方可使用。
Grok Build:配套开源终端编码 Agent
与 Grok 4.5 配套发布的 Grok Build(GitHub 仓库 xai-org/grok-build)是 SpaceXAI 的终端编码 Agent,采用全屏 TUI,支持代码库理解、文件编辑、Shell 命令执行、网页搜索和长时间任务管理。该工具以 Apache 2.0 协议开源,上线两周即获超过 23,500 星标。
Grok Build 不仅支持编码场景,还可处理 Excel、PowerPoint 和 Word 任务,支持最多 8 个并行的子 Agent。7 月 31 日,Musk 在 X 平台发帖"Try Grok 4.5"推广该工具,帖子获得约 2700 点赞、126 万次浏览。
发布节奏提速:每月一个新模型
Musk 在 Grok 4.5 发布后宣布了加速迭代计划——此后每月发布一个基础模型。Grok 4.6 预计 8 月 7 日前后推出,Grok 4.7(据称为 2.1 万亿参数规模)将在数周后跟进,Grok 5 则被定位为"下一个重大跃升"。这一节奏明显快于 OpenAI 和 Anthropic 的更新周期。
此外,7 月 29 日 SpaceXAI 发布了 Grok Voice Think Fast 2.0,在 AA Speech-to-Speech Quality Index 上得分 82.9%,超过 GPT-Realtime-2.1(79.1%)和 Gemini 3.1 Flash(69.5%)。
争议与不确定性
Grok 4.5 的发布并非毫无争议。
最显著的关切来自 幻觉率大幅上升。Artificial Analysis 的 Omniscience 评估显示,Grok 4.5 的准确率从 Grok 4.3 的 35% 提升至 52%,但幻觉率同时从 25% 翻倍至 54%。模型"知道得更多,但出错时也更自信"。多家独立评测将其描述为"过度自信、不够细致"。
基准污染事件公开化。Cursor 在发布后披露,Grok 4.5 的训练数据中意外包含了一份早期 Cursor 代码库快照,导致 CursorBench(Cursor 自研评估套件)的分数被全部撤回。而在独立、中立 harness 的 DeepSWE 1.1 上,Grok 4.5 仅得 53%,远低于 Fable 5 的 70%——较 SpaceXAI 自有 harness(DeepSWE 1.0)上的 62% 下降了 9 个百分点。
此外,安全护栏违规率在对比组中最高(0.63 次/任务),上下文窗口从 Grok 4.3 的 100 万 token 缩减至 50 万,且 SpaceXAI 未发布 Grok 4.5 的模型卡。早期独立长测仍然有限,实际生产环境中的长期可靠性有待验证。