AREX Feed Article
Muse Spark 1.1 截胡 Grok 4.5:Agentic 三榜封王,价格只要 Fable 5 的 1/10
7 月 9 日,Mark Zuckerberg 在 X 上发了一条推文。这是他三年来的第一条——上一次发帖还是 2023 年 7 月,彼时这个平台还叫 Twitter。
推文只有一句话:「今天我们要发布 Muse Spark 1.1 —— 一个强大的 agentic 和 coding 模型,价格极低。」45,205 个赞,3,592 次转发,22.7M 浏览。评论区最高赞回复来自 Elon Musk,只有两个字:「Jinx」。
这或许是本周 AI 行业最拥挤的发布周里,最戏剧性的一幕。
Zuck 抛弃 Threads 来 X 宣发,Elon 两个字的回复拿了 17K 赞
Muse Spark 1.1 的发布本身已经足够重磅,但更让社区兴奋的是发布方式。
Zuckerberg 上一次在 X 发帖是 2023 年 7 月——正是他将 Twitter 改名为 X 的那个月。此后三年,他忙于 Threads,却在这个节点回到了对手的阵地。正如一位用户调侃的:「Zuck 跑了三年终于想起密码了。」另一位写道:「这大概是 Threads 最大的失败——连老板发产品都要来 X。」
社区反响立竿见影。Google 的 Logan Kilpatrick(Gemini 团队成员)第一时间回复「恭喜你和团队取得这个进展」,获 1,174 赞。知名 AI 开发者 Mckay Wrigley(@TakeoffAI 创始人,22.7 万粉丝)则直奔主题:「如果今天想把模型接入 agent 产品,API 怎么搞?——我被卡在等待名单上了。」
Elon Musk 的回复最为简短:「Jinx。」这条只有两个字母的回复拿下 17,730 个赞、473 次转发,成为 Zuck 推文下最热的互动。在 Grok 4.5 发布仅 24 小时后,Musk 的「Jinx」既是同行间的打趣,也带着一丝被截胡的微妙。
不过,并非所有声音都是赞美。大量开发者在评论区反映 API 无法访问、注册需绑定 Instagram 账号、地区限制等问题。「为什么要通过 Instagram 注册来使用开发者 API?」一位用户质问。另一位简洁地总结:「F*ck EU?」
一周三个模型:GPT-5.6、Grok 4.5、Muse Spark 1.1 接连登场
要理解 Muse Spark 1.1 的时机意义,得看这一周发生了什么。
7 月 7 日,Meta 发布 Muse Image——Meta Superintelligence Labs 的首个图像生成模型。两天后,7 月 9 日,OpenAI 发布 GPT-5.6 系列(Luna、Terra、Sol),同一天 SpaceXAI 发布 Grok 4.5。而就在 Grok 4.5 登顶 Harvey's Legal Agent Bench 不到 24 小时后,Muse Spark 1.1 上线,直接夺走了这个位置。
这已经不是巧合。从四月 Muse Spark 初代发布时的「谨慎试水」,到七月 Muse Image + Muse Spark 1.1 的「五天两弹」,再到 Meta 首席 AI 官 Alexandr Wang 在 CNBC 采访中透露的「一个更强大的模型 Watermelon 正在训练中」——Meta 的节奏正在从跟随者转向参与者。
更关键的是商业模式的转折。Muse Spark 初代仅通过私密 API 预览提供给「精选合作伙伴」。而 1.1 版本伴随的是 Meta Model API 的公测——这是 Meta 历史上第一次向开发者收取模型调用费用。输入 $1.25/M token,输出 $4.25/M token,新账户赠 $20 免费额度。
Agentic 工具调用三榜封王,但长链 coding 仍需追赶
Muse Spark 1.1 的性能画像非常清晰:Agentic 工具调用是绝对主场,coding 是快速追赶项。
根据独立评测机构 Vals AI 的数据,Muse Spark 1.1 在三个代理类基准上登顶:MedScribe(医疗代理)、TaxEval(税务代理)和 Harvey's Legal Agent Bench(法律代理)。在 TaxEval 上,Meta 同时占据前两名;在 Harvey's Legal Agent Bench 上,它从 Grok 4.5 手中夺走第一——而 Grok 4.5 登顶还不到 24 小时。
Artificial Analysis 的综合评测提供了更全面的图景:Muse Spark 1.1 在 Intelligence Index 上得分 51,与 GLM-5.2、GPT-5.4、GPT-5.6 Luna 持平。仅比 Grok 4.5(54 分)低 3 分。
但领先集团——Claude Fable 5(60 分)、GPT-5.6 Sol(59 分)、Claude Opus 4.8(56 分)——仍有明显距离。
具体到 agentic 工具调用,Muse Spark 1.1 在关键指标上实现了断层领先。MCP Atlas(规模化工具调用)得分 88.1,而 Opus 4.8 为 82.2、GPT-5.5 仅为 75.3。JobBench(专业工具调用)得分 54.7,远超 Opus 4.8 的 48.4 和 GPT-5.5 的 38.3。
但短板同样清晰。DeepSWE 1.1(长链 agentic coding)仅得 53.3 分,远低于 GPT-5.5 的 67.0 和 Opus 4.8 的 59.0。这印证了 Wang 在 CNBC 采访中的说法:「你必须把 coding 能力作为整体 agentic 能力的一部分来建设」——言下之意,长链 coding 仍在追赶中。
模型的 token 效率是一大亮点。Muse Spark 1.1 仅用 94M 输出 token 跑完 Intelligence Index 全套评测,比同档的 GPT-5.4(109M)和 GPT-5.6 Luna(125M)更省。
按 Meta 的定价,每项任务成本约 $0.26——不到 GLM-5.2($0.37)的 70%,仅为 GPT-5.4($0.89)的 1/3。输出速度约 114 tokens/s,TTFT(首 token 延迟)约 21 秒。
上下文窗口从初代的 262K 扩展至 1M token,幻觉率从 73% 降至 38%。但这一降幅主要来自模型选择「不回答」而非「回答得更准确」——准确率基本持平(45% → 41%)。
从「送模型」到「卖模型」,Meta 的 AI 棋局拐了个急弯
本周之前,Meta 在 AI 行业的角色是明确的:开源旗手。Llama 系列以开放权重闻名,开发者可以自由部署、微调、商用。这在当时是一种差异化策略——当 OpenAI 和 Anthropic 都在收 API 费时,Meta 在「送」。
但 Muse Spark 1.1 改变了这一切。模型不再开源,Meta Model API 开始收费。用 Alexandr Wang 在 CNBC 采访中的话说,定价「非常激进和有吸引力」。Reuters 指出这一价格高于 GPT-5 mini 和 Claude Haiku 4.5,但低于 Claude Sonnet 4.8 等高端模型。
这并不是全面转向封闭。Wang 在 CNBC 采访中确认:「我们仍然致力于开源,MSL 正在开发一个 Muse Spark 的变体,计划开源。」但他拒绝透露时间线。
Rowan Cheung(The Rundown AI 创始人,59.3 万粉丝)的观察精准地捕捉了市场心态:「很多人怀疑 Meta 在 AI 竞赛中的地位。昨天他们发布了 Muse Spark 1.1,现在是最强 agentic 模型之一,而且大幅压低了 OpenAI 和 Anthropic 的价格。」他补充了一个关键信号:Meta 股价自发布以来涨超 10%。
从行业格局看,Muse Spark 1.1 的定价策略正在改写 Agentic 赛道的经济模型。当 Fable 5 仍然是综合能力最强的模型时,Muse Spark 1.1 以 1/10 的价格在特定 agentic 场景中实现可比的性能、2 倍的速度——这对于需要大规模部署 agent 的企业来说,不是「选哪个更好」的问题,而是「选哪个更划算」的问题。
价格屠夫的入场,不只是一次模型迭代
Muse Spark 1.1 的真正意义不在于它拿了几个 SOTA。而在于 Meta 用一套「闭源 + 低价 API + 消费级免费」的组合拳,在 Agentic 赛道划出了自己的定价基准线。
当 Zuck 选择在 X 而不是 Threads 上首发这条消息时,他传递的信号比推文本身更响亮:在 AI 这场牌局上,Meta 不再满足于坐在旁边看。它要上桌,而且带够了筹码。
本文基于公开资料撰写,仅供参考。转载需注明来源。