AREX Feed Article
Zuck 三年首回 X,Muse Spark 1.1 硬刚 GPT-5.6 与 Fable 5
三年不鸣,一条推文价值 2172 万次观看
7 月 9 日下午,Mark Zuckerberg 发布了他三年来的第一条 X 推文。
"今天我们发布 Muse Spark 1.1——一款强大的代理和编程模型,价格非常低。"这条推文在 24 小时内获得 2172 万次观看、4.4 万点赞和 3521 次转发。上一次他在这个平台发言,还是 2023 年 7 月,彼时 X 刚刚从 Twitter 更名。
他选择在 X 而非自家 Threads 宣布这款产品,本身就是一个信号:当你要触达开发者,就得去开发者所在的地方。而他带来的不光是一个新模型——是 Meta 有史以来第一次为自己的 AI 模型挂上价格牌。
Elon Musk 回了一个「Jinx」,但真正点破本质的是另一个人
Zuckerberg 推文下,X 老板 Elon Musk 秒回了一个词:"Jinx"。这条回复收获 1.7 万点赞和 90 万次观看。X 产品负责人 Nikita Bier 半开玩笑地问:"要不要我帮你开通创作者变现?"——被转了 638 次,点赞 2.2 万。Google AI 团队成员 Logan Kilpatrick 也送上祝贺:"恭喜你和团队取得这个进展!"
但真正点破本质的是 AI 博主 Alex Prompter:"免费和开源,是 Meta 落后时的策略。一张价格表意味着他们认为自己已经追上了。"这条推文获得 819 次点赞、11.9 万次观看,被收藏 178 次。
Meta 首席 AI 官 Alexandr Wang 随后发布技术长线程,称 Muse Spark 1.1 "在多项代理评测中与 GPT-5.5 和 Opus 4.8 竞争"。该线程获得 137 万次观看和 3589 次点赞。Replit CEO Amjad Masad 简洁回应:"Nice work。"
第三方评测机构 Vals AI 给出了更具分量的独立验证:Muse Spark 1.1 在 Vals Index 综合排名第四,是前十名中速度最快的——比前三名平均快 3 倍。在医疗记录、税务分析和法律代理三项垂直评测中均位列第一,从 Grok 4.5 手中夺走了法律代理之冠。这条推文获得 61.7 万次观看和 1216 次点赞。独立评测者 scaling01 则给出谨慎判断:"Muse Spark 1.1 大致介于 Opus 4.6 和 4.7 之间,考虑到极低价格,这已经足够接近成本前沿。"
同一天,三家公司同时亮剑
7 月 9 日这一天发生的事情,足以写进 AI 行业编年史。
凌晨,OpenAI 全面开放 GPT-5.6 系列——Sol、Terra、Luna 三档分级模型,旗舰 Sol 定价 $5/$30。前一天,SpaceXAI 发布 Grok 4.5,以每小时约 80 token 的速度成为市场上最快的模型之一,定价 $2/$6。更早一周,Anthropic 的 Claude Fable 5 和 Mythos 5 双双登场,在 SWE-Bench Pro 上以约 80% 的得分建立起令人生畏的品质壁垒。
Databricks 的 Yuchen Jin 在 X 上写道:"我们正在经历一场模型大爆炸:GPT-5.6、Grok 4.5、Muse Spark 1.1、GLM-5.2 和 Fable 5 全部在过去一个月内发布。"这条推文获得 1297 次点赞。
对 Meta 而言,Muse Spark 1.1 的意义不止于产品迭代。今年 4 月,Meta Superintelligence Labs 在 Alexandr Wang 的领导下发布初代 Muse Spark,Wang 当时称之为"开胃菜"。三个月后,这道"主菜"端上了桌——附带一张付费账单。CNBC 报道指出,Zuckerberg 正面临华尔街压力,需要为 Meta 高达 6000 亿美元的 AI 基建投资找到回报。Wang 同时透露,一款代号 "Watermelon" 的更强大模型正在训练中。
不争编程之王,只做工具调度之冠
Muse Spark 1.1 的基准测试成绩呈现出一个清晰的"分叉"模式——在代理和工具调度类评测中领跑,在纯编程和多模态任务中甘居第三。
在专业工具使用评测 JobBench 上,它以 54.7 分大幅领先 Claude Opus 4.8(48.4)和 GPT-5.5(38.3)。在规模化工具调度评测 MCP Atlas 上以 88.1 分位居第一。在工具辅助推理评测 Humanity's Last Exam 上以 62.1 分再度领先。三项代理核心指标全部第一——多工具编排、子代理委派、长会话状态保持,恰恰是当前企业 AI 落地最需要的能力。
但纯编程赛道是另一番景象。SWE-Bench Pro 得分 61.5,落后 Opus 4.8 的 69.2 近 8 分。DeepSWE 1.1 得分 53.3,落后 GPT-5.5 的 67.0 近 14 分。Meta 没有试图造一个全面争冠的模型——它在工具调度上做到最强,在代码生成上接受第三。这种取舍是刻意的。
定价才是 Meta 最锋利的武器。每百万 token 输入 $1.25、输出 $4.25(新账户赠送 $20 免费额度),相比 Fable 5 的 $10/$50 便宜了 8 到 12 倍。100 万 token 上下文窗口支持主动压缩,OpenAI 和 Anthropic 双 SDK 兼容,内置网页搜索——工程团队切换模型只需改一个 base URL。独立开发者 Max Blade 实测后惊呼:"比 GPT-5.6 Sol 便宜 86%,比 Fable 5 便宜 91%,但速度和能力远超预期。"
关键不是 Muse Spark 1.1 有多聪明,而是它让代理任务便宜到可以规模化运行。
三角形的三极:Meta 选了最狠的那一角
一年前的 AI 格局是一架梯子——你选择能负担得起的最强模型。2026 年 7 月的格局是一个三角形。
一角是品质之巅:Anthropic 的 Fable 5 和 Mythos 5,定价 $10/$50,SWE-Bench Pro 上碾压式领先约 15 个百分点。一角是平台纵深:OpenAI 的 GPT-5.6 Sol,Codex 生态、多代理工具链、计算机使用能力——行业最深的集成面。一角是极致效率:Grok 4.5 的极速推理、Muse Spark 1.1 的激进定价——以十分之一的价格提供接近前两角的能力。
分析师 Ken Huang 在其 Substack 报告中一针见血:"没有一家厂商还在试图同时赢下三个角。Anthropic 不追赶 Muse 的价格,Meta 不追赶 Fable 的 SWE-Bench 得分,xAI 交付了速度和成本,让出了品质桂冠。每家选了一个角——这意味着你也必须选一个。"
Meta 的策略是价格战。Wang 在 CNBC 采访中直言这是"非常激进且有吸引力的定价",目标是"让价格匹配海量消费级使用量"。他同时确认,Meta 仍在开发 Muse Spark 的开源变体——用他自己的话说,Meta"仍然致力于开源"。但此时此刻,摆在台面上的是一张价格表。
过去,Meta 靠 Llama 开源赢得开发者信任。现在,它要用 Muse Spark 的性价比赢得开发者预算。
免费是策略,收费是宣言
从不收费到收费,从开源到闭源 API,Meta 的转变不是价值观摇摆,而是竞争位置的重新校准。当你的模型还追不上对手,开源是争取开发者的唯一筹码。当你的模型能在代理任务上叫板 GPT-5.5 和 Opus 4.8,收费就是对自己实力的确认。
Zuckerberg 在推文末尾写道:"More to come soon."这不是一次发布,而是一个进场宣言。在代理时代的黎明,把模型做到最划算,也许比做到最聪明更危险。
Sources
- Mark Zuckerberg on X, July 9, 2026 — (21.7M views, 44.1K likes, 3.5K retweets)
- Alexandr Wang technical thread — (1.3M views, 3.5K likes)
- AI at Meta announcement — (871K views, 4.9K likes)
- Vals AI independent evaluation — (617K views, 1.2K likes)
- Alex Prompter analysis — (119K views, 819 likes)
- Yuchen Jin "model explosion" — (97K views, 1.3K likes)
- CNBC: "Meta jumps into AI coding market to chase Anthropic and OpenAI" —
- TechCrunch: "Meta enters the crowded AI coding battle with Muse Spark 1.1" —
- Bloomberg: "Meta Starts Charging for AI With Muse Spark 1.1 Agentic Model" —
- Reuters: "Meta debuts Muse Spark 1.1 model with preview open to developers" —
- New York Times: "Meta Launches New A.I. Model as Global Technology Race Heats Up" —
- Ken Huang, Substack: "Comparison Report: GPT-5.6 Sol, Fable5, and the Muse Spark 1.1, Grok 4.5" —
- AgentRiot benchmark analysis —
- Digital Applied: "Meta Muse Spark 1.1: Meta's First Paid Agent Model" —
- Meta AI official blog: "Introducing Muse Spark 1.1" —
- Fortune: "Meta releases latest update of AI model Muse Spark" —
本文仅供信息分享,不构成投资建议。文中 benchmark 数据主要来自 Meta 官方报告及第三方独立评测,建议开发者在自有工作负载上验证模型表现。