AREX Feed Article
Zuckerberg 发布 Muse Code:跑分输给 Anthropic,但定价砍到竞品 1/250
自己的跑分图,全输
8 月 5 日,Meta 发布旗下首款 AI 编码代理 Muse Code(beta),同时推出底层模型 Muse Spark 1.2。CEO Mark Zuckerberg 了这则消息。
Muse Code 是一个终端工具,在 macOS 或 Linux 上一行命令安装,可在大型代码仓库中规划修改、编写代码、验证结果。
Meta 在贴出三张基准测试对比图。Muse Spark 1.2 在 Terminal-Bench 2.1、DeepSWE 1.1 以及 Meta 自建的内部编码基准上,全部输给 Anthropic 的 Claude Opus 5。Meta 照发了这些图表。
这家公司入局的策略很清楚:用价格说话。
他们不 care 利润率,他们要的是你的数据
Zuckerberg 的 X 首发帖获得超过 9800 次点赞、840 次转发。他写道:"Releasing Muse Code in beta today. It's a terminal coding agent that takes on complete software engineering tasks across large repos: planning changes, writing code, validating the results."
Meta 首席 AI 官 Alexandr Wang 以一系列推文解释产品架构。他称模型与代理"共同训练",在 NVIDIA Hopper GPU 上连续运行 24 小时、超过 1000 次工具调用后,"仍在初始探索阶段之后持续发现实质性改进"。获得超过 1300 次点赞。
X 用户 的评论获得超过 730 次点赞:"Muse Spark 的输入、输出,还有缓存命中价格,全都比 DeepSeek V4-Flash 还低。他们不 care 利润率,他们要的是数据。"
Meta 研究院 Matt Deitke 指出,Muse Spark 1.2 的贡献者级定价比 Anthropic Fable 5 的输出 token 便宜 250 倍,比 OpenAI GPT-5.6 Sol 便宜 150 倍。
从 Llama 到 Muse:一年翻身上桌
2025 年 6 月,Alexandr Wang 加入 Meta 出任首席 AI 官,领导新成立的 Meta Superintelligence Labs。称,这笔人事任命是 Zuckerberg 重整 AI 战略的核心动作。
2026 年 4 月,Meta 用 Muse Spark 取代了此前的 Llama 开源模型系列。7 月,Muse Spark 1.1 发布,推出付费模型 API。
本次发布正值 Meta 财务承压之际。 指出,Meta 上周因营收指引不及预期且第二季度自由现金流萎缩,股价已遭重挫。Muse Code 是 Zuckerberg 向投资者展示 AI 投入能转化为收入的最新一步。
持久背景代理,加并行工作树
Muse Code 的架构有两个赌注。
第一,持久异步背景代理。竞品每次任务重新创建辅助代理,Muse Code 则在整个会话中保持一组专门化代理持续运行。介绍,这避免了重复的信息收集,降低了长任务中的延迟和人工干预需求。
第二,并行工作树与事件日志。复杂任务派生子代理,各自在独立的 git worktree 中并行工作。Zuckerberg 写道:"测试中我们让它同时为一个游戏构建了六个功能,零冲突。"所有模型调用和编辑操作记录到本地事件日志中,崩溃后可精确恢复。
模型与代理共同训练。Meta 用拒绝采样的 harness 轨迹来训练 Muse Spark 1.2,同时用 Muse Spark 1.1 自动生成编码环境来创建可扩展的训练数据。
在 GPU 内核优化案例中,代理在 NVIDIA Hopper 上运行超过 1000 次工具调用、最长 24 小时,写出了 KDA 和 MLA 内核的"实质性改进",包括将门控累积衰减重新居中到块中点等优化。
基准数据:Terminal-Bench 2.1 得分 82.9%,DeepSWE 1.1 得分 59.3%,Meta 自建内部编码基准 70.6%。Claude Opus 5 在三项测试中分别领先 3.8、5.7 和 8.8 个百分点。Muse Spark 1.2 较 1.1 在 Terminal-Bench 提升 6.7 个百分点,DeepSWE 提升 6.3 个百分点。
价格是唯一的武器
此前,AI 编码代理市场由 Anthropic 的 Claude Code 和 OpenAI 的 Codex 主导。据 ,Claude Opus 5 在 Terminal-Bench 2.1 公开排行榜以 89.1% 领先,GPT-5.6 Sol 以 89.5% 居首。Meta 的基准测试图表未包含 Sol,选用了较弱的 GPT-5.6 Terra 作为对比。Zuckerberg 帖下有用户:"为什么跟 Terra 比,却拿 Anthropic 的顶级模型来比?"
本次发布的转折不在模型能力,而在定价结构。标准级每百万 token 输入 $1.25、输出 $4.25。贡献者级降至输入 $0.10、输出 $0.20,缓存输入 $0.002。代价是开发者的提示和代码进入 Meta 的训练管线。
Wang 确认了这笔交易:贡献者级"让你以显著更低的成本进入",前提是"选择加入以帮助改进模型"。他直言 Meta 的策略是用价格而非能力来差异化。
Meta 同时宣布开始接受零数据留存请求,Wang 称这是"对企业用户很重要的大功能"。
第二好但足够便宜,这是一场持久战的入场券
Meta 进入 AI 编码代理市场第一天,选择了最直白的策略:承认自己不是最好的,让价格低到不可忽视。Zuckerberg 写道:"Muse Spark 1.2 是我们向 frontier 推进的下一步,更大、更强的模型正在路上。"
胜负手不取决于 Muse Code 能否在跑分上反超 Anthropic,而取决于有多少开发者愿意为一个足够好且足够便宜的工具,交出他们的代码。