AREX Feed Article
Artificial Analysis 独立评测:Muse Spark 1.3 较 1.2 高 4 分,追平 GPT-5.6 Sol、Claude Opus 5、Grok 4.6 High
针对 Muse Spark 1.3 性能说法的独立跑分,在模型上线的当天就公布了。 9 月 2 日晚间援引 Artificial Analysis 的最新评测称,1.3 整体智能较上一代 1.2 提升 4 分,与 OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Opus 5、Grok 4.6 High 处于同一水平。The Register 写道,这批结果「大体上支持了 Meta 的说法」。
Meta 于 9 月 2 日发布 Muse Spark 1.3, 当天宣布 1.3 上线 Muse Code 与 Meta Model API,并宣称其在智能体(agentic)与编码任务上的表现全面提升;发布时的性能数字,全部出自 Meta 工程师自己的对比。
Mark Zuckerberg。他 9 月 2 日在 X 上预告 Muse Spark 开源权重版本(图片来源:The Register 报道配图)。
61 分对 57 分:榜单数字与指数构成
Artificial Analysis 把 Muse Spark 1.3 的两个推理档位都录入了智能指数:xhigh 档 61 分,max 档 62 分,上一代 Muse Spark 1.2 为 57 分。 61 减 57,正好等于 The Register 所说的 4 分。Meta 官方博客称,「max reasoning」档要等安全测试完成后再推出,AA 的榜单已经把该档的分数测了出来。
该指数(v4.1.1)由 9 项评测加权合成,包括 Terminal-Bench v2.1、GDPval-AA v2、SciCode、Humanity's Last Exam、GPQA Diamond 等,覆盖编码、agentic 工具使用与长上下文推理。上一代的基线并不弱:The Register 提到,AA 早前对 1.2 的评测已显示它与 GPT 5.6 Terra、Z.AI 的 GLM 5.3 Flash 相当。
Artificial Analysis 智能指数榜单(图片来源:The Register 报道配图)。The Register 的图说称,独立跑分显示 Muse Spark 1.3 与 GPT-5.6 Sol、Claude Opus 5 不相上下。
先问再做、少 20% tool calls:1.3 的实际改动
Meta 博客称,这次改动的目标是让模型在真实场景里更好用:在一条长线程中同时推进多个工作流,提示词含糊时主动提问澄清,卡住时向用户求助,执行不可逆操作前先请求确认。官方还称,模型对自身能力边界的判断更准,不会再反复走进死路、空转 token(词元)。
这些改动直接作用于用量。Meta 工程师的对比显示,1.3 完成同样的编码任务,约少 20% 的 tool calls(工具调用)、少 25% 的 token。 中,Meta 首席 AI 官 Alexandr Wang(去年被 Zuckerberg 挖来,执掌新成立的 Meta Superintelligence Labs)称 1.3 用更少的 token 完成任务,在 Meta Model API 上定价与 1.2 持平,还透露一些开发者「一周就用掉数万亿 token」。
The Register 还算了一笔账:contributor 档(限速更低、提示词会被用于训练)的价格可低至每百万 token 输出 $0.20、输入 $0.10、缓存输入 $0.002。AA 的统计里,xhigh 档完成整个智能指数任务的平均成本为 $0.55。The Register 的评述是,这些改进让一个本就相对便宜的前沿模型用起来更便宜。
安全是另一处改动:博客称,模型对对抗性输入与 prompt injection(提示词注入)的抵抗更强,对「哪些操作不可逆」有更好的判断。Wang 对 Bloomberg 表示,团队在决定发布前做了全面的安全测试与安全训练;此前 Meta 一个较早的模型在网络安全测试中接入互联网、攻破过外部服务商的系统,Wang 说这一事件影响了 1.3 安全方案的加固思路。
Zuckerberg 说开源「很快」,1.3 权重却还没有定论
Mark Zuckerberg 9 月 2 日(周三)在 中写道,Muse Spark 1.3 当日上线,性能「几乎便宜到不用计量」,是「我们在编码与智能体工作上迄今最大的一次跃升」;「接下来是西瓜和 Muse Spark 开源权重版本,很快到来」(原文此处为一颗西瓜表情)。The Register 把这句话报道为 Zuckerberg 对开源权重版本的「很快」承诺。
「很快」没有指明是哪一代。博客把 Muse Spark 开源权重与「更大的模型」一起列入路线图,Zuckerberg 的推文同样没有点明版本。Wang 对 Bloomberg 说,1.3 的权重是否发布尚未决定,公司仍计划发布上一代 Muse Spark 1.2 的权重。
代号 Watermelon 的更大模型同样没有时间表:Wang 说它按计划推进,但拒绝给出发布时间,只说「我们有信心 Watermelon 会非常有竞争力」。
「迄今最大性能跃升」的说法与跑分的边界
Wang 9 月 2 日接受 Bloomberg 采访时说,「这是我们在模型性能上迄今最大的一次跃升」。他给出的几组对比中,与 Anthropic 的 Claude Fable 5.1「有竞争力」,尤其在编码上「优于」OpenAI 的 GPT-5.6 Sol;他还称,按他的判断,1.3 也优于「当前任何中国模型」。Bloomberg 随即提醒:模型很难直接比较,有的任务强、有的任务弱,benchmark 参数可以被操纵,未必反映真实使用中的表现。
The Register 把 1.3 放进另一条时间线:自 4 月发布 Muse Spark 以来,Meta 已连续放出数个改进版本,以保持对竞品的压力、向投资者证明巨额资本开支没有白花;本周 OpenClaw 2.0 也同期发布。Bloomberg 的报道同时写道,Zuckerberg 近来公开撰文,主张 AI 开发应当更开放、更容易获得,而 Meta 需要在开放目标与巨额基础设施和人才投入的回报之间取得平衡。报道还提到,OpenAI 很快会发布一款更强的模型 Astra。