AREX Feed Article
Meta 宣布 Muse Spark 1.3 max 公开上线,称安全测试已完成、编码与智能体更强
北京时间 9 月 5 日 02:16(UTC 9 月 4 日 18:16),Meta 首席 AI 官 Alexandr Wang(其 为 chief ai officer @meta):「我们刚刚公开发布 Muse Spark 1.3 max!」
四分钟后,Meta 官方 AI 账号 @AIatMeta :带 max reasoning(最高推理档)的 Muse Spark 1.3 已在 Muse Code 与 Meta Model API 上线。Wang 给出的放行理由是:max 档的编码与智能体(agentic)表现「显著更强」,即便已经试过 1.3 的 high 或 xhigh 档,也值得再试一次。
这一档在 9 月 2 日 Muse Spark 1.3 首发时并未一同推出。当时 写明:此前已有的推理档位当天即可用,max 档要等完成额外的安全测试后才推出。
(图:Artificial Analysis 于 9 月 4 日随 Intelligence Index v4.2 更新发布的图表,上为指数榜,下为「指数-单任务成本」对比图。)
一条四连发的线程,两条试用路径
Wang 在首条之后,又于 UTC 18:18 和 18:27 连发两条续帖,分别给出两条试用路径;@AIatMeta 的确认推文(UTC 18:20:21)插在两者中间。
API 侧的办法,是 Wang 在:「想试的话,直接用 muse spark 1.3,把 reasoning level 设为 max。」Muse Code 侧则按的指引,在终端执行安装命令 curl -fsSL https://dev.meta.ai/install.sh | bash。这条命令与 9 月 2 日博客给出的安装命令一致。
第三方渠道跟进得也很快。UTC 18:32,自称负责 OpenRouter 推理基础设施运营的 Toven 在 Wang 的帖子下:「已上线 OpenRouter!把 reasoning effort 设为 Max 即可。」按照他的说法,官宣 16 分钟后,除 Muse Code 与 Meta Model API 外,聚合平台上也已经能选到这一档。
截至本文写作时,Wang 的官宣推文已获得约 18.4 万次浏览、1,586 次点赞。
「我们是在完成安全测试之后发布它的」
放行流程的收尾由 Wang 点明。线程里的写道:「提醒一下:我们是在完成安全测试之后发布它的。」
关于性能,Wang 给的全部说明就是「显著更强的编码与智能体表现」这一句。这组官宣推文的文字里没有任何基准数字,也没有解释 max 与 high/xhigh 的实现差别:是同一组权重配更高推理预算,还是独立的新检查点。
max 档在公开前就已有第三方数据。Artificial Analysis(AA)在 9 月 2 日的里已经测过它:当时 Muse Spark 1.3(max)在 Intelligence Index(v4.1.1)得 62 分,高于当时公开可用的 xhigh 档(61 分)。但文章注明,该档仍处于「面向 Meta 合作伙伴的有限预览」状态,AA 随文发布的指数图也以斜纹把它标成「暂不可用(Not currently available)」。
(图:9 月 2 日随 AA 评测文章发布的 v4.1.1 指数图,Muse Spark 1.3(max)以斜纹标注「暂不可用」。)
AA 当时还给出了 62 分从哪来:与 xhigh 相比,max 的提升集中在 τ³-Banking(智能体工具调用评测,47% 提到 52%)与 GDPval-AA v2(真实工作任务评测,1,709 提到 1,754 Elo),代价是两项评测里分别多用 28% 与 62% 的推理 token(词元)。
按这份数据,更接近的解释是:max 用更多推理换更高分数,而非换了模型。62/61 分是 v4.1.1 旧口径下的数字。
更新后的 AA 指数里,max「仍然表现得相当好」
AA 的称,Intelligence Index v4.2 新增了自有评测 AA-Briefcase(带私有测试集的智能体知识工作评测)与 GDP.pdf(跨 4,592 页 PDF 的长文档推理),移除了已饱和的 GPQA Diamond(科研推理评测),私有保留测试集的权重从两成提高到四成。
按 AA 的文字总结,v4.2 下 Anthropic 的 Claude Fable 5.1 居首,OpenAI 的 GPT-6 Astra 第二(比 GPT-5.6 Sol 高 4 分),Meta 是榜单上排名第三的实验室;单任务成本帕累托前沿由 Anthropic、OpenAI、Meta 与 Z.AI 共享。
新增的 AA-Briefcase 里,Claude Fable 5.1 与 Opus 5 领先,其后是 GPT-6 Astra 与 Muse Spark 1.3。v4.2 配图(本文封面)中,Muse Spark 1.3(max)出现在指数榜上,max 与 xhigh 两个档位也都出现在指数-单任务成本图里。
北京时间 9 月 5 日 07:18(UTC 9 月 4 日 23:18),Wang 针对这次更新:「更新后的 Artificial Analysis 指数——Muse Spark 1.3 max 仍然表现得相当好!」并称「高效前沿全部由 Muse、Claude 和 GPT 构成」。这是他对 AA 图表的转述口径。AA 更新文章的文字部分没有列出 Muse Spark 1.3 max 在新口径下的分数,具体数值以其官网模型页为准。
评论区把档位差别问得很具体。有人:「max 是 1.3 的一个新检查点,还是只是更大的推理预算?我已经在 Muse Code 里用 xhigh 了,除了标签,到底什么变了?」也有人:「如果 max 全面强于 high 和 xhigh,为什么还要保留三个档位?」
在 Wang 随后发出的(「try out max!」)下面,有 Muse Code 订阅用户直接:「我猜 max 档会影响 Muse Code 的用量限额——Power 订阅在 Medium 与 Max 两档下,每 5 小时分别能用多少?」