AREX Feed Article
Arena.ai AutoEval 评测:Muse Spark 1.3 以 1,623 分进入 Code Arena: WebDev 前十
Arena.ai 于 UTC 时间 9 月 3 日 18:48(北京时间 9 月 4 日 2:48)在 X 上公布了 Web 开发排行榜 Code Arena: WebDev 的最新第三方评测:Meta 的 Muse Spark 1.3(xhigh)以 1,623 分排到约第 10 位,与 Claude Fable 5(第 8,1,628 分)、GPT-5.6 Sol(第 11,1,616 分)水平相当,较 Muse Spark 1.1(第 25,1,540 分)和 Muse Spark 1.2(第 30,1,534 分)大幅提升()。Arena.ai 注明这是早期 AutoEval 分数(AutoEval 指用偏好奖励模型代替真人投票的自动评测),名次要等真人投票进场后收敛。
Muse Spark 1.3 一天前(UTC 时间 9 月 2 日晚)才在 Muse Code 与 Meta Model API 上线。Meta 官方称其 agentic(智能体式)与编码(coding)能力全面提升,内部对比比 1.2 少用约 20% 的 tool calls(工具调用)、约 25% 的 token(文本单位),发布帖还预告接下来会有更大的模型与 Muse Spark open weights(开放权重)版本()。扎克伯格(Meta 联合创始人兼 CEO,见 )在 Threads 上称这是公司在编程与智能体任务上「迄今最大的一次跃升」,并预告 Muse Spark open weights 版本即将推出()。
一次发布,从第 30 名跨到约第 10 名
Arena.ai 给出的对照很直接:1.3(xhigh)比第 8 名 Claude Fable 5 低 5 分,比第 11 名 GPT-5.6 Sol 高 7 分,较 1.2 高 89 分、较 1.1 高 83 分,官方账号称之为「大幅改进」。
在 上,muse-spark-1.3-xhigh 还没有正式名次编号,也没有真人票数:它是全榜 125 个模型中唯一带 AutoEval 标记的条目,按 1,623 分(置信区间 ±17)插在第 9 名 Tencent hy4-preview(1,626 分)与第 10 名 qwen3.8-flash-next(1,622 分)之间。前两代模型的分数来自真人投票:1.1 有 7,184 票,1.2 有 2,065 票;邻近的 GPT-5.6 Sol 与 Claude Fable 5 分别有 10,813 票与 9,159 票。
这一名次属于在售的 xhigh 档
要看清这份榜单,先分清档位。VentureBeat 当天(9 月 3 日 16:19 UTC)的报道指出,Meta 公布的最强成绩大多来自 max 推理档:Meta 称该配置仍在补充安全测试、很快会到来,Artificial Analysis 只在限量合作方预览中评估过它,目前没有列出任何 API 提供商;本周通过 Muse Code 与 Meta Model API 广泛开放的是原有推理档位,其中包括 xhigh()。
榜单上的 Muse Spark 1.3 正是 xhigh 档。以 Meta 自己披露的数字看,max 档与 xhigh 档之间仍有差距:GDPval-AA v2 为 1,754 对 1,709(Elo 计分),OSWorld 2.0(智能体操作电脑的评测)为 66.9 对 57.2()。
图片来源:VentureBeat 依据 Meta 公布的 Muse Spark 1.3 评测数据制图。
价格没有随版本变化:Meta 保留了与 1.2 完全相同的 API 定价,输入每百万 token 1.25 美元、输出 4.25 美元(),实时榜单价格栏也列出同一数字。同一时期的另一项第三方数据来自 Artificial Analysis:其智能指数(Intelligence Index)给 xhigh 档 61 分,与 GPT-5.6 Sol max、Grok 4.6 high、Claude Opus 5 high 持平,低于 Claude Fable 5.1 max 档的 66 分。两份独立评测给出的相对位置一致:xhigh 与 GPT-5.6 Sol 相当,而两个榜的顶端都是 Anthropic 的模型。
图片来源:Artificial Analysis(VentureBeat 报道转引,2026 年 9 月 3 日版)。
奖励模型代投的分数,要等真人票检验
Arena.ai 在帖子中说明了机制:一个基于 Arena 真人偏好数据训练的奖励模型代替真人投票,「随着更多真人票进场,我们会继续观察分数如何收敛」()。X 用户 Ricci Research(@ricci_nov)把矛头指向评测方法本身:「用过去的真人票训练出的奖励模型,正在给这些票投出时还不存在的模型打分,它只会奖励旧偏好分布喜欢的东西。当占位符没问题,但真正有意思的数字是:真人票进场后,分数会移动多远。」()用户 prince gupta(@prince_guptar)更看重跃升本身:「一次发布从第 30 名到第 10 名是实打实的飞跃。如果真人投票最终确认了它,Meta 这里肯定有值得盯的东西。」()另一位用户 kiri49(@kiri49x86)把话题引向开源:「希望 open weights 快点来。它不会是最好的开源模型,但依然会不错。」()
max 档与 open weights:两件事都还没有日期
max 推理档何时开放仍是未知:Meta 官方在发布帖里的口径只是「完成安全测试后即将推出」。开源权重那边也只有预告:Meta 首席 AI 官 Alexandr Wang(其 X 简介自述 chief AI officer @meta)在发布当天说,更大的 Muse 模型紧随其后,「还有 Muse Spark open weights release」()。
VentureBeat 观察到,Meta 官方文章里的路线图条目现在只写「the Muse Spark open weights release」,版本号、日期、模型规模与许可证一概没有;报道回溯到 8 月 10 日扎克伯格「未来几周」开放 Muse Spark 1.2 权重的承诺,并判断这还不算食言,但这次发布让路线图「变得更不清晰而不是更清晰」()。
接下来要盯住两处变化:榜单上那个 AutoEval 名次在真人投票进场后会移到哪里,以及 open weights 的预告何时给出版本号与日期。