AREX Feed Article
Vals AI 评测称 Muse Spark 1.3 Max 与 Fable 5、GPT-5.6 Sol 持平,单任务成本低 4~8 倍
位于旧金山、自称「Public LLM Evaluation」的评测平台 Vals AI,于 9 月 6 日 18:15 UTC(北京时间 9 月 7 日凌晨 2:15)发布评测称:Meta 的 Muse Spark 1.3 Max 推理档在 Vals Index 上的表现与 Anthropic 的 Claude Fable 5、OpenAI 的 GPT-5.6 Sol 持平,单次任务成本低 4~8 倍(原文称 4x - 8x cheaper)。发布 43 秒后,Meta 官方 AI 账号 AI at Meta(@AIatMeta)转推了这条结论。
这份评测针对的正是刚上线的新档位:Muse Spark 1.3 于 9 月 2 日发布,当时 Meta 官方称 max 推理档要等;,max 档才在 Muse Code 与 Meta Model API 上线。Vals AI 出分时,这个档位公开上线还不满两天。
榜单第 5 名:64.53 分,每任务 3.40 美元
Vals 原帖配图是 Vals Index 的榜单截图。该榜单自称按 GDP 加权(GDP-weighted benchmark),截图顶部显示共收录 55 个系统。
截图里 Muse Spark 1.3 Max 排第 5:准确率 64.53%(±1.23),单次测试成本 3.40 美元;第 4 名 Claude Fable 5 是 66.04%(±1.03)、28.73 美元;第 6 名 GPT-5.6 Sol 是 63.71%(±1.06)、13.79 美元。按这组价格算,Fable 5 的单次测试成本约为 Muse 的 8.4 倍,GPT-5.6 Sol 约为 4 倍,与 Vals 声称的「便宜 4~8 倍」一致。
Vals 的「持平」对标的是第 4 名的 Fable 5,不是榜首:Claude Fable 5.1 以 68.83% 列第一,领先 Muse 4.3 分。64.53 分夹在 Fable 5 与 GPT-5.6 Sol 之间,与两者的差距分别是 1.5 分和 0.8 分。
同榜另有一行不带 Max 标注的 Muse Spark 1.3,排第 9:60.31%,单次测试 2.90 美元。两行的 token(词元)价格相同,都是输入 1.25 美元、输出 4.25 美元,差别在于每次测试多花约 0.5 美元、准确率高出 4.2 个百分点。
把这次成绩记录为 64.53% ±1.23、单次测试 3.404 美元,上下文窗口 1M,权重标注为不公开(Private)。
Code Migration 从 29.4% 到 42.2%
,Vals AI 宣布把 Muse Spark 1.3 收录进 Vals Index,排名从第 16 升至第 8,并称排在它上面的每个模型,单任务成本都是它的 2~10 倍。
在里,Vals 补充说,Muse Spark 的发布轨迹显示模型在向长程智能体(agentic)工作流倾斜:早期版本擅长简单、定义清晰的任务,在长程、多步任务上偏弱。
1.3 在 Code Migration 任务上从 29.4% 升至 42.2%;在 Vibe Code Bench 上排第 6,50 个全栈应用里 17 个无瑕疵完成,每个应用成本约 2.10 美元,而排在它前面的五个模型需要 33~42 美元。
9 月 5 日的帖子只写了「Muse Spark 1.3」,没有标注推理档;随即提醒 Vals:「试试 Muse Spark 1.3 Max——不是 xhigh」,那是 Meta 几小时前刚上线的档位。
,在模型名后明确标出了(Max)。
Meta 官方转推只有原文
9 月 6 日 18:16:33 UTC,。转推没有附加任何评语或新数据,内容就是 Vals 那句话本身:它能说明 Meta 官方在放大这条第三方结论,但对数字的准确性没有表态。
该账号在 X 上有约 84.6 万关注者。截至 9 月 7 日下午(北京时间),Vals 的这条评测帖已累计约 12 万次查看、550 余次点赞。
「持平」与「便宜」的两本账
对「持平」的追问集中在榜单顶端。 对照数字后写道:「64.55 对 68.85,和 Fable 5.1 并不真的持平;说实话更接近 GPT-5.6 Sol 的 63.71。」 则写道:「不过是追平了基准分数,仅此而已。」
自称前微软员工、正在做生产级 agentic AI 系统的 持相反判断:「用低 4~8 倍的成本追平前沿基准,真正的账就变了:大多数生产环境里的 agent 不需要最强的模型,需要的是能过线的那款里最便宜的。」
成本差可以拆成两笔账。第一笔是标价:Muse 的 token 输入/输出价格为 1.25/4.25 美元,Fable 5 为 10/50 美元,GPT-5.6 Sol 为 4/20 美元。
第二笔是用量:Muse 跑完一轮 Vals Index 测试耗时 20 分 30 秒,短于 Fable 5 的 37 分 51 秒和 GPT-5.6 Sol 的 32 分 24 秒。
但这两笔账都算在 Vals 自己的任务集上:Vals 在自称所有评测自营、多数基准自建,任务集中在金融、软件,以及网络安全、递归自我改进等「有经济价值」的领域。榜单上的分数与成本,只对这套任务集成立。
这份成绩单的证据边界到此为止:榜单与模型页公开可查,任务与基准由 Vals 自建,Meta 的转推没有为任何数字作保。「持平」和「便宜」目前是 Vals 账本上的一行记录,账本公开,可以被任何人复核,也可以由任何别的评测方重新算一遍。