AREX Feed Article
Meta AI 预览 WildArtifactBench:首批 10 个任务以胜率与 Elo 取代标准答案评分
8 月 20 日,Meta AI 官方账号 @AIatMeta(AI at Meta)——一个用于评估智能体(agent)在多种交付物格式上完成复杂真实任务的内部评测框架。Meta 称,该框架用人类评判者与智能体评判者做偏好比较,汇总出胜率(win rates)与 Elo 分数,取代严格的 ground-truth 评分,从而把任务覆盖范围扩大到实用的多模态工作流;同日发布的还有首批 10 个任务,页面在 开放,提供全部任务下载。
推文以四条连发:主帖之外,一条用对比卡解释设计原则,另两条分别展示 Muse Spark 1.1 与 1.2 在 Cat Mesh(低多边形坐姿猫网格)和 Plywood Whale(胶合板拼插鲸鱼摆件)两个任务上生成的交付物。
胜率与 Elo 取代 ground-truth 评分
WildArtifactBench 与常见基准的区别在评分方式。Meta 的说法是:不再拿模型输出与严格 ground-truth 核对,而是让评判者比较两个交付物哪个更好,评判者既有人类也有智能体(agentic preference judges)。这使没有唯一正确答案的任务也能被评估,比如"生成的 3D 网格像不像一只坐着的猫"。
作为内部框架的公开预览,这些对比来自 Meta 自己的评测口径。Meta 随附的(下图)把部分设计原则浓缩成三行。
评分方式:WildArtifactBench 使用对基线模型的胜率与 Elo 分数,行业基准则用 ground-truth 或基于 rubric 的 LLM-as-judge 验证。任务范围:前者涵盖几乎任何任务与格式,无论结果是否可验证、是否主观,后者局限于可验证或可客观评分的任务。分布:前者是分布在多模态智能体工作流与环境中的真实任务,后者是缺乏统一评价标准的特定垂直任务,常依赖人为构造、不真实的挑战。
主帖配图还给出两张分数-成本图(自动评估、人工评估),横轴为每个任务的平均成本(美元),纵轴为分数,标注了 Muse Spark 1.0/1.1/1.2、GPT 5.4/5.5/5.6 Sol、Opus 4.6/4.8/5、Gemini 3.1 Pro 等模型。
首批 10 个任务:从坐姿猫到胶合板鲸鱼
标注为"Preview · 10 tasks",并附"Download all tasks"压缩包。每个任务由 instruction.md(任务要求)、data/(输入文件)与 rubrics.json(评估标准)组成。
要求模型生成单个 cat.obj 文件,复刻参考图中那只低多边形坐姿猫:前爪并拢、后腿收拢、尾巴贴着身体、三角耳直立。网格必须低多边形、水密(watertight)、无孔洞与非流形边,且居中于原点;rubrics 逐条检查输出能否被标准 3D 查看器打开、是否明显是猫、姿态是否与参考图一致、头身比和耳朵大小与腿长是否正确。
要求设计一只胶合板拼插鲸鱼摆件,输出可直接激光切割的 SVG 图纸:3mm 胶合板厚度的槽口与榫头、含底座零件、零件标注或配色以区分组装顺序,共约 6-12 个零件,全程不用胶水。rubrics 里有一句明确的取舍:可组装性优先于视觉复杂度,一个简单但能真正拼起来的方案,胜过零件对不上的精美设计。
下载压缩包中可见的任务目录还包括 materials-metrology(材料计量)与 coronary-stenosis(冠状动脉狭窄)。Serhii Shchoholiev(@sshchoholiev,X 简介自称 Hypha 的 Agents 工程负责人)在中写道:"这是我们见过的最怪的基准测试,从鸟鸣到微芯片设计。"
Muse Spark 1.2 的猫比 1.1 更像猫
官方直接展示了"交付物质量"这个难以量化的维度。Cat Mesh 任务上,Muse Spark 1.2(左)生成的猫头部、面部、腿与尾巴更连贯,轮廓清楚;1.1(右)的猫更块状、五官模糊。
中,1.2 输出了一张完整图纸:零件按 A-D 编号(BODY、PECTORAL FINS、TAIL FLUKE、STAND),附"四步组装、免胶水、先干装测试"的说明,标题写着"HUMPBACK WHALE - 3D PLYWOOD PUZZLE - 3mm - SLOT-TOGETHER - NO GLUE";1.1 输出的是更简洁的激光切割线稿。
Muse Spark 是 Meta Superintelligence Labs 于 4 月 8 日推出的 ——原生多模态推理模型,支持工具调用、视觉思维链与多智能体编排。WildArtifactBench 的评测对象正是 Muse Spark,这也解释了为何相对比较(谁更好)比标准答案更适合这类开放式交付物。
主导者:这是 Muse Spark 的北极星评测
项目负责人当天出面说明了定位。Zengyi Qin(@qinzytech,简介自称 Meta Muse Spark 多模态智能体评测负责人、MIT 博士、曾联合创办一家估值 6 亿美元的公司)在中写道,WildArtifactBench 是 Muse Spark 多模态智能体能力的内部"北极星评测"(north star eval),为多模态智能体训练与 hill-climbing 提供"丰富的洞察与清晰的信号";他"从 0 到 1"主导了这个项目;"很快就会有一个开源的公开版本"。
Meta 在主帖里称,发布 10 个任务是"衡量多模态智能体实际实用价值方面的一次推进";Qin 的补充则说明这只是开头:一个开源的公开版本"很快"就会到来。
社区追问:评分裁判会不会一起开源?
发布后的讨论集中在两个问题上:开源范围与评分机制的可迁移性。X 用户 说"Meta 开源 agentic 评测,有当年 Llama 时代的感觉",并在回复里呼吁"把整套都开源吧,这个空白等着你们来填"。NotaDEV(@leononrails)的是:"又一个基准、又一个榜单,不过这次至少把成本展示出来了。"
对评分机制本身,指出了一个技术细节:Elo 依赖对手池——被比较的模型集合一变,排名就会跟着变,即使模型本身没有变化。
的提问最直接:"10 个任务公开、其余留在内部,那评分裁判(judge harness)本身会发布吗?"Qin 表示公开版本"很快"到来,但 Meta 官方的推文串没有说明裁判机制是否包含在内。评分裁判是否随任务一起开源,是这次预览留下的最具体的未决问题。