AREX Feed Article
Meta AI 亮出 Muse Spark 1.2 新评测:机器人寻鸭,图片视频变网页
8 月 20 日,Meta AI 官方账号 AI at Meta(@AIatMeta)在 X 上发布推文线程,公开 Muse Spark 1.2 的新评测与演示。线程的第一条视频演示里,模型解析多模态观察并调用工具,引导一台机器人在非结构化环境中穿行,寻找一只橡皮鸭()。
Meta 在中称,Muse Spark 1.2 能承担从"把视觉内容变成可运行代码"到"把感知转化为物理动作"的广泛多模态任务,并具备面向视频密集工作流的音视频理解能力。文章还披露,Muse Spark 已在 Meta 内部媒体生成等场景部署,为 Muse Image 与 Muse Video 生成详细字幕作为训练数据。
机器人穿过办公室找一只橡皮鸭
寻鸭演示是整条线程的开场。Meta 的描述是:Muse Spark 解析多模态观察、调用工具,引导机器人在非结构化环境中导航,最终找到橡皮鸭。演示视频的画面分两半:左侧是导航控制界面,包含相机画面、路径地图以及模型的推理与工具调用面板;右侧是实验室走廊,一台白色轮式机器人停在书架旁。视频画面标注"SEQUENCES HAVE BEEN SHORTENED THROUGHOUT",提示片段经过剪辑()。
Meta 的研究文章把"找鸭子"列为机器人演示之一,与"整理化妆品""打包午餐""找食物"并列。文章解释,机器人一侧采用两级系统:高层规划模型负责场景理解、区分相似物体并把目标拆成子任务,低层则由基于 Muse 家族更小模型实验版本训练的 Vision-Language-Action(VLA)策略执行动作()。
三张评测图:视觉推理、图表理解、知识密集型任务
线程第二条推文放出一张三联评测图,展示 Muse Spark 1.2 在 SimpleVQA、ZeroBench 与 CharXiv Reasoning 三个基准上与 Muse Spark 1.1、Gemini 3.7 Flash、Opus 5、GPT 5.6 Sol 的对比()。
按图上数值,SimpleVQA 中 Muse Spark 1.2 得 75.0%,落后 Gemini 3.7 Flash 的 77.8%;ZeroBench 上为 54.0%,与 GPT 5.6 Sol 的 54.6% 接近;CharXiv Reasoning 上为 87.6%,低于 Opus 5 的 89.3% 和 Gemini 3.7 Flash 的 88.7%。与 Muse Spark 1.1 相比,1.2 在 SimpleVQA(75.0% 对 73.3%)和 ZeroBench(54.0% 对 46.0%)上更高,CharXiv Reasoning 上略低(87.6% 对 88.4%)。
这些数字来自 Meta 自己的评测。Meta 称,Muse Spark 1.2 的多模态增益在能调用工具时最明显,模型会更仔细地检查视觉输入,并把发现纳入推理()。研究文章注明,更多评测细节见完整报告。
同一天,Meta 还预告了 WildArtifactBench:一个用于评估智能体在真实复杂任务上交付能力的内部评测框架,用人类与智能体偏好裁判的胜率和 Elo 分数替代固定标准答案,并放出其中 10 个任务(,)。
截图与视频,变成能运行的网页和游戏
数字制品生成是这条线程强调的第二类能力。Meta 称,Muse Spark 1.2 能把图像或视频中的视觉布局、层级与风格翻译成可运行代码,生成网页与游戏;正确性以实际渲染和行为是否符合预期来判断,模型通过重新检查自己生成的制品进入持续自我改进循环()。
研究文章给出一个具体例子:名为"Human's Journey"的交互式翻页书,单页实现,版式、字体、翻页动画与跟随光标的放大镜都由模型生成。文章还回顾,早前发布时的演示中,Muse Spark 1.2 曾把一段通过终端上传的视频转成可用的民宿预订页面;并称模型在把图像或视频转换为网页方面表现突出,Design Arena 上的收录与排名截至 2026 年 8 月 18 日()。
双机械臂整理桌面:模型当「大脑」
机器人演示的另一半是桌面整理。Meta 展示了一个 Muse Spark 专用变体作为机器人"大脑"与编排器:接收用户指令、解码工具调用、观察结果,循环直到任务完成。演示视频里,双机械臂在桌面上区分发刷与化妆刷,并把口红放进抽屉;画面底部标注"Sub-task planner by Muse Spark",目标一栏写着"arrange objects in the organizer"()。
研究文章补充了实现方式:面对一个抽象目标,高层规划模型先做场景理解、消除相似物体的歧义,再把目标分解为子任务,每个子任务由低层 VLA 策略执行。文章以"把化妆品整理进收纳盒"为例说明拆解过程,并注明该例中的低层动作由一个更小的 Muse 家族模型的实验版本完成()。
内部部署:与 Muse Image 协作媒体生成
Meta 在推文中披露,Muse Spark 已在公司内部多个场景部署,包括媒体生成:它与 Muse Image 协作进行智能体媒体生成,并产出详细字幕作为 Muse Image 与 Muse Video 的训练数据;还能把原始文本、图像与视频内容转化为可供下游应用使用的信号与洞察()。
Muse Spark 1.2 目前通过 Meta Model API 与 Muse Code 对外提供()。Meta 在文章中注明,这批评测与演示发布在开源权重版本放出之前。
上线两周,从编码终端走到桌面机器人
Muse Spark 1.2 于 8 月 5 日随 Muse Code(beta)一起上线,定位是长时程软件工程的终端编码智能体,同日在 Muse Code 与 Meta Model API 开放(,)。
更早的 7 月 9 日,Muse Spark 1.1 发布并开启 Meta Model API 公测();7 月 7 日发布的 Muse Image 在介绍中即提到与 Muse Spark 集成()。8 月 10 日,Meta 还发布了 30B 参数的开源模型 Muse Glimmer,采用 Apache 2.0 许可()。
回复区里,追踪 AI 动态的用户 Apollo 把寻鸭演示与 Google 的 Gemini Robotics ER 2 并列:"Meta 对 Google Gemini Robotics ER 2 的回答?它也以图像和视频为输入。"()机器学习工程师 Alex Zverianskii(个人简介自称有 15 年以上 NLP 经验、三度创业、曾任 Gett 首席机器学习工程师)则把机器人演示的关键落在循环机制上:"Loop until the task is complete is the contract. Progress as state, not first token."——循环直到任务完成才是契约,进度是状态,而不是第一个 token()。