AREX Feed Article
Artificial Analysis 实测 Muse Glimmer:智能指数 35 分,幻觉率 82%
8 月 10 日 20:42(UTC),独立评测机构 :Intelligence Index 得 35 分,比 Meta 上一代开源权重模型 Llama 4 Maverick 的 14 分高 21 分。这是 Meta 自 Llama 4 以来 16 个月里的第一个开源权重发布,也是 Meta 第一个 Apache 2.0 许可模型。同一份还测出,模型的幻觉率是 82%。8 月 12 日, Muse Glimmer 在其托管平台上线。
Muse Glimmer 是 Meta Superintelligence Labs 8 月 10 日发布的 30B 稠密 agent 模型,,面向本地常驻 agent 工作流,可在配备单块消费级 GPU 的 Mac 或 PC 上运行,当天在 Hugging Face 开放下载;Meta 同日,Muse Spark 1.2 的权重也将随后开放。Artificial Analysis 在评测文章中说明,Meta 在公开发布前提前向它开放了模型用于评测。
35 分与 Kimi K2.5 并排,落后 Qwen3.6 3 分
35 分在 Artificial Analysis 的排行榜上紧贴 Kimi K2.5(Reasoning,36 分),落后 Qwen3.6 27B(Reasoning,38 分)和 Ling 3.0 Flash(38 分)各 3 分,与 Meta 自己的专有旗舰 Muse Spark 1.2(xhigh,57 分)构成两档阵容。
授权条款的变化是评测单独列出的第一条。此前 Meta 所有开源发布都使用 Llama License;Muse Glimmer 用 Apache 2.0,几乎不限制商用和衍生使用。它在 AA 的 Openness Index 上得 44 分,与 DeepSeek V4 Flash(0731)、GLM-5.2、Ling 3.0 Flash 持平,高于多数开放模型,也比 Llama 4 Maverick 的开放度得分高——原因是许可更宽松、方法论披露更充分。
参数效率是第二条:30B 的 Muse Glimmer 比同尺寸的 Gemma 4 31B(Reasoning,30 分)高 5 分,以少 33 倍的参数量追平了总参数 1T 的 Kimi K2.5(36 分)。参数效率前沿仍然属于 Qwen3.6 27B(38 分)。
单卡 H100 能跑满 128K,82% 幻觉率是短板
Muse Glimmer 是 30B 稠密模型,内含约 1.8B 参数的视觉编码器(MMMU-Pro 视觉推理 74%);权重 BF16 约 60GB,4-bit 约 18GB。它的混合注意力机制为每个全局层配三个滑动窗口层,把 128K 上下文的 KV cache 最低压到约 1.8GB。因此 BF16 精度下,单块 H100 就能跑满 128K 上下文;4-bit 下,高配 MacBook 或 RTX 5090 即可运行。
短板集中在 agentic 知识工作。GDPval-AA v2 上它得 953 Elo,低于 1000 的人类基线;智力水平相近的 Qwen3.6 27B 和 Gemini 3.5 Flash-Lite 都是 1141,Kimi K2.5 是 1004。Terminal-Bench v2.1 得 52%,低于 Qwen3.6 27B 的 61%。知识校准的差距更大:AA-Omniscience 指数 -33,幻觉率 82%,而 Qwen3.6 27B 是 49%,Gemini 3.5 Flash-Lite 是 34%。评测特意说明,它的准确率与同级持平,把分拖下去的是幻觉,不是答不出。
例外是工具调用:Tau3-Banking 得 24%,高于 Gemini 3.5 Flash-Lite 的 18% 和 Qwen3.6 27B 的 17%,属于同级最好的一档。
OpenRouter 上线 Glimmer,Ollama、vLLM 当日跟进
Muse Glimmer 上线,称其为“Meta Superintelligence Labs 的首个开放权重模型”,公告里给出的分数是 MCP Atlas 75.5、SWE-Bench Pro 51.2。显示输入 $0.30/1M、输出 $1.20/1M,131K 上下文,由 DeepInfra、Together、Fireworks 三家托管;DeepInfra 的 P50 吞吐 104 tok/s、延迟 0.56 秒。
模型页的流量统计覆盖 8 月 10 日至 12 日,累计提示词 token 6.86B,流量最大的应用是编程 agent(426M tokens),其次是 Nous Research 的 Hermes Agent(164M tokens)。
Muse Glimmer:Apple Silicon 走 MLX 引擎,支持 DFlash 加速(1.5–1.8 倍)和图像输入,ollama run muse-glimmer 即可运行,能直接驱动 Claude Code、Codex、Pi 等编程 agent 和 OpenClaw、Hermes 等常驻个人助手。,一条 vllm serve meta-models/Muse-Glimmer-30B 就能跑。
同日,用 2-bit GGUF 在 14GB RAM 上调用 100+ 工具,并让模型连续 5 分钟完成一次仓库 bug 排查。Meta 博客列出后续:llama.cpp、MLX、ExecuTorch 的优化集成计划在数日内落地,并正在与 AMD、Arm、Dell、Intel、NVIDIA 合作做设备优化。
两个悬置项:Spark 1.2 的许可与 Meta 自家 API
其一,Muse Spark 1.2 的权重。Mark Zuckerberg 8 月 10 日在 X 上宣布“很快”发布 Muse Spark 1.2 的权重;Meta 首席 AI 官 Alexandr Wang 的同样是“soon”。截至评测发布,Muse Spark 1.2 在 AA 排行上仍是专有模型;两则预告都没有说明开放版将采用什么许可。
其二,Meta 自己的 API。评测写明:发布时 Meta 没有在自己的 API 上服务 Muse Glimmer,定价和吞吐“取决于第三方提供商”。记录的实际输入价约 $0.325/1M。权重在 Hugging Face 公开、35 分由第三方实测,但按 token 付费调用,目前得经由第三方托管方,例如 OpenRouter 及其接入的 DeepInfra、Together、Fireworks。