AREX Feed Article
Meta 祭出 Muse Glimmer:30B 开源 Agent 模型,Apache 2.0,18GB 就能跑
8 月 10 日, 宣布推出 Muse Glimmer:一个 30B 参数的开源模型,Apache 2.0 许可,专为本地常驻 Agent 工作流优化。Meta 称其在关键 Agent 用例和基准上表现强劲,且设计为可完整运行在 Mac 或配备高性能 GPU 的 PC 等消费级硬件上。
Muse Glimmer 不属于 Llama 系列。它来自 Meta Superintelligence Labs,由 Muse Spark 蒸馏而来,是一款 Dense 架构的视觉模型。 在后续推文中称其为"同类尺寸中最强的 Agent 模型",并确认该模型支持视觉输入,在 4-bit 量化后仅需约 18GB 内存即可运行。
「Meta 杀回来了」——三小时内的社区第一波反应
抢在官方公告前约十分钟放话:"兴奋地宣布今天开放 Muse Glimmer 的权重——一个能在单张消费级 GPU 上跑的 30B 模型。Muse Spark 1.2 的开源版本也即将到来。两个截然不同的模型,都在进入人们手中,后面还有更多。"
在 17 分钟后迅速跟进,提供 GGUF 量化版本和完整运行指南;透露与 Meta 和 Hugging Face 在 llama.cpp 推理实现上进行了合作,Meta 向 Unsloth 提供了 day-zero 支持。
Hugging Face 工程师 在回复中贴出链接。NVIDIA NeMo-Automodel 团队的 确认 NeMo 已支持对 Muse Glimmer 进行微调。Atomic Chat 和 LocalAI 随即宣布开始制作自有量化版本。
也有不同声音。chutes_ai 的 提醒:"这里的'消费级硬件'不是你普通的笔记本,大概需要一张约 4000 美元的 NVIDIA GPU 来获得满意的速度。"安全方面, 指出 CI Memories 违规率(26.4)高于 Gemma4-31B(12.1),"对于一个主打在家庭网络里跑无人监管 Agent 任务的模型来说,这不是小事。"
从 Muse Spark 蒸馏而来,踩准了本地 Agent 的爆发点
Meta Superintelligence Labs 此前已发布 Muse Spark 系列旗舰模型并开启 Meta Model API 公测。Muse Glimmer 正是从这一系列模型中蒸馏出来的产物:把前沿能力压进一个能在本地运行的尺寸。
30B 附近的 Dense 模型赛道正在变成 Agent 能力的主战场。Qwen3.6-27B 已证明这个尺寸能在多项 Agent 基准上与更大模型掰手腕,Gemma4-31B 也带着自己的思考模式入场。Meta 选择 Apache 2.0 而非定制许可证,意味着商用和二次开发不受用户数或收入规模限制。
显示:Muse Glimmer 的知识截止日期是 2026 年 1 月 4 日,训练数据涵盖超过 100 种语言。它支持 OpenClaw 和 Hermes Agent 等多种 Agent 编排框架,被设计来驱动真正的工具调用链。
量化 + DFlash 投机解码:30B 模型的"瘦身术"
Muse Glimmer 是约 29.6B 参数的 Dense Causal Transformer,搭载约 1.8B 参数的 ViT-G/14 视觉编码器。52 层,6656 隐藏维度,131K+ 上下文窗口,注意力模式采用 [Local, Local, Local, Global] 重复结构。
要让它在消费级硬件上跑出可用速度,Meta 同时做了两件事。
第一,量化。将语言模型压缩到约 4-bit 精度,体积缩至 20GB 以下。Meta 在 15 项基准上验证了压缩损失:K-Quant-Dynamic(32GB VRAM 目标)仅 0.2%,K-Quant-17GB(24GB VRAM 目标)也不过 1.0%。
第二,DFlash 投机解码。一个轻量 drafter 模型,一次前向传播预测整块 16 个 token,主模型并行验证。结果:RTX 5090 上从 74.9 tok/s 飙到 233.4 tok/s(3.1 倍),M4 Max 上从 23.7 到 37.8(1.5 倍),M5 Max 上从 26.6 到 50.2(1.8 倍)。
Meta 还在线程中放出了一段 Demo:Muse Glimmer 从一句自然语言指令出发,自主发现本地 Home Assistant 实例,查询设备 API,手写 HTML/CSS/JS 仪表盘,并部署本地服务器进行验证。全程无需人工干预。
基准方面,Muse Glimmer 在 8 项通用 Agent 测试中 5 项领先 Gemma4-31B 和 Qwen3.6-27B。MCP Atlas 75.5(vs 54.2 / 62.5),DeepSearch QA 74.6(vs 61.7 / 71.1),τ3-Banking 23.5(vs 15.1 / 16.7),WildClawBench 47.6(vs 37.6 / 43.2),Gaia2 43.3(vs 36.4 / 40.0)。SWE-Bench Pro 得分 51.2,远超 Gemma4 的 36.9,略高于 Qwen3.6 的 50.2。
Qwen3.6-27B 在 OSWorld-Verified(75.6 vs 65.9)、SWE-Bench Verified(77.2 vs 76.0)和 TerminalBench 2.1(60.7 vs 51.7)上保持领先。双方在 Agent 赛道各有胜负,没有通吃。
Apache 2.0 的 30B Dense 视觉模型:一张绕不过的牌
此前,30B 区间的开源 Agent 模型主要由 Qwen 和 Gemma 把持。Muse Glimmer 以 Apache 2.0 进场,没有商用限制,同时附带完整量化方案和投机解码工具链。从 到 均已支持即下即用。
社区评论员 的总结点出了关键:"30B Dense + Apache 2.0 + 视觉,这个组合极为罕见。大多数'开放'发布仍然在单独的不可商用许可证上设卡。如果 Glimmer 真的在这个尺寸档位上扛住了 Agent 评测分数,它就把本地 Agent 的基线往上拉了一个层级。" 则从商业角度评论:"一个没有模型 API 收入需要保护的公司,刚刚给闭源竞赛加了压。"
Muse Glimmer 支持四种可调推理强度(low/medium/high/xhigh),推荐采样参数为 temperature 1.0、top_p 0.95、top_k 64。Unsloth Desktop 已在 macOS、Windows 和 Linux 上提供一键下载和运行体验。
Alexandr Wang 那句"Muse Spark 1.2 开源版本即将到来"暗示 Meta 正在构建一条从旗舰研究模型到本地可部署模型的完整开放管线。
本地 Agent 从"能跑"到"能用"
Muse Glimmer 把一件之前只在理论上成立的事情做成了出厂配置:一个 30B 视觉模型,Apache 2.0 许可,量化到能塞进消费级硬件,靠投机解码跑出流畅对话速度,自带工具调用和故障恢复能力。
Alexandr Wang 说后面还有更多。这个"更多"——Muse Spark 1.2 的开源版本、可能在路上的更多尺寸——才是真正值得盯着的部分。本地 Agent 的临界点正在从"能不能跑"变成"能不能用"。Muse Glimmer 卡在了这个切换点上。