AREX Feed Article
Unsloth 将 GLM-5.3 压至 239GB:自称保留 81% 精度,256GB Mac 可本地运行
8 月 28 日 17:57(UTC,北京时间 29 日凌晨 1:57),Unsloth 官方 X 账号宣布推出 GLM-5.3 的 2-bit 量化版:模型从 1.51TB 压缩到 239GB,体积缩小 83%,自称保留约 81% 精度,可在 256GB Mac 或内存加显存组合的机器上本地运行。同时附上了和 ,并把 GLM-5.3 称为"迄今最强开源模型"。这些体积与精度数字均出自 Unsloth 自己的口径,推文未附第三方基准来源。
239GB 对应指南中主推的 UD-IQ2_M 量化档,2-bit 档的总内存门槛为 245GB(统一内存,或显存加系统内存);指南还称,在 MoE 卸载模式下,一张 24GB 显存的显卡配 256GB 内存也能运行。被压缩的对象是 Z.ai 于 8 月 14 日发布的,原始权重约 1.51TB。
"本地"到底指什么硬件?
推文发出 21 分钟后,Unsloth 的 Daniel Han(X 简介:Building @UnslothAI)补充了 1-bit 版的情况:dynamic 1-bit 把 GLM-5.3 从 1.5TB 压到 217GB,保留约 76% 的 top-1 精度;他用这个版本在 Unsloth Desktop 里做了个贪吃蛇小游戏,"跑得很好"。Han 最后写道:"zai 势头正盛,先是 GLM-5.3-Flash,现在又是 GLM-5.3。"
社区的反应集中在"本地"二字上。开发者 写道:"1.51TB 降到 239GB 还保住了 81%,这就是实验室演示和我真能在自己桌上跑起来的东西之间的那道线。"开发者 则提醒:"在把模型称为'本地'之前,先问一个问题:这里的'本地'到底指什么硬件?官方口径瞄准的是 256GB 级内存,这一个细节就改变了部署决策。"
也有人对 2-bit 表示怀疑。AI 资讯博主 说:"以我以往的经验,这么激进的量化会让 tool call 频繁失败,损失这么多精度,一个'}'或本该出现在某处的符号就丢了,尤其是在严格的 tool call 里。"还有人对内存门槛自嘲,另一位用户 引用推文写道:"'在 256GB Mac 上运行……'我低头看了看自己 8GB 的'穷人版'MacBook。"截至本稿核验时,这条推文获得 657 次点赞、78 次转发和约 5.4 万次观看。
发布 14 天后,GGUF 就到了
8 月 14 日,Z.ai 发布 GLM-5.3。官方博客称它与 GLM-5.2 共用同一基础模型,全部提升来自后训练;在自研的 Z.ai Code Bench 上比 GLM-5.2 提升 50%,在 Terminal Bench 3.0、Agents' Last Exam 上达到开源权重模型的 SOTA。同一篇博客预告:权重将在发布两周后、完成安全评估与加固后开放。
这中间还插了一个发布。8 月 26 日,Z.ai 推出 GLM-5.3 系列的多模态模型 GLM-5.3-Flash,称它发布前曾以 ox-alpha 的代号在 OpenCode 和 OpenRouter 上匿名测试。Unsloth 在 8 月 27 日,称 3-bit 版 128GB 内存即可运行;第二天,GLM-5.3 的 2-bit 版接踵而至。Unsloth 在指南中感谢 Z.ai 提供 day-0 访问权限。
发布节奏因此变成:Z.ai 每放出新模型,Unsloth 几乎同步给出可本地运行的量化版。8 月 26 日,就公开感谢过 Unsloth 的 day-0 支持:"一个高性能 125B 模型现在只需 75GB 内存就能本地跑。"
245GB 内存门槛与 24GB 显存的 MoE 卸载
量化把权重按更低精度存储。GLM-5.3 的原始 BF16 权重约 1.5TB,2-bit 档 UD-IQ2_M 只有 239GB,拆成 6 个分卷文件。Unsloth 的动态量化(Dynamic GGUF)按层选择性降低位宽,其 8 月 12 日发布的 就是用 Dynamic 1-bit 把 4.9TB 压到 397GB。模型卡上同一家族还有 1-bit 的 UD-IQ1_S(217GB)、UD-IQ1_M(228GB),2-bit 的 UD-Q2_K_XL(254GB)和 3-bit 的 UD-Q3_K_XL(343GB)。
"本地能跑"的门槛由总内存决定。指南的硬件表:1-bit 223GB、2-bit 245GB、3-bit 290 至 360GB、4-bit 372 至 475GB、6-bit 570GB、8-bit 810GB。GLM-5.3 是 MoE 模型,40B 活跃参数,把非活跃专家卸载到系统内存后,一张 24GB 显卡加 256GB 内存就能跑 254GB 的 UD-Q2_K_XL。运行方式有两种:llama.cpp 命令行,或 Unsloth Desktop(macOS、Windows、Linux 通用)。
本地版保留了模型的主要特性:1M 上下文窗口,Low/High/Max 三档思考强度(默认 Max,思考无法关闭),clear_thinking 参数,指南推荐的默认采样参数是温度 1.0、top_p 0.95。至于"保留约 81% 精度",指南的表述是"Dynamic 2-bit 在体积缩小 83% 的情况下达到约 81% 准确率",这是 Unsloth 的自我评估,推文和指南都没有引用第三方复测结果。
从 4.9TB 到 239GB:内存竞赛打到旗舰模型
过去两周,Unsloth 连续刷新"本地可跑"的模型档位。8 月 12 日,Qwen3.8-2.4T-A95B 从 4.9TB 压到 397GB(-91%),要求 410GB 以上内存;8 月 26 日, 只需 75GB;8 月 27 日,GLM-5.3-Flash 的 3-bit 版 128GB 可跑。GLM-5.3 的 239GB 则落在 256GB 统一内存的 Mac 这一档。
这次的不同在于被压缩的对象:刚发布两周的旗舰开源模型,Unsloth 称之为"迄今最强开源模型",Z.ai 的口径是"编码能力最强的开源权重模型"。前沿性能与本地运行之间的带宽正在被量化技术本身填平,Unsloth 正把自己变成这条通道的默认入口:阿里 Qwen 公开致谢 day-0 支持,Z.ai 连续两天发布的新模型(8 月 27 日 Flash、28 日 GLM-5.3)都由它首发 GGUF。
争议也集中在两点:Acermax 认为 2-bit 下 tool call 会频繁失败;81% 的精度数字则仍是 Unsloth 的单方口径。
81% 目前只是 Unsloth 的一家之言
GGUF 已经开放下载,教程给出了完整命令,Unsloth Desktop 里也能直接搜索下载。对拥有 256GB 统一内存 Mac、或 24GB 显卡加 256GB 内存的用户,这意味着一个两周前才发布、权重当时被预告"两周后开放"的旗舰模型,现在可以跑在自己机器上。但"保留约 81% 精度"目前只是 Unsloth 给出的一家之言,2-bit 下的实际表现要等社区在自己的任务上跑过才有答案。