AREX Feed Article
Unsloth 把 GLM-5.3-Flash 压到 3-bit:128GB 内存可本地跑,称对标 Claude Opus 4.8
8月27日 14:43(UTC),以本地推理工具 Unsloth Desktop 知名的旧金山团队 Unsloth 在宣布,GLM-5.3-Flash 现在可以本地运行:3-bit 精度版本在 128GB 内存的机器上即可跑,同时放出和 。推文称,这款 320B 总参数、18B 激活参数的模型"在 DeepSWE、编码与 agentic(智能体)基准上对标 Claude Opus 4.8"(原文:rivals Claude Opus 4.8 on DeepSWE, coding & agentic benchmarks)。这些数字出自 Unsloth 指南与 Z.ai 博客各自公布的自测基准表,属于厂商口径。
账目本身很具体:3-bit 量化文件 UD-IQ3_XXS 约 120GB,比 BF16 原版(641.64GB)小 81%;指南给出的内存要求表显示,1-bit 需要 100GB,3-bit 需要 128–150GB,未量化的 BF16 需要 650GB。就在一天前,模型开发者 Z.ai 刚在官方博客揭晓,GLM-5.3-Flash 就是此前匿名测试的 ox-alpha。
一天前还是匿名模型 "ox-alpha",一天后装进 128GB 内存
(8月26日发布)介绍,GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,采用混合稀疏与线性注意力架构,基于 30T token 语料训练,上下文窗口 100 万 token,自述"以十分之一的价格全面超过 GLM-5.2",并在 Artificial Analysis Intelligence Index v4.1.1 上以每任务 0.045 美元(折扣价)拿到 57 分。博客同时揭晓:该模型此前以 ox-alpha 的匿名身份在 OpenCode 和 OpenRouter 上测试,"迅速成为当周最流行模型",这些流量全部跑在中国 AI 芯片上。配图显示,ox-alpha 上线 6 个完整日在 OpenRouter 处理了 23.2T tokens,是第二名 deepseek-v4-flash 的 2.3 倍。
第二天,Unsloth 就给出指南与量化文件,指南开头致谢 Z.ai 提供"day-zero access"(发布当日即可访问模型)。安全研究员 clearbluejar(ClearSec Labs 创始人)引用推文评价:"干得漂亮 @UnslothAI,模型发布 24 小时内就出了博客。"
3-bit 的账:120GB 文件、82% 精度、两条运行路径
Unsloth 指南的量化分析列出了各档位数据(均为 Unsloth 自测):1-bit UD-IQ1_S 文件 93.09GB,保留 71% 的 top-1% 精度;2-bit UD-Q2_K_XL 为 109GB,保留 78%;3-bit UD-IQ3_XXS 为 120GB,保留 82%;4-bit UD-Q4_K_XL 为 200GB,保留 93%。
运行有两条路径:Unsloth Desktop 应用(支持 macOS、Windows、Linux,自动把层卸载到内存并检测多 GPU 配置),或 llama.cpp,但必须使用 Unsloth 的特定分支(glm5next/upstream)。指南建议的 3-bit 启动命令是 unsloth run --model unsloth/GLM-5.3-Flash-GGUF:UD-IQ3_XXS。模型有三档思考模式 Low、High、Max,默认 Max,最大上下文 1,048,576 tokens。
想要更高精度还有下一档:Unsloth 团队成员 Daniel Han 在中称,4-bit 版本保留 93% 精度,"基本上就是本地版 Claude 4.7 Opus",256GB Mac 或两台 DGX Spark 可以流畅运行,"5-bit 甚至也可能跑"。
"对标 Opus 4.8" 的分寸:自测数字,且按完整权重计算
指南里的基准表(与 发布的基准图、即本文封面图,以及 Z.ai 博客的数字一致)显示,GLM-5.3-Flash 在 DeepSWE v1.1 上得 63.4 分,超过 Claude Opus 4.8 的 58.0 和 GLM-5.2 的 46.2;Terminal Bench 2.1 为 84.3 对 85.0;Toolathlon Verified 为 78.4 对 76.2;AutomationBench v1.0.6 为 48.8 对 41.0。措辞上,Z.ai 博客用的是"接近"(approaching)Claude Opus 4.8,Unsloth 推文则用了"对标"(rivals)。
但有一个前提:这些分数属于未量化模型,本地跑起来的 3-bit 版只保留 82% 的 top-1% 精度,1-bit 版只有 71%。回复区里,MimiCO 提醒"Opus 对比用的是完整权重,不是 3-bit 量化版,agentic 场景下量化损失会叠加";Ricci Research 说得更直白:"benchmark 对标 Opus 是在 BF16 下,你 Mac 上跑的是只留住 71% 记忆的 1-bit 表亲。它能跑起来本身已经神奇,只是别把演示当旗舰。"自称"替补 CISO"的 sherlock_comms 则引用推文质疑:"保留一个本就不完美模型 70% 的精度,对严肃应用几乎无用。"
128GB 算不算"本地":社区开测与质疑并存
推文发布约三个半小时后(截至本稿核验),累计约 11 万次浏览、680 次点赞、77 次转推。支持者不少:用户 rusa 称"3-bit 在 128GB 内存上具备竞争力,是今年最安静的故事,量化工作对本地模型的贡献超过任何一次单独发布";自称 AI Builder 的实践哥MinLi 宣布"将在 4090 48G×4 上测试,牛来 vs qwen";前 TED 与 AOL 从业者 alexrudloff 则希望看到 2-bit 和 3-bit 的规范评测。
质疑集中在"本地"二字的门槛。Gabriel Abi 算了一笔账:"128GB 内存对多数人来说不算本地,这套硬件要 2000 美元以上,最小可行机器比一辆还不错的二手汽车还贵";账号自称由 AI agent 运营的 ranbyagents 调侃:"对 16GB 笔记本用户来说,'本地'这个词承担了太多";Shortwav Labs(芝加哥软件工程师)反馈最新版 llama.cpp 跑不起来,指南要求改用特定分支;用户 rowanrdouglas 则追问 128GB 下的每秒 token 数。
GGUF 仓库挂着 "WIP",社区在等更严的评测
Hugging Face 上的 GGUF 仓库页面顶部仍标注"# WIP please stay tuned"(制作中,请保持关注),并链向指南、Z.ai 博客与技术报告;指南里 2-bit 的下载命令也写着"上传后可用"(once uploaded),提示部分档位当时尚未就绪。Unsloth 与 Z.ai 给出的是各自的自测基准,社区想要的,是 alexrudloff 所说的 "proper evals"。"128GB 能跑"已经兑现,"3-bit 是否真的对标 Opus 4.8",只能等独立评测来回答。