AREX Feed Article
Unsloth 发布 Qwen3.8-Flash GGUF:75GB 内存本地跑 125B,宣称超 Claude-Opus-4.6 (Max)
8 月 26 日,本地模型运行与训练工具商 Unsloth 在宣布,Qwen3.8-Flash 现在可以在本地运行:通过 Unsloth 的 GGUF 量化,这个 125B 参数的 MoE 模型只需 75GB 内存,Unsloth 并宣称其性能超过 Claude-Opus-4.6 (Max),Qwen3.8-Flash-Next 还能让 CPU RAM / unified memory 配置跑出接近 VRAM 的速度。
推文发布于 UTC 8 月 26 日 15:45(北京时间 23:45),配文附上和 。指南将 Qwen3.8-Flash-Next 描述为基于新 Qwen4 架构的开源 125B 多模态 MoE 模型,支持 262K 上下文,并注明"感谢 Qwen 提供 day zero 访问";其 1-bit 量化档把模型从 BF16 的 355GB 压到 75GB,体积缩小 79%。需要说明的是,"超 Opus"的对比和 75GB 门槛均为厂商自述口径:benchmark 出自 Qwen 官方模型卡,量化质量数据出自 Unsloth 自己的分析,已见到的第三方实测也只覆盖运行速度。
Qwen 前脚开源,Unsloth 当天放出量化
8 月 26 日 20:34(北京时间),阿里巴巴 Qwen 团队在宣布开放 Qwen3.8-Flash 权重:125B 参数加 51B N-gram 嵌入,每个 token 只激活 6B 参数,作为 Qwen4 架构的预览(Gated DeltaNet 与 Qwen Sparse Attention 混合注意力、Gated Residual、N-gram Embedding、Muon 优化器)。官方称训练成本约为 Qwen3.7-Plus 的 1/9,原生上下文 262K、可经 YaRN 扩展至 1M;生产版 Qwen3.8-Flash 将很快通过 QwenCloud API 上线,定价每百万输入 token 0.16 美元、输出 0.47 美元。
原始权重并不亲民。指出,BF16 checkpoint 为 335.28 GiB(FP8 为 172.78 GiB),"工作站跑不动",vLLM 下最低也要 GB300 双卡(TP2),8×H200 节点需用 TEP8 并行;模型采用 qwen-community-1.0 许可而非 Apache-2.0。原始体积与单机部署之间的落差,正是 Unsloth 的空间。
Unsloth 当天 23:10(北京时间)发布运行指南,23:45 发推宣布 GGUF 上线。推文用 Qwen3.8-Flash 指代,放出的 GGUF 文件名与指南标题均为 Qwen3.8-Flash-Next。
355GB 压到 75GB:1-bit 量化与 N-gram 表的取舍
推文所说的 75GB 对应 1-bit 档。指南给出的硬件需求表:1-bit 75GB、2-bit 79GB、3-bit 90GB、4-bit 112GB、5-bit 200GB、8-bit 270GB、BF16 355GB;量化分析表中最小两档是 UD-IQ1_S(72.5GB)和 UD-IQ1_M(74.5GB)。
关键在于 N-gram 嵌入表。这张 2000 万行的大表(bigram/trigram,挂在 Layer 2)按前两三个 token 的组合查表,随机访问模式决定了它不能重度量化:Unsloth 把 Ngram/PLE 层最低压到 4-bit,其余权重才用 1-bit。按 Unsloth 的 KLD 分析,1-bit 档保留约 80% 的 top-1 一致率(UD-IQ1_S 为 80.239%),最接近原版的 UD-Q4_K_XL(111.3GB)为 93.481%。指南还提示,可以把 PLE/Ngram 层 offload 到 SSD 并用 mmap 映射,进一步降低内存占用。
指南同时写明:"最小档可在 75GB 上运行,所以最好配备 96GB RAM/unified memory 的设备。"推文里的"75GB 即可运行",实际要求机器再留出约 21GB 余量。
「内存跑出接近显存速度」:机制与 64GB 实测
Unsloth 指南的核心卖点是:模型跑在 CPU 系统内存还是 GPU VRAM 上"差别相对不大",其架构让 RAM/unified memory 推理速度比一般模型更接近 VRAM,特别适合 Mac、NVIDIA DGX Spark 和大内存设备。支撑这一点的结构特征,包括每 token 只激活 6B 参数,以及那张 51B 参数的 N-gram 嵌入表。
独立开发者 lilting.ch 在 8 月 27 日发布的验证了这条路线:他在 M1 Max 64GB 上自编译 Unsloth 提交的 llama.cpp PR #27742,用 AtomicChat 的分片版 GGUF(3.84bpw-IQ4_XS,84.9GB,N-gram 表单独分片放在 SSD),测出预填充 181.7 tok/s、生成 17.6 tok/s,约为发行方 M5 Max 64GB 数据(517.9 / 36.0 tok/s)的 35% 和 49%。
N-gram 表是能跑起来的前提:它按 token 只需按哈希地址读取 16 行(量化后约 2.7KB),可以放在 SSD 上按需取用;而 MoE 专家权重每 token 要读好几 GB,必须常驻内存。
实测也划出了 75GB 口径的边界。llama.cpp 用 mmap 打开 GGUF,任何包含 GPU 张量的分片都会整片 wired 进显存;Unsloth 自家文件把 N-gram 表与权重混在同一组分片里,64GB 的 Metal 设备上整表被 wired,首轮 decode 直接 OOM,这正是 lilting.ch 改用第三方分片布局的原因。一位用户在 PR 评论中实测:M5 Max 128GB 跑 UD-Q4_K_XL,wired 内存 114.4GiB,把 N-gram 表权重重打包到最后一个分片后降到 90.8GiB。
PR #27742 以 draft 状态提交于 8 月 26 日,截至 8 月 27 日中午未合并,且已有第二并行槽崩溃、KV cache 量化断言等 bug 报告。
「超过 Claude-Opus-4.6 (Max)」:赢在哪、输在哪
"性能超过 Claude-Opus-4.6 (Max)"出自 Unsloth 的推文与指南,底层数据是 Qwen 官方模型卡的 benchmark,由 Unsloth 转载在 GGUF 模型页。对比表中 Qwen3.8-Flash-Next 在多数条目领先:SWE-bench Pro 62.5 对 53.4,LiveCodeBench v6 91.9 对 88.8,IFBench 81.3 对 62.5,JobBench 55.7 对 36.6,CoWorkBench 73.9 对 68.2;多模态侧 RealWorldQA 88.5 对 73.9,AndroidWorld 84.5 对 62.0,MathVision 90.6 对 65.5,CharXiv (RQ) 84.6 对 66.0。
但并非全面领先:HLE 上 Claude-Opus-4.6 (Max) 以 40.0 对 35.9 领先,GPQA Diamond 则是 91.7 对 91.3,几乎打平。MarkTechPost 的发布报道同样指出"前沿推理仍是差距":Claude 在 HLE 领先,DeepSeek-V4-Flash-0731 在 NL2Repo-Bench 以 54.2 对 48.1 领先。
评测方法论也留了注脚:除 Claude 采用官方公布分数外,其余模型均用 Claude Code harness 重新评测。"超 Opus"是对一组 benchmark 的概括,不是逐项结论。量化版究竟保留多少精度,目前只有 Unsloth 自己的 KLD 分析背书。
社区已经开跑:75GB 是入口,96GB 才是舒服线
截至发稿(8 月 27 日),Unsloth 的推文已有超过 85 万次浏览、2363 次点赞、290 次转发。社区反应以"真的能跑"为主,同时反复提醒内存门槛。
自称从事 AI、工程、研究与产品工作的 在 Unsloth Studio 里跑了 UD-Q4_K_XL(111.3GB),评价"非常不错,和其他模型感觉完全不同,分析更深入、更系统,能发现大多数其他模型遗漏的东西",同时提醒该档位需要 111GB 内存并使用 llama.cpp PR。 用 5060 Ti 16GB 加 128GB 内存的机器加载 UD-IQ4_XS(93.7GB),"加载完成,正常跑起来了",输出约 11 tok/s,称"精度现阶段 No.1",感叹"这到底怎么回事"。
自称 Qwen Ambassador、开源项目 OpenCrabs 创建者的 说:"仅 75GB RAM 就能在本地跑最好的 125B 本地模型之一,这太疯狂了。"上海开源开发者 的评论是"是时候部署属于你自己的本地 LLM 了";南非用户 则提醒"它需要大量系统内存,而这些内存不便宜"。
开发者把三款模型摆在一起对比:GLM-5.2 217GB、激活 40B,约 0.3 tok/s;DeepSeek V4-Flash 82.5GB、激活 13B,约 5.8 tok/s;Qwen3.8-Flash-Next 75GB、激活 6B,待测。他说:"体积变小了,激活参数也少了。"
截至发稿,"超 Opus"与"75GB 即可"仍是厂商口径:benchmark 来自 Qwen 官方模型卡,量化精度保留来自 Unsloth 自己的 KLD 分析,llama.cpp 的 PR #27742 也还是未合并的 draft。可以核验的是社区已经跑出来的数字:64GB M1 Max 上 17.6 tok/s 的生成速度,5060 Ti 上约 11 tok/s 的实测。模型确实住进了个人电脑,只是 75GB 的入场券,对应的是一台 96GB 的机器。