AREX Feed Article
Qwen3.8-27B GGUF 上线不足 24 小时破 100 万下载,升至 Hugging Face 第 3 热门
8 月 15 日 14:01(UTC),Unsloth 官方账号宣布:其 Qwen3.8-27B GGUF 仓库在不到 24 小时内拿到 1,000 个赞,此刻整体下载量达到 100 万次,位列 Hugging Face 热门模型第 3 名。同一则推文称,17GB RAM/VRAM 的设备就能通过 Unsloth 运行这个 27B 模型,并附上 与 两个链接。
Qwen3.8-27B 是 Qwen 团队 8 月 14 日开放权重的 27B 参数原生多模态稠密模型,官方标注原生上下文 262,144 token、可扩展至 100 万,并注明训练中使用 MTP(multi-token prediction);。
100 万下载、第 3 热门,官方次日宣布升至第 1
1,000 赞、100 万下载、第 3 热门,这三组数字都是 Unsloth 对自己仓库的统计。随推文附上的截图显示,该仓库 License 标注为 apache-2.0;模型卡写明量化采用 Unsloth Dynamic V3.0(preview),档位从 2-bit 的 UD-IQ2_XXS(9.01GB)一直排到 16-bit BF16(54.7GB),其中 Q4_K_M 标注 17.1GB,正好对应"17GB 就能跑"的说法。模型卡还写明 "MTP for fast inference is available"、支持 Developer Role,并可在 Unsloth Desktop 中运行与微调。
"17GB"这个口径在官方账号那里也有回声:8 月 14 日 16:07(UTC),Qwen 官方账号发推 "27B on 17GB RAM",并在推文里。
8 月 16 日 06:34(UTC),Qwen 官方账号再发一推:"Qwen3.8-27B is now the #1 trending model on Hugging Face!",。从 Unsloth 口中的第 3 到官方口中的第 1,中间隔了不到一天。两个排名都来自当事方账号自己的发帖,没有附上独立复核。
llama.cpp 四档配置:一条命令开 MTP 草稿解码
8 月 14 日 17:11(UTC),Georgi Gerganov(@ggerganov)在 X 上:llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-mtp。在其上追加 --spec-default、--reasoning-preserve 与 --agent 三个参数。
32GB 显存档(推文举例 RTX 5090)同时加载两个模型:Q4_K_M 主模型配 Q4_0 草稿模型(-hfd 指定),--ctx-size 196608,KV cache 用 q8_0,并关掉自动适配(--fit off)。约两小时后,他又发出 ,保留同样的主模型与草稿配置,但不设上下文与 cache 参数。
--spec-type draft-mtp 开启 MTP 草稿投机解码,32GB 与 DGX Spark 两档都为它额外加载了 Q4_0 草稿模型。这组帖子给出了配置,没有给出 MTP 草稿带来的加速幅度数字;评论区有人直接追问 。社区已经有了实测:用户 Sebastian(@Danmoreng)在回复里贴出 16GB 显存 RTX 5080 笔记本的配置,使用 unsloth 仓库的 UD-IQ3_XXS 量化、65,536 token 上下文,同样启用 draft-mtp,。
官方跟进:飞上笔记本,Atomic Chat 回敬
8 月 16 日 07:32(UTC),Qwen 官方账号写道:"Qwen3.8-27B flies on a laptop, becoming part of our work and daily lives. Thanks for the shoutout! @atomic_chat_hq"。
被致谢的 @atomic_chat_hq 是一个名为 atomic.chat 的账号,写 "Local AI chat and Inference Engine. Enhanced by TurboQuant."。它在 24 分钟后的 07:56 回复:"It's a great honor for us to have the support of such a strong partner as @Alibaba_Qwen",。
官方推文只写了致谢,没有附上具体帖子链接。atomic.chat 对这款模型的推荐从发布当天开始:8 月 14 日 21:39(UTC),它,档位从 8-bit(28.9GB)到 1-bit(8.5GB),并称 AD-IQ3_S 档可在 16GB MacBook Air 上运行,与 BF16 原版选 token 的一致率为 92.4%。这些都是 atomic.chat 自己的口径。
两天下来,"27B 模型上笔记本"有了三组具体说法:Unsloth 的 17GB RAM/VRAM、atomic.chat 的 16GB MacBook Air、llama.cpp 社区实测的 16GB 显存 RTX 5080 笔记本(约 60 t/s),三者对应不同量化与引擎,口径并不统一。还悬着的环节是 MTP 草稿解码本身的加速幅度:Gerganov 公布的是命令,帖子里有人问 benchmark,帖子没有给出数字。