AREX Feed Article
Qwen3.8-27B 可本地运行了:Unsloth 动态 GGUF 只需 17GB RAM
北京时间 8 月 14 日 23:08,宣布 Qwen3.8-27B "现在可以在本地运行"(can now be run locally):通过 Unsloth Dynamic GGUFs 只需 17GB RAM,NVFP4 量化版本同步上传,推文附上 GGUF 下载链接与。Unsloth 同时给出自己的判断:Qwen3.8-27B"远超同尺寸任何模型"(by far the strongest model for its size)。
这距离 的倒计时推文正好两小时。21:08,官方发"不到 2 小时见"(Less than 2 hours to say hi),并附上 的链接;前一天,预告"大约还有一天"。此前报道停在预告与等待上,本地运行这一环现在由 Unsloth 接上。
预告后两小时,量化包跟着落地
官方倒计时图显示"00 天 01 小时 53 分"、6,389 人等待发布。指南页写明"感谢 Qwen 提供 day zero 访问"(Thank you Qwen for day zero access),说明这批量化是与开放权重同步准备的,而不是事后补做。推文给出的 GGUF 仓库是 ,NVFP4 版本放在单独的 仓库。
17GB 是 4-bit 档:从 2-bit 到 BF16 的内存阶梯
指南的硬件表把各量化档位所需内存列得很具体:2-bit 11–13GB,3-bit 13–16GB,4-bit 17–19GB,6-bit 24GB,8-bit 31GB,BF16 56GB;单位是 RAM+VRAM 总内存或统一内存。推文里的 17GB 落在 4-bit 档。指南称 4-bit 量化可在 17–19GB 显存的多数设备上跑,例如 RTX 5080、RTX 4090,或 24GB 内存的 Mac。
上手路径是现成的:用 hf download unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*" 下载 4-bit 文件(3-bit 换成 *UD-Q3_K_XL*),再用 llama-cli 以指南给出的参数运行。指南说明这批 GGUF 使用 Unsloth Dynamic V3.0(preview)量化方案。
模型本身按指南口径带视觉与混合思考(hybrid thinking)能力、256K 上下文(经 YaRN 可扩到 1M),并支持 xhigh、medium、low、none 四档 reasoning_effort。
不想碰命令行的人可以走 Unsloth Desktop:开源 UI 应用,支持 macOS、Windows、Linux,自动把模型层卸载到 RAM。同一份指南还列出更大的同族模型 Qwen3.8-2.4T-A95B(BF16 需要 4.9TB 存储,1-bit 动态量化后 397GB,缩小 91%)与 Qwen3.8-Max,本地化的焦点这次先落在 27B 上。
上线一小时:第一批实测与两处报错
发布约一小时后,Unsloth 推文已有 1020 多个赞、123 次转发、49 次引用和 4.2 万次查看。评论区里,X 简介自称应用 AI 研究员的 说:17GB 意味着能装进 24GB 显卡并留出上下文空间,或塞进 32GB 笔记本——"这就是'让人读到的模型'和'让人跑起来的模型'的区别"。
X 简介标注 CTO @ Archdesk 的 贴出自己在 RTX PRO 4000 Blackwell 24GB 上配最新 llama.cpp 的首轮测试:Q4_0 量化开 MTP-3 后生成速度从 22.40 提到 44.95 tok/s,接受率约 80%;同一设置下 IQ4_XS 慢 23.5%、Q3_K_M 慢 30.3%、Q4_K_M 慢 41.8%。
他称 Q4_0+MTP-3 能在单张 24GB 卡上装下完整 262K 上下文,占用约 22.5GB 显存。
X 简介标注 AI 工程师的 则为小显存卡做了补充量化:Q2_K 9.98GB 适配 12GB 卡、Q4_K_M 适配 24GB 卡。推理网关项目 表示会在其推理集群免费提供该模型。
第一天也有摩擦。报告称 GGUF 元数据声称 65 个 blocks,配置里却是 64,多出的 blk.64.nextn.* 张量无法被他的 llama.cpp 后端识别。则报告把 NVFP4 safetensors 转成 GGUF 时,llama.cpp 报 compressed-tensors 尚不支持的错。两处都是用户自报的 day-zero 问题。
"同尺寸最强"还是 Unsloth 自家说法
"远超同尺寸任何模型"出自 Unsloth 的推文,支撑它的对比数字在随推文发布的配图里,对比对象包括 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B、Opus4.6 Max 等。这些数字目前只存在于 Unsloth 自己的发布材料中,本文核对到的范围内没有独立评测可交叉验证。
社区里也有人点到这一层。X 简介标注前剑桥、马里兰、MIT CSAIL 研究员的 评论:"27B 挤进 17GB 还能在图上跟大得多的模型一较高下——量化现在干的活比原始规模更重。"
把口径换成可验证的事实:17GB 门槛是公开仓库里看得见的下载项,而 4-bit 乃至 2/3-bit 档位的智能折损、以及"最强"的成色,要等独立基准和更多用户的实测才有答案。