AREX Feed Article
Unsloth 发布 Qwen3.8-27B Dynamic v3.0 量化,宣称同体积 top-1% 精度高 10%+
Unsloth 8 月 19 日发布 Qwen3.8-27B 的 Dynamic v3.0 量化 GGUF。称这是"我们首次分享的 Dynamic v3.0 早期预览版"的更新,宣称"同体积下 top-1% 精度比所有其他提供商高 10% 以上",新文件兼容 llama.cpp、Unsloth Desktop 等大多数推理引擎。同一篇公告还引入新评测 Divergence-300@32:用 300 条未参与校准的留存样本,对比 BF16 与各家量化模型在 32 个 token 上的生成轨迹。
公告中的精度数字目前都出自 Unsloth 自己的评测;同样的公告还称,5 天内 Unsloth 版 Qwen3.8 下载量超过 510 万次。
(图:Unsloth 文档页的 Qwen3.8-27B GGUF top-1% 精度对比,横轴为去除 MTP 后的量化体积)
发布当天 HN 得 183 分,置顶帖澄清"不是修复"
时间锚点来自 Hacker News:指向该文档页的创建于 8 月 19 日 18:36Z,截至本文写作时得 183 分、66 条评论。Unsloth 的 也标注了"8 月 19 日更新:Qwen3.8-27B GGUF 改用 Dynamic V3.0,同尺寸精度高 10%"。
同一天,danielhanchen(HN 账号,简介指向 Unsloth 项目)在 Hugging Face 仓库的里宣布"发布同尺寸精度高 10% 的新 Qwen3.8-27B GGUF,采用新版本的 Dynamic v3.0",并澄清:"你们中有些人几小时前就看到我们更新了量化文件。没有坏什么,也不需要修复,这次更新纯粹是为了让它们变得更好。"他还称网上"出问题需要修复"的说法是编造的故事。同一帖预告 Unsloth Desktop 当天发布新版本,加入自动压缩、外部 API 工具调用等功能。
分发量的背景同样可查:8 月 14 日已上线,当天就出现在 。Qwen3.8 是 Qwen 的新模型家族(27B、2.4T-A95B、Max),27B 版带视觉与推理能力、256K 上下文,文档称可在 17GB 内存环境本地运行,Unsloth 获得了 day zero access。
6.2GB 的 1-bit 量化保住 72% 精度,MTP 从小体积文件里移除
v3.0 的机制包括新的 imatrix 校准数据集(来源多样,面向 agentic coding、chat 与多语言)、改进的逐层量化选择,以及更多量化技术。文档给出的具体数字:
- UD-IQ1_S 6.2GB(不含 MTP),保留约 72% top-1% 精度,体积小 89%;
- UD-Q2_K_XL 9.83GB,top-1% 精度比次优者高约 8%,文档称它"成功做出过一个能运行的 HTML 程序,只有 1 个小 JS bug,而之前会直接崩";
- 8.37GB 及更小的量化移除 MTP 模块,省约 500MB 磁盘空间,需要时可用单独的 Q4_0 MTP 模块。
danielhanchen 在 HN 上补充了取舍逻辑:8GiB 以下的文件(IQ2_XXS 及更低)才移除 MTP,因为 MTP 有 500-750MiB,"在 8GiB 小机器上,500MiB 也很关键";16GB 机器建议用 UD-IQ3_XXS(10.9GB)或 UD-Q2_K_XL。有用户最初下载 IQ2_XXS 时遇到 MTP 报错,读完公告才明白原因。还有用户注意到 NVFP4 量化里已带 Dynamic 3.0 预览版,在 HN 上问这次发布是否接近最终版本。
Divergence-300@32:用 32 个 token 的轨迹衡量量化损失
Unsloth 解释新评测的动机:top-1% 只是对单次预测做 argmax,衡量不了真实推理。Divergence-300@32 从 Terminal-Bench 2.1、DeepSWE、Harbor、MathArena 2025-26 以及非拉丁语/长文档 prompt 中取出 300 条不在校准集里的留存样本,对 BF16 与所有量化版本、各提供商做 32 token 的贪心解码,看量化输出是否跟得上 BF16 的轨迹、有没有过拟合。文档称它比 top-1% 更能反映多 token 轨迹,相当于把 KLD 的 top-1% 扩展到 32 个 token,并在公告中把 Divergence-300@32 与 KL Divergence 并列为 v3.0 表现更强的指标。
danielhanchen 在 HN 上说:"我们做了 Divergence-300 @32(后面还有 @512),在留存测试集(Terminal Bench、DeepSWE、Math 等)上测 32 token 的真实推理,计划做更大的评测套件。"文档同时援引论文说明为何用 KL 散度而非困惑度报告量化误差。
(图:Unsloth 文档页的 Divergence-300@32 评测结果)
纯 PTQ:不 QAT、不 QAD,也不在校准集上训练
Unsloth 强调 v3.0 全程是训练后量化(PTQ):不在 imatrix 校准数据集上训练,不用 QAT 或 QAD,imatrix 文件公开供社区测试和使用。防过拟合的设计是校准与评测使用完全不同的数据集;文档称对比旧版 UD-2 在未见过的 Wikitext 与代码数据上的 KLD,"大尺寸量化提升没那么大,所以大尺寸仍用 UD-2,并计划继续改进"。这也是仓库里新旧文件并存的原因。
社区实测:从"挺好"到"基本没用"
HN 讨论里有具体实测:kennywinker 说用上一版 2-bit 量化做轻量编程"效果不错";jadbox 称新的 IQ4XS 在 4090 16GB 上"用起来挺好";sharmajai 报告 16GB 显卡满上下文跑 UD-Q3_K_XL 约 14 token/s。反面例子也有:Aurornis 说 1-bit、2-bit 量化在封闭评测集上"基本没用,小误差累积会把输出带偏"。
对指标的质疑集中在 KL 散度上。lostmsu 认为"1% 的 KLD 在 10000 个 token 上会累积成 2000000% 的误差",maxbond 反驳说选错 token 不等于推理出错,模型可以在长轨迹中自我纠正;johndough 则问:"有没有真正测写代码、且带多步骤的量化评测?低 KL 散度说明不了模型会不会陷入死循环。"
Hugging Face 讨论区还有使用问题:有用户报告 UD-Q5_K_XL 在 llama.cpp 下生成时崩溃(LM Studio 正常);有用户希望仓库保留传统均匀量化文件(如 Q4_K_S),称对 12GB/16GB 显卡做 CPU 张量卸载的用户来说,均匀量化明显更快,动态布局在 CPU 反量化和内存传输上是瓶颈。walrus01 抱怨新旧文件同名难区分,只能靠 sha256 逐个比对。
HN 上已有用户表示"等不及看基准测试和对比",danielhanchen 则承诺更大的评测套件。在第三方用独立评测复现这条曲线之前,>10% 的精度优势仍是 Unsloth 的自报数字。