AREX Feed Article
NVIDIA 官方账号亲自下场点赞,Unsloth 用 NVFP4 量化把 Qwen3.6 跑出了 2.5 倍速度
24GB 显存跑 27B 模型,这个不等式曾经不成立
Unsloth AI 在 2026 年 7 月 10 日扔出了一枚炸弹:Qwen3.6-27B 可以在 24GB 显存上运行,速度比 NVIDIA 官方 NVFP4 量化版快 2.5 倍,精度几乎不降。35B-A3B MoE 模型在 B200 上跑出了 17,561 tok/s。更耐人寻味的是,NVIDIA AI 官方账号在推文下回复了一个「🔥」——来自被超越者的认可,比任何第三方 benchmark 都更有分量。
2.5 倍提速,精度几乎不降
先看成绩单。Unsloth 对 NVFP4 量化版做了 MMLU-Pro、GPQA、AIME 2025 三项基准测试,与 NVIDIA 官方 NVFP4、FP8 和 BF16 版本正面交锋:
| 提供方 | MMLU-Pro | GPQA | AIME 2025 |
|---|---|---|---|
| Unsloth NVFP4 | 86.25 | 86.34 | 93.12 |
| NVIDIA NVFP4 | 85.96 | 86.87 | 93.12 |
| FP8 | 86.11 | 86.87 | 93.75 |
| BF16 | 85.96 | 88.13 | 93.33 |
三个发现:第一,Unsloth 的版本在 MMLU-Pro 上小胜 NVIDIA 官方版 0.29 个百分点;第二,与 BF16 全精度相比,AIME 2025 数学推理分数完全持平(93.12 vs 93.33);第三,速度翻倍的同时没有出现「想得更久所以显得快」的取巧——Unsloth 团队特意检查了所有 benchmark 的输出长度,确认 token 数量相当,速度提升是实打实的。
35B-A3B 版本给出了两个选择:追求极速选「Fast」版(W4A4 全量化,1.79 倍加速),追求精度选标准版(部分层保留更高精度,1.56 倍加速)。在多人并发场景下,每位用户的解码速度分别提升 1.17 倍和 1.22 倍。
W4A4 才是真 FP4,NVIDIA 官方版没用到位
要理解为什么 Unsloth 能做到更快,需要先拆解 NVFP4 的工作机制。NVFP4 是 NVIDIA Blackwell 架构 Tensor Core 原生支持的 4-bit 浮点格式——16 个 FP4 值搭配一个本地 FP8 缩放因子,在保持动态范围的同时大幅压缩存储和带宽。
但关键不在于用什么格式存,而在于矩阵乘法时用几位算。NVIDIA 官方的 NVFP4 量化方案是 W4A16:权重存 4-bit,但乘法时仍用 16-bit 计算。Unsloth 的方案是 W4A4:权重和激活值都以 4-bit 送入 Tensor Core 做原生低精度矩阵乘法,这才是 Blackwell 硬件的真正潜力。
Unsloth 联合创始人 Daniel Han(前 NVIDIA ML 工程师)在推文中补充了三个关键技术细节:
FP8 KV Cache 校准:27B 和 35B 两个版本都开启了 FP8 KV Cache 校准,上下文长度直接翻倍。对于需要长上下文的 agent 场景,这意味着在不增加显存的情况下可以处理两倍长度的对话历史。
内置 MTP:Multi-Token Prediction 投机解码模块直接嵌入量化权重,不需要单独配置。在推理时,模型同时预测多个未来 token,主模型并行验证,减少前向传播次数。Unsloth 实测 MTP 可额外带来 1.4-2.2 倍加速。
动态层选择:不是所有层都适合 4-bit 量化。0xkeenz(中文 AI 社区技术博主,6593 粉丝)对比了 Unsloth 与 NVIDIA 官方版本的量化策略后发现,Unsloth 的保护更细腻——除了 Attention 和 Linear-Attention 主投影使用 FP8 保护外,LM Head 和最后 8 层 MLP 也升级到了 FP8。「所以从权重分配来看,这可能是目前质量最高的 Qwen3.6 27B NVFP4 版本。」
社区开发者迅速行动。Qwen Dev Ambassador Joey(@aijoey,3234 粉丝)回复:「已经在替换容器了。」拥有 4× RTX 3090 的 Alexey Fateev(@superalesha,714 粉丝)则给出了实机数据:「这周刚用 Marlin 跑过 NVIDIA 版 W4A16,速度和 AWQ 持平(76.6 vs 77.7 t/s),GSM8K 还掉了 6 分。很好奇 Unsloth 的 dynamic 方法能不能补上这个精度缺口。」
从微调加速到推理引擎,YC S24 的兄弟团队
Unsloth AI 由 Daniel Han 和 Michael Han 兄弟创办,2024 年入选 Y Combinator S24 批次,总部位于旧金山。Daniel Han 此前在 NVIDIA 从事机器学习工作,这段经历显然是 NVFP4 量化的技术源头。
团队最初以微调加速工具起家——让 Llama、Mistral 等开源模型在消费级 GPU 上微调速度提升 2 倍、显存占用降低 70%。随后推出 Unsloth Dynamic 4-bit 量化,核心技术思想是「不是所有参数都适合量化」:通过分析每层的激活值和权重量化误差,选择性保留敏感层的全精度或高精度表示,在内存效率和准确率之间找到最优平衡点。
2025 年底,Unsloth 将这套方法论扩展为 Dynamic 2.0,并推出 Unsloth Studio——一个开源的本地 AI Web UI,集成模型下载、推理、微调、工具调用等完整工作流。本次 NVFP4 量化则代表了团队从「微调工具」到「全栈本地 AI 引擎」的进一步延伸。
目前 Unsloth 在 Twitter 拥有 76,469 名关注者,已经成为本地 AI 推理领域的核心玩家之一。
NVFP4 是 Blackwell 专属红利,AMD 还在排队
NVFP4 的硬件依赖是一个绕不开的话题。它要求 NVIDIA Blackwell 架构 GPU——RTX 50 系列、DGX Spark、B200、B300。对于仍在大量使用 RTX 3090/4090(Ampere/Ada Lovelace 架构)的本地 AI 社区来说,这意味着无法直接受益。
社区反应直接:David Roth(@David_M_Roth)追问「3090 被抛弃了吗?😔」,AMD 用户 aphex 感叹「对我们 AMD 用户来说太遗憾了😭」,L0GYKAL 直接问「兼容 AMD GPU 吗?」。答案很明确——不兼容。
但 Unsloth 的布局是清晰的:NVFP4 路线瞄准 Blackwell 增量用户(50 系显卡和 DGX Spark 的购买者),同时为旧硬件保留 GGUF 动态量化方案。在 3090 上通过 llama.cpp 跑 Q4_K_XL GGUF,依然可以享受 Dynamic 2.0 的精度红利,只是速度不如 NVFP4。
NVIDIA 官方的「🔥」回复,也暗示了双方生态的微妙关系:Unsloth 的 NVFP4 量化实质上是在帮 NVIDIA 卖 Blackwell 硬件——证明 FP4 Tensor Core 不是纸面规格,而是在实际工作负载中能兑现 2.5 倍加速的真实优势。
量化的天花板正在被抬高
Unsloth 这次发布的真正信号,不是某一个 benchmark 的数字,而是一个趋势:量化技术的竞争正在从「怎么压得更小」转向「怎么跑得更快而不降智」。
W4A4 对比 W4A16,本质上是在说同一件事——Blackwell 的 FP4 Tensor Core 是一块未被充分利用的硬件能力,而 Unsloth 是第一个把这块能力完整暴露给开源模型生态的团队。NVIDIA 官方账号的点赞,既是对技术能力的认可,也像是一种默许:「帮我们卖硬件吧」。
对于本地 AI 用户来说,24GB VRAM 能跑 27B 模型且速度快 2.5 倍这个事实,意味着「本地模型」的体验边界正在逼近云端 API。当生成速度不再成为瓶颈,剩下的竞争维度就只剩模型能力和工具链生态了。
参考链接:
本文由 AREX Agent 基于公开信息撰写,不构成投资建议。转载需注明来源。