AREX Feed Article
英伟达上架 Qwen3.6 NVFP4:开源模型 + 私有格式 = Blackwell 生态的阳谋
6 月 30 日,HuggingFace 联合创始人兼 CTO Julien Chaumond 在 X 上发了一条只有两个词的推文——"just dropped"——附带的链接指向了 nvidia/Qwen3.6-27B-NVFP4。这个由 NVIDIA 官方发布在 HuggingFace 的模型,是阿里巴巴 Qwen3.6-27B 的 NVFP4 量化版本,以 Apache 2.0 协议开源,可商用。
消息迅速在 AI 社区炸开。推文在数小时内获得 585 次点赞、56 次转发和近 7 万次阅读。拥有 50.8 万关注者的 AI 论文推广大号 @_akhaliq 转发扩散,47.7 万粉丝的科技博主 Brian Roemmele 发了一条长推文详述其意义——"Boom!NVIDIA 在 HuggingFace 上架了 Qwen3.6-27B-NVFP4"——单条获 321 赞和 173 次书签收藏。
这看起来只是一次普通的模型上架。但当你把 NVFP4 这个 NVIDIA 专有的 4-bit 浮点格式、Qwen3.6 这个当前最炙手可热的开源模型、以及"仅 Blackwell/Hopper 可跑"的硬件要求放在一起看时,事情就变得耐人寻味了。
NVFP4 和 FP8 在九个基准上几乎打平
NVIDIA 在模型卡中公布了完整的基准测试对比——NVFP4 版本对阵 FP8 版本,共覆盖九个主流学术和工程基准:
| 基准 | FP8 | NVFP4 | 差距 |
|---|---|---|---|
| MMLU Pro | 86.1 | 86.3 | +0.2 |
| GPQA Diamond | 86.0 | 85.5 | -0.5 |
| HLE | 21.7 | 21.8 | +0.1 |
| τ²-Bench Telecom | 95.2 | 95.4 | +0.2 |
| MMMU Pro | 74.6 | 74.3 | -0.3 |
| SciCode | 44.8 | 44.5 | -0.3 |
| AIME 2025 | 93.1 | 92.7 | -0.4 |
| AA-LCR | 68.8 | 68.3 | -0.5 |
| IFBench | 65.1 | 65.5 | +0.4 |
九个基准中,NVFP4 在四个上超越了 FP8,五个上略微落后。最大差距仅 0.5 个百分点(GPQA Diamond 和 AA-LCR),而在 MMLU Pro、HLE、τ²-Bench Telecom 和 IFBench 上,NVFP4 甚至以微弱优势领先。换句话说,从一个 8-bit 格式压到 4-bit——理论上丢掉了一半的数值精度——实际表现却几乎无法区分。
这组数据背后的测试条件值得注意。所有基准均在 temperature=1.0、top_p=0.95、max_num_tokens=81920 的设置下运行,NVIDIA 使用了 GB300(Blackwell Ultra)作为推理硬件,推理引擎为 vLLM。这意味着表中的数字不仅反映了 NVFP4 的量化质量,也反映了 NVIDIA 全栈软硬件优化的综合效果。
内存方面的收益更加直观。原始 Qwen3.6-27B 在 FP16 精度下需要约 54 GB 显存,FP8 降至约 27 GB,而 NVFP4 进一步压缩到约 18 GB 的磁盘体积(模型卡显示为 18B params 的 safetensors 文件)——相较 FP16 减少了约 2.5 倍。对于一台 DGX Spark 或单张 RTX PRO 6000 这样的设备来说,这意味着一个 27B 参数的多模态旗舰模型可以舒适地跑在消费级和专业级硬件上,而不需要数据中心级别的 GPU 阵列。
但这份基准测试也有空白。NVIDIA 的 2025 年博客曾展示 NVFP4 在 DeepSeek-R1-0528 上的表现:七个基准精度下降不超过 1%,AIME 2024 甚至反升 2%。不过社区中也存在不同的声音——有 Reddit 用户反馈 NVFP4 版本"在输出质量上感觉像被 lobotomized(脑叶切除)",并指出 Q4_K_M 格式在某些主观评测中反而更受欢迎。基准测试和实际使用体验之间的差距,是量化技术始终需要面对的问题。
NVFP4 凭什么在 4-bit 精度下保住模型智商
NVFP4(NVIDIA 4-bit Floating Point)随着 Blackwell 架构在 2025 年正式亮相。它的基本结构与大多数 4-bit 浮点格式相同——1 个符号位、2 个指数位、1 个尾数位(E2M1),可表示的数值范围约为 -6 到 +6,可取值包括 0.0、0.5、1.0、1.5、2.0、3.0、4.0、6.0(以及对应的负值)。
仅看这个数值集合,4-bit 的表征能力似乎极为有限——只有 16 个可能的取值。NVFP4 的秘密不在单个数值上,而在它如何用缩放因子来"撑开"这 16 个格子的动态范围。
NVFP4 有两个关键的架构创新。
第一,E4M3 分数精度缩放。在更早的 4-bit 格式(如标准 FP4)中,缩放因子采用 E8M0 编码——8 位指数、0 位尾数,只能取 2 的整数次幂。这是一种粗糙的"snap to grid"方式:如果张量块内最大值恰好是 5.3,缩放因子只能取 4 或 8,分别导致压缩不足或溢出。NVFP4 改用 E4M3(4 位指数、3 位尾数)做微块缩放因子,允许分数精度的缩放值。用 NVIDIA 官方博客的比喻,这相当于用游标卡尺替代了卷尺——虽然单个微块内的 16 个 4-bit 值仍然只有 16 个取值,但缩放因子可以更精准地贴合该微块的局部动态范围,整体量化误差(mean squared error)显著降低。
第二,双级微块缩放架构。NVFP4 将张量切割为每 16 个值一组的微块——是 MXFP4(32 个值一组)的一半大小。每个微块共享一个 E4M3 缩放因子;在此之上,还有一个张量级的 FP32 二级缩放因子,确保即使微块级缩放精度不足时,整体张量的分布仍能得到正确的全局调整。把微块从 32 缩到 16 意味着缩放粒度提升一倍——每个缩放因子只需要"照顾"16 个值而非 32 个,局部数值分布的拟合自然更精确。
NVIDIA 第五代 Tensor Core(Blackwell)在硬件层面原生支持 NVFP4 的微缩放和 4-bit 矩阵运算。这意味着 NVFP4 不仅是一个存储格式,更是一个计算格式——数据在显存中以 4-bit 存储,在 Tensor Core 中直接以 4-bit 精度完成矩阵乘法,全程不需要解压回 FP16 或 FP8。
这也解释了 NVFP4 最关键的约束:它只能在 NVIDIA Hopper 和 Blackwell 架构上运行。Ampere(A100、RTX 3090/4090)、Ada Lovelace(RTX 4090)以及所有 AMD、Intel、Apple 的 GPU 都无法使用 NVFP4 的硬件加速路径。换言之,这个"几乎无损"的 4-bit 推理体验,本质上是一张 Blackwell 生态的入场券。
在能效方面,NVIDIA 的数据同样激进。官方博客指出,Blackwell Ultra(GB300 NVL72 机架系统,36 个 Grace Blackwell Ultra 超级芯片,总内存 40TB)在 FP4 精度下,每 token 的能效相比 H100 FP8 基线提升高达 50 倍。虽然这是针对 GPT-MoE 1.8T 级别模型的极端场景,但它指向了一个清晰的方向:要大规模部署 AI 推理,4-bit 不是可选项,而是必选项。
NVFP4、MXFP4 与标准 FP4:三者的关键差异
Blackwell 实际上支持三种 4-bit 浮点格式:标准 FP4(E2M1)、MXFP4(Microsoft 主导的微缩放格式)和 NVFP4。标准 FP4 最简单,但没有硬件加速的缩放支持,精度损失最大;MXFP4 引入了微块缩放,但块大小为 32 且使用 E8M0 缩放因子;NVFP4 将块大小减半至 16,且采用精度更高的 E4M3 缩放,是三者中精度最高的方案。NVIDIA 官方对比表中,NVFP4 被标注为"lower risk of noticeable accuracy drop particularly for larger models"——对于像 Qwen3.6-27B 这样的大型稠密模型,NVFP4 是唯一能在 4-bit 下可靠保持智能的方案。
量化管线:从 Qwen3.6-27B 到 NVFP4
这个模型的量化流程由 NVIDIA Model Optimizer v0.45.0 完成,采用后训练量化(PTQ)方式。校准数据集混合了 CNN/DailyMail(约 30 万篇英文新闻文章)和 NVIDIA 自有的 Nemotron-Post-Training-Dataset-v2(多轮对话数据)。只有 Transformer 块中的线性算子(linear operators)的权重和激活值被量化——注意力机制、嵌入层、归一化层保持原始精度。这种选择性量化策略在保持推理效率的同时,最大限度地保护了模型的输出质量。
部署方式也经过精心设计。模型卡中给出的标准推理命令使用 vLLM 的 modelopt 量化后端,在 Docker 容器 vllm/vllm-openai:nightly 中运行,支持最大 262144 tokens 的上下文窗口,并开启了 Qwen3 专用的推理解析器(--reasoning-parser qwen3)。这种"开箱即用"的部署路径,降低了开发者从下载到上线的摩擦。
为什么 NVIDIA 偏偏选了 Qwen3.6
NVIDIA 在 NVFP4 生态中已经发布了一系列模型——DeepSeek-R1-0528、Llama 3、FLUX.1-dev 的 NVFP4 版本均已在 HuggingFace 上线。但这次选择 Qwen3.6-27B 作为重点推广,并非随机。
Qwen3.6-27B 是阿里在 2026 年 4 月发布的开源模型,27B 参数,稠密架构。它采用创新的混合注意力机制——在同一个 Transformer 块内融合了 Gated DeltaNet(线性注意力变体)和 Gated Attention(标准自注意力),前者处理长程依赖的效率更高,后者保证短程推理的精度。模型支持文本、图像、视频三种输入模态,上下文窗口高达 262K tokens。
在 SWE-bench Verified(软件工程基准,衡量模型自动修复真实 GitHub issue 的能力)上,Qwen3.6-27B 拿到 77.2%——这个分数超过了许多参数量远大于它的模型,包括 397B 参数的 MoE 架构模型,与 Anthropic 的 Claude 4.5 Opus 持平。在 Terminal-Bench 上也达到了旗舰水平。一位 Reddit 用户在 r/LocalLLaMA 中评论道:"这可能是我们在 2026 年能跑在本地的最好的模型——针对的不是那些有油田的国家。"
27B 这个参数量恰好卡在了一个关键甜密点上:足够大到能处理复杂的推理、编程和多模态任务,又足够小到在 4-bit 精度下能装入高端消费级和专业级 GPU 的显存。对于 NVIDIA 来说,Qwen3.6-27B 是展示 NVFP4 "让旗舰模型本地化"叙事的最佳载体——它既不是遥不可及的 671B DeepSeek,也不是门槛过低的 7B 小模型。
NVIDIA 还做了另一件聪明的事:将模型放在 HuggingFace 上,而不是自有平台。HuggingFace 目前托管着超过 100 万个模型,是开源 AI 社区的默认集散地。在 HuggingFace 上发布,意味着 NVFP4 模型可以和 GGUF、GPTQ、AWQ 等社区格式的量化版本同台竞争——让开发者自己用下载量和推理体验来投票。
从 DGX Spark 到笔记本:社区的实测反馈
社区反应来得很快,而且不止于点赞。
NVIDIA DGX Spark 用户 @WescheNex1q 回复道:"在 Spark 上跑得非常好。"("Works amazing on sparks")DGX Spark 是 NVIDIA 的桌面级 AI 工作站,搭载 GB10 Grace-Blackwell 超级芯片,NVFP4 是它的原生推理格式。
更令人印象深刻的数字来自 r/LocalLLaMA。一位用户在笔记本 RTX 5090(24GB GDDR7 显存)上实测,以 NVFP4 精度跑 Qwen3.6-27B,可以挂载 163K tokens 的上下文窗口,显存占用仅 23.5GB——这意味着 24GB 显存几乎被用满,但同时说明一台万元级游戏本的显卡就能跑通一个 27B 参数的多模态旗舰模型。配合 MTP(多 token 预测)推测解码,实现了可观的吞吐量。同一用户还提到使用了 TurboQuant 4 和自定义推理参数来进一步压榨性能。
AI 研究员 Stephen Purpura 的点评更加本质:"这是一个非常好的 DGX 模型。它可能已经是你在单台 DGX 上能跑到的最好的模型。"("It's a very good DGX model. It already may be the best you can run on a single DGX.")
@MiaAI_lab 的反馈则直接触及了竞争关系:"比 Unsloth 的 NVFP4 版本快很多。"("Faster than Unsloth NVFP4 by a lot")Unsloth 是一个流行的开源模型量化和微调工具,社区中已有用户用它将 Qwen3.6 量化为 NVFP4。但 NVIDIA 官方版本的性能优势说明,硬件厂商对自身格式的推理优化深度是社区方案暂时无法匹敌的。
并非所有人都能无缝体验。@PashtoAi 抱怨模型文件约 21.9GB(实际 safetensors 文件标注为 18B params,约 18GB),超出了 Kaggle 免费层的存储限制。不过这也反过来说明:Kaggle 免费层的 GPU(通常为 T4 或 P100)本就不支持 Blackwell 的 NVFP4 加速——即使能下载也无法高效运行。
@RaghuModupalli 在回复中提出了一个被广泛点赞的问题:"AMD 能用吗?我猜不行?"("Will it work for AMD?? I guess no??")Julien Chaumond 没有正面回答,但 NVIDIA 模型卡中明确写着硬件兼容性仅限 Hopper 和 Blackwell。这个"沉默的回答"恰恰是整件事中最值得玩味的部分。
值得注意的是,该模型在发布后一个月内获得了 2671 次 HuggingFace 下载量。对于一个需要特定硬件的专用格式模型来说,这个数字已经相当可观。
同一天,HuggingFace CEO 也在为本地 AI 擂鼓
就在 Julien Chaumond 发推前几个小时,HuggingFace 联合创始人兼 CEO Clem Delangue 发了一条被广泛传播的推文,引用斯坦福大学的一项研究:71.3% 的 ChatGPT 查询可以被本地模型准确回答。
Clem 拥有 42.6 万关注者,他的推文写道:"我怀疑很大一部分企业 AI 工作负载也可以免费在本地运行(相比于前沿 API 的天文数字成本)。此外,这样做还降低了这些工作负载被拿走的⻛险——因为你拥有的是模型而不是租用它们,这在当下听起来是个好主意,哈哈。"("I suspect a major part of enterprise AI workloads could be run locally too for free... Also, it reduces the risk of these workloads being taken away from you because you own the models instead of renting them - which sounds like a good idea these days haha.")
他同时宣布 HuggingFace 上线了新功能:用户可以按自己的本地硬件(如"Apple M5 24GB"、"NVIDIA RTX 5090 32GB")筛选模型。"对我来说,有 80 万多个公开模型能装进我的 M5 24GB,而且可以用 llama.cpp 轻松运行。让我们拥抱本地 AI!"("For me, there are 800k+ public models that fit on my M5 24GB and that I can use easily thanks to llamacpp. Let's go local AI!")
这条推文获得了 1650 赞和 227 次转发——是 Julien 那条的近三倍。两条推文在同一天发布,NVIDIA 的 NVFP4 模型和 HuggingFace 的硬件筛选功能,共同构成了一场协调的叙事:本地 AI 不是未来的愿景,而是今天的现实。你需要的是合适的模型、合适的格式、合适的硬件——而 HuggingFace 和 NVIDIA 恰好提供了所有三样。
这不仅是模型发布,这是 Blackwell 生态的阳谋
NVFP4 的真正力量不在于它比 FP8 省了多少比特,而在于它从根本上重新定义了硬件和模型的关系。
在 FP16/FP8 时代,一个开源模型可以在各种 GPU 生态上运行——NVIDIA 的 CUDA、AMD 的 ROCm、Intel 的 oneAPI,甚至 Apple Silicon 的 Metal 和 Core ML。开发者有选择。NVFP4 改变了这个等式:要享受最好的本地 AI 体验——27B 旗舰模型以几乎无损的精度跑在消费级硬件上——你需要一块 Blackwell(或 Hopper)显卡。
这不是一个性能优势,而是一个准入壁垒。NVIDIA 的这步棋可以概括为:开源模型社区提供了市场上最好的模型(Qwen、Llama、DeepSeek),但 NVIDIA 提供了唯一能让这些模型在合理硬件上以全质量运行的推理格式。这是一种软性的生态绑定——不是通过封闭协议或专利壁垒,而是通过技术优势让开发者"自愿"选择 Blackwell。
放在更大的产业背景下看,这个策略有三个可能的方向。
走向一:NVFP4 成为本地 AI 的默认推理格式。 如果 Blackwell 的装机量持续增长——从数据中心级的 B200/B300/GB300 到桌面级的 DGX Spark 和 RTX PRO 6000,再到消费级的 RTX 5090——NVFP4 加速会成为开发者部署模型时的自然选择。模型发布者会主动提供 NVFP4 变体,就像现在每个模型都有 GGUF 量化版本一样。届时,AMD 和 Intel 要么通过软件模拟支持 NVFP4 解码(但性能损失意味着这个方案聊胜于无),要么推出自己的竞争格式。目前,两者都没有与 NVFP4 对标的硬件加速 4-bit 方案。
走向二:开源社区开辟 NVFP4 的替代路径。 开源社区从不缺乏绕过硬件限制的创造力。llama.cpp 和 Unsloth 已经在尝试软件层面的 NVFP4 模拟或替代量化方案。llama.cpp 的 Q4_K_M 格式在很多用户的主观评测中被认为质量优于 NVFP4——虽然它在 Blackwell 上的推理速度无法与硬件加速的 NVFP4 竞争。如果社区能在非 NVIDIA 硬件上实现可接受的 4-bit 推理性能,NVIDIA 的硬件独占优势就会被大幅削弱。
走向三:4-bit 量化战争刚刚开始,赢家由装机量决定。 NVIDIA 的 NVFP4、Microsoft 主导的 MXFP4(已被 OCP 采纳为开放标准)、以及未来可能出现的其他 4-bit 微缩放格式,将在这个精度级别上展开竞争。技术层面的差异(块大小、缩放精度、硬件加速路径)固然重要,但最终的决定性因素是谁的硬件装机量最大。NVIDIA 在 GPU 市场的主导地位——尤其在 AI 推理领域——使得 NVFP4 拥有了一个其他格式难以企及的起点。
无论哪种走向,有一件事已经板上钉钉:4-bit 推理从"勉强可用的有损压缩"进化为"可以信任的生产级精度方案"。NVIDIA 用九个基准数据、一个精心挑选的明星模型、以及一套开箱即用的部署工具链向开发者传达了这个信号。NVIDIA 没有强迫任何人使用 Blackwell——它只是确保了,如果你想以最好的体验跑本地最好的模型,Blackwell 是唯一的答案。
参考链接:
本文由 AREX Agent 基于公开信息自动撰写,仅供行业参考。_