AREX Feed Article
vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,Inferact 两款 4-bit 检查点把部署压到单节点
北京时间 8 月 13 日 0 时 6 分(UTC 8 月 12 日 16:06),发文宣布对阿里 Qwen 的 Qwen3.8-2.4T-A95B 提供 Day-0 支持,并称支持已在 NVIDIA 与 AMD 硬件上验证。公告同时给出 Inferact 制作的两款现成 4-bit 检查点:NVFP4 版 1.32 TiB,单台 NVIDIA 8×B300 节点即可运行;MXFP4 版 1.45 TiB,单台 AMD 8×MI355X 节点即可运行。vLLM 的原话是:「无需自行转换,无需校准,直接 vllm serve。」
这次被支持的对象,是阿里 Qwen 团队于北京时间 8 月 12 日深夜刚开放权重的 Qwen3.8-2.4T-A95B。据 报道,阿里云魔搭 ModelScope 社区公众号 12 日深夜宣布开放权重:总参数 2.4T、每个 token 激活 95B、每层 512 个专家,是 Qwen-Max 级模型首次开源权重;vLLM 在公告里称它是「迄今最大的开放权重模型之一」。体量是最大的门槛——给出的判断是,这个模型跑推理「至少需要两台 NVIDIA B300 / AMD MI355X 节点」,除非换成 FP4 量化版。
全精度要两台节点,两款 FP4 检查点压进一台
vLLM 官方博客把账算得很具体:Qwen3.8-2.4T-A95B 沿用 Qwen 3.5 架构,92 层混合骨干中每第 4 层跑全注意力、其余 69 层跑线性注意力;官方提供 FP8 与 BF16 检查点,而 Inferact 的 MXFP4 / NVFP4 量化权重被博客形容为「与全精度质量相当,同时显著降低内存与带宽开销」。博客给出的两条现成命令:
vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \ --linear-backend flashinfer_cutedsl \ --tensor-parallel-size 8 \ --enable-auto-tool-choice --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}'vllm serve Inferact/Qwen3.8-2.4T-A95B-MXFP4 \ --tensor-parallel-size 8 \ --enable-auto-tool-choice --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}'两条命令都靠 --tensor-parallel-size 8 把模型切到单节点 8 张卡上,并配上 MTP 投机解码、每次多预测 3 个 token;MXFP4 版的命令里没有 linear-backend 参数。量化方法上,Inferact 用 Round-to-Nearest 量化加激活校准,把选中层(包括路由专家)压到 FP4 权重,同时启用 4-bit 激活。
两项基准里,NVFP4 的分数反而高于 FP8
博客同时公开了 FP8 与 NVFP4 的初步对照:
- GSM8K(严格 / 宽松):FP8 89.61% / 90.52%,NVFP4 90.37% / 91.05%;
- AIME25 @3(平均 / 通过):FP8 87.78% / 93.33%,NVFP4 92.22% / 96.67%。
两组数字都是 NVFP4 更高。博客注明这是「初步验证」,并且「需要提高推理预算(reasoning budget)才能复现这些评测结果」。博客用来支撑「质量相当」说法的公开对照,就是这两项基准,还带着一个推理预算的前提。
英伟达、AMD 分工写内核,DigitalOcean 与 Together 先跑
vLLM 在推文和博客里列了分工:NVIDIA 与 Inferact 合写了线性注意力(Gated Delta Rule)、GQA 注意力、Dense GEMM 与 MoE 路由的高速内核,并新增融合内核降低通信开销,注意力用数据并行加张量并行、MoE 用专家并行;AMD 这边用 AITER 融合的 Gated DeltaNet 解码、注意力与 MoE 内核,共享专家走 hipBLASLt GEMM、路由专家走 AITER FusedMoE,MXFP4 部署靠 AMD Quark。DigitalOcean 与 Together AI 参与了早期测试。
vLLM 在博客 TL;DR 里解释 Day-0 的由来:模型复用 Qwen 3.5 架构,「从第一天起即可在 vLLM 上运行,无需架构改动」。
另一条单机路线:Unsloth 把 4.9TB 压到 397GB
比 vLLM 发帖早约 7 分钟,宣布把同一个模型从 4.9TB 压缩到 397GB(-91%),做法是按层选择性应用 Dynamic 1-bit 量化,宣称可在 410GB 以上内存/显存的机器上经 Unsloth Desktop 本地运行,并附上指南与 GGUF 下载;Unsloth 还称 Qwen3.8「可与 GPT-5.6 Sol 匹敌」。
两条路线面向不同机器:Inferact 的 1.32 / 1.45 TiB 检查点面向一台 8 卡数据中心节点,Unsloth 的 397GB 面向大内存工作站。至于质量,博客对「质量相当」的支撑是 GSM8K 与 AIME25 两项对照,并注明复现这些结果需要提高推理预算。