AREX Feed Article
NVIDIA 公布 Qwen3.8-2.4T-A95B 实测:GB300 NVL72 单卡 4K+ tokens/s、单用户 350+
北京时间 8 月 13 日凌晨 02:55(UTC 8 月 12 日 18:55),,祝贺 @Alibaba_Qwen 开源 Qwen3.8-2.4T-A95B 权重,并公布 NVIDIA 自己的测量:FP8 精度下,该模型在 GB300 NVL72 上开箱即用(out of the box),单 GPU 4K+ tokens/s、单用户 350+ tokens/s。
推文附上同日发布的 ,博客把结论写得更完整:模型未经额外调优,Day 0 即达到上述吞吐。
Qwen3.8-2.4T-A95B 是通义千问第一次把 Max 级旗舰做成开放权重: 8 月 13 日报道,阿里当天正式开放该模型权重,为首次将 Max 级旗舰模型对外开放;NVIDIA 博客称这是阿里迄今最大的开放权重模型,总参数 2.4T、每 token 激活 95B,面向推理与 agentic 负载。此前报道聚焦权重发布与软件栈适配;这份博客补上的是硬件实测数字。
4K+ 与 350+,同一张曲线上的两个端点
推文配图是这条吞吐-交互曲线:标题 "NVIDIA GB300 NVL72 Qwen3.8 Performance",副标题 "Out-of-the-box Qwen3.8-2.4T-A95B performance",条件行 "ISL/OSL: 8k/1k, TensorRT-LLM, FP8, MTP"。拆开即输入 8k、输出 1k token,推理栈 TensorRT-LLM,FP8 精度,启用多 token 预测(MTP)。
横轴是 Interactivity(单用户 TPS),纵轴是 Throughput(单卡 TPS)。4K+ 落在曲线高吞吐端,350+ 落在交互端。按图表,两个数字对应同一条曲线上的两个工作点。
博客图注原文是 "achieving over 4K tokens per second per GPU at peak throughput",即 4K+ 对应峰值吞吐点。推文与博客都没有给出 batch size、并发用户数或首 token 延迟。截至 8 月 14 日,平台数据显示这条推文获 706 个赞、约 3.46 万次查看。
为什么这套数字出自 72 GPU 的整机架
NVIDIA 博客把数字与机架规格绑在一起:GB300 NVL72 把 72 张 Blackwell Ultra GPU 集成进一个平台,72 GPU NVLink 域提供 130 TB/s 的 all-to-all 通信。对这种 512 专家的细粒度 MoE(口径),每个 token 都要路由到分布在不同 GPU 上的专家,互联带宽直接决定吞吐上限。
博客给出的第二个机制是混合注意力:全注意力层与线性注意力层交替,上下文扩到 100 万 token 时,线性层的 KV cache 被有界递归状态替代,计算与显存都不随上下文膨胀。
对照部署门槛,这个数字的"位置"更清楚。vLLM 官方博客称,BF16/FP8 完整版至少需要两台 NVIDIA B300 或 AMD MI355X 节点,FP4 量化版可单节点运行; 8 月 13 日的解读复述了同一门槛。
GB300 NVL72 是一个 72 GPU 的整机架,部署规模远大于两台节点。NVIDIA 测的是整机架级别的吞吐。
vLLM 和 FlagOS 也各自交了 Day-0 答卷
在 NVIDIA 之外,同一份权重还拿到两份 Day-0 公告。vLLM 博客北京时间 8 月 12 日 18:23 发布,比 NVIDIA 博客早约 8 小时,宣布 Day-0 支持并称已在 NVIDIA 与 AMD 硬件上验证,Inferact 团队提供了 NVFP4 与 MXFP4 检查点。
vLLM 的初步评测中,NVFP4 的 GSM8K、AIME25@3 分数略高于 FP8,但注明需要提高推理预算才能复现。
NVIDIA 博客则排列自己的软件栈:SGLang、vLLM、NVIDIA Dynamo 提供开源推理配方,NIM 容器开箱部署,NeMo AutoModel 支持 Day-0 微调 Hugging Face 检查点。图表副标题里的 TensorRT-LLM 说明,4K+ 出自 NVIDIA 自家推理栈。
国内一侧,完成九家芯片的 Day-0 适配,并把新增的 INT8/W8A8 量化路径解释为解决"当下 80% 以上存量 AI 算力不能支持 FP8"的问题。
这句限定点出 NVIDIA 数字的另一面:4K+ 依赖 FP8 与顶级互联,大量存量算力连 FP8 都跑不了,只能走 INT8。
NVFP4 的增益停在"预期",峰值不等于常态
博客对 FP4 只留下一句:包括 NVFP4 在内的进一步优化 "are expected to deliver enhanced performance gains over time",增益停在预期,没有实测数字。
博客也没有其他平台或精度的同口径对照,没有说明 350+ tokens/s 对应哪一档 reasoning 配置(模型自带 low/high/xhigh 三档推理深度)。
这套 FP8 数字目前是 NVIDIA 一家在 GB300 NVL72 上的自测,4K+ 对应曲线峰值端。它回答了旗舰开放权重在机架级硬件上能跑到多快,但跨平台可比性仍是这套数字留给下一步的问题。