AREX Feed Article
CoreWeave 公布 MLPerf Inference v6.1 提交结果,称在 GPT-OSS-120B 上取得全部提交中最高的每 GPU 吞吐
9 月 16 日,CoreWeave ,公布其在 MLPerf Inference v6.1 的提交结果;MLCommons 了这一轮基准测试的结果。CoreWeave 称,其 GPT-OSS-120B 提交在单台 NVIDIA GB300 NVL72 上达到离线场景 16,635 tokens/s/GPU(每块 GPU 每秒生成的 token 数)、服务器场景 16,118 tokens/s/GPU,为 v6.1 数据中心封闭组(Datacenter Closed)所有 GPT-OSS-120B 提交中(不限芯片)最高的每 GPU 吞吐,两种场景均如此。
同一批结果里的另外三项声明:Qwen3-VL-235B-A22B 在 GB300 NVL72 上的服务器吞吐为云厂商最高,DeepSeek-R1-671B 的每 GPU 服务器吞吐较 v6.0 提升近两成,Llama 2 70B 在 GB300 NVL72 上的服务器与离线吞吐同样被 CoreWeave 列为云厂商最高。CoreWeave 强调,这些数字不是在只为基准测试调优的集群上产生的。
一次提交覆盖四个模型族与四个 NVIDIA 平台
按博文说明,CoreWeave 参加的是 MLPerf Inference v6.1 数据中心封闭组的可用(Available)类别,提交横跨四个 NVIDIA 平台(HGX B200、HGX B300、GB200 NVL72、GB300 NVL72)与四个模型族:多模态模型 Qwen3-VL-235B-A22B、671B 参数的 MoE(混合专家)推理模型 DeepSeek-R1-671B、开源权重推理模型 GPT-OSS-120B,以及博文称为生产环境部署最广的模型之一的 Llama 2 70B。场景覆盖服务器(Server)与离线(Offline)两类。
MLCommons 对封闭组与可用类别各有明确定义:封闭组要求提交方使用与参考实现相同的模型,以便对硬件平台或软件框架做同口径比较;可用类别要求系统只包含可购买或在云端租用的组件。两个定义都写在 上。
博文的汇总表列出了各模型对应的提交平台:Qwen3-VL-235B-A22B 在 GB300 NVL72 上;DeepSeek-R1 覆盖 HGX B200 与 GB200 NVL72;GPT-OSS-120B 与 Llama 2 70B 各自覆盖四个平台。
GB300 NVL72 上:Qwen3-VL 的 1,196 QPS 与 GPT-OSS-120B 的每 GPU 吞吐
Qwen3-VL-235B-A22B 是四个模型族里的多模态模型。CoreWeave 称,它在单台 GB300 NVL72 上的服务器场景成绩为每秒 1,196 次查询(QPS);离线场景为 1,135 samples/s(每秒样本数)。
GPT-OSS-120B 的每 GPU 吞吐带有脚注:「由系统总吞吐除以加速器数量」算出,属 CoreWeave 自行换算的派生指标,且「未经 MLCommons Association 验证」。博文称,在 GPU 价格既定时,每块加速器服务更多 token 可以降低单 token 的基础设施成本。
按合计口径,单台 GB300 NVL72 在服务器场景超过 116 万 tokens/s,离线场景超过 119 万 tokens/s,CoreWeave 称这是基于 NVIDIA 平台的系统中最高的合计吞吐。GPT-OSS-120B 的其余结果里,GB200 NVL72 的合计吞吐为服务器 901,058 tokens/s、离线 911,566 tokens/s,被公司称为同类机架级配置中最高;HGX B200 与 HGX B300 则在两个场景中领先所有来自云厂商的 HGX 提交。在 MLCommons 同日发布的中,CoreWeave 还称 GB300 NVL72 上的 GPT-OSS-120B 每 GPU 吞吐较 v6.0 提升了 17%(离线)与 8%(服务器)。
DeepSeek-R1 较 v6.0 的每 GPU 提升与 Llama 2 70B 的百万级吞吐
DeepSeek-R1-671B 给出的是一条纵向对比:CoreWeave 称,把 GB200 NVL72 上 72 块 GPU 的 v6.1 提交与 64 块 GPU 的 v6.0 提交相比,推导出的每 GPU 服务器吞吐提升了 19.8%;这轮提交距 MLPerf Inference v6.0 约五个月。博文把增益归因于对服务栈、调度与运维的持续优化:已投产的 GPU 不必等下一代硬件,就能服务更多 token。
Llama 2 70B 则给出了绝对吞吐数字:CoreWeave 称其在 GB300 NVL72 上的服务器场景为 944,902 tokens/s、离线场景为 1,136,100 tokens/s;在离线场景,这是云厂商基于 GB300 NVL72 的提交中唯一超过每秒 100 万 tokens 的结果。
CoreWeave 称结果跑在客户同款生产集群上:Mission Control 与 SUNK
博文写明了测试环境:「这些结果不是在只为基准测试调优的集群上产生的。」CoreWeave 称,提交跑在与其客户相同的生产集群、镜像和运维栈上。博文用两项工具说明其中的机制:Mission Control 提供机群范围的健康监测与生命周期管理,并通过持续基准测试把系统行为与持久的 tokens/s 结果挂钩;SUNK 做拓扑感知调度,把推理负载固定在 GB200 NVL72 与 GB300 NVL72 系统的高带宽 NVLink 域内。在给 MLCommons 的补充说明里,CoreWeave 也写了类似内容,并提到集成对象存储与节点本地缓存可以加速模型启动。
同一轮 v6.1:30 家提交方、2.99 倍与 5.7 倍
MLCommons 的公告给出了这一轮的规模:提交组织数量创下新高,共 30 家,CoreWeave 是其中之一。v6.1 新增两项测试:面向数据中心的端到端检索增强生成(RAG)与面向边缘的 Agentic 推理;此外新增对投机解码(Speculative Decoding)的支持,覆盖两项推理基准的交互场景与 GPT-OSS 任务。
公告还给出本轮的涨幅参照:视觉语言模型(VLM)测试的最优单加速器服务器成绩比 v6.0 提升 2.99 倍;DeepSeek R1 测试的最优单加速器服务器成绩比一年前的 v5.1 提升 5.7 倍。MLPerf Inference 工作组联合主席 Miro Hodak 解释了新增 RAG 测试的原因:问答已经不只是「在语料库上训练的 LLM」,各方需要了解今天构建的多步骤、多组件流水线的真实性能。另外,NVIDIA Rubin 与 Vera Rubin NVL72 以预览(Preview)身份出现在本轮结果中。
「最高」的边界:自选范围与 MLCommons 的免责声明
CoreWeave 的「最高」表述都是公司自己的归纳:哪些提交算作「云厂商」、按什么范围比较,由博文自行划定;本文没有独立复现这些跨提交方的排序。
MLCommons 在提交方补充说明的开头声明,其中的陈述由提交方提供,「不代表 MLCommons 的观点或意见」。CoreWeave 关于生产集群、Mission Control 与 SUNK 的描述,同样属于公司的自述。
MLCommons 在数据中心结果页提示,已发布的结果有时会被修改或作废,改动会记入变更日志。完整结果、变更日志与各提交方的补充说明均已公开。