AREX Feed Article
CoreWeave 公布 Vera Rubin NVL72 首批实测:每 MW 每秒 token 数最高达 GB200 NVL72 的 10 倍
8 月 12 日,CoreWeave 在它与 NVIDIA 合写的「生产型 AI 工厂」系列第二篇里,公布了 NVIDIA Vera Rubin NVL72 的第一批实测性能:在 DeepSeek R1 推理负载上,每 MW 每秒生成的 token 数最高达到 GB200 NVL72 的 10 倍。
这个数字来自同一份 DeepSeek R1 负载、锁定相同交互性目标(每秒每用户 token 数,TPS/User)下的对比,测量时所有主流推理优化全部开启:大规模专家并行、NVFP4 精度、多 token 预测、prefill 与 decode 分离,跑在 NVIDIA TensorRT-LLM 加 NVIDIA Dynamo 的软件栈上。
同一份 DeepSeek R1 负载,每 MW 的 token 数差 10 倍
完整曲线收录在 CoreWeave 7 月 23 日发表的博客里,8 月 12 日的系列第二篇把这篇作为完整结果链出。图上横轴是每秒每用户 token 数(TPS/User),纵轴是每 MW 每秒 token 数(TPS/MW):以 2025 年的 GB200 NVL72 为基线,Vera Rubin NVL72 的曲线全程压在它上方,差距在曲线中段接近 10 倍,图上用 80,000 与 800,000 TPS/MW 两个标注把这个峰值标了出来。
在用户或 agent 感受到的响应速度差不多时,Rubin 在同样的电量下能多产出近一个数量级的 token。10 倍是最高值,不是整条曲线上的统一差距。这组数据来自 CoreWeave 在自家平台上的测量,由公司自己发布;博客用「first measured performance results」(首批实测性能结果)来描述它。
为什么用每 MW 每秒的 token 数当尺子?
DeepSeek R1 这类推理模型不会一次过给出答案。它会规划、自查、改写,单个查询生成的 token 远多于普通回复,每个 token 都要穿过内存和 NVLink 互联域。因此决定 agent 体验是「即时」还是「迟钝」的,是交互性,不是裸 FLOPS。
AI 工厂的另一条硬约束是电。相同功率预算下,每 MW 能产多少 token,直接决定能承载多少推理流量。CoreWeave 给出的换算:同样的电力预算跑多出近一个数量级的推理流量,或者同样的流量用少得多的电,结果是更低的单 token 成本和更大的扩展空间,这对要反复调用工具、多步推理的 agent 负载尤其有利。
硬件底子是单机架 72 颗 Rubin GPU 加 36 颗 Vera CPU,260 TB/s 的 all-to-all NVLink 6 互联,Transformer Engine 原生支持 NVFP4 精度。
Valvey 隔离机架,Racky 统一传感器
Vera Rubin NVL72 是 100% 液冷,这个功率密度下没有风冷选项。CoreWeave 为此造了两套专利待批(patent-pending)的系统,专为 Vera Rubin 设计,只在 CoreWeave 提供。
Valvey 是每机架的液冷阀门组件,把冷却从被动机械系统变成软件定义的控制面:持续监控流量、温度、压力,出问题时自动隔离单个机架,不牵连相邻机架。Racky 是机架级控制点,把电力、冷却、环境传感器聚合成一个标准化接口,机架因此像普通云资源一样被管理,而不是一次性定制。Rack LifeCycle Controller 在两者之上编排跨机架的工作流。CoreWeave 在博客里的说法是,这一层的作用是让效率增益在客户负载真正上线、规模化运行之后仍然成立。
六月首机上电,八月第二篇讲运营
2026 年 6 月初,CoreWeave 完成业内首次 Vera Rubin NVL72 的 bring-up 与验证,机架级系统端到端立起来,电力、冷却、网络、计算全部验证并运行。7 月 23 日放出完整性能曲线。8 月 12 日,系列第二篇把话题从「能不能跑」转到「怎么一直跑」。
平台层面,博客给出的是六颗重新设计的芯片合成一台超级计算机:Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机。第二代 RAS 引擎做主动维护和不停机健康检查;博客称无缆的模块化托盘让组装速度比 Blackwell 快约 90 倍,软件定义的 NVLink 路由可以绕开故障。
运营层面是另一组数字:Hopper 上 goodput 最高 96%;1,024 卡 Hopper 集群基准中 MFU 比公开报告的其他基准高 20%,平均故障间隔改善约 10 倍,有效训练时间占比最高 98%;Mission Control 每秒处理超过 2 亿个指标采样。
系列第二篇把这些收进同一个论点:决定工厂产出的是生命周期,不是发布。
Jane Street 说有信心,CoreWeave 说这只是起点
CoreWeave 在系列第二篇里引述了 Jane Street 量化研究负责人 Craig Falls 的话:"Their ability to deliver highly performant clusters with full cluster observability and a support team that engages deeply on hard problems gives us the confidence to partner with them on NVIDIA Vera Rubin."(“他们交付高性能集群、提供全集群可观测性、支持团队深入解决难题的能力,给了我们与他们在 NVIDIA Vera Rubin 上合作的信心。”)
在 7 月的博客里,CoreWeave 列举了三类未具名客户的预期。一家全球网络安全公司预计威胁检测推理的每瓦性能提升 10 倍,能在不扩大数据中心占地的情况下把 agentic 安全扩展到更多端点;一家自主编码 agent 公司预计在低得多的单 token 成本下获得同样的 GPU 级推理提升。
一家已经跑在 GB200 NVL72 上的 AI 原生搜索引擎预计推理吞吐有类似提升,可以把实时引用答案搜索扩展到更多用户,而不破坏响应时间目标。
CoreWeave 自己给这组数字定的位置是起点。它的参照是先例:GB200 NVL72 上线后,最初的推理数字随调度、网络和软件栈的调优在几个月内大幅改善,Llama 3.1 405B 在客户实际使用的同一套生产基础设施上的训练时间同比缩短了 2.8 倍。博客写道:"this measurement is a starting point on Vera Rubin NVL72, and we'll continue to publish updated numbers as optimization work progresses"(“这次测量只是 Vera Rubin NVL72 的起点,随着优化推进,我们会继续发布更新数字。”)10 倍是这批数字的第一个公开刻度,下一批测量已经排上日程。