AREX Feed Article
SemiAnalysis 估算:Vera Rubin NVL72 智能体推理每美元吞吐量约为 GB300 的 67 倍,每 GW 年利润可超 Blackwell 平台 2 倍
北京时间 9 月 15 日清晨(UTC 9 月 14 日 22 时前后),分析机构 SemiAnalysis 发布了一篇题为《Vera Rubin NVL72 Agentic Inference: 67x better Performance per Dollar》的,以及一条同主题的。按该通讯的估算:Nvidia Vera Rubin NVL72 在智能体(agentic)推理场景下,于 P90 交互性 170 TPS 的操作点上,每 1 美元总拥有成本(TCO)对应的吞吐量约为 GB300 的 67 倍;折算到电力口径,每吉瓦(GW)年利润可超过 Blackwell 平台 2 倍以上。
通讯称,这些数字来自其自研的 AgentX 基准与 TCO 模型,并把该批结果称为「首个经过验证的 Rubin 智能体推理结果」;致谢名单包括 Jensen Huang、Ian Buck、Nick Comly、Kedar Potdar、Rohit Nagraj 与 Mainland China TensorRTLLM Team,称他们协助调通了下一代 Rubin 的软件(bring-up),并帮助验证了基准结果。帖文与通讯小标题同时写着「Jensen 再次低报性能」(Jensen Sandbagging Performance Again)。
AgentX:数千颗芯片上的真实流量回放
SemiAnalysis 把 AgentX 称为「行业标准」的智能体推理基准场景,运行在自家的 InferenceX 平台上:它在由数千颗芯片组成的集群上回放真实世界的智能体流量,供推理服务商和超大规模 AI 实验室评估不同芯片在不同场景下的效率。
这组数字的计价方式是每 1 美元 TCO 换取多少总吞吐量:把场景总吞吐量除以全部服务成本(每芯片每小时成本 × 所用芯片数)。InferenceX 默认给两种成本假设:超大规模采购与自建(含服务器与网络资本开支摊销、托管、电力与资金成本),以及按市场价签 3 年租约;通讯里的 67 倍与利润测算按自购口径,租约口径下另有一组对比。P90 交互性则是单个回答的流式速度,取 P90 逐 token 延迟的倒数。
本次测试的工作负载是 DeepSeek V4 Pro 1.6T:通讯称其体量足以充当 1~3 万亿参数级模型的代理,且以 MIT 许可证发布、没有模型授权费;相关图表标注的更新时间为 2026 年 9 月 10 日。测试对象 Rubin 是 Nvidia 的下一代平台,通讯的描述是「首个为智能体时代跨六款产品协同设计」,包括 Rubin GPU、Vera CPU、NVLink 6 Switch、ConnectX-9、BlueField-4 与 Spectrum-6。
高交互性端点与 1.4~3 倍的现实区间
67 倍出现在曲线的高交互性端点。通讯写明的条件是:170 TPS、同样使用 TRTLLM 推理栈与 NVFP4 Dense 格式的「同口径」对比、按自购成本假设,Vera Rubin NVL72 每 1 美元 TCO 的总吞吐量约为 GB300(Dynamo TRTLLM 配置)的 67 倍;图表上该点的标注为 67.4x。
但在通讯认为「多数服务商实际会落位」的 60~100 TPS 区间,优势缩小到 1.4~3 倍(对比最新的 GB300 TRTLLM 配置)。交互性上限方面,Vera Rubin 的最高 P90 交互性为 276.24 TPS,比 GB300 Dynamo TRTLLM 的 171.53 高约 61%;不过 GB300 一旦换用开源 SGLang 栈,也能达到与 Vera Rubin 相近的交互性。
通讯因此提醒:引用高交互性段的倍数,必须写明对比的推理引擎。同在 170 TPS 这一点上,按每兆瓦吞吐量计,对手是 GB300 TRTLLM 时倍数为 62.9 倍,换成 GB300 SGLang 就降到 5.56 倍。软件前提同样要紧:这是预发布(pre-release)的早期 TRTLLM 版本,通讯预计性能只会更好;图表也自带「官方预览(Official Preview):结果可能随验证与发布进展继续变化」的标注。
换个口径:租约、单机 B300 与 H200
在另外几档成本与对手下,倍数各不相同。按 3 年租约价(2026 年 7 月,Rubin 每芯片每小时的租金超过 8.5 美元,Blackwell Ultra NVL72 为 5 美元),在 80 TPS 时,同样的租约成本可多产出 62% 的 token;在高交互性段,按同一租约成本口径最高可达 16 倍。
按自购口径、80 TPS 目标,每美元可服务的 token 是单机 B300 的 10 倍;对比 H200,每美元 token 数的优势在 80 TPS 时为 18 倍,120 TPS 时扩大到 39 倍。通讯的形容是,在智能体负载上 Rubin 让 H200「和 TI-84 计算器差不多能打」。
P90 端到端时延上,每 1 美元产出 6,000 万 token 时,Vera Rubin 约为 20 秒,运行最新 vLLM 栈的 B200/B300 约为 60 秒;产出提高到每 1 美元 1.6 亿 token 时,差距拉大到约 6 倍,即 20 秒对 120 秒。
每 GW 年收入与利润:1,595 亿美元对 1,149 亿美元
把吞吐量换算成钱,通讯给出了一组建模结果:在 75 TPS 交互性、60% 利用率、无模型授权费的假设下,每 1 GW 电力对应的年收入为 1,595 亿美元、年建模利润为 1,499 亿美元;对照参数中表现最好的 GB300 配置(Dynamo SGLang)分别为 1,149 亿美元与 1,053 亿美元。同样的电力额度下,收入多约 39%,利润多约 42%。
绝对差额是每 GW 每年多出约 446 亿美元建模利润;按 10 MW 线性折算,约合每年 4.46 亿美元。因为两套配置的每 GW 成本接近,增量收入大部分落到利润上。这个优势也留下降价空间:在负载与计费利用率不变的前提下,Vera Rubin 可把缓存输入、非缓存输入与输出三类 token 的价格整体下调约 28%,仍能拿到与 GB300 Dynamo SGLang 相同的每 GW 收入,运营商可以留作利润,也可以用于价格竞争。
这套测算把电力当作计价单位,通讯的逻辑是:有电的数据中心常是部署瓶颈,每 GW 能产出的 token 越多,每 GW 的收入和利润就越高;它同时提到 Rubin 集成了动态功率调度机制 DSX MaxLPS,数据中心可以按实际推理负载的功率画像安排电力,而不必按最大 TDP(热设计功耗)再加 10~20% 余量来配置,从而在同一电力额度内容纳更多 GPU。
SemiAnalysis 称 Jensen 在 GTC「低报」性能
通讯所说的「低报」,指的是 Jensen 在 GTC 2026 上展示的一张图表。按通讯的描述,该图显示 Vera Rubin NVL72 在 1~3 万亿参数模型、约 200 TPS 时,每兆瓦性能是 Blackwell 的 3 倍;而 SemiAnalysis 称,其在预发布软件上实测到的每兆瓦 token 吞吐量优势最高已达 7 倍。通讯写道:「Jensen 需要在 GTC 停止低报自己的性能宣称。」通讯还提到 GTC 2024:当时 Jensen 称 GB200 NVL72 将达到 Hopper 的 30 倍性能,而按 SemiAnalysis 的测试是 98 倍。
这些指控与背书都出自 SemiAnalysis 自己的文本。按通讯的说法,其基准「已被几乎每一家主要算力买家复现、验证或支持」:从 Google Cloud、微软 Azure、Oracle 到 Meta,还有 vLLM、LMCache、SGLang、PyTorch、Hugging Face 等社区项目与 OpenAI、MiniMax、ZAI、Qwen、Moonshot Kimi 等实验室。它的买卖建议也直白:「如果你买得起或租得起一台 Vera Rubin NVL72,就该买」;文中还引用了一句被通讯归给 Jensen 的话:「买得越多,赚得越多」。
两种口径:总体结论与 75 TPS 细算
这两种口径的对比对象不同:开篇的「2 倍以上」对比的是「Blackwell 平台」;75 TPS 场景的细算对比的是 GB300 最强配置(Dynamo SGLang)。
通讯预告的下一项测算,是每代 Nvidia 芯片全生命周期的总收入。