AREX Feed Article
NVIDIA 公布 Vera Rubin 首次上硅实测:每兆瓦吞吐最高提升 30 倍、token 成本最高降 35 倍
NVIDIA 官方 X 账号 8 月 24 日公布 Vera Rubin NVL72 首次片上(on-silicon)实测性能:在 SemiAnalysis 的 AgentX 工作负载上以 DeepSeek V4 Pro 模型测量,每兆瓦吞吐量最高较 GB300 NVL72 提升 30 倍,每百万 token 成本最高降低 35 倍。官方同步发布的给出同样口径的详细数据与两张实测图表,图表脚注均标明"非官方结果,待 SemiAnalysis 审核(Unofficial Results. Pending SemiAnalysis Review)"。
强调这是"首次在真实硅片上测得的 Vera Rubin 性能,测量方式与 agent 实际运行一致":agentic 会话与聊天或摘要工作负载不同,上下文在数百个步骤中持续累积,最高可达数十万 token。这些数字全部来自 NVIDIA 自测自报,尚未经 SemiAnalysis 独立审核。
30 倍与 35 倍:两张图里的两个数字
配套博客《》发布于 UTC 时间 8 月 24 日 15:00,官方账号约两分钟后发推。第一张图展示每兆瓦吞吐量(TPS/MW)随交互度(TPS/User)的变化:金色曲线(Vera Rubin NVL72)全程位于白色曲线(GB300 NVL72)上方,图上标注 2x、10x、30x 三档增益,GB300 的曲线在交互度升高后明显下坠,两条曲线在高交互度端拉开到 30 倍。
第二张图对比每百万 token 成本($/M Tokens):相同交互度下,Vera Rubin 的成本曲线整体更低,图上标注"35x Lower"。博客点明这套指标对 AI 工厂意味着什么:电力受限时,每兆瓦吞吐量决定工厂收入,每百万 token 成本决定这份收入上的利润率。
为什么用 AgentX:测的是 agent 真实怎么跑
这次对比没有用聊天或摘要基准。 是 SemiAnalysis 旗下 InferenceX 项目的开源 agentic 编码基准,回放真实编码 agent 会话的轨迹,保留上下文增长、工具调用和子 agent 派生。博客称其由"录制的真实世界 agentic 编码会话"构成。
AgentX v1.0 数据集来自 393 条用户主动贡献的 Claude Code 会话:单请求输入 token 中位数约 142k,44% 的会话包含子 agent,完整版回放集包含最长 1M token 的上下文。博客指出,聊天或摘要的输入输出序列通常只有 1K 到 8K token,两者形态完全不同。
用量差异更大:博客援引 OpenRouter 数据称,agentic 工作负载的 token 消耗是简单聊天请求的 15 倍。每次推理请求的上下文都在变长,长上下文处理因此成为 agentic 推理的核心,这也解释了为什么 NVIDIA 把"agent 真实怎么跑"当作这次测量的前提。
30 倍从哪里来:极端协同设计,以及尚未计入的部分
博客把增益归因于"极端协同设计"(extreme codesign):解耦式 serving 让 prefill 和 decode 各自独立扩展,rate matching 同步两者的产 token 速度,大规模 expert parallelism 把 MoE 模型的专家子网络分布到整个 scale-up 域,分布式 KV-cache 与 KV-aware routing 让长会话的已处理上下文不必重复计算,MegaMoE 等融合 CUDA kernel 把计算与通信合并为一次执行。
硬件侧是第五代 Tensor Core 与第三代 Transformer Engine,NVFP4 量化把权重压到 4-bit;NVL72 的 72-GPU scale-up 域配合第六代 NVLink,包速率是普通以太网的 10 倍、延迟为其三分之一。博客还称 NVIDIA DSX MaxLPS 电源管理可在同一兆瓦预算内多部署最多 40% 的 GPU。
博客同时给出两条边界。其一,这些是早期结果,"目前待 SemiAnalysis 审核",图表脚注亦写明非官方结果;其二,数字尚未计入 Vera CPU 在工具调用(tool calling)上的表现——而工具调用正是 agentic 编码轨迹的主要环节。NVIDIA 称随着软件持续优化,Vera Rubin 和 GB300 两代平台的成绩都会继续提升。
对比链条在博客中也有交代:GB300 NVL72 在 DeepSeek V4 Pro 上较 Hopper 架构每兆瓦吞吐最高提升 15 倍,Vera Rubin 在这条曲线上再往前推了 30 倍。
从 CES 官宣到量产实测:八个月的曲线
Vera Rubin 平台于今年 1 月 5 日在 CES 2026 上由 NVIDIA CEO 黄仁勋正式发布。据 ,黄仁勋在主题演讲中称"Vera Rubin 已全面投产",并公布 Rubin GPU 50 PFLOPS NVFP4 推理性能(Blackwell 的 5 倍)、22 TB/s HBM4 带宽等规格。
7 月 21 日,NVIDIA 宣布 Vera Rubin 进入量产爬坡,机架已在 CoreWeave、Google Cloud、Microsoft Azure、OCI 和 Nebius 运行。称 CoreWeave 在 DeepSeek-R1 上测得每兆瓦 token 吞吐较 Grace Blackwell NVL72 提升 10 倍;Vera Rubin NVL72 较 GB200 NVL72 每兆瓦 token 数最高提升 10 倍、每百万 token 成本降至十分之一。
两天后,:工程样品上 DeepSeek R1 较 GB200 NVL72 每兆瓦性能为 5.4 倍、每美元性能为 5 倍;文中写明"早期指标来自 CoreWeave,我们尚未独立验证",并称 NVIDIA 已承诺在 2026 年 Q3 前向 InferenceX 提交可验证数字。8 月 24 日的这次公布,是 NVIDIA 第一次给出自己测得的上硅结果,对比对象也换成了 GB300 NVL72。
自报数字待审:社区的两类读法
数字发布后,社区反应分成两类。伦敦 在引用推文中表示:"考虑到 FLOP/W 和内存带宽/W 大约提升 1.7 倍,我原本预期峰值 TPS/MW 会更高。"另一类看法盯住脚注:用户 评论称"图表底部有'待审核'星号,所以这是预告片,不是正片";用户 则指出 GB300 曲线在 150 TPS/User 之后断崖式下坠,"关于旧芯片的信息和关于新芯片的一样多"。
未落地的验证还在后面:SemiAnalysis 尚未审核这批结果,NVIDIA 承诺的 InferenceX 可验证提交尚未到期,Vera CPU 对工具调用的贡献也未计入。在第三方复核完成之前,30 倍与 35 倍仍是 NVIDIA 自报的上限数字。