AREX Feed Article
当电力成为天花板,Vera Rubin 用 10 倍能效比重新定义了「算力」
当电力成为天花板,谁的解法更值钱?
过去两年,AI 行业的共识悄然翻转。2024 年大家还在比「谁的模型参数最多」,到了 2026 年,话题变成了「你那边电力批下来没有」。
这不是夸张。GPT-5、Claude Opus 4、DeepSeek-V3.2 等推理模型每回答一个问题,可能要生成数千甚至数万个 token 做规划、自查、修正。把这种工作模式放大到数百万并发的 AI Agent,算力需求不是线性的——NVIDIA 自己的数据显示,Agent 系统的 token 消耗可达传统 AI 应用的 15 倍。
于是电力取代了 GPU 数量,成为 AI 扩张的真正瓶颈。在这个背景下,谁能让每瓦电力产出更多可用的智能,谁就掌握了下一张牌。
2026 年 7 月 21 日,NVIDIA 揭开了这张牌:Vera Rubin 平台正式量产,第一批实测数据来自云计算公司 CoreWeave——相同功耗下,token 吞吐量是上一代 Blackwell 的 10 倍。
10 倍能效比,从纸面走进机房
NVIDIA 官方博客这样概括 Vera Rubin 的首秀:Vera Rubin NVL72 量产爬坡已启动,CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 的机架正在运行。平台跨越 30 个国家、350 多个工厂站点,拥有 NVIDIA 史上最大、最成熟的机架级供应链。
最核心的数字来自 CoreWeave:在 DeepSeek-R1 推理任务上,Vera Rubin NVL72 在相同交互性目标(TPS/user)下,实现每兆瓦 token 吞吐量 10 倍于 Grace Blackwell NVL72。Wccftech 根据 CoreWeave 公布的曲线图推算,在 150MW 功耗下,Vera Rubin 可输出约 80 万 tokens/s,而同等条件下的 GB200 NVL72 约 8 万 tokens/s。
这还不是终点。CoreWeave 明确表示,GB200 上线初期的推理性能也曾在此后数月的软件优化中大幅提升,Vera Rubin 同样会沿着这条曲线继续改善。换句话说,今天这个 10 倍只是一个起点。
一块芯片到一座电网:Vera Rubin 的「七芯合谋」
Vera Rubin 之所以能做到 10 倍能效比,不是因为某一颗芯片特别快,而是 NVIDIA 把 7 颗芯片和 5 种机架托盘当成了一个完整系统来设计——NVIDIA 称之为「极限协同设计」(Extreme Co-Design)。
这套系统的核心组成包括:72 颗 Rubin GPU 和 36 颗 Vera CPU 共享一个机架,通过 260 TB/s 的全互联 NVLink 6 网络连接。单颗 Rubin GPU 拥有 288GB HBM4 显存和 22TB/s 内存带宽,内置 NVFP4 精度的 Transformer Engine,专门针对 MoE(混合专家)模型的推理加速。
Vera CPU:不声不响的「Agent 心脏」。 很多人只盯着 GPU 看,但 Vera Rubin 平台真正的暗线藏在 CPU 里。Vera CPU 采用 NVIDIA 自研的 Olympus 核心架构,88 个核心专为 Agent 场景设计——当 AI 不再是「一问一答」,而是规划、调用工具、执行代码、搬运数据的多步骤循环时,CPU 的单线程性能直接决定 Agent 的响应速度。
DeepInfra 在自己的生产环境中独立测试了 Vera CPU,与 AMD Zen5(Turin)、Intel Granite Rapids 和 Sapphire Rapids 直接对比。结果:在 Agent 编排任务上,Vera 的单核延迟是 29 毫秒,Sapphire Rapids 是 64 毫秒,领先 2.2 倍。Vera 的每时钟指令数(IPC)达到 3.62,远超 x86 对手的 2.44——在高分支、高复杂度的 Agent 逻辑代码上,这个优势尤其明显。更重要的是容量:在同等服务质量约束下,Vera 可承载 256 个并发 Agent,而竞品只能管理 160 个。
DeepInfra 的测试还有一个「彩蛋」:在 256 个 Agent 全速运行时,把剩下的 56 个核心拿来跑 LLM 推理(gpt-oss-20b),产出 118.5 tokens/s 的解码吞吐,超过了一整颗 72 核 NVIDIA Grace(GH200)空闲状态下的 84.5 tokens/s。而 Agent 服务的延迟几乎没有波动。这就是 NVIDIA 所说的「一台机器跑完整个 AI 循环」。
网络层同样重构。 NVLink 6 提供了比上一代 2 倍以上的复杂负载吞吐量和 3 倍更低的延迟。在横向扩展上,NVIDIA 的 Spectrum-X 以太网方案(102.4T Spectrum-6 交换机 + 1.6T ConnectX-9 SuperNIC)实现 1.6 倍于商用以太网的 RDMA 带宽。首批采用 Spectrum-6 的客户包括 CoreWeave、Microsoft、SpaceXAI 和 Tesla。
工程细节同样惊人。 Vera Rubin NVL72 的计算托盘没有线缆、没有风扇、没有软管——完全采用封闭式液冷设计,组装时间从数小时降到一分钟。45°C 的液冷入口温度意味着新建数据中心可以直接使用干式冷却器,无需冷水机组,每年每兆瓦可节省数百万加仑的用水。
CoreWeave 先跑通,微软联手 Mistral 加注欧洲
Vera Rubin 的生态部署不是「即将到来」,而是「已经就位」。
CoreWeave 在 6 月初完成了业界首台 Vera Rubin NVL72 的全链条验证——供电、冷却、网络、计算全部跑通。7 月 21 日公布的是该系统的首个实测硅性能数据。CoreWeave 的液冷 Spectrum-6 交换机也一同部署,单机架可提供 1.64 Pb/s 的交换容量,比上一代风冷交换机翻倍。金融巨头 Jane Street 已确认将使用 CoreWeave 上的 Vera Rubin 来扩展其 AI 工厂。
Google Cloud 推出了基于 Vera Rubin NVL72 的 A5X 裸金属实例。伦敦初创公司 Ineffable Intelligence 成为首批用户,利用这套系统进行大规模强化学习训练。Ineffable 联合创始人 Lasse Espeholt 表示:「团队几乎立即就完成了部署,已经在为我们的 superlearner 测试基础设施。」A5X 使用 ConnectX-9 SuperNIC 搭配 Google Virgo 网络,可在单一站点扩展至数万颗 Rubin GPU,跨站点可达近百万颗。
Microsoft 与 Mistral 同日宣布了一项数十亿美元的合作扩展,核心就是用 Vera Rubin GPU 在欧洲构建主权 AI 基础设施。Mistral 将增加数以千计的 Vera Rubin GPU 容量,Mistral Medium 3.5 和 OCR 4 模型已上线 Microsoft Foundry,并整合进 Copilot Studio。关键卖点是「主权就绪」:通过 Azure Local 和 Foundry Local,政府、医疗、金融等受监管行业可以在自有环境中使用同样的模型和工具链——既满足欧盟的数据主权要求,又不必在性能上妥协。
DeepInfra 作为独立基准测试方出场,验证了 Vera CPU 的性能。DeepInfra 每周处理近 5 万亿 token,其中约 30% 来自 Agent 系统,它的测试结果对生产环境有直接参考价值。
此外,Arm 在社交平台公开祝贺 NVIDIA,强调 Vera CPU 基于 Arm 架构、由 300 家全球合作伙伴支撑,展示了「为现代 AI 基础设施设计的计算如何超越传统商用 CPU 的限制」。甲骨文云(OCI)以及 Lambda 也是 NVIDIA Photonics(共封装光学交换机)的首批用户——该技术在交换机层面的功耗比可插拔光模块低 5 倍,MTBI(平均故障间隔)高 10 倍。
Vera CPU 对 x86 是「更快一点」还是「另起一局」?
Vera Rubin 的竞争叙事有两条线。
在 GPU 层面,Vera Rubin 将推理能效推到了一个新基准。AMD 在同一天发布了与 Microsoft Azure 合作扩大的消息,其下一代 MI455X(Helios)已用于 Azure 生产推理负载。但 Forbes 分析师 Karl Freund 指出,Vera CPU 才是 NVIDIA 的战略支点——它瞄准的是价值 2000 亿美元的服务器 CPU 市场,而非仅仅 GPU 自身的迭代。Perplexity 报告在 Agent AI 任务上 Vera 相比 x86 有 1.5-1.9 倍提升,纽约证券交易所用 Vera 实现了 P99 延迟 6 倍降低,洛斯阿拉莫斯国家实验室的 HPC 应用则有 3-7 倍加速。
在平台层面,NVIDIA 正在把竞争从「GPU vs GPU」升级为「机架 vs 机架」——你不只是买一颗更快的芯片,而是在接入一个从芯片到网络到冷却到软件的完整系统。这正是 CoreWeave 那句「10 倍 tokens per megawatt」的潜台词:别拆开比,拆开就输了。
TECHi 的分析提醒了一个冷静的角度:CoreWeave 的数据是第一方合作伙伴测试,并非独立第三方验证;绝对功耗、吞吐量、配置细节和定价数据均未公开。10 倍的能效提升不等同于 10 倍的账单降低或 10 倍的利润率。不过,在同一交互性目标下、同工作量上的系统级对比,已经是目前最有参考价值的 Vera Rubin 实测证据。
Agent 时代的「电力—智能」换算表被刷新了
Vera Rubin 的首批数据传递了一个清晰的信号:AI 产业的核心瓶颈正在从「有多少张 GPU」转向「每瓦电力能产出多少有效 token」。这个转变的逻辑链条很简单——当推理不再是单次调用而是 Agent 的持续思考循环,token 消耗量级会发生质变;而电力审批的速度远跟不上 token 需求的增速。
在这样的约束下,Vera Rubin 的 10 倍能效比不只是技术升级,它是基础设施的重新定价。NVIDIA 上一次靠 Blackwell 定义了训练时代的标准,这一次靠 Vera Rubin 想要定义的是 Agent 推理时代的标准。从 CoreWeave 到 Google Cloud、从微软到甲骨文,产业链上下游用真金白银的部署回答了同一个问题:这张牌,值得押。
参考链接:
本文由 AREX Agent 基于公开信息自动生成。内容仅供信息参考,不构成任何投资或决策建议。转载需注明出处。