AREX Feed Article
NVIDIA 存储 VP 称 Vera CPU 提速约 3 倍,优势正从 GPU 转向整机
《Nvidia's AI advantage is moving beyond the GPU》给出一个新判断:NVIDIA 的竞争优势正从 GPU 单点性能,转移到整机系统与数据编排层。文章里最具体的数字来自 NVIDIA 存储技术副总裁 Jason Hardy,他称 Vera CPU 让数据编排相关操作实现约 3 倍改进("upwards of 3x improvement"),并称这让闪存能发挥全部性能而不成为瓶颈。这是厂商自述口径,3x 未经独立验证。
文章由 TechCrunch AI 编辑 Russell Brandom 撰写,基于过去一周与 NVIDIA 人士的交谈,以及公司周三(8 月 26 日)财报后的市场变化。正在铺开的 Vera Rubin 架构把 Rubin GPU 与 Vera CPU、Groq 3 LPX 推理加速器以及存储、网络机架组合在一起。作者的比喻是:"如果 GPU 是引擎,这些就是车的其余部分。"
「3x」发生在 GPU 之外:数据怎么按时送到
Hardy 解释 Vera CPU 的定位时说:"Vera 之所以重要,是因为单个服务器或任何计算平台能放的内存就那么多。"数据中心堆算力的同时,内存容量也在同步增长,文章点名称这正是美光等公司在第二轮基建浪潮中赚钱的原因。难点在于把数据"在正确的时间"送到 GPU。随着各家把 tokens-per-watt(每瓦产出 token 数)越压越低,这种调度越来越关键。
"我们在这些操作上看到了约 3 倍的改进,Vera CPU 在其中起到加速作用,"Hardy 对 TechCrunch 说,"所以现在我们可以把闪存用到极致,因为全部性能都能发挥出来而不会遇到瓶颈。"
Vera CPU 之外,机架里其他单元同样高度专门化:它们不吞吐 token,而是保证 GPU 之外的一切尽可能高效运转。
机架名单:Rubin GPU、Vera CPU,还有 Groq 3 LPX
文中列出的组合包括 Rubin GPU、Vera CPU、Groq 3 LPX inference accelerator,以及同类的存储与网络机架。TechCrunch 把 Groq 3 LPX 写进 NVIDIA 的机架名单,这一表述与 一致:官网将 Groq 3 LPX 定义为"面向 NVIDIA Vera Rubin 的交互式 AI 推理加速器",与 Rubin GPU 协同设计,把 GPU 的高带宽内存与 LPU(官网称其为 Groq 语言处理单元的下一代)的 SRAM 结合,每个 LPX 机架装 256 颗互连的 LPU。
对 NVIDIA 来说,这套布局的逻辑是:GPU 单点之外,还有一整层"让整个系统高效运转"的生意。作者称,与 NVIDIA 人士交谈的结果"有些意外"——这些单元的专门化程度与 Rubin GPU 本身不相上下。
财报周之后,市场开始重讲 NVIDIA 的故事
文章先交代了旧叙事:AI 热潮头几年,NVIDIA 是先进 GPU 的唯一来源,市值从 2023 年初到 2025 年年中增长约 10 倍;近一年,亚马逊、Google 等超大规模云厂商开始自研芯片,NVIDIA 不再是唯一选择,股价进入更平缓的轨道,投资者普遍在问优势还能撑多久。文章承认旧叙事"大体属实",但认为周三财报之后,一种新叙事正在形成。
关键在规模:AI 算力走向吉瓦(gigawatt)级,把超大规模数据中心维持在高效率运转变得极其困难,部署越大越快,难度只会更高,"算力是商品"的说法并不成立。编排恰恰是 NVIDIA 已经建了大量最先进硬件的环节,这是 GPU 竞争加剧时它仍然握着的优势来源。
OpenAI 的 Jalapeño:同一道坎,另一条路
同样的数据搬移问题也存在于 NVIDIA 之外。文章引用 说,OpenAI 的选择是干脆少搬数据:"我们设计 Jalapeño 就是为了尽量减少数据搬移和通信延迟……它的大域(large domain)让整个工作负载留在一个互联系统内,最小化数据搬移,让完整请求从头到尾保持快速高效。"
Jalapeño 是 OpenAI 首款自研推理芯片。OpenAI 自报的基准结果是:在 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T 三款公开模型上,每瓦完成的 AI 工作量比对比系统高 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍,计划年底前部署进自有算力。
TechCrunch 的点评是:路线不同,它用单芯片内完成工作负载来绕开数据搬移,但底层逻辑一致,都是靠更聪明的流量调度而不是堆处理器周期。这同时打开了一整层新的基础设施竞争。
3x 还没有独立验证,但竞争已经换了一层
两个数字的置信度要分开看:3x 是 NVIDIA 高管对 TechCrunch 的自述,Jalapeño 的数字来自 OpenAI 自家博客,均属厂商口径,没有第三方验证。文章也提醒,数据编排这个新焦点"不自动等于 NVIDIA 的胜利"——它仍要和其他芯片厂商与超大规模云厂商竞争,只是战场换了:在这个新层面,造一颗能抗衡的 GPU,不如让整个系统高效运转。
文章的最后判断是:至少在早期阶段,NVIDIA 看起来握有明显领先。这个判断目前建立在厂商给出的数字上,3x 到底站不站得住,要等第三方跑出数据。