AREX Feed Article
AMD 大会前夜,Nvidia 甩出 10 倍能效王炸:Vera Rubin 全面量产,token 成本砍到十分之一
800,000 tokens per second。Blackwell 才 80,000。
7 月 21 日,Nvidia 正式宣布下一代 AI 平台 Vera Rubin 进入全面量产,首批系统已在 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud 上运行。Nvidia 副总裁 Ian Buck 在加州总部简报会上直言不讳:"我们现在绝对处于全面量产状态。所有主要客户都在部署这些系统。"
CoreWeave 跑了实测。同一个 DeepSeek-R1 模型,Vera Rubin NVL72 每兆瓦吞吐量是 Grace Blackwell NVL72 的 10 倍——800,000 tokens/秒 vs 80,000 tokens/秒,功耗同为 150 兆瓦。CoreWeave 在 X 上贴出结果时写了一句:"No projections. Real results from live hardware." 不是预测,是真硅跑出来的。
同一天,Nvidia 供应商纬创(Wistron)在德州 Fort Worth 为其首座美国工厂揭幕——投资 7 亿美元,324,000 平方英尺,已经量产 GB300 超芯,下一步产线将切换到 Vera Rubin Superchip。
三条消息在同一天砸下来,而 AMD 的年度产品大会就在 72 小时后。
「不是 benchmark 分数变了,是 AI 工厂的计量单位变了」
Nvidia 的官宣推文拿了 4,029 个赞、353 次转发和 133 万次浏览。CoreWeave 的首测推文也收获了 896 个赞和 42.8 万次浏览。但真正让这条新闻出圈的,既不是点赞数也不是浏览数。
金融圈率先炸了锅。Nvidia 高级副总裁 Andrew Bell 披露,Vera Rubin 供应链遍及全球 30 个国家、350 余座工厂,理论最大产能可达每天 1,000 个机柜。按每个机柜 700 万到 800 万美元的定价计算,这意味着单季度潜在营收超 6,300 亿美元。Bell 随后补充,这个数字是"愿景性的,不是运营性的"——但市场的算术已经做完了。
X 上争论的焦点是杰文斯悖论。用户 @bojan_ai 写道:"10 倍 token/兆瓦不会减轻电网压力,只会让电网更紧。在弹性市场中,效率提升带来的需求扩张是超比例的。瓶颈仍然是能源,不是芯片。" 而 Flexport 创始人兼 CEO Ryan Petersen 只回了两个字:"Thank you."
这不只是两个单词。Petersen 的简短回应背后,是所有 AI 基础设施买家正在面对的现实:电力是新的稀缺品,谁能从每兆瓦榨出更多 token,谁就能在 AI 竞赛中活得更久。
两周前 Kimi K3 差点砸了芯片股。现在 Nvidia 用一块真硅证明:效率越高,算力越不够用
7 月初,中国 AI 公司月之暗面发布 Kimi K3 模型——2.8 万亿参数,100 万 token 上下文窗口,896 个专家网络,KV-cache 需求削减 75%。消息一出,费城半导体指数从 6 月高点暴跌超 20%,市场开始认真讨论一个假设:模型越来越高效,是不是意味着不需要那么多芯片了?
黄仁勋在中国国际供应链博览会上称中国 AI 模型"世界一流",同时反对禁止中国开源模型,但坚持对 Blackwell 和 Rubin 等硬件的出口限制。他话里的潜台词很清楚:高效模型不会消灭芯片需求,只会让它换个形式增长——这就是杰文斯悖论在 AI 时代的重演。
7 月 21 日,Nvidia 给出的答案是 Vera Rubin。同一天,纬创德州工厂开工,第一家在美国本土量产 Nvidia 超芯的工厂正式运转,雇佣超过 500 名工人,年底前将扩至 1,000 人。董事长林宪铭在现场说:"AI 时代的速度压力也是一种责任。我们不只要建得快,还要建得对。"
在 AMD 年度产品大会前一天亮出这张底牌,Nvidia 的节奏不是巧合。WIRED 直接点明:Nvidia 就是在 AMD 活动前"造势"。
一个机柜塞进七颗自研芯片,Nvidia 想通了一件事:AI 工厂不需要组装,需要出厂即用
Vera Rubin NVL72 不是一张 GPU 加速卡配一颗 CPU。它是把七颗芯片塞进五层机柜托盘的一体化系统——
第一,10 倍 token/兆瓦的真实来源。
DeepSeek-R1 使用混合专家(MoE)架构,每生成一个 token 都需要跨 GPU 的 all-to-all 通信。Blackwell 时代,网络带宽是瓶颈。Vera Rubin 的 NVLink 6 提供了 260 TB/s 的全互联带宽,让整个机柜像一个统一加速器运行。同时,Spectrum-6 交换机单芯片 102.4 Tb/s,CoreWeave 部署的 SN6600-LD 液冷交换机每机柜 1.64 Pb/s,容量比上一代风冷交换机翻倍,且 spine-leaf 无超额订阅。带宽瓶颈消除后,GPU 不再空等,这解释了 10 倍提升中的关键部分。
第二,Vera CPU 把 x86 拖进了它的主场。
Vera CPU 首次搭载 Nvidia 自研 Olympus 核心——88 核、176 线程、1.2 TB/s LPDDR5X 内存带宽。Nvidia 宣称单线程性能是竞品 chiplet 设计的 2 倍,核间带宽 3 倍,内存延迟降低 40%。云平台 DeepInfra 的独立基准测试显示:AI agent 编排速度提升 2.2 倍,同服务质量下支持 1.6 倍并发 agent。Wolfe Research 估算单颗 Vera CPU 均价约 $5,000,年内出货约 130 万颗。
第三,从几小时到一分钟的装配革命。
Vera Rubin NVL72 的计算托盘内部无电缆、无风扇、无软管,机器人辅助装配将上线时间从数小时压缩到一分钟。45°C 进水温度的液冷设计支持无冷水机干式冷却——Nvidia 估算,对新建 AI 工厂而言,每年每兆瓦可节省数百万加仑水。
Spectrum-6 同时进入量产,早期客户包括 CoreWeave、Microsoft、SpaceXAI 和 Tesla。Nvidia 有史以来第一次登顶全球数据中心以太网交换机收入榜首,直插 Broadcom 和 Cisco 的核心领地。
从 $5M 一台 Blackwell 到 $8M 一台 Rubin,Nvidia 赌的是客户会为「整座 AI 工厂」付钱
此前,AI 基础设施的竞争围绕一个简单问题展开:谁有更多 GPU?
Blackwell NVL72 定价约 500 万美元一台。客户把机柜买回去,自己搞定网络、冷却和软件栈。AMD 的 MI400 系列以性价比为卖点,不断蚕食顾虑成本的客户。Intel 在 CPU 端仍然是默认选项。
Vera Rubin 改写了一切。单价涨到 700-800 万美元,但 Nvidia 的报价不再是"一台装满 GPU 的机柜",而是一座出厂即用的 AI 工厂——CPU、GPU、NVLink 6、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 交换机、液冷系统全部预集成。Nvidia 声称,相比 GB200 NVL72,每百万 token 成本降至十分之一。
这桩生意的逻辑变了。客户不再对比 GPU 核心数,而是对比 token/兆瓦和 token/美元。
转折不止于产品定价。纬创德州工厂意味着 Nvidia 超芯首次在美国本土下线。同一天披露的 SEC 文件显示 Nvidia 持有 AI 云服务商 Nebius 9.3% 股份(源于一笔 20 亿美元投资),加上此前对 OpenAI(300 亿美元)、Anthropic(最高 100 亿美元)、CoreWeave 和 Marvell 的布局——Nvidia 已经不只是卖铲子的人,它正在买下整座矿。
OpenAI 计划 Q3 开始大规模部署 Vera Rubin。Anthropic 和 SpaceXAI 已经在测试系统。Mistral 与 Microsoft 联手,用数万颗 Vera Rubin GPU 在欧洲构建主权 AI 基础设施。Wolfe Research 指出:"Nvidia 正在从 GPU 供应商蜕变为一个垂直整合的 AI 基础设施巨头。"
这不只是换了一代 GPU。这是 AI 竞争换了跑道。
Vera Rubin 全面量产的意义不在 10 倍这个数字本身。特定模型、特定配置下的 benchmark 不能直接折算成商业回报。
它的真正信号藏在 Nvidia 选择的主打指标里。不是 TFLOPS,不是 GB/s,不是晶体管数量——是 token per megawatt。当全球 AI 数据中心的电力审批周期拉到数年,当新建一座变电站比新建一座机房更慢,最稀缺的资源已经不是硅。
Nvidia 赌的是:谁能在同一度电里产出更多智能,谁就拥有了下一张牌桌的入场券。现在,这张入场券握在它自己手里。
Sources: Nvidia Blog (July 21), CoreWeave X/Twitter (@CoreWeave), Nvidia X/Twitter (@nvidia), Reuters, WIRED, The Next Web, Breachroad, BigGo Finance, ChosunBiz, moomoo Community