AREX Feed Article
英伟达喊话行业:每瓦性能 GB300 是 Hopper 的 25 倍
7 月 14 日,NVIDIA 通过官方博客和推特发布了一篇技术檄文,直指 AI 基础设施竞赛的核心规则已经改变:电力,而非芯片产能,才是 AI 工厂的真正瓶颈。在 DeepSeek V4 Pro 上,GB300 NVL72 每瓦性能达到上一代 Hopper 的 25 倍。博客发布 24 小时内,推文获得 304 次点赞、近 5 万次浏览,引发投资圈和工程圈同时热议。
五句话读完这篇博客
- 25 倍:GB300 NVL72 在 DeepSeek V4 Pro 推理上,每瓦性能为 Hopper 的 25 倍;GLM5.1 上 20 倍,Kimi K2.6 上 10 倍。数据来源为 SemiAnalysis InferenceX。
- 60% 定律:典型 AI 工厂中,从电网拉进来的电只有约 60% 转化为有效 AI 工作,其余耗散在冷却和机架级损耗中。
- 40% 增量:NVIDIA DSX MaxLPS 电力管理软件通过实时功率调度、温水液冷和功率转向技术,在同一电力预算内可多塞进 40% 的 GPU。
- 软件月增 5 倍:仅在 DeepSeek V4 一个模型上,同一套硬件通过软件栈优化(TensorRT LLM、Dynamo、SGLang、vLLM),单月内每瓦性能提升了 5 倍。
- 已量产验证:Anthropic、OpenAI、SpaceXAI 已在 Blackwell NVL72 上跑推理;CoreWeave、Perplexity、Fireworks AI 等推理服务商也已部署。
电力成了新的硅
NVIDIA 这篇博客的标题直白到近乎挑衅——"Why Performance per Watt Is the Ultimate Metric for AI Infrastructure Efficiency"。文章署名 Shruti Koparkar,开篇第一句就是结论:"Power is AI infrastructure's inescapable constraint."
这个判断的背景是 AI 推理正在从"偶尔用一下"变成"持续烧钱"。Agentic AI 的兴起意味着每次用户查询背后是数十甚至数百次模型调用,Token 消耗量暴涨。在一个电力配额锁死的数据中心里,谁能从每一度电里挤出更多 Token,谁就决定了收入和利润的上限。
NVIDIA 给出的框架是:每瓦性能不是一个可以被刷分的 benchmark,它只取决于真实生产环境中的表现。这个说法显然在暗指那些拿单卡峰值 FLOPS 做文章的竞争对手——在 72 GPU 域规模的 MoE 推理场景下,单卡跑分和数据中心真实吞吐之间隔着巨大的鸿沟。
博客引用了 SemiAnalysis InferenceX 的三组数据,全部基于开源前沿模型在 GB300 NVL72 与 Hopper 代之间的对比:
- DeepSeek V4 Pro:每瓦性能提升最高 25 倍
- GLM5.1:每瓦性能提升最高 20 倍
- Kimi K2.6(专为长程 Agentic 任务设计):每瓦性能提升最高 10 倍
NVIDIA 特意强调这些数据使用了 Pareto 曲线而非单点对比——不同工作负载需要不同的操作点(有的优化延迟,有的优化吞吐和成本),用 Pareto 前沿来展示更有说服力。同时提供了 DynoSim 工具,让客户在花 GPU 时之前就能找到自己工作负载的最优点。
全栈协同设计为什么能垒这么高
博客花了大量篇幅解释一个概念:codesign(协同设计)。NVIDIA 想说的是,GB300 NVL72 的每瓦性能优势不是靠某一项黑科技砸出来的,而是从硅到软件的每一层都为推理吞吐做了定向优化,而且这些优化会叠加。
NVLink Switch 是最核心的一块拼图。Hopper 时代的 GPU 域是 8 卡,而 Blackwell 是 72 卡——域规模大了 9 倍。对于 MoE 模型推理,更大的 GPU 域意味着 expert 分布更均匀、跨卡通信开销更低。NVLink Switch 已经演进到第六代(Vera Rubin 将继续使用),NVIDIA 强调它不是从通用网络设备改造而来,而是为 AI 工作负载原生设计,支持 SHARP(在交换机内直接完成集合通信计算),从 GPU 上卸掉了一部分工作。
软件栈是另一个杠杆。NVIDIA 的推理软件组合——Dynamo 分布式推理框架和 TensorRT LLM——配合开源方案 SGLang 和 vLLM,支持 NVFP4 量化、分离式推理(disaggregated serving)、大规模 expert 并行、KV 感知路由和 KV cache 卸载。这些技术单独拿出来每一项也许只提升 20%-30%,但叠加起来的乘积效应是惊人的。最直观的例证来自博客中不起眼的一句话:在 DeepSeek V4 上,同一套硬件通过软件优化,单月内每瓦性能提升了 5 倍。
电力管理则直接触及数据中心的物理极限。NVIDIA 的 DSX MaxLPS 软件能在 GPU 和机架之间实时调度功率,支持温水液冷,并用"功率转向"(power steering)技术在电力预算不变的前提下挤出更多性能。NVIDIA 声称这能让运营商在同一电力配额下运行多达 40% 更多的 GPU——在水冷和功率调度做到极致之前,从电网到 GPU 的有效利用率只有约 60%。
谁在用?生产环境才是硬道理
博客的后半段转向客户举证,这是全篇最有说服力的部分。
Anthropic 和 OpenAI 两家最顶尖的 AI 实验室,已经在 Blackwell NVL72 上跑推理。SpaceXAI 也在名单中。这三个名字放在一起,意味着当前最强的基础模型——Claude、GPT 系列、以及 Elon Musk 旗下的 xAI 模型——底层跑的已经是 Blackwell 的机架。
推理服务商一侧,CoreWeave 在 GB300 NVL72 上部署了 Kimi K2.6,配合 NVFP4 量化和 EAGLE3 推测解码来最大化推理性能。Perplexity 在 GB200 NVL72 上跑 Qwen3 235B 和 Qwen3.5-397B-A17B,服务每日数百万次搜索查询,对延迟和可靠性的要求与消费级产品持平。Fireworks AI 在 Blackwell 上部署 GLM 5.2,客户包括 Cursor 和 Factory AI。
NVIDIA 把这个叫做"accumulated production experience"——机架级系统在单节点部署中遇不到的故障模式,只有在几个月的真实流量冲刷下才能积累起运维手册。博客的潜台词是:竞争对手就算纸面参数追上来,软件和运维层面的差距需要以年为单位追赶。
竞争对手不会坐等
NVIDIA 这篇博客发布的时间点很值得玩味。距离 GTC Berlin(10 月 20-22 日)还有三个月,届时 Vera Rubin 平台将正式亮相,新一轮每瓦性能的数字会再次刷新。
这本质上是一次"提前设定评分标准"的操作。如果行业接受"每瓦 Token 数"作为 AI 工厂的核心 KPI,那么 NVIDIA 全栈协同设计的优势就会在每一次代际更替中复利累积。从 Blackwell 到 Vera Rubin,从 NVLink Switch 第六代到第七代,这个飞轮很难被单点突破。
但挑战者并非没有。AMD 的 MI400 系列同样在追求推理场景的每瓦性能;Google 的 TPU v8 在自家生态内拥有软硬协同的自由度;AWS 的 Trainium 在 Anthropic 的 Claude 训练中已经证明了替代能力。更重要的是,博客中提到的所有基准测试都来自 NVIDIA 自己优化过的软件栈和 SemiAnalysis 的测试环境——在生产环境中由第三方独立复现的数据,才是真正的试金石。
另一个值得注意的张力来自软件本身。同一套硬件单月内每瓦性能提升 5 倍,这既是 NVIDIA 软件团队执行力的证明,也意味着今天的数字只是一个快速移动的快照。客户在做 Capex 决策时,需要判断的是"我买下这批 GB300 之后 18 个月的实际表现",而不是博客中今天的数字。
电决定一切的时代开始了
NVIDIA 这篇博客真正在说的,不是 GB300 比 Hopper 强了多少倍,而是 AI 基础设施的竞赛规则已经不可逆地变了。
过去十年,半导体行业围绕"摩尔定律"组织叙事——每 18 个月晶体管密度翻倍。过去三年,叙事变成了"Scaling Law"——模型越大越聪明。而现在,NVIDIA 想设定的新叙事是:电力是唯一不可谈判的约束条件,而全栈协同设计是突破这个约束的唯一路径。
如果这个叙事成立,那么 AI 芯片的竞争就不再是"谁的 FLOPS 更高",而是"谁的平台能从每一度电里榨出更多智能"。在这个维度上,垂直整合越深的玩家越占便宜。NVIDIA 不仅在做芯片,还在做互联、做冷却、做调度软件、做推理框架——它想把整个 AI 工厂变成一个端到端的"黑箱",客户只需要输入电力预算和 Token 需求。
博客最后一句意味深长:"This accumulated production experience, built across generations of frontier models and real-world deployments, is what gives NVIDIA Vera Rubin its head start." 翻译过来就是:等 Vera Rubin 出来的时候,差距只会更大。
参考链接:
转载声明:本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成投资建议。