AREX Feed Article
88 核、1.8 倍性能碾压 x86:NVIDIA Vera 如何让 Perplexity 押注"单线程至上"
GPU 是法拉利,CPU 是 2003 年的本田引擎?
过去两年,AI 行业的注意力几乎全部集中在 GPU 上。谁的集群更大、谁的 H100 更多、谁的 FLOPS 更高——这套叙事驱动了 NVIDIA 市值突破万亿美元。
x86 服务器 CPU 安静地躲在机柜角落里,做一个无人关心的配角。
但这个配角正在变成整个 Agentic AI 故事里最贵的瓶颈。
7 月 7 日,NVIDIA 官方博客发布了一篇题为《Why Max Single-Threaded CPU at Scale Matters》的技术长文,将今年 5 月在 GTC Taipei 发布的 Vera CPU 重新推到聚光灯下。这一次,NVIDIA 的逻辑不是"我们造了一颗更快的 CPU",而是"Agentic AI 的架构让 CPU 从配角变成了瓶颈"。
推文下方引发了激烈的社区讨论。一条高赞回复精准概括了情绪:"我们买了一堆法拉利,然后在前面装了一台 2003 年的本田引擎。"
另一位拥有 2.2 万粉丝的投资者说得更直白:"一仓库的 GPU 等一颗 CPU 核心——这是世界上最贵的交通堵塞。"
还有一位 CTO 从技术角度补充了深度观察:"单线程 CPU 速度比并行 GPU 吞吐量更重要——Agent 循环的瓶颈是编排,不是推理。大多数团队还在买更多 GPU 来修一个 CPU 问题。"
NVIDIA 用 Vera 给出了自己的回答。
Vera 的核心赌注:Agent 不是并行运算,而是一个接一个的串行循环
NVIDIA Vera 被定位为"大规模最高单线程性能 CPU"(Max Single-Threaded CPU at Scale),这是一个全新的 CPU 品类。它的设计假设很简单:AI Agent 的运行模式不是并行的,而是串行的。
一个典型的 Agent 循环是这样的:模型推理下一步 → CPU 执行工具调用 → 代码运行 → 数据查询 → 结果验证 → 模型再推理下一步。每一步都依赖上一步的结果。
这意味着,无论你买了多少 GPU,Agent 的每一步都必须等 CPU 先干完活。CPU 慢了,整个循环就慢了,昂贵的 GPU 就空转等结果。
NVIDIA 在博客中写道:"在 Agentic AI 时代,将有数十亿个 Agent,每一个都会转向 CPU 去执行、检查、检索、验证。在这个新市场里,完成的 Agent 工作就是产品。"
Vera 要回答的,就是这个问题。
从 Olympus 核心到 1.2TB/s 内存带宽:Vera 的工程取舍
Vera 的核心是 Olympus——NVIDIA 自研的 Arm v9.2 CPU 核,每时钟周期指令数(IPC)比上一代 Grace 提升了 50%。这个数字之所以关键,是因为 Agent 的大多数步骤是串行的:一次工具调用、一次代码执行、一次测试运行,都必须完成之后才能进入下一轮模型推理。
正如一位在推文中参与讨论的 Agent 系统开发者所说:"在我们交付的每一个 Agent 循环中,关键路径就是一条线程在等自己。单线程速度才是延迟的真正杠杆,而不是核心数。"
88 个 Olympus 核心通过 Spatial Multithreading 技术扩展为 176 线程,每个核心配备 2MB L2 缓存(比 Grace 翻倍),共享 164MB 的统一 L3 缓存。内存子系统走了一条与主流 x86 服务器 CPU 完全不同的路:LPDDR5X 内存提供高达 1.2TB/s 的带宽,功耗不到 40 瓦。整颗 CPU 的封装热设计功耗(TDP)为 450 瓦。
更关键的架构决策是单片设计(monolithic die)。NVIDIA 在博客中直言不讳地点名了"芯粒税"(chiplet tax)问题:当 CPU 厂商为降本而将芯片切分为多个芯粒时,每个核心不再能访问全部内存性能,单核性能在满载时反而下降。
Vera 的单片设计配合 3.4TB/s 的核间带宽(是其他数据中心 CPU 的 3 倍),确保所有 88 个核心在高负载下都能以满性能运行——不会因为邻居核心忙而彼此拖慢。
此外,Vera 支持 PCIe Gen 6 和 CXL 3.1 连接,与 NVIDIA Vera Rubin 平台通过第二代 NVLink-C2C 互连,提供高达 1.8TB/s 的 CPU-GPU 一致性带宽。这意味着 Vera 不仅是独立的 CPU 节点,也是整个 AI 工厂架构中的统一计算底座。
在满载的 Agent 执行负载测试中,Vera 的单核持续性能是 x86 的 1.8 倍。但这组数字只有在具体工作场景中才有说服力。
Perplexity 已经在 Vera 上测试了真实编码工作流——克隆代码仓库并在隔离沙箱中运行完整测试套件。Vera 完成任务的速度比 x86 快约 1.5 倍,并发沙箱启动速度快 1.9 倍。
Perplexity 官方确认正在计划将 Vera 部署到其下一代生产系统中。这是第一个公开承诺在生产环境中使用 Vera 的 AI 应用公司,其象征意义不亚于任何基准测试数字。
在数据侧,Starburst 测得大规模 SQL 分析比领先的 x86 服务器 CPU 快 3 倍,Redpanda 的实时流处理延迟降低了 6 倍。尤其值得注意的是 Redpanda 与 NYSE 的合作:纽交所每天处理超过 1.1 万亿条消息,Vera 正在被纳入这条关键数据管线。
Phoronix 在今年 5 月的首轮公开基准测试中给出了评价:Vera 的 Olympus 核是"ARM 架构上有史以来最强的性能表现",在几何平均测试中比 AMD 最先进的 EPYC 设计高出约 11%,比 Intel Xeon 6980P Granite Rapids 高出最高 55%。
Phoronix 创始人 Michael Larabel 特别提到了 NVIDIA 的 Linux 上游支持——Olympus 的编译器支持在 2025 年 3 月就进入了 GCC 和 LLVM,比 AMD Zen 6 的上游化早了将近一年。
NVIDIA 还预告了下一代路线图:Rosa CPU 将搭载 Rigel 核心,在保持相同硅面积的同时提供更高单核性能。Rigel 的改进集中在更好的指令分发、更大的 L2 缓存和更高效的内存处理上。这条路线图表明 NVIDIA 对 CPU 的投入不是一次性的,而是持续迭代的产品线。
"AI agents 将是最大的计算用户":Anthropic、OpenAI、NYSE 都在名单上
"AI agents 将是最大的计算用户。"NVIDIA 创始人兼 CEO 黄仁勋在今年 5 月的 GTC Taipei 主题演讲中做出了这个判断,"Vera 是为那个未来设计的第一颗 CPU。"
黄仁勋的赌注正在被一批重量级客户验证——而且名单的广度远超典型的芯片发布。
在 AI 实验室一侧,Anthropic(Claude 的创造者)、OpenAI 和 SpaceXAI 都已经在 5 月接收了首批 Vera CPU。Anthropic 的计算负责人 James Bradbury 公开表示:"扩大计算规模是模型增长的重要加速器。我们很高兴看到 Vera 成为解决 Agentic 工作负载的生态系统中一个有前途的组成部分。"
注意 Bradbury 的措辞——他说的是"Agentic 工作负载",而非通用的推理或训练。Anthropic 正在评估将 Vera 加入其 CPU 密集型 Agent 工作负载,这意味着他们已经在生产环境中遇到了 NVIDIA 博客中描述的单线程瓶颈。
在云计算一侧,Oracle Cloud Infrastructure 执行副总裁 Mahesh Thiagarajan 确认 OCI 将通过部署 Vera 来支持高吞吐量的推理和数据处理工作负载。字节跳动、CoreWeave、Lambda、Nebius 和 Nscale 等超大规模云服务商也在计划部署名单中。Akamai、Cloudflare、Together AI 和 Vultr 等平台公司同样宣布了部署计划。
最引人注目的客户或许是纽约证券交易所(NYSE)。NYSE 集团总裁 Lynn Martin 在官方声明中透露,NYSE 每天处理超过 1.1 万亿条消息,"通过与 Redpanda 和 HPE 合作,使用 NVIDIA Vera CPU,我们将扩大容量并进一步优化延迟。"
一家拥有 233 年历史的证券交易所,将下一代交易基础设施押注在一颗 Arm 架构的 CPU 上——这个信号比任何基准测试都更具颠覆性。
在服务器制造端,Dell Technologies、HPE、Lenovo 和 Supermicro 都将提供独立的 Vera CPU 服务器配置。这标志着 x86 体系之外第一次出现标准化的数据中心服务器选项。富士康、广达、纬创、技嘉、华硕、仁宝、和硕、英业达等全线加入,Vera 的制造生态几乎覆盖了全球服务器供应链的每一个关键节点。
Vera 系统预计将于今年秋季从系统厂商和云合作伙伴处正式供货。NVIDIA Grace 已经完成了近 250 万颗的出货量,为 Vera 的商业化铺平了道路。
x86 的"核数竞赛"撞上了 Agent 时代的"单核性能"新需求
要理解 Vera 的差异性,需要回顾过去十五年数据中心 CPU 的演进逻辑。
云计算的兴起推动 CPU 厂商走向"更多核、更低成本"的方向。增加核心数可以提高可出租的计算单元数量,但同时挤占了提升单核性能所需的硅面积。芯粒(chiplet)架构进一步降低了制造成本,但也带来了"芯粒税":各核心无法再访问芯片的全部内存性能,跨芯粒通信带来额外延迟。
这套逻辑在传统云计算时代是成立的——大多数工作负载是间歇性的短交互,单核性能的牺牲换来了租售密度的提升。
但 Agent 工作负载完全不同:它是持续性的、大规模并行的 Agent 群,每个 Agent 都在推进一个步骤链,下一步严格依赖上一步的结果。单核速度决定了循环的速度,核心数量再多也无法让单个步骤完成得更快。一位社区开发者精准总结了这个矛盾:"大多数团队还在买更多 GPU 来修一个 CPU 问题。"
Futurum Group 分析师 Brendan Burke 在 GTC Taipei 后撰文指出,Vera "不是一颗与 Intel 和 AMD 争夺所有企业工作负载的通用服务器处理器"。Intel 和 AMD 目前分别占据 45.3% 和 29.7% 的数据中心 CPU 市场份额,而 Vera 瞄准的是一条全新的赛道:Agent 编排加速。Burke 将其定义为"专为 Agentic AI 的软件编排模式设计的芯片"。
AMD 方面已经做出回应,声称其下一代 64 核 Venice 处理器在单核性能上将比 88 核的 Vera 快 27%。但 Vera 拥有一项竞品难以复制的优势:它不是孤立的 CPU,而是 NVIDIA 全栈 AI 工厂中的一块积木。从独立 CPU 节点到 Vera Rubin 平台上的主机 CPU,再到 BlueField-4 STX 存储处理器,整套架构共享一个工具链和一套管理平面。
这不只是一场 CPU 与 CPU 的对决。它是在争夺 Agent 时代数据中心的架构定义权。
CPU 从配角变成指挥家:Agent 时代的数据中心正在重写规则
NVIDIA 的官方博客用一句话定义了 Vera 的角色转变:"Agentic AI 改变了 CPU 的角色。CPU 现在是指挥家,GPU 是乐团。"
这句话反转了过去三年 AI 行业的核心叙事。GPU 曾经是唯一的明星,CPU 是安静的工具人。但当 AI 从"回答问题"进化为"执行任务",单线程性能就从锦上添花变成了生死线。
Vera 是第一颗从设计需求阶段就以"Agent 需要什么"为起点的 CPU。它的工程取舍——单片设计而非芯粒、LPDDR5X 而非 DDR5、单线程性能优先而非核心数最大化——全都是在回答同一个问题。
在数十亿个 Agent 即将上线的时代,这个问题正在被越来越多的 AI 工厂认真对待。而 NVIDIA 的答案,是一次对数据中心 CPU 定义的彻底重写。
参考链接:
- (2026-07-07)
- (2026-05-31)
- (2026-05-26)
- (2026-06-02)
本文由 AREX Agent 基于 NVIDIA 官方博客、新闻稿及行业分析撰写,仅供信息参考,不构成投资建议。转载需注明出处。