AREX Feed Article
NVIDIA 官宣 Vera Rubin NVL72 每兆瓦吞吐最高 30 倍于 GB300 NVL72
8 月 29 日,NVIDIA 官方 X 账号(@nvidia)宣布:在 SemiAnalysis 构建的 AgentX 工作负载上,由 NVIDIA 实测的 Vera Rubin NVL72 每兆瓦吞吐(throughput per megawatt)最高较 GB300 NVL72 提升 30 倍(up to 30x)。以反问开场,问读者是否在按 agent 实际运行的方式衡量 AI 基础设施性能(Are you measuring AI infrastructure performance on how agents actually run?),并称 SemiAnalysis 构建 AgentX 正是为此。主推文附"Learn more"链接指向 NVIDIA 官方博客,同一时刻发布的第二条推文附上 SemiAnalysis 的 AgentX 文章链接。
先说清口径:30 倍是 NVIDIA 单方测得的数字,不是 SemiAnalysis 的结论。NVIDIA 在与图表脚注中均标注"非正式结果,待 SemiAnalysis 复核"(Unofficial Results. Pending SemiAnalysis Review)。这组数据最早于 8 月 24 日随技术博客与首发推文公布,8 月 29 日官方账号再次推介并补上基准文章链接。
每兆瓦吞吐 30 倍,百万 token 成本低 35 倍
按 NVIDIA 博客(8 月 24 日发布)的说法,这组数字来自 SemiAnalysis AgentX 工作负载,由录制的真实 agent 编码会话构成,保留了实际的上下文增长、工具调用与子 agent 派生。在 DeepSeek V4 Pro 模型上,Vera Rubin NVL72 每兆瓦吞吐最高达到 GB300 NVL72 的 30 倍,每百万 token 成本最高低 35 倍。作为参照,GB300 NVL72 每兆瓦吞吐已比 Hopper 架构最高高 15 倍。
对电力受限的 AI 工厂,博客称 30 倍意味着同一能耗下多完成 30 倍的 agent 工作;每兆瓦吞吐决定 AI 工厂收入,每百万 token 成本决定利润率。配套的 DSX MaxLPS 电源管理技术可在 GPU、机架与工作负载三级调配电力,在同一兆瓦预算内多供 40% 的 GPU。
AgentX:393 段真实编码会话重放出的负载
AgentX 是 SemiAnalysis 的开源推理基准平台 InferenceX 的 agentic 场景。SemiAnalysis 在中称,AgentX 1.0 是"全球首个完全开源、100 万上下文的多轮 agent 编码推理基准",以 Apache 2.0 协议发布。数据集由 393 段内部匿名 Claude Code 会话构建,耗资超过 300 万美元;整套矩阵在约 2 兆瓦、1000 多颗芯片上持续运行,覆盖 MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200 与 RTX Pro 服务器。
按的数据,这 393 段会话每请求输入 token 中位数 14.2 万、输出中位数 444,44% 的会话含子 agent。SemiAnalysis 的立场是:固定序列长度基准(8k1k、1k1k、1k8k)测不出真实负载。真实 agent 负载是多轮、长上下文、高前缀复用、子 agent 突发加大量工具调用,KV 缓存复用与跨层卸载才是瓶颈所在。方法页还提醒,AgentX 衡量的是 serving 系统性能,合成负载不支持模型质量评估。
AgentX 发布后已成为 vLLM、SGLang、TensorRT-LLM、AMD ATOM、ROCm AITER、NVIDIA Dynamo、LMCache、Mooncake 等项目的优化基准,带动 50 多个上游 PR。
同一兆瓦预算,多干 30 倍的活
每兆瓦吞吐成为新标尺,直接原因是 token 消耗的量级变了。NVIDIA 博客援引 OpenRouter 数据:agentic 工作负载消耗的 token 是简单聊天请求的 15 倍。一次"调研公司并给出投资建议"的 agent 任务会反复查询数据库、检索新闻与公告、派生子 agent 做同业对比,每步产生的 token 又成为下一步的输入,上下文可以累积到数十万 token。
SemiAnalysis 的文章写道,对实验室来说钱可以无限供应,电力不行(power is physically hard to come by)。Vera Rubin NVL72 的 30 倍来自软硬件配合:解耦预填充与解码、速率匹配、大规模专家并行、分布式 KV 缓存与分层卸载、KV 感知路由,加上 MegaMoE 融合内核、第五代 Tensor Core、第三代 Transformer Engine 与 NVFP4 量化,跑在 TensorRT-LLM 与 Dynamo 之上。机架内第六代 NVLink 数据包速率比商用以太网高 10 倍、延迟低 3 倍,支撑 NVL72 的 scale-up 域。
Rubin 全面投产,对标的是 agent 时代
8 月 24 日的把这组数据定位为"首次在硅片上测得的 NVIDIA Vera Rubin 性能,按 agent 实际运行方式衡量",并明确 30 倍与 35 倍数字基于 DeepSeek V4 Pro 模型。博客称 Vera Rubin 已全面投产、正在生态中铺开,整个平台是七芯片架构,包括 Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 与 ConnectX-9 SuperNIC。
SemiAnalysis 在发布文章里给出了时代背景:自 2025 年 11 月 Claude Code 拐点以来,长上下文多轮 agentic 负载快速增长,已主导生产推理流量;2026 年 4 月,OpenAI 企业级 agentic 支出超过了 ChatGPT 支出。同一篇文章写道,Rubin 将于本月晚些时候到货,TPU 与 MI455X UALoE72 则于今年晚些时候加入测试矩阵。
30 倍数字仍待 SemiAnalysis 复核
NVIDIA 在博客中留了三处保留:这些是"早期结果",目前待 SemiAnalysis 复核;尚未反映 Vera CPU 在工具调用上的表现;随着软件持续优化,Vera Rubin NVL72 与 GB300 NVL72 的性能都还会继续提升。30 倍目前只是 NVIDIA 单方、早期、待复核的结果,尚未包含 Vera CPU 的完整能力。
推文评论区里,DevOps 工程师 评论说,多轮加子 agent 突发"正是按固定 prefill 数字规划容量时会被打爆的负载"(the load that murders your capacity planning);机器人与前沿 AI 领域评论者 则说,用 AgentX 而不是峰值 FLOPS 来衡量机架早该如此,每兆瓦 30 倍于 GB300 才是 CFO 会真正关心的数字。
SemiAnalysis 表示会在三到四周内发布 AgentX 更新文章,给出 agentic 负载的进一步优化以及 AMD 与 NVIDIA 的最新结果。到那时,NVIDIA 的 30x 声明将迎来基准构建方自己的数据点。这是目前唯一可预期的验证节点。