AREX Feed Article
OpenAI 首批 NVIDIA Vera Rubin 机架到货,已开跑训练栈
8 月 20 日 07:40(UTC,北京时间 15:40),OpenAI 计算部门 CTO(CTO of Compute)Uday Ruddarraju 在 X 上宣布:首批 NVIDIA Vera Rubin 机架已经到货,并已开始运行 OpenAI 的训练栈(training stack)。他在中说:"这是我们基础设施的一个里程碑:首批 NVIDIA Vera Rubin 机架已经在这里,正在运行我们的训练栈。这是我们扩充算力、支撑 OpenAI 下一代前沿 AI 预训练(frontier AI pre-training)的重要一步。"推文附有一张照片。
发布当天,OpenAI 首席执行官 Sam Altman 转发了这条推文,联合创始人兼总裁 Greg Brockman 称其为"与 NVIDIA 合作的巨大里程碑",NVIDIA 官方账号也出面回应。两天前的 8 月 18 日,Altman 刚刚宣布为达到对齐与安全标准暂停部分前沿 RL 训练,机架到位与训练暂停几乎同时发生。
机架到货,训练栈同步开跑
Ruddarraju 的显示他现任 OpenAI 计算部门 CTO,此前任职于 xAI、Robinhood 和 eBay。
他的措辞重点落在"正在运行我们的训练栈":机架已接入训练基础设施,而非停留在测试导入阶段。截至 8 月 20 日晚,该推文已获超过 1100 次点赞、约 19 万次浏览。
推文没有披露机架数量、部署地点或对应哪一代模型。回复区有用户直接"告诉我们你们是不是要启动 10T+ 的预训练"。
72 颗 Rubin GPU 配 36 颗 Vera CPU 的机架
Vera Rubin 是 NVIDIA 在 3 月 16 日 GTC 2026 上宣布全面投产的新一代 AI 平台。根据 ,该平台由七颗芯片组成:Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机和 Groq 3 LPU。
这七颗芯片组合出五种机架产品:Vera Rubin NVL72 GPU 机架、Vera CPU 机架、Groq 3 LPX 推理机架、BlueField-4 STX 存储机架和 Spectrum-6 SPX 以太网机架。
面向训练的主力是 Vera Rubin NVL72:一个机架内由 NVLink 6 连接 72 颗 Rubin GPU 和 36 颗 Vera CPU。NVIDIA 称,与 Blackwell 平台相比,NVL72 训练大型混合专家(MoE)模型只需四分之一数量的 GPU,推理吞吐量每瓦最高提升 10 倍,每 token 成本降至十分之一。
基于 Vera Rubin 的产品将从 2026 年下半年起由 AWS、Google Cloud、Microsoft Azure、Oracle Cloud Infrastructure、CoreWeave、Crusoe、Lambda 等合作伙伴陆续供货;新闻稿同时点名 Anthropic、Meta、Mistral AI、OpenAI 等前沿实验室计划用该平台训练更大、更强的模型。8 月的到货时间,正好落在这个供货窗口内。
Altman 在 3 月那篇新闻稿中被引用说:"NVIDIA 基础设施是我们持续推动 AI 前沿的基础。借助 NVIDIA Vera Rubin,我们将大规模运行更强大的模型和智能体,为数亿人提供更快、更可靠的系统。"
两天前官宣暂停前沿训练,两天后机架到位
8 月 18 日,Altman 在中宣布:"我们已经暂停了一些前沿 RL 训练,以确保我们能够达到面前新能力水平所要求的对齐、安全和监控标准。"
同日发布的 《Pacing model development in an era of cyber-critical capabilities》补充了细节:受 OpenAI-Hugging Face 事件与 Astra 模型可能达到"关键网络安全能力"阈值影响,OpenAI 暂时放慢扩展节奏,对拟部署的最新模型暂停两周 RL 训练,规模最大的计划中前沿 RL 训练仍处搁置状态。
暂停的是 RL 与部分推理环节,Ruddarraju 宣布的则是为下一代预训练扩充算力,两者并行让社区迅速把两件事连在一起。Pardee RAND 博士 David Manheim 在中调侃:"我猜暂停只是为了让他们安装新的 GPU 机架。"
Klick Health 生成式 AI 部门执行副总裁 Simon Smith 则在中写道:"OpenAI 的前沿模型训练可能暂时暂停了,但支持未来训练的基础设施建设没有停。"
Altman 转发,NVIDIA 官方与 Brockman 先后回应
NVIDIA 官方账号当天 16:16(UTC):"很高兴看到首批 NVIDIA Vera Rubin 机架为 @OpenAI 的训练栈提供算力。我们正在共同建设加速计算基础设施,以推进前沿 AI。"(原文:Awesome to see the first NVIDIA Vera Rubin racks powering @OpenAI's training stack. Together, we're building the accelerated computing infrastructure to advance frontier AI.)
18:51(UTC),Altman ;19:07(UTC),Brockman 在中写道:"与 NVIDIA 合作的巨大里程碑"(huge milestone in our partnership with NVIDIA)。
简介为"superdupercomputers @openai"的 brian wickman ;简介自述在 NVIDIA 工作的 Abheer Singh 则称"更多 Vera Rubin 机架已经出现在野外",暗示部署不止 OpenAI 一家。
粉丝 16.9 万的芯片行业观察账号 Zephyr 也讨论"Rubin 的量产是否已经开始"。
自称能源行业从业者的用户 McFeel 则在中写道:"机架到货是最容易的部分。真正的指标是 Rubin 需要几周才能在单个任务上超过你们现有集群,新芯片通常要先花一个季度做 kernel 和集合通信调优。"
机架数量、地点与下一次预训练仍无下文
回复区有人直接问"有多少台?"(How many?),这个问的正是推文未披露的机架数量。
OpenAI 8 月 18 日发布的博客写道:规模最大的计划中前沿 RL 训练继续搁置,需先完成小规模训练与评估、积累对齐证据。算力先于训练到位。机架已经"在这里并运行着",而下一次前沿预训练何时启动、这批 Rubin 机架在其中承担多少比例,Ruddarraju 的推文均未说明。