AREX Feed Article
郭明錤称 NVIDIA 重启 Rubin CPX:改配 168GB HBM4,拟 2027 年第一季度投产
从路线图上消失了约半年的 NVIDIA Rubin CPX 加速器,据称重新回到了量产日程。,8 月 31 日在 称,他最新的产业链调查显示 NVIDIA 已重启 Rubin CPX 项目,量产预计从 2027 年第一季度开始。
引述郭明錤的原话:「就在市场开始相信 Rubin CPX 已经从 NVIDIA 产品路线图中消失时,我最新的产业链调查显示,NVIDIA 已经重启了这一项目。」与 2025 年公布的原设计相比,复活版改动不小:内存从 128GB GDDR7 换成每颗 168GB HBM4,功耗上限来到 2,300W,与标准 Rubin GPU 持平,部署形态也从与 Rubin 共用机架改为独立的 MGX ETL 机架。这些细节全部来自郭明錤的供应链渠道,NVIDIA 官方没有确认,也未回应 Benzinga 的置评请求。
3 月被撤下,8 月底又传出重启
Rubin CPX 是 NVIDIA 在 2025 年 9 月的 AI Infra Summit 上发布的加速器,专攻推理的 prefill 阶段,也就是模型输出第一个 token(词元)之前、处理整个输入提示词的那段计算。当时的方案是给芯片配 128GB GDDR7,Hardware Busters 复盘称,它本来被定位成「便宜的那个」。约半年后项目生变:RCR Wireless News 记载,NVIDIA 在 2026 年 3 月的 GTC 2026 主题演讲和路线图中撤下了 Rubin CPX,转而展示 Groq 3 LPU 与 LPX 机架,市场多数人就此认定项目已死。
郭明錤的最新调查给出了相反结论。RCR Wireless News 还指出,与 NVIDIA 早前「2026 年底前后可用」的口径相比,2027 年第一季度量产意味着至少再晚几个月,商用部署按它的判断要等到 2027 年晚些时候。
HBM4 换掉 GDDR7,省钱不再是卖点
按郭明錤的说法,复活版的内存容量少于标准 Rubin GPU 的 288GB HBM4,但带宽远高于旧设计的 GDDR7;算力接近 Rubin,prefill 吞吐更强。RCR Wireless News 提醒,这些仍是定性描述,没有新的官方数字:NVIDIA 2025 年 9 月公布的单芯片约 30 petaFLOPS(NVFP4 精度)、prefill 类负载下注意力机制吞吐约为 Blackwell GB300 三倍等指标,大概率已被新设计取代。
内存换型直接改写了这款芯片的成本逻辑。旧方案敢用 GDDR7,前提是 prefill 属于计算密集而非带宽密集的工作,而 GDDR7 每 GB 单价不到 HBM 的一半,便宜内存理论上够用。HBM4 比 GDDR7 贵得多,新 CPX 的立足点从「内存更省钱」变成「prefill 更高效」。
RCR Wireless News 认为,架构分工可能是这轮爆料里更值得注意的部分:prefill 阶段由 CPX 读入并处理整个提示词、生成 KV cache(键值缓存),decode(解码)阶段由标准 Rubin GPU 逐 token 输出,两段之间走以太网 RDMA(远程直接内存访问)交接,NVIDIA 建议 CPX 与 Rubin GPU 按 1:1 配对。这也是 NVIDIA 第一次把推理的两个阶段拆到两种芯片设计上,用意是让搭载昂贵 HBM 的 Rubin GPU 不必为一段它们性能过剩的前置计算高峰空转。
独立 MGX ETL 机架与 1:1 配对
新 CPX 不再挤进 Rubin 的机架。据郭明錤称,CPX 将装入独立的 MGX ETL 机架,客户可选 64、128、192 或 256 颗 CPX GPU 的配置;机架以 64 颗为一个模块,每个模块由 8 个计算托盘(每托盘 8 颗)和 1 个交换托盘组成。托盘内 8 颗 GPU 用 NVLink 互联,跨托盘和跨模块的扩展走 Spectrum-6 以太网,模块内全铜缆、模块间用 OSFP 光缆。
CPX 机架不独立工作,它把处理完的上下文通过以太网 RDMA 交给 Vera Rubin NVL72 解码机架。Rubin CPX 是 Vera Rubin 平台的伴生芯片,同平台还有主 Rubin GPU、Vera CPU、CX9 网卡和 Spectrum-X 交换机;旧方案中 CPX 卡与 Rubin GPU 同架部署(Vera Rubin NVL144 CPX),经 NVLink 与 Spectrum-X 互联。主平台正在放量:据 Benzinga 报道,NVIDIA 8 月公布的财报显示最近季度营收 962.2 亿美元、同比增长 106%,并称 Vera Rubin 已进入全面量产,合作方包括 CoreWeave、Nebius、微软 Azure、谷歌云和甲骨文云。
拆分还带来软件代价。prefill 与 decode 分处两套芯片,NVIDIA 的软件栈要负责跨芯片调度执行;RCR Wireless News 判断,框架与模型开发者多半还得针对这种拆分自行优化(自定义注意力机制和检索密集的流水线尤其如此),才能吃到完整收益。2027 年才交付给了软件工作缓冲时间,但验证风险也叠加在已经延期的日程上。
谁会用一台只做 prefill 的芯片?
RCR Wireless News 的判断是,超大规模云厂商一直在向 NVIDIA 要这类面向超长上下文推理的专用低成本加速器,长上下文的算力账单主要花在 prefill 上,它们是显而易见的早期客户;企业用户要用上基于 CPX 的云实例,还得等新芯片完成集成。到 2027 年,NVIDIA 还要面对 AMD 针对大上下文、内存受限负载优化的加速器,CPX 得拿出真实的总体拥有成本(TCO)优势,才能守住推理市场地位。但客户是否买单仍是开放问题:超大规模厂商可能接受这套专用 prefill 工作流,也可能认为额外复杂度不值,直接扩更多标准 Rubin GPU。
重启原因未明,NVIDIA 官方未置一词
为什么项目在一年内先撤后启、还大改内存与机架,目前没有官方解释。RCR Wireless News 的报道列举了几种猜测:GDDR7 供应链的成本压力、客户对百万 token 级模型的需求变化、早期 Rubin 系统测试暴露的瓶颈,全部未获证实。若量产日期与 1:1 配对都能兑现,最先承压的可能是内存市场:Hardware Busters 分析称,HBM4 已是供应最紧俏的内存,SK 海力士、三星和美光都在把领先产能转向 HBM4,而 1:1 部署意味着每装一颗 CPX 都要备好 HBM4 而不是原来的 GDDR7,2027 年的内存供应会比现在看起来更紧。这家媒体还提醒:CPX 在十二个月内被撤下又复活,本身就说明这类路线图随时会被重写;郭明錤的供应链记录良好但并非完美,在芯片真正流片、数字落到官方规格表之前,一切仍可能再次变动。