AREX Feed Article
d-Matrix 采用 NVIDIA NVLink Fusion,Raptor XPU 将集成进 MGX 机架,预计 2027 年第四季度初步可用
2026 年 9 月 10 日,AI 推理芯片公司 d-Matrix 宣布采用 NVIDIA 的 NVLink Fusion,把下一代 Raptor 推理 XPU 集成进 NVIDIA MGX 机架级平台,面向超低延迟 AI 推理。消息由双方各自发布:d-Matrix 的在美东时间当天上午 9 点发出,同日刊文。
新闻稿还列出了两个时间节点:Raptor 预计在 2026 年底前完成流片(tape-out),集成进 MGX 机架的整机预计 2027 年第四季度初步可用。本次公布的是一张产品路线图:从合作宣布到客户能拿到机器,中间隔着一次流片和一年多的时间。
MGX 机架里的 NVIDIA 组件:Vera CPU、BlueField-4 与 Spectrum-X
d-Matrix 将把 Raptor 直接集成进 NVIDIA 最新的机架参考架构,硬件清单包括 NVIDIA Vera CPU、NVLink 交换机、BlueField-4 DPU、ConnectX-9 SuperNIC 和 Spectrum-X 以太网。整套机架基于 NVIDIA 的 MGX 平台,托盘为模块化、无线缆设计,并沿用 NVIDIA 成熟、经过验证的机架设计、供应链以及供电与散热基础设施;按新闻稿的表述,双方的合作包含一条为期多年的产品路线图,第一步将是 Raptor XPU 装入这台 MGX 机架。
连接部分由 Astera Labs 参与。作为 NVLink Fusion 生态中的连接方案公司,Astera Labs 将与 d-Matrix 合作交付定制方案,确保系统内高吞吐、无缝的数据流。「专用连接正是把创新计算转化为高性能 AI 工厂的关键。」Astera Labs CEO Jitendra Mohan 说,「我们与 d-Matrix、NVIDIA 的合作在 NVLink Fusion 生态内让这一愿景成为现实,为低延迟 AI 推理提供高吞吐。」
d-Matrix 把目标客户列为 AI 实验室、超大规模云厂商(hyperscalers)和 neocloud,用途是超低延迟的「优质 token 服务」。这类场景以交互性为先,客户愿意为速度付费,新闻稿给出的例子是 AI 编程助手、实时聊天机器人和语音 agent。
「推理需求正在激增,但资本、时间和能源依然有限。」d-Matrix 创始人兼 CEO Sid Sheth 在前一天的媒体吹风会上说。他接着表示,「借助 NVLink Fusion 和 MGX,我们可以把 Raptor XPU 集成进一套被广泛部署的液冷架构,给客户一条更快、风险更低的路径去部署和扩展超低延迟推理。」
Raptor 把 DRAM 和 SRAM 叠成「两层楼」
Raptor 是已经量产的 d-Matrix Corsair XPU 平台的后续产品。d-Matrix 的思路是把内存放到离计算更近的地方,按该公司的说法,这样可以绕开传统架构在成本、时延和功耗上的限制;Raptor 延续这条「以内存为中心」的路线,采用了一种 d-Matrix 称是首创的 3D DRAM 堆叠方式:把一颗 DRAM 存储芯片和一颗 SRAM 计算芯片合成一个「两层楼」式的单一封装。据 d-Matrix 的说法,相关技术细节近期由 IEEE 发表,公司联合创始人兼 CTO Sudeep Bhoja 也在 2026 年的 Hot Chips 大会上做过预览。
d-Matrix 表示,Raptor 从底层设计开始就为接入 NVIDIA NVLink Fusion 和 MGX 机架生态做了准备。公司还称,Raptor 目前正在 AI 超大规模云厂商和前沿实验室接受评估,并拥有 100 多项专利;这两条均出自 d-Matrix 的单方表述。
AI 编程被拆成两段:GPU 做 prefill,XPU 做 decode
接入 MGX 机架后,运营方可以做「异构解耦」:把同一个推理负载拆到 Raptor XPU 和 NVIDIA Vera Rubin 之间,分别优化推理的每个阶段。d-Matrix 举的例子是 AI 编程,并称这是当下最流行的解耦场景之一。计算密集的 prefill(预填充)交给 GPU,对时延敏感的 decode(解码)由 d-Matrix 的推理 XPU 加速。
NVIDIA 博客补充了机架之间的配合方式:d-Matrix 的机架可以与 Vera Rubin NVL72 这类基于 GPU 的系统并排工作,做解耦推理;Raptor 则通过 NVLink 连进同一个高带宽、低延迟的 scale-up(纵向扩展)互连域。
不自建机架:NVLink Fusion 补上的环节
造一颗自己的 XPU 很难,把它部署到 AI 工厂的规模更难。NVIDIA 博客把这条路拆成几段:采购芯片、集成高速接口、验证 scale-up 网络方案、设计并认证机架架构,每一步都在增加时间、成本和风险。NVLink Fusion 面向第三方 XPU 和 CPU,把它们接入 NVIDIA 的 NVLink scale-up 网络、Spectrum-X scale-out(横向扩展)网络、MGX 机架架构和整个 AI 工厂平台,让 XPU 厂商跳过从零搭建机架级基础设施的过程:互连、机架架构、软件和供应链由 NVIDIA 提供,伙伴专注做差异化的芯片。
NVIDIA 在博客中给出的数字是:XPU 到 XPU 的时延降至现成以太网方案的三分之一,数据包速率提升 10 倍,每颗 XPU 通过第六代 NVLink 获得 3 TB/s 的全互连带宽。该平台支持 Arm、x86、RISC-V 三种 CPU 架构,也支持与 NVIDIA GPU 搭配。按 NVIDIA 的说法,用同一套机架,数据中心建一次就能同时支持 GPU、CPU 和 XPU,不必为每种处理器单独设计机架架构;这种组合被称为「半定制 AI 工厂」。
「NVLink Fusion 让合作伙伴把自研芯片与 NVIDIA 在 NVLink、先进封装、机架级系统和网络技术上的深厚生态结合起来。」NVIDIA 创始人兼 CEO 黄仁勋说,「NVIDIA AI 基础设施已部署在全球各地的云和本地数据中心,NVLink Fusion 让 d-Matrix 这样的伙伴能够与 NVIDIA 计算平台无缝集成,为构建下一代 AI 工厂的客户扩大加速器选择。」
d-Matrix 加入的是一份仍在扩大的伙伴名单。NVIDIA 博客列出的 NVLink Fusion 伙伴共 16 家:d-Matrix、AWS、Arm、Intel、Fujitsu、SiFive、Alchip、Astera Labs、GUC、Marvell、MediaTek、Samsung、Cadence、Synopsys、Ayar Labs 和 Lightmatter。
流片之前,这仍是一张路线图
在 d-Matrix 的新闻稿里,流片与初步可用都使用了「预计」的表述。
d-Matrix 还邀请访客到 AI Infra Summit 的展台观看演示。这份路线图的第一个可检验节点是流片:设计能否按期交给制造,直接决定新闻稿给出的可用时间是否仍然成立。