AREX Feed Article
NVIDIA 与 Palantir 推出工业供应链 AI 栈,NVIDIA 以“客户零号”部署到自家 Vera Rubin 供应链
据 ,NVIDIA 与 Palantir 公布了一套联合开发、面向工业供应链的主权 AI(sovereign AI)栈:NVIDIA 的开放 Nemotron 模型和 cuOpt 优化库,搭配 Palantir Foundry、AIP 与 Ontology,用于协调从晶圆出厂到首个 token 的物料分配。报道称,NVIDIA 自己成为这套栈的“客户零号”,部署对象则是自家的 Vera Rubin 供应链;单个 Vera Rubin 机架包含 130 万个零部件,来自数千家供应商。
同一天,发布了对这套系统的技术说明:NVIDIA 供应链运营团队与 Palantir 合作,在 Foundry 上搭建“数字供应链智能”指挥中心;cuOpt 每周求解一次混合整数线性规划(MILP),目标是最小化 Time of Ownership(TOO,物料持有时间);团队还对 30B 参数的 Nemotron 3.5 Lightning 做了后训练,让它复现计划员的分配判断。在 NVIDIA 的开发基准上,后训练模型的分配决策准确率为 86.7%,NVIDIA 称它比 Nemotron 3 Ultra 高 31.2 个百分点,比未做后训练的基础版高 69.2 个百分点。上述数字均为 NVIDIA 自述,未经独立验证。
指挥中心:把物料、产能与定性信号汇入同一个 Ontology
NVIDIA 在博客中把自己的供应链描述成一道组合学难题:Grace Blackwell NVL72 平台的供应链横跨全球,整机由数十家 OEM 与 ODM(代工厂商)组装;仅一个计算托盘,也就是单个机架 18 个托盘中的一个,就需要 2 颗 Grace CPU、4 颗 Blackwell GPU 和 32 组 HBM3e(高带宽内存),而每个部件都有各自的物料清单、供应商和交期。
在制造端,合同制造商要等三个来源的零部件到齐才能开始组装:NVIDIA 直供的部件、NVIDIA 寄售库存里的部件,以及供应商供货。理想情况下所有部件同时到达;一旦不能,先到的部件就要等其余部件到齐。NVIDIA 从制造基地收到物料开始计时,到物料作为子组件或成品离开为止,这个指标就是 TOO。由于各零部件的供应每周都在变,公司必须不断决定把哪些紧缺物料、分配多少到哪个基地,博客称之为关键物料分配问题,目前每周人工重排一次;这套分配滚动覆盖本季度和下季度,最近几周已经锁定承诺,所以每周的新数据主要改变更远期的排期。
与 Palantir 的合作把这道题搬进了一个统一视图。Foundry 的 Ontology 用对象和链接而非行和表,把物料、制造基地、承诺、产能、分配、产出和定性信号连成一个受治理的数据层,让计划员可以模拟和分析更多分配场景,也为一个不断累积知识的“AI 飞轮”打下基础。
cuOpt 负责求解,回测解释了计划员的优势
分配先是一道定量题。决策变量是:下一段时期里,每种受限物料给到哪些基地、给多少、什么时间给。围绕它的是全部边界条件:哪些制造商能生产某种 Blackwell 子组件、每个基地在物料到站后能吸收多少产能,以及从整机向后映射的零部件依赖关系,让求解器知道,卡住一个计算托盘的是它最紧缺的输入,而不是平均水平。绑定约束并不固定,它在 GPU、CPU、内存之间逐周漂移,也随三条供应路线的到货时间以及已经对客户做出的承诺而变:某个基地的缺口代价多大,取决于这些承诺。
NVIDIA cuOpt 把上千个变量与约束收敛成一份周度分配。博客称,cuOpt 是一个开源、GPU 加速的决策优化库:它从 Ontology 取输入,把分配建模为混合整数线性规划,以最小化 TOO 为目标,再把结果写回为一条分配决策。它给出的不只是方案,还会报告哪些约束在起作用,让计划员看到某一周卡住数字的是台湾产能,而不是内存供应。由于求解很快,计划员可以围绕答案继续探索:本期内存少 10%、新制造基地上线,这类假设很快就能重新算一遍。计划员不再只向求解器要答案,也开始问它各种取舍。
但回测暴露了数学看不到的部分。NVIDIA 和 Palantir 用历史分配决策对照真实结果做了回测,发现计划员当时掌握着求解器看不到的信息:那一周与合作伙伴往来的邮件、关键区域的恶劣天气预报或正在发生的地缘政治事件、最后一通供应商复盘电话的记录,以及多年积累的经验。这些输入形成对下一期如何分配的直觉;博客称,正是这种直觉让人类专家优于纯粹的数学模型。
于是工作流围绕这些专家重新设计:系统记录下分配决策、背后的理由、预期结果和实际结果,把机构知识变成可以被审阅的决策逻辑;而这些数据都存放在 Ontology 中,也就同时成了训练模型的素材。
后训练 Nemotron 3.5 Lightning:匿名化、扩增、微调与回测
后训练的对象是 Nemotron 3.5 Lightning。博客称,在评估过 NVIDIA 的 Nemotron 开放模型后,团队选中了它:它面向智能体工作流的执行层,混合专家(MoE)架构带来高效的推理;30B 参数、每次前向约 3B 激活的体量既轻量,又足以学会一项聚焦的策略;而且因为开放权重,后训练可以在自己的算力边界内完成。
训练管线分四步,全部由 Palantir Autopilot 端到端管理:NeMo Anonymizer 做匿名化,去除个人可识别信息、模糊敏感字段;NeMo Data Designer 扩增并平衡样本,让模型不仅见到常规周,也见到分配上调、产能受限和中断场景;NeMo AutoModel 只训练一小组 LoRA(低秩适配)参数、冻结基座权重,以减少训练时间、显存占用和检查点体积;最后由时间点回测(point-in-time backtest)充当评估闸门。博客称,这次 LoRA 训练在两块 NVIDIA B200 GPU 上几分钟内完成,轻到可以随反馈积累反复执行。
评估用的还是同一份记录:回放每个历史决策时,只给模型当天可知的信息、隐藏最终结果,再把它与计划员的判断和真实结果对照。评估要回答的核心问题是:假如这个模型上个月已经在跑,它是否会做出正确的分配决策。部署之后,模型读取当前运营上下文,返回建议、理由与附带风险,计划员审阅后做最终决定。
据博客,这套开发基准来自双方共同定义的工作流:模型接收什么、可以建议什么、建议如何打分,都由这套流程规定;三个模型面对的是同一任务与同一评估数据。后训练版 Lightning 于该基准上取得 86.7% 的分配决策准确率,Nemotron 3 Ultra 为 55.5%,基础版 Lightning 为 17.5%。博客配图还列出了另外两项指标:平衡准确率 58.6% 对 Ultra 的 42.0%,Macro-F1 57.5% 对 39.5%。NVIDIA 解释后两项的意义:供应受限时,计划员削减分配的次数远多于上调分配,单看准确率会让一律猜多数类的模型显得好看。博客总结的结论是,在一个边界明确的分配任务上,专门化的 30B 模型能胜过参数量大了一个数量级以上的通用模型(配图把 Ultra 标注为 550B)。
边界也写在博客里:这不代表小模型整体上更强,它的增益集中在被后训练的领域;而且,未来产量风险的预测在微调之后依然困难:“专业化改善了决策任务,但没有解决所有附着其上的预测问题。”
“主权 AI”如何落地:数据、权重与推理都不出边界
博客把这条路线称为“实践中的主权 AI”:专有供应链数据、模型权重和推理全部留在同一个受治理环境内,组织可以在不把数据暴露出去的前提下跑同样的循环,部署位置可选本地或云端。博客还列出复刻这套飞轮的三个必要条件:一个受治理的操作层、包含理由与结果的决策记录,以及能在自有算力边界内做后训练的开放模型。
据 24/7 Wall St. 援引联合公告的报道,模型在专有数据上定制,部署可选本地(Cisco、Dell)或云端(Rackspace、Nebius);整套栈基于 Palantir 的 Sovereign AI Operating System Reference Architecture(SAIOS,主权 AI 操作系统参考架构),并将在 Palantir 的 AIPCon 11 大会上展示。
这套栈的核心是一个闭环:每一次接受、修改、推翻,以及最终的生产结果,都会写回 Ontology,累积到有足够代表性的数据,再启动一轮受治理的再训练。博客称,未来这些反馈将用于强化学习:被接受和被推翻的建议构成偏好对,奖励覆盖分配正确性、策略合规与证据支撑;模型不会在生产环境中自我重训。
博客列出的回报有两个:计划员少花时间重建常规决策,从而覆盖更多基地和产品;分配经验沉淀为机构知识,缩短新人的上手时间。Palantir CEO Alex Karp 在二季度财报电话会上对投资者说(据 24/7 Wall St. 报道):“我们与 NVIDIA 建立了合作伙伴关系,正在扩展应用层。”同一篇报道引述该公司 CTO Shyam Sankar 的说法称:“把 Nemotron Ultra 引入我们的技术栈后 24 小时内,我们就发现了五个生产任务,未经后训练的标准 Nemotron Ultra 在其中击败了前沿模型。”
Vera Rubin 出货爬坡、供应紧张与盘前反应
博客称,为 Vera Rubin 搭建的供应链规模是 Grace Blackwell 的两倍。24/7 Wall St. 的报道交代了这条供应链面对的压力:管理层告诉投资者,Vera Rubin 已于 2026 年 8 月开始出货,采购订单来自每一家主要超大规模云厂商、AI 云和系统 OEM,该平台预计占三季度数据中心收入的约 20%;供应约束至少会持续到 2028 财年年底。
NVIDIA CEO 黄仁勋在财报电话会上说:“我们的整个供应链都承压”“所有人都在全力运转。”CFO Colette Kress 把四季度非 GAAP 毛利率指引定在 71%~72%,归因于内存的“极端定价”;公司另有 2,790 亿美元供应义务,主要绑定 Vera Rubin 的内存采购。该报道还写道,软件无法凭空变出 HBM。
市场盘前的反应平淡:据同一报道援引 Barron's 的数据,NVIDIA 与 Palantir 的股价分别下跌 1.35% 和 1.88%。
该报道还认为,这桩合作比多数 AI 发布会多了一个可量化的指标:已出货的机架数。接下来要看两件事:AIPCon 11 能带来多少客户转化,以及 NVIDIA 是否会在下一次财报电话会上量化交付周期或良率的改善。