AREX Feed Article
AWS 与 NVIDIA 官宣:2027–2028 年再部署 200 万张 GPU
2026 年 8 月 26 日,AWS 与 NVIDIA 联合发布新闻稿,宣布扩大战略合作:计划 2027–2028 年在 AWS 全球基础设施再部署 200 万张 NVIDIA GPU,型号覆盖 Blackwell Ultra、Rubin 与 Rubin Ultra()。新闻稿电头为西雅图与加州圣克拉拉。
这 200 万张是追加量:在 NVIDIA GTC 2026 上,AWS 已宣布自 2026 年起增加超过 100 万张 NVIDIA GPU,新闻稿称"自那以后,需求超过了这些预期"。同一天,NVIDIA 官方新闻室发布了内容相同的版本()。公告还列出配套计划:Vera CPU 架构引入 AWS、NVLink Fusion 扩展支持 NVIDIA 定制高带宽内存(NVHBM)、为美国政府建设 AI 工厂(含 10 万张 GPU)、Amazon Robotics 采用 NVIDIA 物理 AI 平台等。新闻稿的措辞均为"计划"与"正在推进"(plan to deploy、are working to),属于交付承诺,尚未落地验证。
继 GTC 2026 的 100 万张之后,AWS 再加 200 万张
新闻稿称 AWS 是"任何云厂商中 GPU 实例范围最广"的一家。追加的 200 万张将部署在 AWS 全球基础设施(包括 AI 工厂)上,型号为 Blackwell Ultra、Rubin 与 Rubin Ultra,服务 agentic AI、科学发现、企业自动化与物理 AI 等负载。
同批扩容还包括 Amazon EC2 G7 实例与 RTX PRO 4500 Blackwell Server Edition GPU。新闻稿称,G7 相比上一代 G6 提供 4.6 倍 AI 推理性能与 2.1 倍图形性能,AWS 是首家提供 RTX PRO 4500 加速实例的主流云厂商。两家公司同时合作 NVIDIA Spectrum 网络技术,优化大规模 AI 训练集群的网络性能。
Vera CPU 进 AWS,Trainium 与 GPU 在同一机架内打通
第二项新内容在 CPU 侧。新闻稿称,AWS 与 NVIDIA 正在把 Vera CPU 基础设施引入 AWS,为需要高性能 CPU 算力的 agentic AI 负载提供额外选项。Vera 被描述为"为下一代 AI 专门打造",与 AWS 同时提供自研芯片和合作伙伴加速器、CPU 的策略互补。
更深的集成发生在内存与互联层。AWS 在 re:Invent 2025 已宣布下一代 Trainium 芯片支持 NVIDIA NVLink Fusion 高速芯片互联技术;这次合作把该支持扩展到 NVIDIA 新的定制高带宽内存(NVHBM)。
NVIDIA 与 Amazon 的芯片团队 Annapurna Labs 将在内存供应商参与下推进,让 Trainium 获得更快、更省电的内存。新闻稿称,结合 NVLink Fusion,Annapurna Labs 可以调用 NVIDIA 的定制内存技术与 scale-up 架构,在共同的机架级架构内把 Trainium 与 GPU 无缝集成。
安全与网络条款同步覆盖:所有基于 NVIDIA GPU 和 Trainium 的 EC2 实例,包括使用 NVLink Fusion 的实例,都构建在 AWS Nitro System 上,并通过 Elastic Fabric Adapter(EFA)互联。
10 万张 GPU 的政府 AI 工厂,面向 IL6 及以上负载
公告里另一项给出明确数字的计划面向政府客户。AWS 与 NVIDIA 计划为美国政府建设 AI 工厂,交付 NVIDIA AI 软件栈,包括在 AWS 安全基础设施上交付 10 万张 GPU,用于联邦与国家安全负载。
新闻稿称,这能让政府机构以 Impact Level 6(IL6)及以上的分级大规模部署 AI;Amazon 官网的配套报道称之为美国政府最高的安全分级之一()。
从 Nemotron 到仓库机器人,合作铺满软件栈
其余计划分布在模型、数据处理与机器人三个方向。NVIDIA Nemotron 开源模型继续上架 Amazon Bedrock(全托管、serverless)与 Amazon SageMaker(客户可在自有基础设施上部署与微调)。
数据处理方面,Amazon EMR 将用 EC2 G7 实例与 NVIDIA cuDF 库做 GPU 加速数据处理,新闻稿称相比 CPU 配置速度快至 3.7 倍、性价比提高 30%。
Amazon OpenSearch Service 的 GPU 加速向量索引快至 9 倍、成本降至四分之一,托管集群与 OpenSearch Serverless 均可用。About Amazon 的报道补充,EMR 的对比针对 Apache Spark 负载。
机器人方面,Amazon Robotics 采用 NVIDIA 物理 AI 平台,包括 Jetson 平台、Omniverse 库与 Isaac 开源机器人开发平台,覆盖仿真、合成数据生成、机器人训练、路线优化、功能安全与 real-to-sim 验证,全部运行在 GPU 加速的 Amazon EC2 实例上。
「需求跑在所有预测前面」,两位 CEO 的署名判断
AWS CEO Matt Garman 称:"客户希望自由选择最适合自己 AI 工作负载的工具,并希望一切无缝协作(the freedom to choose the best tools for their AI workloads)。这就是我们与 NVIDIA 深度投入、让 AWS 成为运行 NVIDIA AI 技术最佳场所的原因,从网络、安全到部署,我们都在优化基础设施上的性能。"
NVIDIA 创始人兼 CEO 黄仁勋(Jensen Huang)称:"NVIDIA 与 AWS 打造了 AI 时代最伟大的增长引擎之一,需求跑在所有预测前面(demand is running ahead of every forecast)。16 年来,我们一直在云端扩展 NVIDIA 计算;现在,我们正把合作扩展到全栈——GPU、CPU、网络、开源模型与软件,以只有 AWS 与 NVIDIA 能提供的空前速度与规模,让 agentic AI 和物理 AI 成为现实。"
两家公司把关系起点定在 16 年的联合创新上。About Amazon 的报道补充,AWS 与 NVIDIA 曾一起推出全球第一个 GPU 加速云实例。
200 万张是计划,交付要看 2027–2028
整份公告的动词是"计划"与"正在推进"。NVIDIA 在文末附上 Forward-Looking Statements,提示增长、供应、需求等预期存在风险,实际结果可能与此不同。新闻稿没有披露这 200 万张 GPU 对应的投资金额,也没有给出 Vera CPU 基础设施落地 AWS 的时间表。
可以确认的是数字本身:两次宣布合计 300 万张 NVIDIA GPU,覆盖 2026 至 2028 年。按两家公司的表述,AWS 自研的 Trainium 将与 NVIDIA GPU 在同一机架级架构内、通过 NVLink Fusion 与 NVIDIA 定制内存协同工作。计划能否兑现,要等 2027 年的部署节奏给出第一个答案。