AREX Feed Article
华为发布 OceanStor M900 AI 记忆存储,称单集群 KV Cache 容量达 64PB、NPU 访问时延降至 60 微秒
2026 年 9 月 17 日,华为全联接大会 2026(HUAWEI CONNECT 2026)在上海世博展览馆及世博中心开幕。华为副董事长、轮值董事长汪涛(David Wang)在题为「智启新未来,打造智能世界的硅基黑土地」的主题演讲中,正式推出 OceanStor M900 AI 记忆存储(英文名 Context Memory Storage),定位面向超大规模数据中心的 AI 推理。据华为当天发布的,该产品为超节点(SuperPoD)提供全共享记忆空间,容量达 PB 级、性能达 TB/s 级;给出的具体数字是:单集群 64PB 的 KV Cache 容量、40TB/s 的聚合访问带宽。
这款产品的核心做法,是把推理过程中产生的 KV Cache 从显存与内存扩展到 SSD(固态硬盘):依托灵衢(UnifiedBus)高速互联网络构建全局池化共享与分级存储,并以华为称业界首创的 CPU、网络、盘控三芯合一架构实现 NPU 到 SSD 的一跳直通,访问时延降至 60 微秒。上述数字与「业界首创」的说法均为华为发布口径。
长上下文与多轮推理,让显存和内存装不下 KV Cache
据华为新闻稿 FAQ 的解释,KV Cache 是大模型推理过程中缓存已计算的 Key 和 Value、供后续推理复用以避免重复计算的数据;随着长上下文、多轮推理和复杂任务增多,它成为 AI 推理中主要的「记忆」数据。
华为在新闻稿中给出的背景是:2026 年 AI 应用从 Chatbot 对话演进为能自主完成复杂任务的智能体,大模型迈向 10 万亿级参数规模,主流模型上下文窗口突破百万词元,多轮推理成为常态,KV Cache 规模随之持续增长,显存与内存在容量和性价比上均已无法满足需求;超节点被华为称为 AI 基础设施建设的「必然选择」,构建显存、内存与 SSD 协同的多级存储体系则被称为「行业共识」。在华为的定义里,AI 记忆存储是面向超大规模数据中心超节点的新型数据基础设施,支持 KV Cache 跨显存、内存和 SSD 的分级存储与高效调度,OceanStor M900 是这一品类的代表产品。华为在新闻稿中称,这一步推动 AI 基础设施从以计算为中心,迈向计算、网络与存储深度协同。
灵衢池化分级:把超节点的 KV Cache 从显存、内存扩展到 SSD
容量方面的机制,按新闻稿的描述,是依托灵衢高速互联网络实现 KV Cache 的全局池化共享和分级存储,把超节点的 KV Cache 从显存与内存扩展至 SSD。华为称,单 NPU(神经网络处理单元)可用的 KV Cache 容量由此从 GB 级提升至 TB 级,更多上下文得以保存、共享和复用,KV Cache 缓存命中率也随之大幅提升。
三芯合一:NPU 到 SSD 一跳直通,省掉协议转换和 CPU 转发
性能部分的关键,是华为称业界首创的三芯合一架构:把 CPU、网络控制器单元和 NAND 控制器单元集成于一体,提供原生 KV 语义,让超节点的 NPU 一跳直通 SSD,免去协议转换和 CPU 转发。据华为数据,访问时延由毫秒级降至 60 微秒、缩短 90%;单集群聚合访问带宽 40TB/s,「相比业界方案提升 1.5 倍」——新闻稿没有说明对比方案和测试条件。
场景化数字同样出自华为:在典型 AI 编程场景中,这一架构可使推理集群 Token 吞吐率翻倍、首 Token 时延(TTFT,Time to First Token)缩短一半。
KV-Aware 自适应存储:按数据价值调度排布,SSD 寿命提升 16 倍
成本部分依赖华为称业界首创的 KV-Aware 自适应存储技术:根据 KV Cache 数据价值预测生命周期,对多模介质上的数据排布进行智能调度。按华为口径,该技术可实现最高 24 DWPD(每日全盘写入次数,Drive Writes Per Day),使 SSD 介质寿命提升 16 倍,支撑三年稳定运行;华为称,这能通过减少介质更换和运维投入,降低大规模 AI 推理基础设施的长期成本。
口径之外:独立验证、价格与上市时间缺席
从容量、带宽、时延到寿命提升,新闻稿中的关键数字全部来自华为自己的发布材料,两处「业界首创」也是华为的自述,文中没有附带第三方测试或客户部署数据。
华为在新闻稿结尾判断,AI 基础设施将由单纯追求算力规模,进一步迈向算力、网络与「存力」的系统协同,并把 AI 记忆存储称作「持续提升超大规模推理 KV Cache 容量与访问效率的必然选择」。至于这些数字何时能有独立测量与之对照,以及产品的上市时间与定价,新闻稿均未提及。