AREX Feed Article
华为 openPangu-2.0-Pro 开源:首个 500B+ 全昇腾训练模型,未使用 NVIDIA 硬件
2026 年 8 月 1 日,华为正式发布 openPangu-2.0-Pro 的开源权重与技术报告。这是一个总参数量约 5050 亿、每 token 激活约 180 亿参数的混合专家(MoE)大语言模型,支持 512K 上下文窗口,预训练数据量约 34T tokens。最引人注目的是:整个预训练过程完全在华为昇腾 910B NPU 上完成,未使用任何 NVIDIA 硬件——这是迄今为止首个公开可验证的 500B 以上参数级别、全程脱离 NVIDIA 硬件栈训练的开源模型。
模型权重已上架 Hugging Face(openPangu License V2.0),同时可通过华为云 ModelArts 在线体验,推理代码在 GitCode 的 Ascend Tribe 社区开源。
架构设计:MLA 混合注意力与 Muon 优化器
openPangu-2.0-Pro 在架构层面进行了多项创新:
- 混合注意力机制:沿用高效的多头隐式注意力(MLA),并引入 DSA(解耦稀疏注意力)与 SWA(滑动窗口注意力)的分层混合架构,层配比 1:2。SWA 层负责局部窗口建模,DSA 层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算与显存开销。
- 拓扑改进:将传统残差连接升级为 4 支流 mHC(multi-head Convolutional)架构,提升表征多样性与泛化能力。
- 自投机解码:采用 3 头多 token 预测(MTP)模块,一次前向可额外预测 3 个 token,显著提升推理吞吐。
- Muon 优化器:使用 Muon(MomentUm Orthogonalized by Newton-Schulz)替代传统的 Adam 类优化器,在受限的昇腾集群上通过更高的计算效率弥补单芯片算力差距。DeepSeek V4 Pro、Kimi K2 等前沿模型也已采用 Muon 或其变体。
后训练:三阶段 OPD 管线
后训练阶段分为三步:首先进行"快慢合一"的监督微调(SFT),随后分别针对不同能力域进行多专项强化学习(RL),最后通过在线策略蒸馏(OPD)将各专项模型的能力融合回单一通用模型。OPD 在训练过程中在线运行,旨在避免传统的序列微调带来的灾难性遗忘问题。该三阶段 OPD 管线在此参数量级的开源模型中尚属首次公开记录。
基准成绩:官方自报,尚无第三方验证
华为在技术报告中公布了两版模型的评测结果。以下是部分关键数据(均为官方自报):
| 评测集 | openPangu-2.0-Pro-Thinking | openPangu-2.0-Pro-Non-Thinking |
|---|---|---|
| AIME 2026 (Avg@16) | 95.4 | 87.3 |
| AIME 2026 w/ Python (Avg@16) | 97.9 | — |
| GPQA-Diamond (Avg@4) | 87.9 | 81.1 |
| HMMT Feb 2026 (Avg@16) | 86.2 | 63.3 |
| LiveCodeBench V6 (Avg@3) | 85.7 | 74.5 |
| SWE-bench Verified (Avg@3) | 68.5 | 66.8 |
| HLE | 27.1 | 9.0 |
需要强调的是:截至本文撰写时,Artificial Analysis、BenchLM 等独立评测平台均未发布 openPangu-2.0-Pro 的第三方评测结果。上述所有成绩均来自华为官方技术报告,独立验证预计需要数天至数周。
"全昇腾训练"≠"全国产供应链":关键的供应链背景
TechTimes 的深度报道指出了该声明中一个至关重要的限定条件:TechInsights 对昇腾 910B 和 910C 芯片的拆解分析发现,几乎所有受检芯片的计算核心(die)均由台积电 7nm 工艺制造,而非中芯国际(SMIC)的 N+2 工艺。华为通过注册于开曼群岛的芯片设计公司 Sophgo 获取了约 290 万颗台积电制造的 7nm die,该行为已被美国商务部认定违反出口管制,台积电因此面临可能高达 10 亿美元以上的罚款。
此外,拆解还在昇腾 910C 中发现了三星 HBM 堆栈。据报道,中国在 HBM 出口管制收紧前已储备约 1300 万颗三星 HBM 堆栈。
这意味着:openPangu-2.0-Pro 确实证明了昇腾软件与架构栈可以支撑前沿规模的训练,但用于训练该模型的昇腾 910B 芯片本身并未实现"全国产"——其核心 die 来自台积电,HBM 来自三星。随着台积电 die 库存在 2026 年初基本耗尽,未来昇腾芯片将完全依赖 SMIC 晶圆和长鑫存储(CXMT)的 HBM。下一个基于纯国产供应链的昇腾前沿训练才是真正的考验。
战略意义:出口管制背景下的参考架构
在出口管制持续升级的背景下,openPangu-2.0-Pro 的意义超出了模型本身:
- 对受限国家与机构:超过 100 个国家签署了《曼谷宣言》承诺 AI 主权项目。openPangu-2.0-Pro 为无法合法获取 NVIDIA 硬件的地区提供了从芯片、互联、框架到模型的完整技术参考。马来西亚已于 2025 年宣布基于昇腾的主权 AI 计划。
- 对 AI 研究者:MLA+DSA/SWA 混合注意力、OPD 后训练、Muon 优化器在 500B+ 规模上的组合尚未在公开文献中出现,技术报告已公开,社区评估期才刚刚开始。
- 对基础设施运营商:模型支持华为云 ModelArts 托管推理及自部署。社区正在推进标准格式转换以在 NVIDIA GPU 上运行,512K 上下文窗口使其在长文档处理场景中具有潜在优势。
同时需要客观看待差距:NVIDIA CUDA 生态拥有超过 400 万注册开发者,华为 CANN 生态仍在追赶中。兰德公司此前记录了科大讯飞从 NVIDIA 切换至昇腾 910B 时遭遇约三个月的开发延迟。华为承诺在 2026 年底前开源 CANN 和 MindSpore,这被视为弥合生态差距的关键一步。
法律与部署注意事项
使用华为云 ModelArts 托管推理意味着用户数据流经受中国《国家情报法》(2017)第七条和《网络安全法》第二十八条约束的基础设施——这些法律要求中国组织依法配合国家情报与公安工作。自部署权重于非中国境内基础设施的用户不受此约束。