AREX Feed Article
华为开源openPangu-2.0-Pro:首个全Ascend NPU训练的505B开源大模型,供应链调查揭示国产化局限
2026年7月31日,华为正式将openPangu-2.0-Pro的模型权重、基础推理代码及技术报告在Hugging Face、ModelScope和GitCode Ascend Tribe社区开源上线。该模型总参数量约505B(5050亿),每token激活18B参数,采用混合专家(MoE)架构,上下文窗口512K,预训练数据约34T tokens。openPangu-2.0-Pro是首个在不依赖NVIDIA GPU的情况下完成全量预训练的500B+级开源大模型——其训练完全基于华为自研Ascend 910B NPU。然而,TechTimes在8月1日发布的供应链调查指出,训练所用Ascend芯片的部分关键环节仍涉及非国产组件,令“全自主”叙事面临审视。
模型架构与技术特性
openPangu-2.0-Pro在架构层面进行了多项升级。注意力机制沿用高效的多头潜在注意力(MLA),并采用解耦稀疏注意力(DSA)与滑动窗口注意力(SWA)独立分层混合架构,层间配比为1:2——SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,在保持精度的同时降低长序列推理的计算与显存开销。传统残差连接被升级为4支流多头卷积残差(mHC)架构。模型还配备3头多token预测(MTP)自投机解码模块,一次额外预测3个token以提升推理吞吐。
训练采用了Muon优化器而非业界主流的AdamW。Muon通过Newton-Schulz迭代对动量缓冲进行矩阵正交化,将权重矩阵作为几何单元处理,在受限算力条件下获得更快的收敛速度。这一选择并非偶然——DeepSeek V4 Pro、Kimi K2和GLM-5.2等同样使用Ascend类硬件训练的大规模MoE模型均已采用Muon或其变体。
后训练阶段分为三个步骤:监督微调(SFT)融合“快慢思维”风格;多专项强化学习(RL)分别针对不同能力域训练专家模型变体;最后通过在线策略蒸馏(Online Policy Distillation, OPD)在训练过程中将各专家能力融合回单一通用模型,以避免顺序微调带来的灾难性遗忘或权重平均带来的能力稀释。
全Ascend训练的象征意义
openPangu-2.0-Pro的核心叙事在于:这是首个在500B+参数级别上,完全使用非NVIDIA硬件完成预训练的开源模型。此前DeepSeek V4 Pro(1.6T参数)、GLM-5.2和Qwen 3.7等中国前沿开源模型,其训练过程均不同程度依赖NVIDIA A100或H100 GPU集群。openPangu-2.0-Pro的发布证明,华为Ascend软件与架构栈可支撑前沿规模训练,这对无法合法或实际获取NVIDIA硬件的国家和机构具有参考价值。
华为常务董事余承东在6月的HDC 2026上曾解释,openPangu-2.0-Pro总参数“仅”505B的原因在于:华为的算力大量用于支持国内其他企业需求,自身保留的数量有限;加之AI算力成本极高,华为更聚焦时延和吞吐率的优化。该表态也间接承认了Ascend算力供给的紧张状况。
供应链调查:国产化叙事背后的现实
TechTimes于8月1日发表的调查报道揭示了一个更复杂的图景。TechInsights对Ascend 910B和910C芯片的拆解分析发现,几乎所有被检测芯片的计算核心(die)均来自台积电(TSMC)7nm制程,而非中芯国际(SMIC)。华为通过注册于开曼群岛的芯片设计公司Sophgo,获取了约290万枚TSMC制造的7nm die,这一行为被美国当局认定为违反出口管制,TSMC因此面临美国商务部可能高达10亿美元以上的罚款调查。
这批TSMC die库存支撑了2024至2025年Ascend芯片的产能,但据TechTimes报道,该库存已于2026年初基本耗尽。未来的Ascend芯片生产将完全依赖SMIC的N+2制程(使用深紫外DUV光刻而非极紫外EUV)。此外,Ascend 910C拆解中还发现了三星HBM堆叠,而中国虽已储备约1300万枚三星HBM,长鑫存储(CXMT)在HBM级产品的产量和良率上尚未达到三星或SK海力士的水平。
这意味着,openPangu-2.0-Pro虽证明Ascend软件与架构栈可完成前沿规模训练,但训练该模型的实际硬件并非完全国产——下一代完全基于SMIC计算die与CXMT HBM的Ascend训练,才是真正的考验。
性能评估与社区反响
Hugging Face模型页面公布了openPangu-2.0-Pro的详细评测结果。Thinking版本在AIME 2026数学竞赛题上达到95.4(Avg@16),GPQA-Diamond达87.9(Avg@4),LiveCodeBench V6达85.7(Avg@3),SWE-bench Verified达68.5(Avg@3),HLE(人类最后考试)为27.1。这一成绩在开源模型中具备竞争力,但与DeepSeek V4 Pro等前沿模型相比仍存在代际差距。
截至8月1日,openPangu-2.0-Pro尚未进入LM Arena(Chatbot Arena)文本榜单的前120名(榜单截至当日共收录386个模型),社区盲评投票数据缺失。这意味着在真实用户偏好这一目前最具参考价值的非基准评测维度上,openPangu-2.0-Pro尚未获得足够的社区认知度和使用量。Hugging Face页面显示模型月下载量为31次,同样偏低。社区对模型能力的评估很大程度上仍依赖华为自报的基准测试分数,独立验证尚不充分。
此前的Flash版本(92B总参/6B激活,6月30日开源)已通过社区贡献合并入ik_llama.cpp,使模型可在非Ascend硬件上运行。Pro版本的社区适配工作尚在早期阶段,其Ascend原生特性限制了NVIDIA GPU用户的直接使用。
地缘政治背景
openPangu-2.0-Pro的开源发布正值中美科技脱钩持续加剧之际。7月28日,美国联邦通信委员会(FCC)宣布禁止进口新的外国制造人形机器人及四足机器人,明确针对中国;同期,美国对华半导体出口管制持续收紧,ASML的EUV光刻机仍被禁止对华出口。
美国外交关系委员会(CFR)2025年12月的分析指出,当前美国最先进AI芯片的性能约为华为最佳芯片的5倍,且该差距预计到2027年将扩大至17倍。兰德公司(RAND)记录了科大讯飞从NVIDIA转向Ascend 910B训练时经历的三个月开发延迟。在这一背景下,openPangu-2.0-Pro的发布成为中国算力自主叙事的重要节点——其象征意义大于即时的能力冲击。
华为在官方声明中表示:“我们诚邀全球开发者、企业伙伴及研究人员下载使用,或访问华为云MaaS模型即服务平台在线体验,欢迎广大用户反馈使用意见,助力开源生态持续进步。”
来源
- (2026年8月1日)
- (2026年8月1日)
- (2026年7月31日)
- (2026年7月31日)
- (2026年7月29日)
- (截至2026年8月1日)