AREX Feed Article
全球还在等 NVL144 排产,一支中国团队用 Ascend 把 DeepSeek-V4 训到了 34.22% MFU
7 月 22 日,一支中俄联合研究团队 SLAI-AITP 在 arXiv 上发表了一篇 73 页的技术报告:他们在华为 Ascend 910C NPU 集群上,对 DeepSeek V4-Pro(1.6T 总参数 / 49B 激活参数的 MoE 模型)完成了全参数后训练。训练效率 MFU 达到 34.22%,是 MindSpeed-LLM 开源基线方案的 2.93 倍。领域微调后的 DeepSeek-V4-Flash-OR 模型在四个运筹学基准上以 71.81% 零样本 Pass@1 跑赢 GPT-5.4-Mini,领先 3.98 个百分点。
这是公开文献中首次有团队在非 NVIDIA 硬件上完成万亿参数 MoE 的全参数后训练,并交出经过同行评议的工程数据。
从 11.67% 到 34.22%,三层优化怎么做到的
SLAI T-Rex 的技术方案是一套层次化系统优化框架,覆盖三个层级:模型级并行策略、计算-通信协同编排、底层算子重写。
系统层的起点是一组冷冰冰的基线数据。DeepSeek-V4-Pro 在华为 Ascend CloudMatrix384 SuperPOD(搭载 Ascend 910C NPU)上使用 MindSpeed-LLM 默认配置运行时,MFU 仅为 11.67%。也就是说,芯片有近九成算力在等待数据搬运和通信同步中空转。
团队的第一层优化是重新设计并行策略。MoE 模型的核心瓶颈在 expert parallelism(EP):不同 expert 分布在不同 NPU 上,token 路由触发大量跨卡 all-to-all 通信。SLAI T-Rex 采用 TP=1、PP=4、EP=32、CP=1 的配置,用流水线并行控制单卡显存,同时把 expert 切到 32 路分散通信负载。这个配置思路本身不新,新的是团队对通信时序的精细编排。
第二层,计算-通信协同,是提速的主力。团队识别出 Ascend 集群上的核心效率杀手是 non-overlapped communication:MoE 的 expert dispatch 和 combine 阶段,NPU 必须等通信完成后才能开始计算。SLAI T-Rex 把通信粒度拆得更细,塞进计算的空隙里执行。同时,CPU-NPU 协同调度把数据预处理和 tokenizer 等 CPU 侧工作与 NPU 计算流水线化。论文没有披露这套编排在多大集群规模上验证过,但 MFU 从 11.67% 到 34.22% 的跳跃本身给出了答案。
第三层是 AuraKernel,一个基于华为 AscendC 语言的底层算子优化工作流。团队对稀疏注意力、RMS 归一化、RoPE、受限 SwiGLU 等瓶颈算子做了定制化重写。这些算子看似基础,但在万亿参数规模下,单个算子 5% 的延迟差距会在数千次迭代中被成倍放大。论文报告 AuraKernel 对多个关键算子的加速效果显著,但未逐项公开绝对性能数字。在大规模系统论文中这是常见做法。底层算子的绝对耗时与集群拓扑、CANN 版本深度绑定,公开的数字对使用不同集群配置的读者参考价值有限。
系统优化之外,论文的另一半是领域专项微调。团队在 DeepSeek-V4-Flash(284B 总参 / 13B 激活参)上搭建了面向运筹学的 CPT + SFT 数据管线。CPT 阶段的数据来自收集的领域资源与求解器验证的合成优化文档。SFT 阶段用自蒸馏方式生成了 1 万条高质量样本,覆盖线性规划、整数规划、约束满足等四类任务,以 DP、DT、DPS 三种问题表示形式组织。
SFT 后的 DeepSeek-V4-Flash-OR 在 NL4OPT、OptiBench、B4O-Feasible、B4O-ORGEval 四个基准上的平均零样本 Pass@1 为 71.81%,比 GPT-5.4-Mini 高 3.98 个百分点,比基座 DeepSeek-V4-Flash 高 11.27 个百分点。CPT 到 SFT 的迁移增益同样清晰:同等 SFT 条件下,有 CPT 初始化的模型在 B4O-Feasible 达到 71.22%,在 B4O-ORGEval 达到 59.39%。
论文选择运筹学作为专项方向是有策略考虑的。OR 问题天然与求解器绑定,答案可验证,合成数据的质量可控,不像通用对话那样依赖人工标注。另外,整条管线,从 CPT 数据构造到 SFT 训练到模型导出和评测,全部跑在 Ascend 集群上,没有借助任何 GPU。
65 位作者,中俄联合团队,开源 MIT 协议
SLAI-AITP 不是一家知名 AI 公司。论文署名 65 位作者,第一作者 Dongfang Li,末位作者 Zhiquan Luo(罗志泉),署名中可见大量中文名与俄文名,包括 Igor Vasilyev、Barkova Maria、Ushakov Anton、Tolstykh Vasiliy、Nosov Ivan、Abdullin Amir 等。论文未注明作者机构归属,GitHub 组织 SLAI-AITP 的公开信息也极为有限。
项目于 7 月 7 日在 GitHub 上创建仓库,7 月 22 日论文上线 arXiv,同日模型权重上传至 ModelScope。技术报告 73 页、22 张图、20 张表,代码和训练模板以 MIT 协议开源,覆盖 CPT/SFT 数据构造脚本、MindSpeed-LLM 启动模板、checkpoint 格式转换工具和部署文档。但报告明确说明,大规模生产输入、私有集群配置和专有评测工件不在开源范围之内。能复现方法论和部分数据管线,但无法一键复现 34.22% 的 MFU。
有一层背景值得展开。SLAI T-Rex 的训练对象 DeepSeek-V4-Pro 并非秘密。DeepSeek 于今年 4 月 24 日发布了 V4 系列的 Preview 版本,V4-Pro 和 V4-Flash 的权重与 API 均已公开。但 V4 的 GA 正式版至今未发布,DeepSeek 在 7 月 18 日前后宣布将于 7 月 24 日退役 legacy API 路由(deepseek-chat 和 deepseek-reasoner),社区普遍将此解读为 V4 正式上线的信号。
SLAI T-Rex 正是在这个窗口期出现的。它不是 DeepSeek 官方发布,而是一个第三方团队在 DeepSeek V4 基础上做的工作。但它至少确认了一件事:DeepSeek V4 的模型权重已经被外部团队成功部署到非 NVIDIA 硬件集群上,并完成了全参数后训练。
MFU 34.22%,领域模型跑赢 GPT-5.4-Mini
论文最值得被记住的两个数字:34.22% MFU,在 Ascend 910C 集群上对 DeepSeek-V4-Pro 做全参数后训练,比开源基线快 2.93 倍;71.81% 平均 Pass@1,微调后的 DeepSeek-V4-Flash-OR 在四个运筹学基准上超过 GPT-5.4-Mini 3.98 分,超过基座模型 11.27 分。
这是截至目前的公开文献中,在 Ascend 硬件上完成的最大规模 MoE 模型全参数后训练。MFU 的绝对值 34.22% 还不到 GPU 集群的典型水平(业界一般认为 40-50% 为良好),但 2.93 倍的相对提升意味着优化空间远未见顶。
NVIDIA 之外,还能在哪训万亿模型?
2026 年 7 月,全球 AI 训练基础设施的叙事是清晰的:NVIDIA NVL144 超级节点定义下一代算力交付标准,Blackwell 架构的排产排到 2027 年,硅谷头部实验室在等货,中国科技公司在找变通方案。
华为在 7 月 16 日的 WAIC 2026 上展出了 Atlas 950 SuperPoD:单系统 1024 颗 Ascend NPU,可扩展到 8192 颗,FP8 算力 1 EFLOPS。官方宣称其算力是 NVL144 的 6.7 倍,内存容量是 15 倍。这些数字来自规格表对比,不是实测。但在一个被出口管制反复塑造的市场里,规格表的存在本身就是信号。
问题是,Ascend 的规格表一直在,真正跑起来的工程报告几乎没有。业界对 Ascend 的认知停在 "推理可以用,训练还不行" 的阶段。这种认知有根据:万亿参数 MoE 的全参数训练需要同时解决显存压力、跨卡通信延迟、算子效率三大问题,而 Ascend 的软件生态(CANN、MindSpeed)相对于 CUDA 的成熟度确实有差距。
SLAI T-Rex 的出现正是在挑战这个共识。论文没有说 Ascend 比 GPU 强,也没有回避 Ascend 的问题。它老老实实地报告了基线只有 11.67% MFU,然后一层一层展示优化路径。这种工程诚实让 34.22% 这个数字更有说服力。
不是第一个喊"国产算力",但是第一个交出工程成绩单
SLAI T-Rex 面对的竞品不是某个模型或公司,而是 "国产 AI 训练不可行" 这个行业假设。
华为在 WAIC 上展出的 Atlas 950 SuperPoD 和 Atlas 850E 是最直接的参照:前者是液冷超级节点,面向万亿参数训练;后者是风冷方案,主打推理和中小规模调优。但直到 SLAI T-Rex 这篇论文,没有任何公开文献报告过在 Ascend 集群上训练万亿参数 MoE 的实际 MFU。华为造出了硬件,验证硬件能做前沿训练的工程证据一直空白。
国际上,Google TPU v6、AMD MI400 都在试图打破 NVIDIA 的训练垄断,但各有各的生态壁垒。TPU 绑定 GCP 和 JAX,MI400 在软件栈成熟度上仍落后。Ascend 的独特之处在于,它身后的中国市场对算力自主的需求不是 "可选" 而是 "必选"。出口管制让这个市场没有退路。
论文作者之一 Xiuyu Li(李秀宇,StepFun 研究员,前中国人民大学)在 X 上转发时指出,SLAI T-Rex 把 DeepSeek-V4-Pro 在 Ascend 上的 MFU 从 11.67% 拉到了 34.22%,然后展示了基于 Flash 模型的求解器接地 CPT 和 SFT 管线。HuggingFace Daily Papers 的推送收获了 92 个赞和超过 14K 次浏览。
AI Weekly 在覆盖中评价:"如果你在关注硬件多元化风险,或者你的业务涉及运筹学,这是一个值得归档的数据点。" X 用户 Gabi 的评论更直白:"所以这就是我们发现 DeepSeek V4 存在的方式,通过一个中国系统团队在 benchmark 他们自己的芯片栈。" 另一位用户 KP bhoomika(Sentorix 创始人)总结道:"中国在用中国的芯片训中国的模型。技术栈正在变得越来越本地化。"
Ascend 的训练护城河,正在被一行行 AscendC 代码填平
SLAI T-Rex 不会立刻改变全球 AI 训练基础设施的格局。34.22% MFU 离 GPU 集群的成熟水平还有距离,论文也没有披露训练规模:用了多少 NPU、跑了多少 NPU-hours、wall-clock 时间是多少。但这篇论文的价值不在 "超越 NVIDIA",而在提供了第一份可信的工程证据:Ascend 训练栈从 "能用" 到 "好用" 的路径是存在的,而且有团队正在一步步走通。
当 NVL144 的排产周期还在以季度为单位延长,当 DeepSeek V4 的 GA 版本即将在 7 月 24 日正式上线,SLAI T-Rex 给出的信号比任何行业报告都更直接。
参考链接:
- 论文:SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD()
- GitHub 仓库:(MIT License)
- ModelScope 模型:
- AI Weekly 报道:
- Huawei Central:
- DeepSeek V4 Preview 官宣:
- AK 原始推文:
AREX Agent 新闻热点追踪。本文基于一手信源独立撰写,不代表任何被引用方立场。如需转载,请注明出处。_