AREX Feed Article
NVIDIA 上架五个 550B 教师模型:Nemotron 3 Ultra 的老师公开了
8 月 14 日,NVIDIA 在 Hugging Face 的官方组织下一次性放出五个 Nemotron 3 Ultra 教师模型:、、、 和 。五个模型卡都标注 Hugging Face 发布日期为 08/14/2026。
五个模型统一为 550B 总参数、55B 激活参数,许可为 OpenMDW-1.1,官方标注的最低运行配置是 4 张 GB200/B200/GB300/B300 或 8 张 H100。模型卡写明它们的正式身份:MOPD(Multi-Teacher On-Policy Distillation,多教师在线策略蒸馏)阶段的领域专家教师。
当晚 23:15(UTC),开源模型研究者 Nathan Lambert 关注。他的 X 简介写着此前在 Ai2 联合领导 OLMo、撰写 Interconnects 通讯。
他称这些为「专家模型」:「很高兴看到 NVIDIA 发布了用于 MOPD 的专家模型。这让相关研究开始变得容易获取得多。」随后补了一句:「不过对多数研究者来说,这些模型太大了。」
Lambert 转发后,评论区先算起了 GPU 账单
Lambert 的推文链接指向 Competition-Coding 教师页;截至 8 月 15 日,这条推文显示 113 次点赞、15 次转发、8 条回复。
比他早约 10 分钟,新模型播报账号 DailyPapers(@HuggingPapers),称其为「550B(55B 激活)的编程专家,为竞赛编程而建,也用作蒸馏教师」。
次日 06:06(UTC),DailyPapers General-Reasoning 教师:「为长程数学与逻辑而建的 550B MoE,微调目标是把最难的题蒸馏出去。」
回复区里,本地模型爱好者 @thebasedcapital :「这种体量的开放权重,留给多数研究者的还是盯着 GPU 账单发呆。」开发者 @zswaff :「『易获取』,直到你看见参数数量为止。」
6 月交学生,8 月交老师
这些教师的来龙去脉写在 6 月 9 日的 里:Ultra 是 550B 总参数、55B 激活的混合 Mamba-Attention MoE 模型,20 万亿 token 预训练,后训练分 SFT、RL、MOPD 三步。
报告称,NVIDIA 当时「训练了十多个领域专用教师模型」,其中包括 agentic 教师。
6 月的开源清单只有 Base、Post-Trained、NVFP4 量化检查点和 GenRM,外加配方、数据与 RL 环境,教师检查点不在其中。8 月 14 日上架的五个教师,模型卡记录训练时间为 2025 年 12 月至 2026 年 5 月,后训练数据截止 2026 年 5 月,全部收录在 里。
五位 550B 老师,各守一个领域
五个教师各司其职:Competition-Coding 面向竞赛编程、算法题与代码推理;General-Reasoning 主攻数学、逻辑中最难的多步题;STEM 覆盖数学、代码、自然科学与人文学科推理;Instruction-Following 负责指令遵循与结构化输出;Chat 管多轮对话与语气。
架构同为 LatentMoE(Mamba-2 与 MoE 交错排列,辅以注意力层)加 Multi-Token Prediction,NVFP4 预训练,上下文最长 1M token。
Competition-Coding 教师从后训练完成的 Ultra 学生出发,再做一轮编程向 SFT 与 RL:训练数据须通过编译和测试执行验证,奖励同样来自编译器与测试。报告称这轮 RL 在 LiveCodeBench v6 上比通用推理教师高 2.4 分。
STEM 模型卡声称在 GPQA、MMLU-Pro、LiveCodeBench v6、IMOAnswerBench 和 Apex Shortlist 上与 DeepSeek V4 Pro (High) 打平或超过。报告 Table 3 给出的对比是:IMOAnswerBench 92.5 对 88.0,LiveCodeBench v6 90.0 对 89.8,GPQA 88.5 对 89.1。
这些是 NVIDIA 自己在模型卡与技术报告里给出的评估数字。
复现 MOPD 缺的那块拼图,8 月补上了
MOPD 的做法是:学生模型在全部领域自己生成 rollout,由相应教师逐 token 打分,学生再对齐教师的输出分布。整个过程异步流水线化,Ultra 训练跑了两轮迭代;教师还从更新后的学生检查点重新出发,形成学生与教师的共同进化。
模型卡写明,这些教师可单独用于「自己的蒸馏与数据生成管道,充当教师或评分器」,且商用与非商用均可。代价同样写清:Competition-Coding 仓库的模型索引显示单份权重约 1.12TB;显示,五个教师截至 8 月 15 日的下载量在 75 到 872 之间。
教师权重到位了,运行门槛原样保留:4 张 B200 或 8 张 H100 的最低配置,与 Lambert 的提醒、评论区的 GPU 账单吐槽指向同一处。
报告里的其余教师,还没露面
报告图 10 的流水线里还有 SWE、Office work、Search、Usability、Agentic Safety 等教师,截至 8 月 15 日未见 NVIDIA 的 Hugging Face 组织。
截至 8 月 15 日中午,NVIDIA 官方 X 账号(@NVIDIAAI)的推文里也没有这批模型的发布帖,它们是被 DailyPapers 和 Lambert 的转发带进公众视野的。
NVIDIA 把 MOPD 配方里最贵的中间产物也公开了,这套「十多个专家蒸馏一个学生」的方法正在走向可复现。550B 参数、1.12TB 权重和 4 张 B200 的最低配置划定了使用者的范围:先把机器备齐,才谈得上复现。