AREX Feed Article
Marin 535B-A23B 全开放预训练开跑:18.75T tokens、11 台 GB200 NVL72、约 3 个月
8 月 21 日,斯坦福大学计算机科学教授、Together AI 联合创始人 Percy Liang ,全开放(fully open)MoE 模型 Marin 535B-A23B 的预训练已于本周启动。他公布的「航程计划」(voyage plan)是:80% 预训练 + 20% midtraining,合计 18.75T tokens,在 11×GB200 NVL72 上运行约 3 个月,约 2.7e24 FLOPs;预训练与 midtraining 结束后还有 post-training。「和往常一样,整个过程都是开放的。」
开跑之前,团队用从 1.6B-A61M(48B tokens)到 27.7B-A1.2B(926B tokens)的四阶 scaling ladder 做了校准,既用来排查问题,也用来预测这次 hero run(正式运行)的表现。「这是迄今我们最大的一次运行,所以肯定会有意料之外的事(expecting the unexpected)。」Liang 写道。
18.75T tokens 的航程
Marin 团队把这次运行登记在 (标题为「[Hero Run] 535B-A23B on 18T tokens」)里,issue 创建于 8 月 18 日,完整模型规格公开在评论中:535.3B 总参数、22.76B 激活参数(模型名里的 A23B 即约 23B 激活参数),hidden dim 6144、48 层、384 个 expert、top-k 8,采用 EP64 专家并行,在 GB200 上用团队自研的 pooled-wave expert-parallel all-to-all 实现。
预训练数据是两阶段 Harrier 配比(two-phase Harrier mixture),存放在模糊去重后的 datakit 数据仓库。公开的 wandb 报告「」实时追踪这次运行。
这是 Marin 迄今最大的运行。此前的公开成果包括 和 ,这次的总参数约为 67B 运行的 8 倍。
先跑四档小模型,再押注 hero run
scaling ladder 共四档:1.6B-A61M(48B tokens)、4.0B-A162M(128B tokens)、11.5B-A481M(381B tokens)、27.7B-A1.2B(926B tokens),与 hero run(535B-A23B,18T tokens)。
Open Athena 技术员工、参与 Marin 项目的 :上一轮 67B MoE 运行中,scaling law 让团队模拟出了整条训练轨迹,最终 loss 命中目标的误差在 1% 以内,训练中途任意时间点的 loss 也能预测到 1% 以内。「基于这一发现,我们用 scaling ladder 模拟了昨天开跑的 535B MoE 的整条训练轨迹。会怎么样,走着瞧。」
issue 里列了跑 ladder 的理由:提前发现 bug、观察梯度范数与 token dropping 等训练动态、把整个运行周期的 eval 投影出来逐点对照、为 hero run 的异常提供小规模参照,以及最后一条:只花总计算量的 1%。上一轮 ladder 就抓出过问题:梯度范数随 token horizon 增长超过 4,团队据此加入 logit z-loss 修复,后续消融显示没有这个修复,高 batch size 下的运行会在中途彻底崩溃。
时展示过这套方法的潜力:团队称小规模运行曾以 0.2% 的误差预测一次 1e23 FLOP 规模的运行,外推距离为拟合区间最大点的 300 倍。
从 GitHub issue 到 wandb,全程公开
「和往常一样」是 Marin 的方法论。2025 年 5 月 19 日的成立公告里,团队把 Marin 定义为开放实验室:每个实验用 GitHub issue 跟踪,issue 相当于迷你预注册,先声明假设与目标;实验以 PR 形式提交,任何人都可以评审;运行过程可实时观看,并附 WandB 链接。
这次运行沿用同一套流程。issue #8435 承担登记与追踪职能,数据配比、超参数、模型规格全部公开;Liang 在紧接着的第二条推文里补充,除了预测最终 loss,他们还能预测中间 checkpoint 的 loss,「这样可以在航行途中检查我们是否在轨道上」。第二条推文附带的 scaling ladder 预测图(本文封面),图注直接指向 issue #8435。
恭喜、追问与验算:社区的第一轮回应
主推文发布后数小时内获得约 580 个赞、3.4 万次浏览(截至 8 月 22 日检索时)。回复里信息量较高的几条来自开放模型圈的技术人员。
「恭喜团队!很高兴看到有算力提供给非营利组织,期待之后用上这个模型。」前 AI2 OLMo 联合负责人、现从事开放模型研究的 。EvolutionaryScale 联合创始人、现 Biohub 的 :「有什么理由只训练约 18 TPP(tokens per parameter)?」
曾从事漏洞研究与安全方向的 :2.7e24 FLOPs 除以 18.75T tokens 约等于 144B FLOPs/token,接近 6×23B,比稠密 535B 的对应开销低约 22 倍,认为预算与 A23B 的标签对得上。用户 是:「公开数据配比、配置和实时 loss,让这次训练成为人们真正能学到东西的一次运行。」poolside 联合 CEO 是:「开放程度令人惊叹。」
3 个月里要过的关卡
issue 里写明了这次运行的容错与变数。硬件故障或 MFU 下降造成的延迟,最多用 25% 的 token 预算补偿:缩短 token horizon,同时调整线性 LR 衰减速率。长上下文是另一项计划内风险:从 4k seqlen 起步(比上一轮的 8k 更保守,为换取更好的 expert 均衡),运行到 50% 时升到 8k,95% 时升到 65k,最后做针对性的 262k 阶段;运行约 10 到 20 天时安排一次一两天的早期 cooldown,用于启动 RL 实验,同时收集长上下文影响 token dropping 的第一个全规模数据点。
「这是迄今我们最大的一次运行,我预计一路上会有大量学习和调整,但这也是乐趣所在。」Larry Dial 在 8 月 20 日写道。按约 3 个月(issue 记为约 100 天)的计划,预训练与 midtraining 要到 11 月下旬才结束,之后还有 post-training。在那之前,外界能核对的进度就是 wandb 曲线与 ladder 预测的贴合程度;按 8 月 19 日前后开跑推算,第一次 early cooldown 大约落在 8 月底到 9 月初。