AREX Feed Article
Yandex 开源 AliceAI-Foundation-80B-A3B-Base:从零训练 18 万亿 token,称预训练评测胜过更大的 DeepSeek-V4-Flash-Base
2026 年 9 月 21 日,Yandex 在 Habr 官方博客,以 Apache 2.0 许可证开放其新基础模型 AliceAI-Foundation-80B-A3B-Base 的权重,模型已上架 。按官方模型卡,这款模型总参数 80B,每个 token 激活 3B,上下文窗口最高 262,144 token,训练完全从零开始,没有使用任何第三方开源模型的权重做初始化。 同日报道补充了训练规模:预训练消耗了 18 万亿 token。
成绩单是 Yandex 自己给出的:在预训练评测中,这个 80B 模型在多项任务上超过体量大得多的 DeepSeek-V4-Flash-Base(284B 总参/13B 激活)与 Nemotron-3-Super;并称以约三分之一总参、约七分之一激活参数的体量,在事实性知识、数学、编程和长上下文上超过自家 2025 年 10 月发布的闭源模型 Alice AI LLM 235B。这些对比均出自 Yandex 内部评测口径。
图:Habr 官方发布的题图,俄语标题意为「模型在基准上的成绩,%」。
权重已可下载:512 个专家、48 层混合架构与四卡部署
官方把它描述为一款带 MoE(Mixture of Experts,混合专家)层的混合架构基础语言模型:48 层,按 12 组循环,每组由三个「KDA → MoE」块与一个「Gated Attention → MoE」块组成;MoE 部分共 512 个专家,每个 token 路由到 10 个专家外加 1 个共享专家;另带 1 层 MTP(multi-token prediction,多 token 预测)。词表规模 129,024,隐藏维度 2,048。
部署门槛不算低。按模型卡,用 Transformers 加载的参考版本是 5.16.1,KDA 层在 GPU 上运行还需要 flash-linear-attention 0.5.0;用 vLLM 部署走官方 Docker 镜像,示例配置为 4 卡张量并行,并启用 MTP 投机解码(每次猜测 1 个 token),SGLang 也在支持列表里。许可为 Apache 2.0,www1.ru 的报道指出它允许商用与研究使用,开发者可以自行运行模型并按自己的任务微调。
定位上,Yandex 在公告中把这次开源称作迈向其「统一推理模型」(ЕРМ)的又一步,Alice AI 的 Agent 能力未来将在这条路线上发展;www1.ru 也把它描述为未来支持推理与 Agent 能力的 Alice AI 基础。需要留意的是,这次发布的是预训练(pretrain)阶段的 Base 权重:官方表格里的成绩取自预训练「推理阶段」结束后的最终 checkpoint(检查点),Agent 技能是他们在 SFT(supervised fine-tuning,监督微调)之后单独测的。
从续训 Qwen3-235B 起步到完全从零:约半年的重来
公告把这次发布接在两条旧线上。一条是去年 12 月发布的:那时的 Alice AI LLM 235B 训练是从 Qwen3-235B-A22B 的权重起步的;这一次则是完整的从零训练。另一条是同事们近期开放的——按公告的说法,那款模型同样没有用开源权重初始化。
团队把这次从零训练的整个流程压在约半年内完成:重造训练语料、试了多套架构方案、重新选定超参数,并在数据里加入复杂推理与工具交互内容。每个关键决策的验证成本也不低——语料更新、架构与超参数各自的贡献,是在一系列从零开始、每个 2 万亿 token 的独立训练中测出来的。
自评成绩单:赢在哪,输在哪
这次的对阵名单包括 Qwen3.5-35B-A3B-Base、GLM-4.5-Air-Base(106B 总参/12B 激活)、Nemotron-3-Super-120B-A12B-Base(120B/12B)、DeepSeek-V4-Flash-Base(284B/13B),以及自家 2025 年 10 月版的 Alice AI LLM 235B Base。除 Qwen 外,其余模型的总参与激活参数都比新模型大。
Yandex 称,在事实性、教育与专家知识三组共 10 项基准中,新模型拿下 8 项第一,优势尤其集中在俄语语境:自建的 得 86.5(DeepSeek 为 83.2,Qwen 仅 62.4), 得 67.9;数学上 MATH-500 拿下对比中的最高分 91.1。
| 基准 | AliceAI 80B-A3B | Qwen3.5-35B-A3B | GLM-4.5-Air | Nemotron-3-Super | DeepSeek-V4-Flash |
|---|---|---|---|---|---|
| WikiWebFacts(俄语事实) | 86.5 | 62.4 | 70.2 | 72.8 | 83.2 |
| MATH-500 | 91.1 | 81.9 | 60.2 | 84.8 | 80.7 |
| TriviaQA | 79.0 | 71.4 | 83.5 | 89.8 | 89.4 |
| LongMemEval 128k | 64.6 | 55.6 | 50.6 | 64.8 | 68.0 |
表:摘自 Yandex 公布的预训练评测主表,均为其内部评测口径。
更难的推理类基准上差距拉开:IMO AnswerBench pass@8 得 88.7(Qwen 84.5、Nemotron 64.5),HMMT 2026 年 2 月赛题 pass@32 得 96.9,LiveCodeBench v5-6 pass@8 得 82.9,AIME 2026 pass@32 与 Qwen 并列 96.7。pass@k 衡量的是 k 次尝试中至少解对一次的概率。DeepSeek-V4-Flash-Base 没有出现在这张对比表里——Yandex 称,在他们的多种测量设置下,该模型的成绩都接近于零。
输掉的项目也写在同一份材料里:英语事实性的 TriviaQA(79.0 对 Nemotron 的 89.8)、MMLU-Pro(66.8 对 69.9)、SuperGPQA(44.3 对 46.6)和 BigCodeBench(48.3 对 DeepSeek 的 49.1)都让出第一;与自家 235B 相比,俄罗斯统考 EGE(90.5 对 93.3)和 BigCodeBench(48.3 对 49.8)两项也仍然落后。长上下文介于两者之间:FinQA 128k 与 DeepSeek 并列第一(74.1),LongMemEval 128k 排在第三,落后第二名 Nemotron 0.2 个百分点。所有测量在 Yandex 内部评测基础设施上完成,主表用 vLLM、temperature=0,推理类用 temperature=1 并配合惩罚项设置(repetition_penalty=1、presence_penalty=1.5)。
技术报告里的四个意外
随权重一起放出的还有一份技术报告,覆盖数据管线、评测协议、训练稳定性与 scaling laws(缩放定律),关键决策附消融实验,也写明了最终放弃的路线。公告列出了几个被团队自己标为「意外」的结果:留出语料上的 loss(训练损失)几乎预测不了哪个模型在目标基准上更强;按 scaling laws 重算超参数后,训练一度「爆炸」,MoE 激活值持续走高、loss 随之陡增,他们不得不排查究竟是预测错了,还是新超参数暴露了训练流程本身的问题;在「从开源模型初始化」时代好用的数据增强配方,放到更长的从零预训练里必须重新设计;只教模型复杂推理,不足以让它获得 Agent 技能,把工具交互提前放进预训练,post-train(后训练)之后的 Agent 基准成绩才有改善。
为什么要自建基准:失效、过拟合与判卷一致性
WikiWebFacts 与 HardMultiQA 是随模型同日开放的两个事实性基准,侧重俄语语境,并附评测协议。Yandex 在公告里解释了自建的理由:公开基准会随时间失去区分度,也容易被针对性过拟合;他们按真实用户场景设计测试,再验证自动判分与人工评分的一致性;对采用的公开基准则在与已发表结果相同的模型上重测,结果对不上就调整测法。开放这两个基准与协议的目的,公告说得很直白:让第三方能够独立复现报告里的结果。
Sber 的回应、三种成本估算与「主权模型」认证时间表
www1.ru 的报道为这场发布补上了竞争背景:今年 7 月,Sber CEO 格尔曼·格列夫(German Gref)曾表示只有该行拥有完全自主的大型语言模型,并称 Yandex 实际是在微调阿里巴巴的 Qwen 模型;Yandex 当时否认了这一说法。如今,一个从零训练的 80B 模型连同权重一起公开。
Sber 代表称,Alice AI Foundation 的出现证明了俄罗斯工程团队的水平,但把竞争尺度拉回旗舰模型:参数不超过 1000 亿的模型市面上已有不少,而俄罗斯在全球竞争中的位置,主要取决于数千亿乃至万亿参数的旗舰模型。财经大学(Financial University)人工智能系主任米哈伊尔·科罗捷耶夫(Mikhail Koroteev)把这次发布视为对持续讨论的回应、Yandex 试图缩小与 Sber 差距的动作,并预计 post-train 之后它将有能力与 GigaChat 3.5 Reasoning 竞争。
成本是另一笔账。Yandex 未披露任何数字,www1.ru 援引的外部估算口径不一:《Vedomosti》在一家大型云厂商的消息人士把主训练阶段估在 1.5 亿~4.5 亿卢布;大语言模型研发中心负责人瓦连京·马雷赫(Valentin Malykh)通过 MWS AI 代表给出的估算是租用 Nvidia DGX 系统约 40 亿卢布;Data Light 商务发展总监亚历山大·格罗莫夫(Alexander Gromov)把包含实验与失败启动在内的算力成本估在 5 亿~10 亿卢布。
「主权模型」这个标签眼下还挂不上。按 www1.ru 的说法,Yandex 将这次发布定位为完全自主,但法律为这类模型设定了单独的合规确认程序:主权大基础模型须由俄罗斯法人开发、生命周期技术上可复现、用户响应与数据存储由俄罗斯数据中心承载,并通过规定的合规确认;门槛较低的「国家模型」则允许在开放许可下使用俄罗斯与境外组件。而相关主要规范要到 2027 年 3 月 1 日才生效,在那之前,「主权」仍只是 Yandex 自己的定位表述。