AREX Feed Article
字节跳动训练 10 万亿参数模型:规模三倍于 Kimi K3,直逼 Anthropic Mythos
8 月 7 日,称,字节跳动正在预训练一个参数规模高达 10 万亿的 AI 模型。这不仅是中国迄今为止曝出的最大单体模型训练项目,也可能让这家 TikTok 的母公司首次进入与 Anthropic Mythos 同一重量级的竞赛。同日跟进报道了 FT 的披露。字节跳动未予证实。
一位接近该项目的人士告诉《金融时报》,模型目前处于预训练早期阶段,这一阶段通常需要三到六个月,之后才会进入微调和安全对齐。最终参数量也尚未确定。
10 万亿参数,预训练还要跑三到六个月
中国目前公开发布的最大模型是 Moonshot AI 的 ,总参数 2.8 万亿。字节跳动的新模型比它大了三倍以上。即便放到全球范围,目前仅有 Anthropic 的 系统被广泛认为处于这一量级。 Mythos 约为 8 万亿参数。Anthropic 在 2026 年 4 月发布的 Mythos Preview 系统卡中将其描述为"迄今为止能力最强的前沿模型",但因能力提升幅度过大,公司决定不向公众开放,仅限与少数合作伙伴用于防御性网络安全项目。
参数数量并非衡量模型能力的唯一标准。业界在过去两年已经反复验证,数据质量、训练方法和架构效率往往比单纯扩大参数更能决定最终表现。但 10 万亿这个数字本身意味着一件事:字节跳动愿意为一轮预训练投入的算力,足以将绝大多数竞争者挡在门外。
据《金融时报》报道,该模型预计采用 MoE(混合专家)架构。MoE 的核心逻辑是把模型的大多数参数拆分成多个"专家"子模块,每次推理只激活其中一小部分。10 万亿总参数并不等于 10 万亿参数同时在跑,实际激活量可能只有 10% 到 20%。独立分析师估计 Anthropic 的 Mythos 也采用类似策略,每次前向传播激活约 8000 亿到 1.2 万亿参数。
MoE 的选择有其现实考量。字节跳动在 2025 年 3 月开源了 ,一套专门优化 MoE 通信效率的框架,宣称在单层 MoE 上实现 1.96 倍加速、端到端训练 1.71 倍加速。一家公司不会无缘无故投入研发资源去解决 MoE 的通信瓶颈,这通常意味着它已经在跑足够大的 MoE 模型并切实撞上了这堵墙。
张一鸣上个月说了什么,以及为什么是现在
就在 FT 报道曝光前一天,引述中国官媒澎湃新闻的报道称,字节跳动创始人张一鸣在上月的一次内部会议上告诉 Seed AI 研究团队:不要通过蒸馏(distillation)竞争对手的模型来追赶进度,即使这意味着短期落后。据 补充,这一表态针对的是 Seed 团队,并非公司层面的全面禁令。
张一鸣的这番表态发生在一个极其敏感的时间窗口。2026 年 7 月 22 日, Moonshot AI 通过"工业规模的蒸馏"(industrial-scale distillation)从 Anthropic 的 Fable 模型中窃取能力来开发 Kimi K3。美国财政部随即。Moonshot 否认了所有指控,但争议本身已经将"蒸馏"推到了中美 AI 博弈的靶心位置。
在这个背景下,张一鸣选择公开与蒸馏切割,同时推进一个从零开始预训练的 10 万亿参数模型。编辑观察:字节跳动要借此证明自己不需要"借鉴"西方模型也能站到前沿,而考虑到 TikTok 在美国面临的持续监管压力,这笔表态的政治价值可能不亚于其技术价值。
2000 人的 Seed 团队,2000 亿的资本开支
字节跳动 Seed 团队由前 Google DeepMind 科学家吴永辉(Wu Yonghui)领导,据《金融时报》报道,目前在中国和海外共有约 2000 名成员,涵盖研究员、基础设施工程师、数据专家和翻译人员。
支撑这支队伍的是一张快速膨胀的支票。据 报道,字节跳动已将 2026 年 AI 基础设施资本开支计划从 1600 亿元人民币上调至 2000 亿元(约 294 亿美元),增幅 25%,其中更大比例将用于采购国产 AI 芯片。此前,字节跳动计划在 2026 年投入约 1000 亿元(约 143 亿美元)用于采购 Nvidia AI 芯片。
但芯片仍然是最大的变数。美国的出口管制限制了字节跳动获取最先进 GPU 的渠道。今年 3 月,字节跳动通过马来西亚云计算运营商 Aolani Cloud,部署了约 500 套 Nvidia Blackwell 计算系统、总计约 3.6 万张 B200 GPU,交易金额约 25 亿美元。Nvidia 确认该交易符合美国出口管制规定,但这种迂回通道的可持续性并不确定。
Moonshot AI 在训练 Kimi K3 时使用了约 2 万张 Nvidia 芯片。10 万亿参数模型需要的资源远远不止于此。尤其在预训练阶段,任何一次集群级故障都可能导致数天的进度回退。字节跳动的芯片采购预算和中马之间的 Blackwell 通道,仅仅提供了进入这场竞赛的最低入场券。
参数竞赛没有终点,但已经有人换了跑道
字节跳动不是唯一在参数上做文章的中国公司。过去一年里,中国 AI 实验室已经集体跨过了万亿参数门槛:
- Moonshot AI 的 Kimi K3(2.8 万亿参数)于 2026 年 7 月发布完整权重,成为全球最大开源模型,在多个基准测试中与 Anthropic Claude Fable 5 和 OpenAI GPT-5.6 Sol 互有胜负。
- DeepSeek 的 V4 Pro 据估计约 1.6 万亿参数。
- 阿里巴巴的 Qwen 系列持续迭代,其最新版本自称全球第二的开源权重模型。
- 小米也发布了 1.02 万亿参数的模型。
与此同时,最顶级的西方实验室已经在调整方向。Anthropic 将 Mythos Preview 定性为"因能力过强而不宜公开发布",转而将其用于防御性网络安全。OpenAI 和 Google 也在将注意力转向 agentic 能力和推理时计算。参数规模的军备竞赛远未结束,但前沿实验室的关注点正在从"能做多大"扩散到"能控制多少"。
对字节跳动而言,10 万亿参数模型的真正价值可能并不在于跑分。这家公司同时拥有 TikTok 和 Doubao(豆包)。Doubao 已是中国用户量最大的消费级 AI 应用之一。一个前沿级基础模型可以直接注入这些产品,从推荐算法到内容生成再到交互体验,实现从研发到收入的短闭环。极少有西方 AI 实验室同时具备同等规模的模型训练能力和消费者分发网络。
字节跳动的赌注,从来不只是参数
在报道中指出,中国公司训练出一个能与西方顶尖模型匹敌的系统,将构成"一个象征性的里程碑——在两国政府越来越以国家视角框定这场竞争的时刻。"
但象征意义不能替代工程现实。10 万亿参数的预训练是一场马拉松,不是冲刺。从数据 pipeline 的稳定性、集群故障的容错机制,到 MoE 路由的负载均衡、训练损失的收敛曲线,每一个环节都可能卡住整个项目。字节跳动有过大规模系统工程的经验,TikTok 的推荐系统本身就是全球最复杂的 AI 基础设施之一。但推荐系统和基础模型训练是两种截然不同的工程挑战。
《金融时报》援引知情人士称,字节跳动高层对这个项目态度坚决。考虑到张一鸣在蒸馏问题上已经亮明了底线,这种坚决意味着没有后路:不能蒸馏,就只能硬训。硬训的代价是数百亿人民币的算力投入,以及至少半年的时间窗口。在这个窗口期内,Anthropic 和 OpenAI 并不会停下来等。
训练完成后的实际表现才是真正的考验:字节跳动能否在芯片受限的条件下,把纸面上的 10 万亿参数变成跑得起来的 10 万亿参数。