AREX Feed Article
三次否决:张一鸣为什么拒绝蒸馏捷径
据三名知情人士向英国《金融时报》透露,字节跳动正在预训练一个参数规模最高可达 10 万亿的超大模型,目前处于早期阶段,确切参数规模要到后期才能确定。如果一切顺利,预训练通常需要三到六个月,之后进入微调并最终发布。
字节跳动对此未予回应。
一个10万亿参数的项目浮出水面
中国目前已发布的最大模型——月之暗面的 ,参数量约 2.8 万亿。字节跳动的项目是其三倍以上。Anthropic 不公开模型参数规模,但业内估计其最先进的 Mythos 5 约 8 万亿参数,Fable 5 约 5 万亿参数。
换句话说,字节跳动的目标规模不仅远超国内同行,而且直逼 Anthropic 的最高端系统。
知情人士称,多家中国 AI 实验室正在训练约 5 万亿参数规模的模型,而字节跳动是目前最激进的一家,直接冲击 10 万亿量级。
字节跳动的 Seed 模型开发团队由前 Google DeepMind 科学家吴永辉领导,全球约 2000 人,涵盖核心研究、基础设施工程、数据标注和翻译。字节旗下火山引擎向企业销售 AI 解决方案,消费端产品豆包以 3.24 亿月活位居中国 AI 助手第一。
从「模型坍缩」到「词表主权」:不蒸馏的工程逻辑
据 援引接近 Seed 团队人士的说法,字节内部对开源模型的蒸馏禁令早在 2023 年 4 月就已明确:禁止将 GPT 生成数据混入训练集,并通过 API 检测等技术手段硬性执行。过去一年半,这个禁令经历了三次压力测试。
第一次是 2025 年 1 月 DeepSeek-R1 发布后,推理风格席卷全球,Seed 内部有研究员提议跟进蒸馏,张一鸣拒绝。他要的是模型「学习如何思考」,而不是模仿 R1 的「碎碎念」。
第二次是英伟达 Blackwell 芯片部署后算力差距拉大,蒸馏呼声再起。字节选择增资 2000 亿元,在全国加建智算中心。
第三次是 Kimi K3 跻身全球顶尖榜单带来的压力。在 Artificial Analysis 最新全球 LLM 排行榜中,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 位居第四,而字节 Seed 2.1 Pro 仅排第 21 位。
张一鸣每次都顶住了。
真正支撑这个决定的,是一套环环相扣的技术判断。
模型坍缩是真实存在的。 2024 年 7 月,牛津、剑桥等机构联合研究登上《Nature》封面,首次系统证实:如果模型反复用 AI 生成的数据训练,原始数据分布中的尾部信息会逐渐消失,产生不可逆的能力退化。
ICLR 2025 的 Meta 研究进一步确认,训练数据中哪怕只掺入千分之一合成数据,就足以触发模型坍缩。模型参数量越大,在特定阈值下坍缩效应反而被放大。
尾部信息(方言俚语、边缘场景、小众领域知识)决定了模型处理未知问题的上限。蒸馏过程天然会抹平这些长尾。
字节的底气在于数据。抖音日均产出超 8000 万条短视频,TikTok 覆盖 150 多个国家和地区,这是全球最庞大的原生人类内容池。
词表是不容外包的技术主权。 Llama 的词表针对英语优化,遇到中文成语、网络热梗、弹幕缩写会被拆成四五个零散单字,语义关联被切碎。
更关键的是多模态:Seedance 2.0 已实现原生音画同步视频生成,支持 60 秒 2K 分辨率和 8 种语言唇形对齐。这种能力的前提,是文本、视频帧、音频信号在底层实现原子级映射。
蒸馏别人的模型等于继承别人的编码地基:视频帧怎么切 Token,音频节奏怎么编码,多模态信号怎么做联合注意力。所有底层决策都不再属于自己。
从头训练才能植入字节自身的奖励模型。抖音的推荐逻辑讲完播率和互动率,电商讲点击到购买转化,短视频讲节奏感。这些业务逻辑必须在 RLHF 阶段深度植入 Reward Model,让模型对齐字节系产品目标。
蒸馏来的模型,其「灵魂」里刻着别家公司的偏好逻辑,后训练阶段再做调整也只是在别人地基上装修。
「字节刚开始也做蒸馏,后来张一鸣痛定思痛,说我们还是要走长远路。」国内某大厂高管对雷锋网表示,「阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。」
项亮挂帅,2000人团队和两千亿赌注
从头训练 10 万亿参数的超大模型,是一个工程问题,不是算法问题。
一次完整预训练周期长达数月,要调动数万张 GPU 并行计算。任何一张显卡的内存错误、任何一条高速链路的通信闪断、任何一个算子的精度溢出,都可能让前期投入全部打水漂。
集群规模越大,故障概率越高。假设单卡平均无故障时间 10 万小时,一万张卡的集群平均每 10 小时就会遭遇一次硬件故障。
字节面临的挑战还要再加一层:受美国芯片出口管制限制,字节无法采购英伟达最新 Blackwell 芯片,只能使用性能受限的 H20。别人靠更强单卡性能就能撑起训练效率,字节只能用更大集群规模、更高资源利用率和更极致工程优化来弥补。
公开信息显示,字节的智算中心已布局内蒙古乌兰察布、山西大同、河北怀来与张北、安徽芜湖等地。2026 年 AI 基础设施资本开支上调至超 2000 亿元,公司净利润同比出现明显下滑。核心原因是算力采购与数据中心建设的集中投入。
张一鸣本人将一半精力倾注在 Seed 团队。
据雷锋网报道,10 万亿参数项目由 Seed Foundation 负责人项亮主导,与预训练数据负责人沈科协同推进,目前仍处于早期探索阶段,最终是否正式发布尚未确定。
不止字节一家:中国大模型集体冲击第一梯队
字节不是唯一在冲线的玩家。据知情人士透露,多家中国实验室正在训练约 5 万亿参数规模的模型。阿里 Qwen 3.8-Max 拥有 2.4 万亿参数,在 Artificial Analysis 排行榜上位居全球第四。Moonshot AI 据称使用 训练 Kimi K3,其训练规模已经极为可观。
但字节跳动的 10 万亿参数目标,把这场竞赛直接拉到了下一个量级。
参数数量不等于能力。数据质量、训练方法、后训练优化同样决定最终表现。然而,在 Scaling Law 仍然有效的当下,参数规模的跃迁本身就是最明确的信号:字节跳动不满足于在中国市场追赶,它要直接站到 Anthropic Mythos 所处的那个梯队的同一高度。
指出,字节拥有多数 AI 实验室不具备的优势:TikTok 和豆包的庞大用户群同时提供了训练数据和现成的部署渠道,可以把研究投入快速转化为产品。
三年窗口期,谁能留在牌桌上
Anthropic 自 2026 年以来连续公开指责 Minimax、月之暗面、DeepSeek、阿里通义实验室存在蒸馏其模型的行为,将中国大模型的快速崛起归因于「抄捷径」。
字节跳动的「不蒸馏」路线,在当下突然具备了提前避险的战略意味。全链路自研的模型没有知识产权争议,没有合规包袱,无论是全球布局还是长期技术竞争,都站在更安全的位置。
但这条路同样是一场豪赌。2000 亿资本开支、净利润下滑、创始人一半精力,所有筹码都压在了一条更慢、更难的路上。
张一鸣在两周前的 Seed 全员会上告诉团队,要追求「世界领先的模型能力」,不要过于担心短期落后。字节跳动的大模型,目前还藏在预训练的机房深处。