AREX Feed Article
张一鸣罕见定调:字节大模型不走蒸馏捷径,甘愿短期落后
"用别人的输出,换一时的榜单排名"
8月6日,多家媒体曝出字节跳动创始人张一鸣在近期一场内部会议中的发言。张一鸣极少在Seed团队会议上公开发言,此次却直接定调:字节不做模型蒸馏。
财闻同日求证到,张一鸣在近期内部会议中表示,做模型要坚持长期主义、延迟满足感,而不是"用别人的输出,换一时的榜单排名"。
模型蒸馏是指利用能力更强模型的输出训练另一模型,可以较低成本快速提升能力。据财闻了解,今年以来国内开源大模型加速迭代,字节面临的外部竞争压力上升,每当有能力较强的开源模型发布,内部围绕蒸馏的讨论便会升温。
张一鸣给出了相反的判断。他明确提出,字节跳动"应该愿意为长期目标牺牲一部分短期收益"。他认为依赖外部模型蒸馏虽可能带来短期效果,也可能干扰团队对底层技术路径的探索,不利于长期技术突破。
禁令不只是口号,API检测已经上线
字节内部并非只下达口头禁令。
据第一财经报道,Seed团队已通过API异常检测、增强开源模型数据过滤等工程手段,防止研发人员私下调用第三方模型输出作为训练集。
财闻了解到,字节跳动内部目前严禁利用外部开源模型进行蒸馏。据晚点LatePost引述The Information报道,张一鸣此前已在Seed团队全员会上明确表态,字节不会利用模型蒸馏来加速大语言模型的能力提升。 第一财经的报道则进一步指出,这一决定意味着Seed模型在短期内会在评测榜单上暂时落后于DeepSeek、Kimi和Qwen等国内竞争对手。
多模态已跑通,语言模型还在补课
张一鸣此时出手,背景是字节AI业务冰火两重天的局面。
CEO梁汝波在8月6日的年中全员会上总结:视频生成模型Seedance保持了SOTA,豆包在C端应用上保持了竞争力。但他也承认,大语言模型"与海外领先模型的差距有所拉大"。
据晚点LatePost报道,Seed同期发布的语言模型Seed 2.0市场反响有限,而GLM-5和Kimi K2.5的Coding能力已明显领先。火山引擎豆包大模型的token消耗中,超过一半来自Seedance和Seedream多模态系列,语言模型占比不高。
为补课Coding能力,张一鸣亲自邀请、高薪吸引DeepSeek核心研究员郭达雅加入Seed,负责模型Coding能力专项训练。字节拥有国内最充足的算力储备与高密度人才队伍,Seedance的成功也让内部看到:模型能力一旦领先,便能迅速转化为商业护城河。
梁汝波接棒:"接受短期落后"不是被逼的
在同日的2026年度年中全员会上,CEO梁汝波对张一鸣的定调做了进一步阐述。
梁汝波表示:"接下来字节跳动还是会坚持自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。"
他辟谣称外界关于"字节因外部压力才坚持自研"的说法是猜测,真实原因是希望团队延迟满足感,打好技术基础。"这对长期实现AGI很关键。"
新成立的"创造力服务平台"负责人谭待以Seedance 2.0补充:只有SOTA模型才能率先解锁高经济价值的创造场景,"在这个模型诞生前,视频生成更多是玩具"。他透露Seedance调用量"工作日远高于周末",说明模型已进入严肃生产力场景。
梁汝波还公布了豆包、飞书、火山引擎整合的商业逻辑:AI在生产力上的发展快于预期,To B市场更重要,飞书新增客户中已有超九成同步采购飞书AI产品。
不抄近道,字节的底气在哪里
张一鸣的反蒸馏决策,是对走捷径惯性的明确拒绝。
如果团队习惯等别人发布新模型再"学习",短期成绩或许亮眼,底层架构的硬骨头将无人去啃。张一鸣的判断是:蒸馏会干扰真正意义上的长期技术突破。
支撑这一信心的,是字节的规模化基础:豆包月活已超3亿,火山引擎在中国公有云MaaS市场占据近半份额。
梁汝波在全员会上将公司业务战略概括为九个字:"高度优先,粗主干,优化长期"。AI是高度优先,希望豆包像抖音一样成为"主干"业务,面对当下落后则"优化长期"、不自乱阵脚。
张一鸣本人的投入也提供了旁证。据南华早报报道,他一直在旁听Seed团队的核心技术评审,并熬夜阅读OpenAI的论文。
张一鸣和梁汝波在同一天、用两种语气指向了同一个结论:字节宁愿短期落后,也不抄近道。Seedance从"玩具"变成生产力工具的故事,则提供了一份参照——SOTA模型一旦跑通,商业化回报会自己追上来。
参考链接: