AREX Feed Article
字节跳动成立「AI 数据与安全」一级部门,王赢磊挂帅整合三大数据团队
字节跳动近期成立了新的一级部门「AI 数据与安全」(AI Data & Security),与 Seed、Flow、抖音等核心部门平行。这是字节继 2023 年底成立 Seed(模型研发)和 Flow(AI 产品)两个 AI 一级部门后,围绕 AI 业务设立的第三个一级部门。从多个独立信源处确认了这一消息,随后做了跟进报道。
新部门负责人为王赢磊(Adam Wang),他此前担任 TikTok 平台责任团队负责人和 TikTok 直播业务负责人。一位接近字节的人士告诉《智能涌现》:「王赢磊负责的直播业务曾是 TikTok 最主要的营收来源之一,在字节内部有过赫赫战功。」
一个部门管完字节所有大模型的数据
AI 数据与安全部门的核心职能很明确:为字节旗下所有大模型提供跨模态数据服务,覆盖数据生产全流程,包括标准制定、寻源采购、合成清洗、质量评测等。
这个新部门整合了多个此前分散的数据团队。其中最关键的一块是 TikTok 创始团队成员傅越(花名 Yuyi)于 2023 年成立的 Global Data 团队,原规模在百人左右。该团队起初为 Dola(豆包海外版)、TikTok 等国际业务服务,后来转向为 Seed 的模型训练做数据采购和质量管控。团队内部设有产品经理、数据工程、采购、质检运营、安全合规等多个职能。
此外,集团数据中台 DMC 和 Flow 下属的 AI 数据平台 AIDP 也被一并整合。据多位知情人士透露,整合工作从 2026 年 6 月初已开始。由于涉及的多个部门之间业务多有重叠,字节目前仍在梳理架构、优化人员。
整合后的新部门横跨基座模型到业务团队,体量相当庞大。《智能涌现》此前曾报道,在字节内部,仅为 Seedance 做模型数据评测的团队就有上千人。每一位 Seedance 算法工程师背后,往往配着十余位数据同事做支持。对比来看,很多视频赛道头部创业公司的内部评测团队达到数十人就算大投入。
王赢磊接手,傅越将离开
王赢磊的履历集中在 TikTok 业务线。他此前担任 TikTok 直播业务负责人,该业务曾是 TikTok 最主要的营收来源之一。2025 年 8 月,他转任 TikTok 平台责任团队负责人——当时 TikTok CEO 周受资通过全员邮件宣布将核心产品团队与信任与安全产品团队合并为平台责任团队,由王赢磊统筹,向 TikTok 产品运营负责人支颖汇报。在去年 10 月的新一轮架构调整中,他继续留任该职位。
与此同时,原 Global Data 负责人傅越将于近期离职。据 援引大厂日爆消息,傅越的下一步计划尚未确定,目前的说法是会考虑不同机会,包括创业的可能性。
傅越本科毕业于北京大学,毕业后加入 BCG(波士顿咨询)从事战略咨询工作,随后取得 MIT 斯隆管理学院 MBA 和哈佛大学肯尼迪学院 MPA 学位。2017 年,他加入腾讯任战略研究副总监;2018 年首次加入字节,先后在 TikTok 信任与安全部门、TikTok 电商运营部门任职;2022 年 5 月离职创业;2023 年 10 月重回字节,随后成立了 Global Data 团队。
「坚决不蒸馏」倒逼的数据投入
字节在 AI 数据上大幅加码,根子在 Seed 成立之初就定下的原则。
在 7 月底的 Seed 全员会上,久未露面的张一鸣表态:字节在大模型攻坚上「坚决不蒸馏」。8 月 5 日的字节跳动全员会上,CEO 梁汝波进一步明确:「字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。」
不蒸馏意味着不能靠套壳竞争对手的模型输出来训练自己的模型,所有训练数据必须自己合成、采买、清洗。这需要一个庞大的数据团队来支撑。
Seed 团队在 Seedance 2.0 上的成果,被多位从业者称为「一场数据的胜利」,进一步坚定了字节对数据的投入。《智能涌现》此前报道,字节 2026 年初在世界模型和 Coding 模型训练上的数据预算已超过千万美元级别,并且「如果觉得不够,可以随时追加预算」。
目前字节数据团队内部采取赛马机制,按方向划分为世界模型、代码、高难学科等。在模型商业逻辑日渐清晰的背景下,每个数据项目也需要核算 ROI。
公开数据见底,模型竞争转入数据军备赛
字节对数据的押注不是孤例。过去一年,全球大模型攻坚面临同一个趋势:在推理范式缓慢收敛的前提下,算法架构带来的能力提升趋缓,数据已经成为决定模型能力上限最重要的变量。
跟字节等中国大厂相比,海外大模型公司的数据投入还要高出数倍。硅谷头部公司的外部数据预算正在以每年数十亿美元的量级膨胀。Anthropic 仅在 2025 年就为 RL 数据拨出了超过 10 亿美元的预算。硅谷明星数据公司 Mercor 年化收入从去年的 5 亿美元涨到今年年中的 20 亿美元,其中 91% 来自 OpenAI、Anthropic 等头部模型公司,估值飞涨至 200 亿美元——这家公司成立仅三年。
根本原因在于,互联网上的公开数据几乎已被穷尽。过去三年,模型训练所需的数据经历了从公域到私域的转变——公开互联网中有大量报告和文档,但缺少人类产出这些结果的过程:如何理解模糊意图、寻找上下文、犯错和修正。AI 所需的高质量「过程数据」往往藏在企业内部代码库和员工日常操作痕迹里,从公域转向私域的争夺已经开始。
在国内,大厂之间的数据人才争夺也在升温。腾讯近半年来频繁以高达三倍的薪资从字节数据团队挖人。阿里、腾讯在数据采购上的预算都有明显增长,且不断加码。一位数据行业人士告诉《智能涌现》,大厂目前普遍设置数据排他策略,比如设定数据集独家期限、阶段性买断供应商核心人员。