字节成立一级"AI数据与安全"部门,
10万亿参数大模型背后的数据饥渴战

深度分析 组织架构 × 数据战略 2025
当大模型参数规模冲击10万亿,高质量训练数据的稀缺性迫使字节跳动将数据工程提升至一级部门战略,而这正是整个AI行业在Scaling Law极限下必须面对的核心瓶颈。
组织架构演变 · 从分散到集中
Global Data
~100人 · 国际业务
DMC
数据中台
AIDP
Flow旗下
Seed数据团队
内部支撑
整合 · 升级
AI数据与安全
一级部门 · 与Seed/Flow/抖音平行
★ 战略升格

01 字节的"数据升官":从分散团队到一级部门

字节跳动近期将原分散于多个业务线的数据团队整合为"AI数据与安全"一级部门,与Seed、Flow、抖音等平行,直接反映出大模型训练对数据集中化管控的迫切需求。

组织调整时间点 2025年8月 原负责人傅越离职,由TikTok平台责任团队负责人王赢磊接任
前身团队规模 约100人 2023年成立的Global Data团队,最初服务Dola、TikTok等国际业务
数据预算 千万美元级 2025年字节在世界模型和Coding方向的数据预算,且可追加
数据人员配置 1:10 Seedance数据评测团队上千人,算法工程师与数据人员比例约1:10

张一鸣明确反对通过蒸馏外部模型来追赶,称字节应'为长期目标牺牲一些短期利益'。

张一鸣 字节跳动创始人

02 10万亿参数模型:Scaling Law的极限押注

据金融时报报道,字节正在预训练参数规模可能达到10万亿的超级AI模型,若实现将成为全球最大AI模型之一,但这需要远超当前的数据投入。

模型参数规模目标 5万亿~10万亿 目前处于早期预训练阶段,最终规模将在后续训练中确定
参数规模对比
GPT-4 约1.8万亿参数
Llama 3 4050亿参数
字节目标 5万亿~10万亿参数
字节目标远超当前主流大模型,数据需求呈指数级增长

Chinchilla Scaling Law指出,参数翻倍时训练数据量也应同步翻倍,但高质量人类文本供给有限,成为物理瓶颈。

03 全行业的数据饥荒:从爬虫到采购再到切割实体书

全球公开人类文本总量 约300万亿Token Epoch AI估算,考虑质量与重复利用后
数据耗尽时间预估 2026~2032年 若按当前训练数据增长速率,可能提前
各公司获取高质量数据的成本对比
Google与Reddit数据授权 约6000万美元/年
OpenAI与News Corp合作 多年期,金额未公开
Anthropic买书切书项目 数千万美元,数百万册实体书
Anthropic版权诉讼和解 15亿美元

Anthropic内部文件称要'破坏性扫描全世界所有的书'。

华盛顿邮报 据法院解封文件披露

04 字节的独特困境:不蒸馏+10万亿参数=数据必须自产

张一鸣明确反对蒸馏外部模型,意味着字节必须完全依靠自研数据工程来支撑10万亿参数模型的训练,这极大提高了对数据数量、质量、多样性的要求。

数据团队构成 多团队合并 Global Data、集团数据中台DMC、Flow旗下AIDP、Seed内部数据团队
数据来源拓展 采购+自产+合成 包括代码、数学、科学领域专家参与生产,以及AI合成数据

字节的数据战略已从"找数据"转向"造数据",数据工程成为与算法、算力并列的第三支柱,这也是"AI数据与安全"升格为一级部门的根本原因。

编辑判断

字节的部门调整看似组织内务,实则是大模型军备竞赛进入深水区的标志。当参数量级突破10万亿,数据已经从"辅助资源"变为"战略资产"。字节的独特之处在于,它既要追求极限规模,又要避免走捷径,这迫使它必须建立一套从数据采购、生产到评测的完整工业化体系。而全行业的数据短缺竞赛,正在将数据成本推向指数级增长——Anthropic的15亿美元和解金或许只是开始。

核心结论

字节成立一级数据部门,既是应对10万亿参数模型的现实需求,也是对整个AI行业数据瓶颈的提前布局。未来核心竞争力将不仅取决于算力堆砌,更取决于谁能在数据整合、生产和合规上建立系统性优势。

综合公开信息整理