字节跳动近期将原分散于多个业务线的数据团队整合为"AI数据与安全"一级部门,与Seed、Flow、抖音等平行,直接反映出大模型训练对数据集中化管控的迫切需求。
张一鸣明确反对通过蒸馏外部模型来追赶,称字节应'为长期目标牺牲一些短期利益'。
据金融时报报道,字节正在预训练参数规模可能达到10万亿的超级AI模型,若实现将成为全球最大AI模型之一,但这需要远超当前的数据投入。
Chinchilla Scaling Law指出,参数翻倍时训练数据量也应同步翻倍,但高质量人类文本供给有限,成为物理瓶颈。
Anthropic内部文件称要'破坏性扫描全世界所有的书'。
张一鸣明确反对蒸馏外部模型,意味着字节必须完全依靠自研数据工程来支撑10万亿参数模型的训练,这极大提高了对数据数量、质量、多样性的要求。
字节的数据战略已从"找数据"转向"造数据",数据工程成为与算法、算力并列的第三支柱,这也是"AI数据与安全"升格为一级部门的根本原因。
字节的部门调整看似组织内务,实则是大模型军备竞赛进入深水区的标志。当参数量级突破10万亿,数据已经从"辅助资源"变为"战略资产"。字节的独特之处在于,它既要追求极限规模,又要避免走捷径,这迫使它必须建立一套从数据采购、生产到评测的完整工业化体系。而全行业的数据短缺竞赛,正在将数据成本推向指数级增长——Anthropic的15亿美元和解金或许只是开始。
字节成立一级数据部门,既是应对10万亿参数模型的现实需求,也是对整个AI行业数据瓶颈的提前布局。未来核心竞争力将不仅取决于算力堆砌,更取决于谁能在数据整合、生产和合规上建立系统性优势。