🏭 大模型 · 路线抉择

拒绝蒸馏捷径,押注10万亿参数:中国大厂一场罕见的长期主义豪赌

张一鸣在 Seed 全员会上罕见发声,明确拒绝以蒸馏手段追赶前沿大模型——尽管字节 Seed 2.1 Pro 在 Artificial Analysis 全球榜仅列 第 21 位,而中国同行已占据前十近半席位。

综合公开信息整理 全文约 6 分钟读完
#字节跳动 #大模型 #蒸馏 #长期主义
第 21 位 Seed 2.1 Pro 全球模型排名
2000亿+ 2026 年 AI 基础设施资本开支
10万亿 在讨论中的参数规模大模型

⚡ 30 秒速览

  • 路线之争:三次蒸馏提议被否,张一鸣三次说了"不"——"要愿意为长远目标牺牲短期利益"。
  • 技术代价:Nature 证实 AI 数据训练触发模型坍缩,千分之一合成数据就够。
  • 10万亿赌注:字节讨论训练 10万亿 参数模型,是国内已知最大计划。
  • 商业逻辑:全链路自研无知识产权争议,全球化布局提前避险

01榜单格局 中国模型崛起,字节缺席

最新一期 Artificial Analysis 全球 LLM 排行榜,中国模型已占据前十近半席位。月之暗面、阿里、智谱、深度求索,四家中国实验室全部跻身前十。

唯独字节,缺席了这场头部聚会。

🥈 Kimi K3 Max月之暗面
#2
Qwen 3.8 Max阿里
#4
GLM 5.2 Max智谱
#7
DeepSeek V4 Flash深度求索
#8
Seed 2.1 Pro字节跳动 · 主角
#21

条形长度按排名比例示意,非分数刻度。字节 Seed 2.1 Pro 与中国头部模型的差距肉眼可见。

02三次路线之争 张一鸣每次都说了"不"

蒸馏,通俗说就是拿其他大模型的答案来训练自己的模型,是行业公认的"捷径"。据公开报道,字节内部至少经历了三次关于是否蒸馏的路线之争。

2025.01

DeepSeek-R1 发布

推理风格席卷全球,Seed 研究员提议跟进蒸馏。张一鸣拒绝——他要的是 Seed 像人类一样"学习如何思考",而不是模仿 R1 的"碎碎念"。

Blackwell 部署后

算力差距拉大

对手拿到了英伟达最新芯片,字节只能靠 H20 苦撑,蒸馏呼声再起。张一鸣再次说不,字节选择增资 2000 亿,在乌兰察布和怀来加盖智算中心。

Kimi K3 登顶后

内部焦虑达到顶点

每次国内开源新模型发布,都是一次压力测试。但在张一鸣眼里,榜单是虚的,商业主权是实的。

据接近 Seed 的人士透露,内部对蒸馏的禁令通过 API 检测等技术手段硬性执行,早在 2023 年 4 月就已明令禁止将 GPT 生成数据混入训练集。

张一鸣每次都顶住了。

03为什么拒绝蒸馏 四个环环相扣的技术逻辑

从技术角度而言,字节 Seed 坚持从头训练不做"蒸馏派",是一套环环相扣的技术演进逻辑。从头训练虽然痛苦,但它是突破天花板的唯一解。

🧪 模型坍缩:AI 数据训练的"近亲繁殖"陷阱Nature 2024

  • 牛津、剑桥等机构联合研究登上 《Nature》封面:模型反复用 AI 生成数据训练,原始数据分布中的尾部信息逐渐消失,产生不可逆的能力退化。
  • ICLR 2025 Meta 研究进一步证实:训练数据中哪怕掺入 千分之一的合成数据,就足以触发模型坍缩;参数越大,坍缩效应越被放大。
  • 真实世界的知识藏在长尾里——罕见边缘场景、反常识提问、方言俚语、小众专业知识。AI 的"标准答案"天生抹平这些。
蒸馏的天花板:永远只能逼近别人的上限,越追,自己的边界越窄。

🔤 词表主权:从底层定义规则多模态地基

  • Llama 的词表针对英语优化,遇到中文成语、网络热梗、弹幕缩写,常被拆成四五个零散单字——推理效率低,语义被切碎。
  • 字节 Seed 的核心战场是原生多模态。Seedance 2.0 已实现原生音画同步,支持 60 秒 2K 视频和 8 种语言唇形对齐,前提是底层原子级映射。
  • 蒸馏别人的模型 = 继承别人的编码地基。后天微调改不了底层的 Token 空间和语义框架。
对要做视频生成的字节:地基的自主权,比短期的文本榜单排名重要得多。

🏭 AI"重工业":万卡集群的工程内功H20 限制

  • 超大规模预训练最致命的指标叫 MTBF(平均无故障时间)。单卡 10 万小时,万卡集群平均每 10 小时一次硬件故障,需毫秒级检测 + 断点续训。
  • 受出口管制,字节只能使用 H20 芯片,单卡效率与海外差距显著,只能靠集群规模与工程优化补齐。
  • 2026 年字节 AI 基础设施资本开支 超 2000 亿,净利润明显下滑,核心原因正是算力采购与数据中心建设的集中投入。
走蒸馏路线的厂商不需要攻克万卡级稳定训练,自然也沉淀不下这套重工业级的系统能力。

04蒸馏的代价 学答案,永远学不会思维

蒸馏路线

  • 见效快:几百万条指令数据,几周内分数飙升
  • 成本低:几百张 GPU 跑几周
  • 天花板低:永远逼近别人的上限
  • 继承他人的偏好与价值观

从头训练

  • 慢、难、贵:从零训练 200B+ 参数 MoE
  • 自由定义:从 Token 到 RLHF 全链路自主
  • 能力上限靠自己定义
  • 技术主权握在自己手里

蒸馏学的是"答案",从头训练学的是"思维"。用别人模型的输出训练,你学到的是对方的输出分布——语气、套路、甚至 RLHF 阶段被注入的价值观偏好。它模仿得了结果,模仿不了背后的推理链路。

更关键的是,模型的"灵魂"会打上别人的烙印。字节需要的是完全对齐自身业务逻辑的奖励模型:抖音的推荐讲完播率和互动率,电商讲点击到购买的转化效率,这些独特的商业逻辑必须深度植入 Reward Model。如果你蒸馏了 GPT-4,模型的"灵魂"里刻着 OpenAI 的偏好逻辑,再怎么调,也是在别人的地基上装修。

0510万亿赌注 用规模换时间

拒绝了捷径,字节的追赶路径是什么?答案正在浮出水面。据公开报道,字节跳动正在讨论训练一个参数规模 10 万亿的大模型,显著超过目前国内已知的所有模型计划。

10万亿字节计划参数
2.8万亿Kimi K3 参数
2.4万亿Qwen 3.8-Max 参数
70%净利润同比下滑

10 万亿参数意味着接近同行的 4 倍规模。该项目仍处于早期探索阶段,最终是否正式发布尚未确定。

这是一个非常"字节"的选择:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。

但这是一场豪赌。参数规模翻倍,训练难度不是线性增长,而是指数级上升。数据供给、算力稳定性、对齐难度、推理成本,每一项都是巨大的挑战。

当 DeepSeek 被 OpenAI 正式指控蒸馏,当美国立法将模型数据窃取纳入国家安全范畴,字节的选择突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱。

编辑核心判断

蒸馏的诱惑在于确定性:你知道终点在哪里,知道怎么走最快。但它的代价,是永远失去定义终点的资格。当技术范式窗口期急剧收窄,能定义智能上限的,只有那些从零构建过完整技术栈的玩家。