拒绝蒸馏捷径,押注10万亿参数:中国大厂一场罕见的长期主义豪赌
张一鸣在 Seed 全员会上罕见发声,明确拒绝以蒸馏手段追赶前沿大模型——尽管字节 Seed 2.1 Pro 在 Artificial Analysis 全球榜仅列 第 21 位,而中国同行已占据前十近半席位。
张一鸣在 Seed 全员会上罕见发声,明确拒绝以蒸馏手段追赶前沿大模型——尽管字节 Seed 2.1 Pro 在 Artificial Analysis 全球榜仅列 第 21 位,而中国同行已占据前十近半席位。
最新一期 Artificial Analysis 全球 LLM 排行榜,中国模型已占据前十近半席位。月之暗面、阿里、智谱、深度求索,四家中国实验室全部跻身前十。
唯独字节,缺席了这场头部聚会。
条形长度按排名比例示意,非分数刻度。字节 Seed 2.1 Pro 与中国头部模型的差距肉眼可见。
蒸馏,通俗说就是拿其他大模型的答案来训练自己的模型,是行业公认的"捷径"。据公开报道,字节内部至少经历了三次关于是否蒸馏的路线之争。
推理风格席卷全球,Seed 研究员提议跟进蒸馏。张一鸣拒绝——他要的是 Seed 像人类一样"学习如何思考",而不是模仿 R1 的"碎碎念"。
对手拿到了英伟达最新芯片,字节只能靠 H20 苦撑,蒸馏呼声再起。张一鸣再次说不,字节选择增资 2000 亿,在乌兰察布和怀来加盖智算中心。
每次国内开源新模型发布,都是一次压力测试。但在张一鸣眼里,榜单是虚的,商业主权是实的。
据接近 Seed 的人士透露,内部对蒸馏的禁令通过 API 检测等技术手段硬性执行,早在 2023 年 4 月就已明令禁止将 GPT 生成数据混入训练集。
张一鸣每次都顶住了。
从技术角度而言,字节 Seed 坚持从头训练不做"蒸馏派",是一套环环相扣的技术演进逻辑。从头训练虽然痛苦,但它是突破天花板的唯一解。
蒸馏学的是"答案",从头训练学的是"思维"。用别人模型的输出训练,你学到的是对方的输出分布——语气、套路、甚至 RLHF 阶段被注入的价值观偏好。它模仿得了结果,模仿不了背后的推理链路。
更关键的是,模型的"灵魂"会打上别人的烙印。字节需要的是完全对齐自身业务逻辑的奖励模型:抖音的推荐讲完播率和互动率,电商讲点击到购买的转化效率,这些独特的商业逻辑必须深度植入 Reward Model。如果你蒸馏了 GPT-4,模型的"灵魂"里刻着 OpenAI 的偏好逻辑,再怎么调,也是在别人的地基上装修。
拒绝了捷径,字节的追赶路径是什么?答案正在浮出水面。据公开报道,字节跳动正在讨论训练一个参数规模 10 万亿的大模型,显著超过目前国内已知的所有模型计划。
10 万亿参数意味着接近同行的 4 倍规模。该项目仍处于早期探索阶段,最终是否正式发布尚未确定。
这是一个非常"字节"的选择:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。
但这是一场豪赌。参数规模翻倍,训练难度不是线性增长,而是指数级上升。数据供给、算力稳定性、对齐难度、推理成本,每一项都是巨大的挑战。
当 DeepSeek 被 OpenAI 正式指控蒸馏,当美国立法将模型数据窃取纳入国家安全范畴,字节的选择突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱。
蒸馏的诱惑在于确定性:你知道终点在哪里,知道怎么走最快。但它的代价,是永远失去定义终点的资格。当技术范式窗口期急剧收窄,能定义智能上限的,只有那些从零构建过完整技术栈的玩家。