张一鸣给 AI 行业降温:别把蒸馏当捷径,慢比快更需要勇气
7 月底,字节跳动创始人张一鸣在 Seed 全员会上给团队泼了一盆冷水:别把蒸馏当捷径,哪怕因此落后国内同行。这句话在今天格外刺耳——开源模型 token 占比半年翻倍、同一款 App 两份月活报告差出 1.46 亿、真正把 AI 部署进核心流程的企业只有 16%。数字越漂亮,裂缝越深。
7 月底,字节跳动创始人张一鸣在 Seed 全员会上给团队泼了一盆冷水:别把蒸馏当捷径,哪怕因此落后国内同行。这句话在今天格外刺耳——开源模型 token 占比半年翻倍、同一款 App 两份月活报告差出 1.46 亿、真正把 AI 部署进核心流程的企业只有 16%。数字越漂亮,裂缝越深。
不久前,张一鸣与 Seed 负责人吴永辉共同召开了一场全员会。除了给团队打气,他还专门谈了一个在今天的行业氛围里显得有点不合群的话题——模型蒸馏。
观点很直接:不要把蒸馏当作提升模型能力的捷径,哪怕这意味着可能会落后于国内同行。
这句话放在今天,像往沸腾的锅里浇了一勺冷水。
过去两年,AI 行业的默认叙事是「快」:参数从百亿堆到万亿,榜单从 MMLU 刷到 Arena Elo,KOL 加班做对比视频,结论永远是「国产又赢了」。朋友圈一片欢腾,仿佛 AGI 下周就来。
比参数、比榜单、比单项能力——一切以最容易量化、最容易写进 PR 稿、最容易让投资人兴奋的数字为中心。
不把蒸馏当捷径,宁可暂时落后,也要保住从第一性原理出发的研究能力与创新文化。
这套逻辑放在今天,指向一个反直觉的判断:AI 行业正在把数字游戏玩到极致,却很少有人去填模型与真实世界之间那道越变越宽的沟。
今年 7 月,月之暗面发布 Kimi K3,参数精确到 2.78 万亿,全球最大开源模型。那天朋友圈被刷了屏。三天后,官方公告:用户请求量大幅超出预估,逼近现有集群承载极限,即日起暂停 C 端新用户订阅。
2.78 万亿参数 · 全球最大开源模型
发布第 3 天,用户挤崩集群,暂停新订阅
豆包月活 5.28 亿,国内第一
另一家机构同月数据为 3.82 亿,差出 1.46 亿
可灵、即梦、Vidu 轮番登顶视频生成榜
创作者只关心:等多久、能不能用、人像崩不崩、版权有没有保障
注:三组对照均来自公开报道。「光环」为对外宣传口径,「现实」为实际发生或被真实使用者反复提及的问题。同一统计对象的差异,源于统计口径与测算方法不一致。
没有人造假。只是「月活」这个用了二十年的指标,到了 AI 产品上突然测不准了——插件调用算不算?API 访问算不算?连统计口径都没有共识,那些煞有介事的排名,看看就好。
视频生成领域的榜单竞赛,更是到了走火入魔的地步。每隔一段时间就有一家宣布在某个评测集登顶,KOL 迅速跟进出「深度评测」,结论永远是「国产又赢了」。可你问真正用它做内容的人,他们关心的根本不是 benchmark 上那零点几分。
这就像车厂造出一台发动机参数全球第一的跑车,开出来发现油箱只够跑十公里。模型在榜单上无所不能,到了具体工作里,更像一个聪明但不靠谱的实习生——什么都能聊两句,真交给他一件完整的事,你还得在后面收拾烂摊子。
为什么张一鸣对蒸馏这么敏感?
蒸馏本身是正经技术方向——用大模型输出训练小模型,让它在特定场景逼近大模型能力,同时大幅降低推理成本。但在今天的国内 AI 圈,它已经异化成一条抄近路的产业链。
这条流水线的规模有多大?OpenRouter 的数据给出了一个侧面:今年 1 月,开源模型处理的 token 占比为 34%;6 月,这个数字变成 65%,半年接近翻倍。
注:数据来自 OpenRouter 公开统计。占比跃升背后有多少是真实技术突破、有多少是蒸馏与榜单过拟合,无法从该数据直接判断。
占比翻倍,但有多少是真正的技术突破?不少人心里有数,只是不说。更要命的是,这种路径依赖会从根上废掉一个团队的研究能力——当工程师习惯了用别人的输出训练模型,就不会再想怎么从第一性原理改进结构、构建真正高质量的数据集。
更深的裂缝在底层。前 OpenAI 研究员 Diogo Almeida 指出,当年奠定 Scaling Law 的论文在计算推理最优分配时算错了一个参数;DeepMind 的 Sander Dieleman 转发称,这个 bug 大概率让行业在错误方向上浪费了巨额算力。
这么多顶级公司、上万张 GPU 烧进去,几年内竟没人发现——因为所有人都在同一条赛道上狂奔,没人停下来问路对不对。蒸馏,就是这条路径依赖的终极形态。
这已经不是 AI 行业第一次上演这样的剧本。
苹果是最新的注脚。2024 年 WWDC 上,Apple Intelligence 被吹得天花乱坠,之后跳票两年,直到今年 WWDC 才拿出像样的版本,核心能力还得靠接 OpenAI 和谷歌的 API。发布会当天,苹果股价从盘中 317 美元跌到收盘 301 美元,市值蒸发约 2300 亿美元。
华尔街的逻辑很简单:你演示的这些,ChatGPT 两年前就有了。我们等了两年,就等来了这个?
这就是参数繁荣掩盖下的真相——实验室里的胜利,到真实世界要重新打一次折,而这个折扣,经常大到让人怀疑人生。
当然,不是参数不重要,也不是榜单毫无价值。技术发展早期,量化指标确实能帮我们看清进步。但当整个行业把手段当目的、把指标当目标,事情就开始变味。
麦肯锡的一份报告显示,2025 年企业在 AI 上的投入比前一年翻了一番,但真正把 AI 部署到核心生产流程的比例,只从 12% 涨到了 16%。
换句话说,84% 的投入还停在 POC 和「用几次就搁置」。钱花了,热闹看了,AI 并没有像预期那样重构业务流程。
真实世界太复杂了:工业现场数据有噪声、生产环境动态变化,催化剂的活性、热态工件的变形量这类关键参数连采都采不到;金融风控一个错误判断就是几千万损失,医疗诊断一个幻觉就是重大事故。这些场景要的不是 99%,是 六个九、七个九的可靠性,以及每一步都可解释、可追溯、可审计。
好消息是,已经有人开始往这个方向走了。
纳德拉在财报会上转口讲财富 500 强里有多少家在跑 Azure AI 平台、企业自建 Agent 数量,商业模式从「席位」转向「席位 + 按量计费」。
Gemini at Work 展示的不是炫酷 demo,而是大众、华纳兄弟、Snap 这些公司怎么把 Gemini 真正嵌进生产流程。
腾讯 WorkBuddy、阿里 QoderWork、字节 TRAE、金山 WPS AI——不再比谁的模型更聪明,开始比谁能更深地嵌入工作流,谁能真正帮用户解决问题。
这条路注定更难走。它要求你沉到行业里去,理解客户的真实痛点,忍受很长时间没有高光时刻的寂寞。它不像发布万亿参数模型那样能上头条,不像刷到榜单第一那样让投资人兴奋,也不像 KOL 评测那样带来潮水般的流量。
但这才是真正的 AI 浪潮该有的样子。
把参数当结果,AI 是 PPT;把参数当起点,AI 才是生产力。
当数字游戏散场,真正的分水岭不在模型大小,而在谁先把 AI 嵌进真实世界的齿轮——这轮竞赛的终局赢家,不会是榜单上跑得最快的那个,而是最先在产业现场把账算清楚的那个。
你可以继续看榜单,也可以去看看那些正在默默改变生产流程的普通用户。但至少记住一件事:在 AI 行业,最容易量化的数字,往往最不值得追逐。