🧠 模型 · 训练动态

中国 AI 实验室激进押注:训练 10 万亿参数大模型,规模或超越行业顶尖模型

据知情人士透露,这家公司正在训练一个参数量高达10 万亿的 AI 模型——即便按5 万亿的下限计算,也已超过目前中国已发布的最大模型,接近海外头部模型规模;若按 10 万亿计算,将直接超越约 8 万亿参数的行业标杆。

综合公开信息整理 2026-08-07 全文约 4 分钟读完
#大模型 #超大规模预训练 #模型蒸馏 #AI Coding
10 万亿 目标参数量 · 尚处早期训练阶段
3–6 个月 预训练窗口期 · 之后微调发布
8 万亿 对标模型参数 · 10 万亿将超越

⚡ 30 秒速览

  • 发生了什么:知情人士称,该公司正在训练参数量高达 10 万亿的 AI 模型,次日报道口径从"超 5 万亿"上调至"10 万亿"。
  • 意味着什么:5 万亿已超国内现有最大模型,10 万亿将直接超越海外约 8 万亿参数的行业标杆。
  • 谁在主导:由 Seed Foundation 负责人主导,与预训练数据负责人合作推进。
  • 关键态度:创始人明确反对模型蒸馏——"不想走捷径",即使短期落后也要坚持自研路线。
  • 战略信号:整合算力与数据资源,强调 AI Coding 关键地位,同时加速 B 端商业化,形成"双线进攻"。

01数字为什么重要?一条被不断上调的新闻

8 月 7 日,英国《金融时报》援引知情人士报道,该公司正在训练一个参数量高达 10 万亿 的 AI 模型。而就在前一天晚间,另一家媒体的口径还是"超 5 万亿"。

一夜之间,数字翻了一倍。

这个差距不是无关紧要的修饰——它直接决定了新模型的行业坐标:

5 万亿(下限口径)

已超过国内已发布的最大模型,接近海外头部模型规模。属于"追上"。

10 万亿(最新口径)

直接超越约 8 万亿参数的行业标杆,属于"碾压"。完全不同的叙事。

注:两种口径均来自知情人士表述,模型仍处早期预训练阶段,最终参数量将由后期训练结果决定。

截至发稿,该公司未对此事作出回应。一位知情人士补充:模型仍处早期阶段,预训练窗口为 3 到 6 个月,顺利的话之后会进行微调并发布,具体尺寸将在后期确定。

换个角度想——连发布者自己都还没定最终参数,外界的想象力已经先跑起来了。

02为什么这个消息值得认真对待?

单纯"训练大模型"不是新闻——各大厂商都在做。真正值得关注的是三个信号叠加

3 人关键人物:创始人 ×2 + 技术负责人
2 次最高层公开表态
1 个明确反对:模型蒸馏
2 线产品 B 端 + 训练激进

注:数字格展示的是本次事件中可计数的高层动作密度——两次全员会、两位最高层先后发声、一项明确的技术路线表态。

过去几天,这家公司的创始人与 CEO 在两次不同的全员会上先后表态。创始人张一鸣在与 Seed 负责人吴永辉共同召开的全员会上,解释了一个关键的组织调整:把火山引擎、飞书和豆包的资源整合到一起,目的是"构筑在算力和数据上的优势"。

这不是一次普通的架构调整。

把产品、销售与技术资源拧成一股绳,指向同一个目标:为超大规模模型训练提供弹药

03他们相信什么?两次全员会上的关键表态

🗣️ CEO 梁汝波:AI Coding 是短板,也是方向全员会 · 2026-08-06

  • 坦承豆包大模型在 AI Coding 方面并不算突出,直接用海外某产品的 Claude Code 举例。
  • 承认短板,但将其明确为下一步要补强的核心方向
信号解读:不回避差距,把 Coding 列为战略级能力缺口。

🧭 创始人张一鸣:不蒸馏,不走捷径Seed 全员会

  • 明确反对模型蒸馏——将其定义为"复制已有能力",长期只会逼近对手,无法真正超越。
  • 表态即使不蒸馏意味着短期内技术落后于国内竞争对手,也"不想走捷径"。
  • 同时提醒:编程只是眼下的热点之一,要着眼其他领域
  • 透露过去几年已在 AI 方向大量投入,未来还会投入更多
信号解读:这是一条鲜明的技术路线宣言——拒绝速成,押注长期自研。

值得补充的背景:模型蒸馏(Model Distillation)是将大型复杂模型压缩为更小模型的过程,即让小型模型复制教师模型的知识与输出。它能在短期内显著提升表现,但本质是"跟随"而非"开创"。

张一鸣的拒绝,是对这条"捷径"的公开否决。

04为什么是现在?一个被对手"让"出来的窗口期

大洋彼岸的近况,给国内大模型训练撕开了一个难得的窗口期

🌍 海外头部模型的"安全危机"

  • 某海外标杆模型(约 8 万亿参数)因安全顾虑被暂时禁用,仅对经批准的组织开放。
  • 另一头部模型此前也因安全问题被勒令"停服"
  • OpenAI 的模型同样频繁爆出不受控的安全问题
效应:竞争窗口被外力打开,但能接住的只有准备好的人。

与此同时,国内玩家在跑分上已经逼近。

过去几周,月之暗面的 Kimi K3 和阿里巴巴的 Qwen 3.8 Max 在基准测试中表现抢眼,仅在某些领域落后于海外头部模型,国内外开发者反馈积极。

跑分之外,更关键的是下一阶段的动作。业内人士透露:多家中国实验室正在训练对标规模的模型,而这家公司几乎是赛道上押注最激进的一家

外部窗口内部激进资源整合规模冲刺

注:链路图示意本次事件中"外部机遇 → 内部决策"的传导逻辑,非官方信息披露。

05"双线进攻":产品端与训练端同时加速

训练端的激进已经足够高调,但产品端的动作同样密集。

📱 产品端:To C 到 To B 的全面冲刺

  • 面向消费者的 AI 应用月活已达 3.24 亿,是国内最受欢迎的 AI 应用之一。
  • 将飞书团队一分为二:产品团队并入豆包,销售线划归火山引擎
  • 与飞书合并后,豆包开始向 B 端市场冲刺
产品端逻辑:把 C 端积累的流量优势,转化为 B 端商业化能力。

🧠 训练端:规模激进 + 技术路线鲜明

  • 10 万亿参数目标,超越行业标杆的开源/闭源策略选择。
  • 与阿里、腾讯等同行不同,大模型大多保持闭源
  • 最新视频生成模型已跻身全球最先进之列
训练端逻辑:拒绝蒸馏,用基础设施投入换真正的代差。

两条线,一个目标:在窗口期内建立不可追赶的领先优势

06编辑核心判断

编 辑 独 立 观 点

10 万亿参数本身不是答案,拒绝蒸馏才是。

张一鸣的表态把这场竞赛从"规模比拼"拉回了"能力沉淀"——当所有对手都在用蒸馏快速逼近时,选择不蒸馏意味着主动接受短期落后,去赌一条更慢但可能更远的路。这可能是比参数量更值得关注的信号。

一个诚实的注脚:

"10 万亿"目前只是知情人士的说法,尚未得到官方确认。模型仍处早期预训练阶段,最终参数量可能调整。历史上,预训练规模与最终发布参数未必一致——但无论如何,5 万亿以上的下限已经足以改变国内大模型的竞争坐标

怎么跟进

关注该公司 Seed 团队与豆包产品的后续发布节奏。模型仍处预训练早期阶段,预计 3–6 个月后或有更多信息释放。

持续跟踪 Seed 团队动态