中国 AI 实验室激进押注:训练 10 万亿参数大模型,规模或超越行业顶尖模型
据知情人士透露,这家公司正在训练一个参数量高达10 万亿的 AI 模型——即便按5 万亿的下限计算,也已超过目前中国已发布的最大模型,接近海外头部模型规模;若按 10 万亿计算,将直接超越约 8 万亿参数的行业标杆。
据知情人士透露,这家公司正在训练一个参数量高达10 万亿的 AI 模型——即便按5 万亿的下限计算,也已超过目前中国已发布的最大模型,接近海外头部模型规模;若按 10 万亿计算,将直接超越约 8 万亿参数的行业标杆。
8 月 7 日,英国《金融时报》援引知情人士报道,该公司正在训练一个参数量高达 10 万亿 的 AI 模型。而就在前一天晚间,另一家媒体的口径还是"超 5 万亿"。
一夜之间,数字翻了一倍。
这个差距不是无关紧要的修饰——它直接决定了新模型的行业坐标:
已超过国内已发布的最大模型,接近海外头部模型规模。属于"追上"。
直接超越约 8 万亿参数的行业标杆,属于"碾压"。完全不同的叙事。
注:两种口径均来自知情人士表述,模型仍处早期预训练阶段,最终参数量将由后期训练结果决定。
截至发稿,该公司未对此事作出回应。一位知情人士补充:模型仍处早期阶段,预训练窗口为 3 到 6 个月,顺利的话之后会进行微调并发布,具体尺寸将在后期确定。
换个角度想——连发布者自己都还没定最终参数,外界的想象力已经先跑起来了。
单纯"训练大模型"不是新闻——各大厂商都在做。真正值得关注的是三个信号叠加。
注:数字格展示的是本次事件中可计数的高层动作密度——两次全员会、两位最高层先后发声、一项明确的技术路线表态。
过去几天,这家公司的创始人与 CEO 在两次不同的全员会上先后表态。创始人张一鸣在与 Seed 负责人吴永辉共同召开的全员会上,解释了一个关键的组织调整:把火山引擎、飞书和豆包的资源整合到一起,目的是"构筑在算力和数据上的优势"。
这不是一次普通的架构调整。
把产品、销售与技术资源拧成一股绳,指向同一个目标:为超大规模模型训练提供弹药。
值得补充的背景:模型蒸馏(Model Distillation)是将大型复杂模型压缩为更小模型的过程,即让小型模型复制教师模型的知识与输出。它能在短期内显著提升表现,但本质是"跟随"而非"开创"。
张一鸣的拒绝,是对这条"捷径"的公开否决。
大洋彼岸的近况,给国内大模型训练撕开了一个难得的窗口期。
与此同时,国内玩家在跑分上已经逼近。
过去几周,月之暗面的 Kimi K3 和阿里巴巴的 Qwen 3.8 Max 在基准测试中表现抢眼,仅在某些领域落后于海外头部模型,国内外开发者反馈积极。
跑分之外,更关键的是下一阶段的动作。业内人士透露:多家中国实验室正在训练对标规模的模型,而这家公司几乎是赛道上押注最激进的一家。
注:链路图示意本次事件中"外部机遇 → 内部决策"的传导逻辑,非官方信息披露。
训练端的激进已经足够高调,但产品端的动作同样密集。
两条线,一个目标:在窗口期内建立不可追赶的领先优势。
10 万亿参数本身不是答案,拒绝蒸馏才是。
一个诚实的注脚:
"10 万亿"目前只是知情人士的说法,尚未得到官方确认。模型仍处早期预训练阶段,最终参数量可能调整。历史上,预训练规模与最终发布参数未必一致——但无论如何,5 万亿以上的下限已经足以改变国内大模型的竞争坐标。
关注该公司 Seed 团队与豆包产品的后续发布节奏。模型仍处预训练早期阶段,预计 3–6 个月后或有更多信息释放。
持续跟踪 Seed 团队动态 →