“芯云模一体”产线方案落地,中国智驾基础设施进入工业化竞争
阿里云在乌兰察布智驾论坛上发布完整打通数据‑模型‑算力的全链路方案,日处理百万级 clips,万卡集群有效算力利用率97%+,30余家车企与方案商已接入。
阿里云在乌兰察布智驾论坛上发布完整打通数据‑模型‑算力的全链路方案,日处理百万级 clips,万卡集群有效算力利用率97%+,30余家车企与方案商已接入。
智驾的路线正在分化——端到端、VLA、世界模型各执一端。但范式一旦切换到“训模型”,瓶颈就变成了三件事的困境:数据供得上吗?模型底子够好吗?算力扛得住吗?任何一项是短板,另两项的投入都会被浪费。
集群建起来了,算法团队反而更焦虑——数据清洗和标注的周期仍以周计,多模态数据从车端回流到进入训练,中间要经过大量人工和半自动化工序,可用的训练样本迟迟供不上来。算力卡只是入场券,数据产线才是瓶颈。
数据从车端回流 → 人工搬运到本地服务器 → 分批上传云 → 格式转换 → 去重清洗 → 标注团队 → 断点多,周期以周计。
数据从车端回流 → 自动转换 → 清洗 → 向量化 → 大模型自动标注 → 混合样本检索 → 直接训练,全链路打通,以天为单位迭代。
注:数据产线覆盖从多模态数据接入、自动化清洗、向量化、大模型标注到混合样本检索的全链路,日处理能力达到百万级 clips,支撑模型以天为单位迭代。
阿里云智能集团计算平台事业部负责人汪军华在论坛上直言:特斯拉的真正壁垒,不仅是算法,更是其极度高效的数据到模型产线闭环能力;而数据到模型产线的闭环效率,往往是模型迭代速度中最短的那块木板。
芯片对应算力,云对应数据产线,模型对应基座与世界模型——所谓芯云模一体,就是把三层串成一条产线。三者是上下游关系,缺了哪一环,另外两环的投入都会打折。
模型层是阿里云区别于任何一家纯算力或纯芯片供应商的地方。千问模型成为智驾 VLA 的基座选择之一,万相作为世界模型引擎承担“出题与评价”的角色——从模仿到强化,从会开车到懂世界。
算力层则由平头哥的 M890 芯片支撑。市面上“超节点”众多,但平头哥半导体副总裁高慧给出的判据很硬:真正的超节点必须实现支持同步内存语义的统一编址。只有做到这一点,节点内的算力才能作为一个完整的巨型 GPU 被统一调度,总有效算力逼近单卡的线性叠加。
在这个标准下,平头哥做出了国内首个64 卡单层、全对称超节点架构:卡间带宽一致,64 卡单跳时延一致,统一内存语义,无缝兼容 NCCL 底层通信原语。
注:M890 超节点实例于 8 月 10 日开售,订单成功后 1 小时内交付,从公布到商用不到一周。
这套方案不是实验室产品。2022 年,小鹏汽车与阿里云合作在乌兰察布建成中国最大的自动驾驶智算中心“扶摇”,那时回答的问题是“要不要上云”;今天,小鹏已开始用阿里云的国产芯片做训练,第二代 VLA 让视觉原始数据更快进入模型、直接产生动作。
会场上,有人抛出一个尖锐的问题:过去积累的数据,到底还算不算护城河?一个没有历史包袱、从零直接做 VLA 的新玩家,有没有可能弯道超车?
阿里云的回应给出了另一个视角:真正的护城河,可能不是硬盘里存了多少数据,而是那条能把海量、杂乱的非结构化数据,持续炼成高质量训练样本的数据闭环产线。数据会随着技术路线切换而贬值,产线不会——路线换了,产线还在高速运转。
路线分化带来的不是选择的自由,而是焦虑。每一条路都需要重资产投入,而车企的预算和耐心都是有限的。但把几条路线摆到一起看会发现,分歧集中在算法层,对地基的要求却出奇一致:数据都要以天为单位供上来,算力都要以万卡为单位管起来,基座模型与世界模型的能力各取所需。
无论 VLA、世界模型还是端到端最终跑通,赢家都要跑在同一条产线上。阿里云把投入放在地基而不是路线上:数据产线兼容不同架构的模型输入,基座模型支持多种下游任务,算力集群适配不同的训练框架和推理需求。
在阿里云智能集团资深副总裁、公共云事业部总裁刘伟光看来,算力全栈自研,是这条路走得远、走得稳的底气。地基的终点,是他在致辞结尾给出的定位:“云之于 AI,绝不仅仅是算力供应。我们要做的,是一朵全栈 AI 的云,是为中国建一座 AI 工厂。让每一家车企都能在这座工厂里,造出自己的智能。”
算法竞赛里可以有黑马,工业化竞争里没有奇迹。路线之争还会继续,但无论哪条路先跑通,它都会跑在一条被完整打通的产线上。这就是不确定中的确定性。
灵骏·真武 M890 超节点实例已正式商用,订单成功后 1 小时内交付。核心技术已全面应用于阿里云智驾基础设施方案,面向车企与智驾方案商开放。
aliyun.com → 智驾产线方案注:具体接入方式请通过阿里云官方渠道咨询