阿里通义智驾大模型首曝:复杂场景接管率92%,端到端架构登顶行业
近日,阿里巴巴通义实验室联合智己汽车,首次披露其端到端智驾大模型完整技术细节。该模型在第三方评测中,城市复杂场景(无保护左转、人车混行、夜间窄路)的人工接管率降至8%,较行业平均水平下降近60%,成为首个由AI大厂主导、以产品级身份落地量产车的智驾大模型。
近日,阿里巴巴通义实验室联合智己汽车,首次披露其端到端智驾大模型完整技术细节。该模型在第三方评测中,城市复杂场景(无保护左转、人车混行、夜间窄路)的人工接管率降至8%,较行业平均水平下降近60%,成为首个由AI大厂主导、以产品级身份落地量产车的智驾大模型。
注:接管率定义:每100公里城市复杂场景(无保护左转、人车混行、夜间窄路)中,系统主动请求或需人工干预的次数。数据来源:第三方机构封闭场地+开放道路联合测试,测试里程约5000公里。柱形自5%起缩放,非零起点。
传统智驾方案是「分体式」:感知模块识别红绿灯、行人、车道线;预测模块推断轨迹;规划模块决定路径;控制模块转到方向盘。四个模块各自训练,中间有信息损耗。
通义智驾大模型为端到端架构——一个模型,从摄像头图像直接输出方向盘角度、油门/刹车力度。所有子任务在一个神经网络内完成。
一个诚实的注脚:
感知→预测→规划→控制,四段式流水线。
优点:可解释性强,易于调试。
缺点:各模块误差累积,端到端延迟约400-600ms。
图像输入→直接输出驾驶指令。
优点:信息无损,延迟<200ms。
缺点:黑盒特性,可解释性弱,对训练数据质量要求极高。
注:模型参数量约12亿,通过通义千问大模型蒸馏所得,专为驾驶场景压缩。延迟指从摄像头采集到方向盘执行指令的完整链路耗时。
端到端的风险不言自明——模型一旦犯错,很难定位是哪个环节出了问题。通义团队的做法是加一道安全兜底层:当主模型输出的置信度低于预设阈值(如0.85),系统自动降级并请求人工接管,同时语音提示原因。
「上海内环,早高峰,走走停停。」——模型通过自学习前车刹车模式,预判加减速时机,跟车距离比行业平均缩短约30%,减少被加塞的概率。
「从家到公司,高速+城市快速路+地面道路,全程约170公里。」——一套模型贯通所有路段,无需切换模式。包括进入服务区、自动泊车、出匝道变道等完整链路。
当系统检测到驾驶员疲劳状态(通过车内摄像头),智驾模型自动进入「增强监控」模式——提高安全兜底层的触发阈值,同时对前方幽灵刹车、路边突然蹿出的小动物等风险,提前做出更保守的应对。
答案不复杂:阿里在通义千问大模型上积累了长序列建模和多模态融合的核心能力。智驾端到端模型本质上是对图像序列的时序建模——这和通义千问处理长文档、视频理解是同一套底层技术。
从架构逻辑看,通义千问的「长上下文」能力被迁移到了驾驶场景:
变化的只是模态:从文本/图像变成实时摄像头流 + 毫米波雷达 + 超声波传感器;输出从自然语言变成方向盘转角、油门/刹车开度。底层逻辑一脉相承。
把复杂场景接管率压到8%以下,证明了一件事:通用大模型的能力,经过领域蒸馏和工程优化,完全可以颠覆传统智驾的模块化范式——而且效果更好。
端到端智驾大模型不是锦上添花,而是对传统分体式架构的彻底降维。当AI大厂把通用大模型的能力迁移到驾驶场景,行业竞争就从「谁的传感器更多」转向「谁的模型更聪明」。
该智驾大模型已搭载于智己LS6、L7 2026款,即日起推送OTA升级。登录智己APP可查看适配车型及推送时间。
智己汽车官网 → 查看智驾版本