🏆 智驾 · 大模型突破

阿里通义智驾大模型首曝:复杂场景接管率92%,端到端架构登顶行业

近日,阿里巴巴通义实验室联合智己汽车,首次披露其端到端智驾大模型完整技术细节。该模型在第三方评测中,城市复杂场景(无保护左转、人车混行、夜间窄路)的人工接管率降至8%,较行业平均水平下降近60%,成为首个由AI大厂主导、以产品级身份落地量产车的智驾大模型。

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#阿里通义 #智驾大模型 #端到端 #智己汽车
🥇 8% 接管率 城市复杂场景,行业最低之一
92% 复杂场景自主通过率,含无保护左转
60% 接管率比行业平均下降约60%

⚡ 30 秒速览

  • 谁做的:阿里巴巴通义实验室 + 智己汽车联合研发,基于通义千问底座,专为智驾场景蒸馏。
  • 强在哪:端到端架构,将感知、预测、规划、控制合一,从图像输入到方向盘指令,延迟<200ms。
  • 测了什么:第三方封闭道路 + 上海、北京、广州开放道路测试,覆盖23类极端场景。
  • 底线思维:模型自带安全兜底层,当置信度低于阈值,主动降级并语音提示人工接管。
  • 去哪体验:智己LS6/L7 2026款已搭载,上海车展后推送OTA全量升级。

01复杂场景接管率对比 智驾大模型 vs 行业主流方案

🥇 通义智驾大模型阿里巴巴 / 智己
8%
华为 ADS 3.0华为
14%
特斯拉 FSD V12特斯拉
18%
小鹏 XNGP 5.0小鹏
22%
蔚来 NAD 2.0蔚来
26%

注:接管率定义:每100公里城市复杂场景(无保护左转、人车混行、夜间窄路)中,系统主动请求或需人工干预的次数。数据来源:第三方机构封闭场地+开放道路联合测试,测试里程约5000公里。柱形自5%起缩放,非零起点。

02端到端:不是概念,是压缩

传统智驾方案是「分体式」:感知模块识别红绿灯、行人、车道线;预测模块推断轨迹;规划模块决定路径;控制模块转到方向盘。四个模块各自训练,中间有信息损耗。

通义智驾大模型为端到端架构——一个模型,从摄像头图像直接输出方向盘角度、油门/刹车力度。所有子任务在一个神经网络内完成。

一个诚实的注脚:

分体式架构(行业主流)

感知→预测→规划→控制,四段式流水线。
优点:可解释性强,易于调试。
缺点:各模块误差累积,端到端延迟约400-600ms。

通义端到端大模型

图像输入→直接输出驾驶指令。
优点:信息无损,延迟<200ms。
缺点:黑盒特性,可解释性弱,对训练数据质量要求极高。

200ms端到端延迟
23极端场景覆盖
5000km公开道路测试
1.2B模型参数量

注:模型参数量约12亿,通过通义千问大模型蒸馏所得,专为驾驶场景压缩。延迟指从摄像头采集到方向盘执行指令的完整链路耗时。

端到端的风险不言自明——模型一旦犯错,很难定位是哪个环节出了问题。通义团队的做法是加一道安全兜底层:当主模型输出的置信度低于预设阈值(如0.85),系统自动降级并请求人工接管,同时语音提示原因。

03它到底扛住了什么?三个极端场景实录

🚦 无保护左转:上海徐家汇,五车道 + 人行横道 + 非机动车流满分通过

  • 场景:无左转箭头灯,对向直行车流密集,右侧非机动车道有外卖电动车穿插。
  • 模型行为:先微减速观察,等待对向车流出现2秒以上间隙,同时预判右侧电瓶车轨迹,以平滑弧线切入目标车道,全程无急刹。
  • 对比:同路段,分体式方案试了3次,2次因犹豫不决而人工接管。
测试结论:「行为接近人类老司机,时机判断精准」

🌙 夜间窄路:广州老城区,宽3.5米,两侧违停、对向有车满分

  • 路面宽度仅够两车勉强错车,两侧停满车辆,路灯昏暗。
  • 模型主动将车速降至10km/h,利用后视镜+环视摄像头持续调整车身姿态,在会车时保持右侧间距15cm,平稳通过。
  • 安全兜底层未触发,全程零干预。
评审:「夜间低光照下,对障碍物边缘的检测精度和避让策略均超预期」

🚶 人车混行:北京五道口,学生与共享单车密集4维全满分

  • 场景包含行人突然横穿、共享单车逆行、外卖车路口抢行。
  • 模型提前300ms预测行人轨迹变化,采取渐进式减速而非急刹,避免后车追尾风险。
  • 对逆行单车,模型选择降速让行并微调方向,不打乱整体交通流。
评分维度:行人轨迹预测 / 制动平顺性 / 对向避让 / 交通流影响 —— 全部满分。

04极端场景之外,日常通勤更从容

🛣️

高架拥堵自动跟车

「上海内环,早高峰,走走停停。」——模型通过自学习前车刹车模式,预判加减速时机,跟车距离比行业平均缩短约30%,减少被加塞的概率。

🏙️

跨城自驾:上海→杭州,全程零接管

「从家到公司,高速+城市快速路+地面道路,全程约170公里。」——一套模型贯通所有路段,无需切换模式。包括进入服务区、自动泊车、出匝道变道等完整链路。

夜间通勤保护

当系统检测到驾驶员疲劳状态(通过车内摄像头),智驾模型自动进入「增强监控」模式——提高安全兜底层的触发阈值,同时对前方幽灵刹车、路边突然蹿出的小动物等风险,提前做出更保守的应对。

05为什么是阿里做出来的?

答案不复杂:阿里在通义千问大模型上积累了长序列建模和多模态融合的核心能力。智驾端到端模型本质上是对图像序列的时序建模——这和通义千问处理长文档、视频理解是同一套底层技术。

从架构逻辑看,通义千问的「长上下文」能力被迁移到了驾驶场景

多帧图像序列时空特征提取轨迹预测驾驶指令

变化的只是模态:从文本/图像变成实时摄像头流 + 毫米波雷达 + 超声波传感器;输出从自然语言变成方向盘转角、油门/刹车开度。底层逻辑一脉相承。

把复杂场景接管率压到8%以下,证明了一件事:通用大模型的能力,经过领域蒸馏和工程优化,完全可以颠覆传统智驾的模块化范式——而且效果更好。

编辑核心判断

端到端智驾大模型不是锦上添花,而是对传统分体式架构的彻底降维。当AI大厂把通用大模型的能力迁移到驾驶场景,行业竞争就从「谁的传感器更多」转向「谁的模型更聪明」。

现在就能体验

该智驾大模型已搭载于智己LS6、L7 2026款,即日起推送OTA升级。登录智己APP可查看适配车型及推送时间。

智己汽车官网 → 查看智驾版本