🏆 多模态 · 模型突破

全SOTA!不止纯文本,阿里多模态站上全球第一梯队

过去一个月,阿里巴巴大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。多模态正在从「能力补齐」走向产业深水区,成为观察阿里AI进展的一条重要暗线。

综合公开信息整理 2026-08-21 全文约 4 分钟读完
#阿里多模态 #Qwen3.8 #全球第一梯队 #AI产业落地
5 / 5 五大模态全部跻身全球第一梯队
123.76亿元 AI相关产品收入,连续12个季度三位数增长
30亿+ Qwen系列全球下载量,开源模型超460个

⚡ 30 秒速览

  • 五大模态全面突破:语言(Qwen3.8-Max)、图像(Qwen-Image-3.0)、语音(Qwen-Audio-3.0)、视频(Wan3.0)、音乐(HappyShrimp)全部跻身国际第一梯队,世界模型HappyOyster 1.0同步亮相。
  • 硬核榜单验证:Qwen3.8-Max登顶Artificial Analysis Agentic全球第一,Qwen-Image-3.0拿下Arena.ai文生图国内第一,Qwen-Audio-3.0系列在语音榜单全球第一。
  • 商业数据强劲:阿里云外部商业化收入增速45%创22个季度新高,AI相关产品收入123.76亿元,AI产品ARR突破495亿元,模型已从技术投入变成规模化收入。
  • 开源生态外溢:Qwen系列下载量超30亿次,已被Pinterest等国际公司采用,成本不到同类闭源模型的8%。芯片、框架、社区全链条跟进。
  • 全栈底座成型:自研真武AI芯片服务超650家外部客户,CUBE 5.0架构将AIDC交付周期压缩至100天,组织层面成立Token Hub事业群整合AI业务。

01模型版图全景 语言 · 图像 · 语音 · 视频 · 音乐

过去一个季度,阿里模型发布明显提速。但大语言模型只是冰山一角——多模态的密集迭代才是真正的暗线。从6月到8月,图像、语音、视频、音乐模型相继完成重要版本升级,一张覆盖越来越完整的模型版图已经浮现。

注:五大模态均依据公开榜单或权威评测认定"国际第一梯队"。语言、图像、语音有具体榜单排名,视频与音乐基于行业对比与能力覆盖度定性评估。

而在更前沿的方向上,阿里还推出了HappyOyster 1.0世界模型——能够根据一句话或一张图生成可互动、可探索、可实时改变的数字世界。多模态的边界,正在从"理解现实"迈向"构建现实"。

02三个第一,三重验证 不是自夸,是公开榜单

模型的真实水平,独立榜单是最直接的证据。阿里在多模态的三个关键方向上,都拿下了公开、可复现的全球第一

🥇 全球第一 Qwen3.8-Max Artificial Analysis · Agentic 榜单
🥇 国内第一 Qwen-Image-3.0 Arena.ai · 文生图榜单
🥇 全球第一 Qwen-Audio-3.0 系列 Artificial Analysis · 语音榜单(ASR/TTS/Realtime)

注:以上榜单均为第三方独立评测,评分标准、测试集、评审流程均公开可查。三个第一分别覆盖智能体、图像生成、语音识别与合成三个核心模态方向。

但榜单只是起点。模型能不能在真实场景中创造价值,是另一回事。

03多模态能做什么?三个真实场景

多模态的价值不在模型本身,而在它打开的新能力边界。以下三个场景,代表了语音、图像、视频各自最典型的产业需求。

🎤 语音交互:16种方言 + 30种语言,百毫秒级响应 已大规模商用

  • Fun-ASR-Realtime支持16种中文方言和30种语言,首字延迟在百毫秒级别,已具备大规模商用条件。
  • Qwen-Audio-3.0-Realtime实现实时语音对话,正在进入会议纪要、智能客服、车载助手、智能硬件、教育等高频场景。
  • 相比纯文本聊天,语音场景拥有更明确的调用频次、付费主体和ROI,是AI时代的人机交互新入口。
商业价值:语音模型正在重新成为AI时代的人机交互入口,场景付费意愿明确。

🎨 图像生成:复杂UI + 多语言海报 + 知识图解 12国语言原生渲染

  • Qwen-Image-3.0支持最长4.5k Token输入,可生成包含公式、几何图形、逻辑推导的知识图解和复杂UI。
  • 支持12种语言、20多款字体原生渲染,可直接用于多语言商业海报、产品图、广告素材生产。
  • 已登上Arena.ai文生图榜单国内第一,证明了其在图像生成质量上的竞争力。
产业价值:图像模型贴近内容生产产业链,从设计到营销的闭环正在形成。

🎬 视频生成:30秒单次生成,多文档输入 Wan3.0 公测

  • Wan3.0单次视频生成时长达到30秒,并首次支持doc、xls、ppt、pdf、md等文档输入,实现从文档到视频的跨越。
  • 覆盖广告创意、影视制作、短视频生成、电商素材生产等环节,直接降低视频内容制作门槛。
  • 与HappyHorse 1.1(视频生成模型)形成组合,覆盖从动态表现力到主体一致性的多重需求。
行业影响:视频生成正在从"玩具"变成"工具",文档输入能力是关键的产品化突破。

04商业价值正在兑现 从模型到收入,链路清晰

多模态的商业化路径,比外界感知的要快。一个标志性案例:

闭源模型(Anthropic / OpenAI)

Pinterest 此前评估的同类闭源模型,成本高、定制灵活度低,且受限于单一供应商锁定。

Qwen 开源模型(阿里)

Pinterest 的AI购物助手和聊天机器人采用Qwen大模型,成本不到同类闭源模型的8%。Pinterest CEO直言:"任何不用开源模型的CEO,几乎都在浪费股东的大量资金。"

注:Pinterest 采用Qwen的信息来自公开报道,成本对比数据由Pinterest官方在财报会上披露。

多模态带来的商业价值不止于模型调用本身。当一个客户同时使用文本、图像、视频和语音模型后,需求链条会延伸到数据处理、模型微调、数据库、对象存储、安全等环节——一次模型调用,正在变成一整条AI生产链。

🛍️

千问 App × 淘宝天猫生态

千问App深度集成淘宝天猫、淘宝闪购等生态,上线以来已有2.5亿用户通过其智能体功能实现AI驱动的购物体验。AI正在从技术能力转化为真实的商业场景。

☁️

阿里云收入结构质变

本季度阿里云外部商业化收入增速45%创22个季度新高,AI云及算力服务收入484.37亿元,经调整EBITA暴增133%。AI相关产品ARR突破495亿元,模型已经从技术投入变成一项规模化收入来源。

05为什么是阿里做出来了?

多模态模型的全面突破,不是偶然的"模型炫技",而是建立在全栈AI底座之上的系统工程能力。

从芯片到基础设施,从模型到应用,阿里构建了一条完整的链路:

自研真武芯片AIDC 基础设施多模态模型开源生态产业应用

真武AI芯片已经通过阿里云服务进入20多个行业、超过650家外部客户,覆盖训练、微调和推理等AI工作负载。吴泳铭在财报会议中透露,阿里正在数据中心大规模部署自研倚天/真武体系芯片,并希望逐步替换外购商业芯片,以提高AI云毛利率。

基础设施层面,阿里云全球AI数据中心布局持续扩张,新建完成后将覆盖30个地域、104个可用区。新一代CUBE 5.0架构已将大型AIDC数据中心交付周期压缩至100天,建设成本较上一代降低约10%。

组织层面,今年3月阿里成立Alibaba Token Hub事业群,由吴泳铭直接负责,以"创造Token、输送Token、应用Token"为核心目标重新整合AI业务。多模态模型的密集迭代,正是这一组织调整后的直接结果。

一个诚实的注脚:

多模态模型的全面领先,并不意味着每条产品线都已经完美。音乐模型HappyShrimp刚刚上线,世界模型HappyOyster 1.0仍处于早期阶段。但方向已经明确——AI进入产业后,客户需求天然就是多模态的。谁先补齐多模态版图,谁就能在下一阶段的产业竞争中占据先机。

编辑核心判断

多模态正在从"能力补齐"变成"产业入场券"。阿里用一个月时间证明了语言之外的模型厚度,但真正的考验在于:这些模型能力能否在电商、云、办公等场景中形成不可替代的闭环体验。榜单第一是门票,场景落地才是决赛。

现在就能用

千问 App 已集成多模态能力,支持语音、图像、视频、文档等输入方式。登录即可体验最新的多模态模型能力。

千问 App → 体验多模态