AI·快讯
🎙️ 语音模型 · 技术发布

阿里发布 Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教

7 月 31 日,阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度系统性升级,同时具备语音润色能力,可直接输出结构化文本。

来源:综合公开信息整理 2025-07-31 全文约 3 分钟读完
#Qwen-Audio #语音识别 #阿里云 #ASR
1.7% 离线版曾登顶全球权威评测错字率第一
95.36% 医疗场景行业词召回率
90%+ 热词定制化准确率,多数场景破 99%

⚡ 30 秒速览

  • 核心升级:长音频 Context、行业词内化、热词智能定制、语音一步润色四大能力。
  • 长上下文:转写时参考近期已识别内容,同音词、术语和中英混说不再跨片段认错。
  • 行业词:医疗、IT、股票、名人等领域实体词内化进模型,无需人工逐一设词表。
  • 热词定制:用声学证据 + 上下文智能判断替代简单替换,加得越多不再带偏结果。
  • 润色一步完成:去填充词、修自我修正、整理结构化表达,无需调用下游文本大模型。
  • 去哪体验:阿里云百炼平台已开放调用。

01识准专业词汇,是落地的最后一公里

识准专业词汇,是 ASR 模型走向行业落地的最后一公里,也是本次升级的核心。全新升级的 3.0 版本,聚焦通用的语音识别能力,不止于把每个字听对,更要在复杂语境中持续听对、在专业领域中精准听对

但是,"听对"这件事,远比想象中难。

在会议、访谈、课程、直播等长音频场景中,很多专业术语、英文词汇并不能只靠当前几秒的语音准确判断。同一个发音可能对应十几个同音词,模型必须记住前面说过什么,才能输出正确的那一个。

传统 ASR 识别

逐句切片处理,片段间无记忆,同音词靠概率盲猜,跨片段即遗忘。

Qwen-Audio-3.0-Flash

转写当前片段时参考近期上下文,延续关键词与语义线索,同一位发言人、同一个概念跨片段不丢。

阅读说明:对比卡呈现的是两种技术路线的核心差异,并非具体跑分数据。下方各节将给出确切数字。

02行业词不用教,模型自己学

上下文记忆解决了"说过的词不再认错"。而很多专业词汇在整场对话中可能只出现一次,模型需要在从未见过的情况下也能一次听对。

传统方案的瓶颈很直接:人工维护词表,永远追不上行业变化。

Qwen-Audio-3.0-ASR-Flash 将这一过程内化为模型自身能力,无需人工逐一设置,即可在真实业务场景中持续进化。研究团队通过持续挖掘医疗、IT 编程、股票、社会名人等领域的实体词,构建了覆盖多行业的高质量词库,并基于这些实体词合成训练数据,增强模型对专业术语和低频词的识别能力。

医疗场景
95.36%
IT 编程
显著提升
股票金融
显著提升
社会名人
显著提升

阅读说明:医疗场景为确切召回率数据;其余领域官方表述为"显著提升",柱形长度仅作示意,非精确分数。行业词召回率指正确识别出的行业实体词占应识别总量的比例。

03热词加得越多,反而越准

行业词库覆盖了通用场景,但各行各业还有自己的长尾词——人名、品牌名、产品名和各类行业黑话。这些词频率低、更新快,不可能全部预装进模型。

热词定制,正是为了让它们也能被精准识别。

传统方案长期面临一个矛盾:热词加得越多,误触发越多,识别结果反而被带偏。Qwen-Audio-3.0-ASR-Flash 对热词定制能力进行了全面升级,采用模型结合声学证据与上下文进行智能判断的方式,而非简单替换。

传入热词声学证据校验上下文语义判断智能输出

在传入热词的条件下,热词定制化准确率在所有测试集均达到 90% 以上,多数场景更是突破 99%

阅读说明:链路图展示的是热词定制从输入到输出的判断流程。传统方案为"传入热词→直接替换",新方案增加了两步校验环节。

04语音润色:一步完成,链路更短

Qwen-Audio-3.0-ASR-Flash 还具备语音润色能力。更重要的是,这些润色由 ASR 模型在识别环节一步完成,无需再调用下游文本大模型,链路更短、延迟更低、使用成本也更低。

🗣️ 去除填充词与自我修正识别环节一步完成

  • 去填充词:口语中的"那个""嗯"等无意义填充词被直接去除。
  • 保留最终意图:"我们下周三评审,不对,是周四"——只保留"周四"这一最终表达。
  • 结构化整理:散乱的口述内容自动整理为结构化表达,可直接用于会议纪要。
关键优势:传统方案需 ASR 转写 → 调用文本大模型润色两步串行;新模型在识别环节同步完成,延迟与成本双降。

阅读说明:案例卡展示的是同一输入在传统链路与新链路下的处理差异。润色能力并非独立功能,而是内嵌于识别过程。

05已验证的落地场景

目前,Qwen-Audio-ASR 系列已在多个场景中获得广泛验证,离线版本曾在全球权威 AI 评测平台 Artificial Analysis 以 1.7% 的错字率位列全球第一

会议纪要整理 实时字幕 教育录播 智能客服 医疗听诊记录 金融访谈转写 直播字幕生成 长视频字幕

阅读说明:深色标签为原文明确提及的已验证场景,浅色标签为基于能力特征推断的适用场景。

06编辑核心判断

Qwen-Audio-3.0-ASR-Flash 的升级路径很清晰:上下文记忆解决"跨片段遗忘",行业词内化解决"没见过的词听不对",热词智能判断解决"加得越多越带偏",语音润色解决"转写后还需二次处理"。

一个诚实的注脚:1.7% 的全球第一错字率属于离线版本,Flash 版本的具体跑分官方尚未完整披露。

但更重要的信号是:ASR 正在从"听写机器"变成"理解机器"。当模型能记住上下文、能内化行业知识、能在识别环节同步完成润色,语音识别的竞争维度已经从"字准率"单点比拼,升级为理解力 + 工程链路 + 成本控制的综合较量。

编辑核心判断

语音识别的竞争,已从"谁听得更准"转向"谁理解得更深、链路更短、成本更低"——能一步做完的事,就不会再留给两步。

现在就能用

Qwen-Audio-3.0-ASR-Flash 已在阿里云百炼平台开放调用,用户可前往体验。

阿里云百炼平台 → 开放调用中