🎤 语音识别 · 模型发布

专有名词听中率突破 95%,阿里千问语音识别模型 Qwen-Audio-3.0 发布

7 月 31 日,阿里千问大模型团队发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现显著提升。医疗场景专业词"听中率"达 95.36%,工业、IT 编程、畜牧业均超 90%,热词"听中率"多数场景突破 99%

综合公开信息整理 2026-07-31 全文约 3 分钟读完
#阿里千问 #Qwen-Audio #语音识别 #ASR #专业词识别
95.36% 医疗场景专业词"听中率"
99%+ 热词"听中率"多数场景突破
17 支持语种 · 平均语义错误率 17.09%

⚡ 30 秒速览

  • 专业词医疗场景听中率 95.36%,工业 / IT 编程 / 畜牧业均超 90%——模型将行业词汇内化为自身能力,无需逐一配置词表。
  • 热词分级热词机制,听中率全部 90% 以上,多数场景突破 99%。企业可配置专属词汇,即时生效,不误伤通用识别。
  • 润色去口头禅、去重复,可读性从 2.55 跃升至 3.43,优秀可读率从 30.75% 提升至 59.27%——直出结构化书面文本。
  • 多语言17 种语言混合识别,平均语义错误率 17.09%,优于 Azure、ElevenLabs Scribe v2 及 Gemini 3.0 Flash。
  • 历史Qwen-Audio-ASR 系列曾在全球权威语音评测中,以 1.7% 错字率拿下全球第一

01全球第一的语音识别底座 错字率仅 1.7%

在 Qwen-Audio-3.0 之前,其前代系列已在全球权威 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率登顶全球第一。这并非一次偶然的实验室成绩——它证明了这个模型家族在通用语音识别上已经达到世界级水准。

但通用准确率只是入场券。真正的商业化瓶颈,从来不在标准普通话上。

🏆

全球 #1 语音识别

Qwen-Audio-ASR 系列 · 错字率仅 1.7% · Artificial Analysis 评测

1.7%错字率

注:Artificial Analysis 为国际权威 AI 评测平台,评测覆盖多语种、多场景下的语音识别准确率。1.7% 错字率为该平台历史最佳成绩之一。

02三大引擎:上下文、行业词、热词 专治"听不懂"

真实场景中的语音识别,难点从来不在标准发音,而在专业术语、中英文混说、同音词混淆。Qwen-Audio-3.0-ASR-Flash 用三项能力逐个击破。

上下文一致性

长音频 Context 能力,识别时参考前文已识别内容,跨片段保持连贯,不遗漏、不认错。记忆来自音频本身,随对话自动更新。

95.36%

行业词识别

将医疗、IT、工业、金融等专业词汇内化为模型自身能力,无需逐一配置词表。医疗场景听中率突破 95.36%,工业 / IT / 畜牧业超 90%。

99%+

热词定制化

分级热词机制,企业专属词汇即时生效。热词"听中率"全部测试集超 90%,多数场景突破 99%,不因热词扩容而拉低通用精度。

注:行业词"听中率"为内部评测指标,指模型正确识别专业词汇的比例。热词测试覆盖医疗、金融、法律、制造等多行业定制场景。

03从口头到书面:一口气去掉口头禅 可读性提升 34%

人们日常说话时充满语气词、重复、自我纠正。传统方案需要"先识别 + 再用大模型润色"两步走,而 Qwen-Audio-3.0-ASR-Flash 在识别阶段就直接输出结构化文本

三个真实案例,看它如何"听懂你真正想说的话"。

🎯 去除无意义语气词 可读性 2.55 → 3.43

润色前:
那同时因为其实您日常我们再去用一些 AI 的 AI 的一个产品和模型的话,我们其实大部分都是在用一些像这种 DeepSeek 或者是千问,或者是这个 Kimi 这样的一个通用模型。
润色后:
同时,因为日常使用 AI 产品和模型时,我们大部分都在用 DeepSeek千问Kimi 这类通用模型。
去掉了"那""其实""这个"等填充词,句子结构从松散变为紧凑,关键信息保留完整。

🔁 清理口吃与重复 优秀可读率 30.75% → 59.27%

润色前:
那也是通过,比如说把相关的一些,就是就电动车的一些,就是它的一些产品手册啊,还有像是一些问题集啊,然后产品说明啊这种投喂进去之后,那用户他有车需求的,车辆可以行驶到喇叭不响就可以去定位,比如说喇叭啊喇叭不响会有什么问题……
润色后:
那也是通过把电动车的产品手册、问题集和产品说明等投喂进去。用户有车辆需求时,比如车辆可以行驶但喇叭不响,就可以去定位"喇叭不响会有什么问题"。
冗余的"就是""一些""啊"被清除,长句拆分为逻辑清晰的短句,技术描述更精准。

✂️ 处理自我纠正 忠实度 & 可读性双高

润色前:
这个这个,搜一下那个遇果香源的红富士苹果,啊不是,是烟台栖霞红富士,对,要 3 斤装的,还带"脆"字的那个。
润色后:
搜一下 烟台栖霞红富士,要 3 斤装、带"脆"字的那个。
完美识别说话人的自我纠正过程,只保留最终意图,去掉了"这个这个""啊不是""对"等修正痕迹。

注:评测采用"先识别 + 再用 Qwen3.6-Plus 润色"的两步走方案作为基线对比。Qwen-Audio-3.0-ASR-Flash 单模型即可达到与两步走方案可比的润色质量。

0417 种语言,一次搞定 平均语义错误率 17.09%

多语言混合识别是语音模型的"硬骨头"。Qwen-Audio-3.0-ASR-Flash 支持从中文、日韩、东南亚到欧洲主流语言的 17 种语言,用户只需告诉模型会议可能涉及哪几种语言,即可自动开启混合识别。

在七个语种的评测中,它的表现全面优于主流竞品。

Qwen-Audio-3.0-ASR-Flash 17.09%
Azure 语音识别 23.6%
ElevenLabs Scribe v2 21.8%
Gemini 3.0 Flash 25.3%

在工业场景下,中文平均错字率仅 7.8%,英文为 11.52%,同时保持理论出字延迟 300 毫秒

支持语言:
中文 日语 韩语 泰语 越南语 印尼语 马来语 印地语 阿拉伯语 英语 法语 德语 西班牙语 葡萄牙语 俄语 更多……

注:语义错误率(Semantic Error Rate)评测覆盖 7 个语种,由人工标注语义正确性,越低越好。对比数据来自官方公开评测。

05语音识别竞赛进入下半场 从准确率到落地效率

长期以来,语音识别行业的竞争集中在标准普通话基础错字率的比拼。但真实商业化落地的核心瓶颈,从来不是标准发音——而是医疗术语、编程变量、工业设备型号、金融标的等小众词汇的识别能力。

一个诚实的注脚:

传统做法需要企业投入人力持续维护专属词表,而热词扩容又会反向拉低通用识别精度。这种"加词就降准"的困境,才是行业真正的痛点。

传统语音识别

  • 依赖固定词表,专业术语需人工维护
  • 热词加多 → 误触发增加 → 通用精度下降
  • 口头禅、重复需后处理大模型润色
  • 多语言场景需分别部署专属模型

Qwen-Audio-3.0-ASR-Flash

  • 行业词汇内化为模型能力,无需独立词表
  • 分级热词机制,专属词汇即时生效不误伤
  • 识别阶段直出结构化文本,去口头禅
  • 单模型支持 17 种语言混合识别

从"通用工具"到"生产力工具"的转型,核心在于模型能否理解真实世界的复杂性。当前国内 AI 语音识别市场集中度持续走高,竞争赛道已从单纯准确率转向垂直行业落地效率

语音输入上下文理解专业词识别热词匹配语音润色结构化输出
编辑核心判断

语音识别不再比"谁听得更准",而是比"谁在真实场景中更少需要人工兜底"。Qwen-Audio-3.0 证明:把专业词听中率做到 95% 以上,比把通用错字率再降 0.5 个百分点,对商业客户更有实质价值。

现在就能用

Qwen-Audio-3.0-ASR 已通过阿里云百炼平台开放调用,提供语音识别、离线文件转写、实时语音识别三个版本,开发者可即接即用。

阿里云百炼平台 → 立即体验