🎤 语音识别 · 模型发布

阿里发布 Qwen-Audio-3.0-ASR-Flash:长音频不丢词、行业词不用教,热词定制准确率突破 99%

7 月 31 日,阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度系统性升级,同时具备语音润色能力,可直接输出结构化文本。该模型已在阿里云百炼平台开放调用。

综合公开信息整理 2026-07-31 全文约 3 分钟读完
#阿里巴巴 #Qwen-Audio #语音识别 #ASR #行业词识别
🥇 错字率 1.7% 离线版全球第一(Artificial Analysis)
95.36% 医疗场景行业词召回率
99%+ 热词定制准确率(多数场景)

⚡ 30 秒速览

  • 赢在哪:长音频不丢词——模型可参考近期上下文,同音词误判率大幅下降;行业词不用教——无需人工维护词表,模型内化多领域专业词汇。
  • 数据说话:医疗场景行业词召回率突破 95.36%,热词定制化准确率多数场景达 99%+,所有测试集均超 90%
  • 附加能力:语音润色一步完成——去除填充词、合并自我修正、输出结构化文本,无需调用下游大模型,延迟更低、成本更省。
  • 去哪体验:阿里云百炼平台已开放调用,即搜即用。

01三大升级 从「听清」到「听懂」的跨越

传统 ASR 模型的核心矛盾是:每一秒都能听清,但放到整段对话里,却经常听错。同一个发音对应十几个同音词,模型必须记住前面说过什么,才能输出正确的那一个。Qwen-Audio-3.0-ASR-Flash 的升级,正是围绕这一核心矛盾展开。

传统方案

每几秒独立识别,同音词靠当前语音片段猜;行业词依赖人工维护词表,热词加得越多误触发越多。

Qwen-Audio-3.0-ASR-Flash

长音频 Context 记忆近期语义,行业词内化为模型能力,热词定制结合声学证据与上下文智能判断。

但升级不止于参数,真正的战场在真实场景中。

模型在转写当前语音片段时,可参考近期已识别的上下文,延续同一话题中的关键词与语义线索。在一场长达数小时的会议录音中,同一位发言人的名字、同一个技术概念,不会因为跨了多个语音片段就被忘记或认错。

而行业词识别方面,研究团队通过持续挖掘医疗、IT 编程、股票、社会名人等领域的实体词,构建了覆盖多行业的高质量词库,并基于这些实体词合成训练数据,增强模型对专业术语和低频词的识别能力。

02技术深度 数据背后的工程能力

传统方案中,行业词识别往往依赖人工维护词表,Qwen-Audio-3.0-ASR-Flash 将这一过程内化为模型自身能力,无需人工逐一设置,即可在真实业务场景中持续进化。在最新的行业词汇内部评测中,各场景的行业词召回率均有显著提升。

1.7% 错字率 · 全球第一
95.36% 医疗场景行业词召回率
90%+ 热词定制所有测试集
99%+ 热词定制多数场景

注:错字率数据为离线版本在 Artificial Analysis 评测结果;行业词召回率与热词准确率均为内部评测数据,实际表现可能因场景而异。

数据背后,是工程能力的系统性升级。

更关键的是,这些能力并非孤立存在——长音频 Context 与行业词识别形成正向循环:上下文记忆帮助模型更准确地锁定专业词汇,而行业词库的覆盖又让模型在长音频中保持术语一致性。两者叠加,效果远超单项提升。

03语音润色 一步到位,无需下游大模型

Qwen-Audio-3.0-ASR-Flash 还具备一项独特能力:在识别环节直接完成语音润色,无需再调用下游文本大模型,链路更短、延迟更低、使用成本也更低。

口语中的「杂质」被自动清理:

🗣️ 去除填充词 一步完成

  • 口语中的“那个”“嗯”“就是”等填充词被直接去除,输出干净文本。
  • 无需额外后处理,ASR 模型在识别时即完成过滤。
效果:转写即终稿,减少人工编辑成本。

🔄 自我修正合并 保留最终意图

  • 说话时的自我修正,如“我们下周三评审,不对,是周四”,只保留最终意图
  • 模型自动识别修正结构,丢弃前半段错误信息。
效果:输出内容与说话人真实意图一致,不保留冗余修正轨迹。

📋 结构化输出 散乱变有序

  • 散乱的口述可自动整理为结构化表达,段落清晰、逻辑连贯。
  • 适用于会议纪要、访谈记录等需要规整输出的场景。
效果:从语音到结构化文本,一步到位,无需二次加工。

更重要的是,这些润色由 ASR 模型在识别环节一步完成,无需再调用下游文本大模型,链路更短、延迟更低、使用成本也更低。

04热词定制 加得越多,越准

传统方案长期面临一个矛盾:热词加得越多,误触发越多,识别结果反而被带偏。Qwen-Audio-3.0-ASR-Flash 对热词定制能力进行了全面升级,采用模型结合声学证据与上下文进行智能判断的方式,而非简单替换。

场景覆盖广,准确率全线突破:

医疗 IT 编程 股票 社会名人 品牌名 产品名 行业黑话

在传入热词的条件下,热词定制化准确率在所有测试集均达到 90% 以上,多数场景更是突破 99%。以下为部分场景的准确率表现:

医疗场景
95.36%
编程场景
90%+
股票场景
90%+
多数场景(含热词)
99%+

注:柱形宽度为示意性比例,非精确等距缩放;准确率以标注数值为准。医疗场景为内部评测数据,其余为综合测试集结果。

05为什么是现在?

语音识别走到今天,「听清」已是标配,「听懂」才是分水岭。Qwen-Audio-3.0-ASR-Flash 的三大升级——长音频 Context、行业词内化、热词智能判断——指向同一个方向:让 ASR 从「语音转文字工具」进化为「语音理解引擎」。

一个诚实的注脚:行业词召回率在医疗场景突破 95%,但仍有近 5% 的盲区;热词定制在多数场景达到 99%+,但在极低频、极生僻的词上仍有提升空间。这不是缺陷,而是技术演进的正常节奏。

真正值得关注的是技术路径的转变:模型不再被动等待人工词表,而是在识别过程中主动调用语义记忆与上下文线索。这条路一旦走通,行业落地的最后一公里将被系统性缩短。

编辑核心判断

当 ASR 模型学会「一边听一边想」,行业词识别的瓶颈就从人工维护转向模型进化——这才是语音识别走向通用场景的真正拐点。

现在就能用

Qwen-Audio-3.0-ASR-Flash 已在阿里云百炼平台开放调用,即搜即用,无需等待。

阿里云百炼 → 搜索「Qwen-Audio」