专有名词听中率突破 95%,阿里千问语音识别模型 Qwen-Audio-3.0 发布
7 月 31 日,阿里千问大模型团队发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现显著提升。医疗场景专业词"听中率"达 95.36%,工业、IT 编程、畜牧业均超 90%,热词"听中率"多数场景突破 99%。
7 月 31 日,阿里千问大模型团队发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现显著提升。医疗场景专业词"听中率"达 95.36%,工业、IT 编程、畜牧业均超 90%,热词"听中率"多数场景突破 99%。
在 Qwen-Audio-3.0 之前,其前代系列已在全球权威 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率登顶全球第一。这并非一次偶然的实验室成绩——它证明了这个模型家族在通用语音识别上已经达到世界级水准。
但通用准确率只是入场券。真正的商业化瓶颈,从来不在标准普通话上。
Qwen-Audio-ASR 系列 · 错字率仅 1.7% · Artificial Analysis 评测
注:Artificial Analysis 为国际权威 AI 评测平台,评测覆盖多语种、多场景下的语音识别准确率。1.7% 错字率为该平台历史最佳成绩之一。
真实场景中的语音识别,难点从来不在标准发音,而在专业术语、中英文混说、同音词混淆。Qwen-Audio-3.0-ASR-Flash 用三项能力逐个击破。
长音频 Context 能力,识别时参考前文已识别内容,跨片段保持连贯,不遗漏、不认错。记忆来自音频本身,随对话自动更新。
将医疗、IT、工业、金融等专业词汇内化为模型自身能力,无需逐一配置词表。医疗场景听中率突破 95.36%,工业 / IT / 畜牧业超 90%。
分级热词机制,企业专属词汇即时生效。热词"听中率"全部测试集超 90%,多数场景突破 99%,不因热词扩容而拉低通用精度。
注:行业词"听中率"为内部评测指标,指模型正确识别专业词汇的比例。热词测试覆盖医疗、金融、法律、制造等多行业定制场景。
人们日常说话时充满语气词、重复、自我纠正。传统方案需要"先识别 + 再用大模型润色"两步走,而 Qwen-Audio-3.0-ASR-Flash 在识别阶段就直接输出结构化文本。
三个真实案例,看它如何"听懂你真正想说的话"。
注:评测采用"先识别 + 再用 Qwen3.6-Plus 润色"的两步走方案作为基线对比。Qwen-Audio-3.0-ASR-Flash 单模型即可达到与两步走方案可比的润色质量。
多语言混合识别是语音模型的"硬骨头"。Qwen-Audio-3.0-ASR-Flash 支持从中文、日韩、东南亚到欧洲主流语言的 17 种语言,用户只需告诉模型会议可能涉及哪几种语言,即可自动开启混合识别。
在七个语种的评测中,它的表现全面优于主流竞品。
在工业场景下,中文平均错字率仅 7.8%,英文为 11.52%,同时保持理论出字延迟 300 毫秒。
支持语言:注:语义错误率(Semantic Error Rate)评测覆盖 7 个语种,由人工标注语义正确性,越低越好。对比数据来自官方公开评测。
长期以来,语音识别行业的竞争集中在标准普通话基础错字率的比拼。但真实商业化落地的核心瓶颈,从来不是标准发音——而是医疗术语、编程变量、工业设备型号、金融标的等小众词汇的识别能力。
一个诚实的注脚:
传统做法需要企业投入人力持续维护专属词表,而热词扩容又会反向拉低通用识别精度。这种"加词就降准"的困境,才是行业真正的痛点。
从"通用工具"到"生产力工具"的转型,核心在于模型能否理解真实世界的复杂性。当前国内 AI 语音识别市场集中度持续走高,竞争赛道已从单纯准确率转向垂直行业落地效率。
语音识别不再比"谁听得更准",而是比"谁在真实场景中更少需要人工兜底"。Qwen-Audio-3.0 证明:把专业词听中率做到 95% 以上,比把通用错字率再降 0.5 个百分点,对商业客户更有实质价值。
Qwen-Audio-3.0-ASR 已通过阿里云百炼平台开放调用,提供语音识别、离线文件转写、实时语音识别三个版本,开发者可即接即用。
阿里云百炼平台 → 立即体验