Qwen-TTS 语音合成突破人类水平,三种中文方言自然度登顶
通义千问语音合成模型以 300 万+小时 训练数据实现人类级别自然度与表现力,支持北京话、上海话、四川话三种方言生成,在 SeedTTS-Eval 评测中多项指标达到业界领先水平,成为首个以大规模语料自然习得方言特征的国产语音合成系统。
通义千问语音合成模型以 300 万+小时 训练数据实现人类级别自然度与表现力,支持北京话、上海话、四川话三种方言生成,在 SeedTTS-Eval 评测中多项指标达到业界领先水平,成为首个以大规模语料自然习得方言特征的国产语音合成系统。
Qwen-TTS 使用了超过 300 万小时 的大规模语料库进行训练,合成效果实现了人类级别的自然度和表现力。与传统的拼接合成或参数合成不同,它会根据输入文本自动调整韵律、节奏和情绪变化——这意味着同一句话,放在不同语境下说出来,语气截然不同。
注:训练语料包含中英文混合语音数据,方言数据通过大规模自然对话语料覆盖,非人工标注合成。
7 种音色,各有各的「声」份。
注:前四种为标准中英双语音色,后三种为方言音色。每种音色均支持中英混合输入,方言音色在中文方言文本上表现最优。
Qwen-TTS 的方言能力不是简单的「口音滤镜」——它能够理解方言特有的词汇、语序和语气词,并以该方言的自然节奏说完整段话。以下是三种方言的生成示例:
注:以上文本为模型实际生成内容,非人工标注。方言自然度由 SeedTTS-Eval 评测及人工听测双重验证。
自然度不只是主观感受。Qwen-TTS 在 SeedTTS-Eval 评测集上完成了严格的客观测试,核心指标包括词错误率(WER,越低越好)和音色相似度(SIM,越高越好)。以下为四种标准音色的中文评测结果:
注:WER 越低越好,SIM 越高越好。Cherry 在 WER 上表现最优(1.209%),Serena 在 SIM 上表现最优(0.804)。柱形条为相对比例示意,非绝对缩放。评测数据来自 SeedTTS-Eval 标准测试集。
在英文及困难(hard)测试集上,Qwen-TTS 同样表现稳定——Cherry 在英文 WER 上达到 1.967%,hard 集 WER 为 6.069%,均为同级别最佳水平之一。
Qwen-TTS 已通过 Qwen API 开放,最新版本为 qwen-tts-latest(或 qwen-tts-2025-05-22)。开发者只需几行代码即可完成语音合成:
支持 7 种音色 自由切换,输入文本自动识别方言特征——如果用北京话文本搭配 Dylan 音色,输出就是纯正京腔;如果用四川话文本搭配 Sunny 音色,输出就是地道川音。目前 API 已全面开放,无需申请白名单。
注:以上代码为简化示例,完整版包含异常处理与音频下载。API 密钥通过环境变量 DASHSCOPE_API_KEY 配置。
语音合成技术在过去十年经历了从「拼接合成」到「参数合成」再到「神经网络合成」的跃迁,但方言合成始终是一个被低估的难题。大多数系统只能做「带口音的普通话」,而非真正的方言。
Qwen-TTS 的关键突破在于:它没有专门标注方言数据,而是通过 300 万小时的大规模自然对话语料,让模型自主习得了方言的韵律、词汇和语气特征。这意味着方言能力不是「打补丁」打上去的,而是从数据中生长出来的。
需要大量方言标注数据,人工设计口音规则,合成结果生硬,更像「方言朗读」而非「方言说话」。
端到端学习,从大规模自然对话中习得方言特征,无需人工规则,输出自然如同真人聊天。
但一个诚实的注脚:目前仅覆盖三种方言,中国有 七大方言区、数十种次方言。从「三种」到「全覆盖」,还有很长的路。
方言合成是语音技术从「能听会说」走向「真正理解」的关键分水岭。Qwen-TTS 证明了大规模语料训练可以自然习得方言特征,这条路径比人工设计规则更可持续——但覆盖中国七大方言区,才是真正的里程碑。
Qwen-TTS 已通过 Qwen API 全面开放,最新版本 qwen-tts-latest 即开即用。支持 7 种音色、3 种方言,中英双语混合输入。
Qwen API → 选择语音合成注:实际体验请访问通义千问官方文档,搜索「Qwen-TTS」获取 API 密钥与调用指引。