🗣️ 语音合成 · 技术突破

Qwen-TTS 语音合成突破人类水平,三种中文方言自然度登顶

通义千问语音合成模型以 300 万+小时 训练数据实现人类级别自然度与表现力,支持北京话、上海话、四川话三种方言生成,在 SeedTTS-Eval 评测中多项指标达到业界领先水平,成为首个以大规模语料自然习得方言特征的国产语音合成系统。

来源:综合公开信息整理 2026-07-22 全文约 3 分钟读完
#Qwen-TTS #语音合成 #中文方言 #SeedTTS-Eval #通义千问
300 万+ 小时 训练语料 · 中英双语混合
7 种 中英双语音色 · 含 3 种方言
3 种 中文方言 · 北京话 / 上海话 / 四川话

⚡ 30 秒速览

  • 训练规模:超 300 万小时中英双语语料,合成效果达到人类级别自然度与情绪表现力。
  • 方言能力:支持北京话、上海话、四川话三种方言,模型自动从文本识别方言特征,无需额外标注。
  • 评测成绩:SeedTTS-Eval 上中文 WER 最低 1.209%,音色相似度最高 0.804,多项指标领先。
  • 音色阵容:7 种中英双语音色,Cherry、Ethan、Chelsie、Serena 为标准音色,Dylan / Jada / Sunny 对应三种方言。
  • 使用方式:通过 Qwen API 即可调用,代码三行完成语音合成,已开放最新版本 qwen-tts-latest。

01核心能力 规模、音色与方言覆盖

Qwen-TTS 使用了超过 300 万小时 的大规模语料库进行训练,合成效果实现了人类级别的自然度和表现力。与传统的拼接合成或参数合成不同,它会根据输入文本自动调整韵律、节奏和情绪变化——这意味着同一句话,放在不同语境下说出来,语气截然不同。

300 万+小时训练语料
7种中英双语音色
3种中文方言
2种语言 · 中英双语

注:训练语料包含中英文混合语音数据,方言数据通过大规模自然对话语料覆盖,非人工标注合成。

7 种音色,各有各的「声」份。

Cherry 中英双语 Ethan 中英双语 Chelsie 中英双语 Serena 中英双语 Dylan 北京话 Jada 上海话 Sunny 四川话

注:前四种为标准中英双语音色,后三种为方言音色。每种音色均支持中英混合输入,方言音色在中文方言文本上表现最优。

02方言案例 北京话 · 上海话 · 四川话 真实生成效果

Qwen-TTS 的方言能力不是简单的「口音滤镜」——它能够理解方言特有的词汇、语序和语气词,并以该方言的自然节奏说完整段话。以下是三种方言的生成示例:

🗣️ 北京话 · 音色 Dylan 自然度 · 极高

  • 「我们家那边后面有一个后山,就护城河那边,完了呢我们就在山上啊就其实也没什么,就是在土坡上跑来跑去,然后谁捡个那个嗯比较威风的棍,完了我们就呃得瞎打呃,要不就是什么掏个洞啊什么的。」
  • 「得有自己的想法,别净跟着别人瞎起哄,多动动脑子,有点儿结构化的思维啥的。」
北京话特点:儿化音自然、语气词「完了呢」「呃」到位、句末「啥的」地道。模型没有刻意模仿,而是像真人在聊天。

🗣️ 上海话 · 音色 Jada 自然度 · 极高

  • 「侬只小赤佬,啊呀,数学句子错它八道题,还想吃肯德基啊!夜到麻将队三缺一啊,嘿嘿,叫阿三头来顶嘛!哦,提前上料这样产品,还要卖 300 块硬币啊。」
  • 「侬来帮伊向暖吧,天光已经暗转亮哉。」
上海话特点:「侬」「伊」人称代词准确、「小赤佬」「阿三头」俚语自然、「夜到」「天光」时间词地道。语气中带着上海话特有的「嗲」与「爽利」。

🗣️ 四川话 · 音色 Sunny 自然度 · 极高

  • 「胖娃胖嘟嘟,骑马上成都,成都又好耍。胖娃骑白马,白马跳得高。胖娃耍关刀,关刀耍得圆。胖娃吃汤圆。」
  • 「他一辈子的使命就是不停地爬哟,爬到大海头上去,不管有好多远!」
四川话特点:童谣节奏自然,「好耍」「爬哟」「好多远」等典型川渝表达。句末语气词「哟」「嘛」的使用非常地道,没有「川普」的生硬感。

注:以上文本为模型实际生成内容,非人工标注。方言自然度由 SeedTTS-Eval 评测及人工听测双重验证。

03评测指标 SeedTTS-Eval 客观数据

自然度不只是主观感受。Qwen-TTS 在 SeedTTS-Eval 评测集上完成了严格的客观测试,核心指标包括词错误率(WER,越低越好)音色相似度(SIM,越高越好)。以下为四种标准音色的中文评测结果:

Cherry
WER (zh)
1.209
SIM (zh)
0.799
Ethan
WER (zh)
1.489
SIM (zh)
0.777
Chelsie
WER (zh)
1.256
SIM (zh)
0.658
Serena
WER (zh)
1.495
SIM (zh)
0.804

注:WER 越低越好,SIM 越高越好。Cherry 在 WER 上表现最优(1.209%),Serena 在 SIM 上表现最优(0.804)。柱形条为相对比例示意,非绝对缩放。评测数据来自 SeedTTS-Eval 标准测试集。

在英文及困难(hard)测试集上,Qwen-TTS 同样表现稳定——Cherry 在英文 WER 上达到 1.967%,hard 集 WER 为 6.069%,均为同级别最佳水平之一。

04使用方式 三行代码,调用人类级别语音合成

Qwen-TTS 已通过 Qwen API 开放,最新版本为 qwen-tts-latest(或 qwen-tts-2025-05-22)。开发者只需几行代码即可完成语音合成:

# 安装依赖 import dashscope # 调用语音合成,指定音色为 Dylan(北京话) response = dashscope.audio.qwen_tts.SpeechSynthesizer.call( model="qwen-tts-latest", text="哟,您猜怎么着?今儿个我看NBA,库里投篮跟闹着玩似的,张手就来。", voice="Dylan" ) # 获取音频 URL audio_url = response.output.audio["url"] print(audio_url)

支持 7 种音色 自由切换,输入文本自动识别方言特征——如果用北京话文本搭配 Dylan 音色,输出就是纯正京腔;如果用四川话文本搭配 Sunny 音色,输出就是地道川音。目前 API 已全面开放,无需申请白名单。

注:以上代码为简化示例,完整版包含异常处理与音频下载。API 密钥通过环境变量 DASHSCOPE_API_KEY 配置。

05为什么是现在?

语音合成技术在过去十年经历了从「拼接合成」到「参数合成」再到「神经网络合成」的跃迁,但方言合成始终是一个被低估的难题。大多数系统只能做「带口音的普通话」,而非真正的方言。

Qwen-TTS 的关键突破在于:它没有专门标注方言数据,而是通过 300 万小时的大规模自然对话语料,让模型自主习得了方言的韵律、词汇和语气特征。这意味着方言能力不是「打补丁」打上去的,而是从数据中生长出来的。

传统方言合成

需要大量方言标注数据,人工设计口音规则,合成结果生硬,更像「方言朗读」而非「方言说话」。

Qwen-TTS 方案

端到端学习,从大规模自然对话中习得方言特征,无需人工规则,输出自然如同真人聊天。

但一个诚实的注脚:目前仅覆盖三种方言,中国有 七大方言区、数十种次方言。从「三种」到「全覆盖」,还有很长的路。

编辑核心判断

方言合成是语音技术从「能听会说」走向「真正理解」的关键分水岭。Qwen-TTS 证明了大规模语料训练可以自然习得方言特征,这条路径比人工设计规则更可持续——但覆盖中国七大方言区,才是真正的里程碑。

现在就能用

Qwen-TTS 已通过 Qwen API 全面开放,最新版本 qwen-tts-latest 即开即用。支持 7 种音色、3 种方言,中英双语混合输入。

Qwen API → 选择语音合成

注:实际体验请访问通义千问官方文档,搜索「Qwen-TTS」获取 API 密钥与调用指引。