国内首个AI语音生产力平台CosyVoice Studio发布,Qwen-Audio登顶全球语音榜
8月7日,阿里巴巴推出国内首个AI语音生产力平台CosyVoice Studio,整合语音识别、语音合成、实时语音交互三类核心能力,覆盖「听、创、聊」全链路。其自研的Qwen-Audio-3.0-Realtime在第三方评测平台Artificial Analysis上以84.1%的综合指数夺冠,语音推理、智能体表现、对话动态三个子项均列世界第一。
8月7日,阿里巴巴推出国内首个AI语音生产力平台CosyVoice Studio,整合语音识别、语音合成、实时语音交互三类核心能力,覆盖「听、创、聊」全链路。其自研的Qwen-Audio-3.0-Realtime在第三方评测平台Artificial Analysis上以84.1%的综合指数夺冠,语音推理、智能体表现、对话动态三个子项均列世界第一。
在第三方评测平台 Artificial Analysis 7月28日的语音综合指数(Speech to Speech Index)榜单中,Qwen-Audio-3.0-Realtime 以 84.1% 的综合得分摘得桂冠。更关键的是,它在所有子项上均未失手。
注:柱形图为相对展示,非零起点;综合指数 84.1% 为 Artificial Analysis 平台公开数据,三个子项排名根据官方评测结果标注。该榜单覆盖全球主要语音模型,全程自动化评测。
过去,语音 AI 的能力散落在不同工具里:转写用 A 产品,合成用 B 平台,对话系统需要独立对接。企业想用语音能力,往往要拼凑多个模块。CosyVoice Studio 做的事情很直接——把这三件事放在同一个平台上。
语音识别、合成、对话各自独立,用户需要分别采购并自行集成,体验割裂,部署成本高。
「听、创、聊」一体化,从采集到理解到产出,一条链路走完,个人和企业都能直接使用。
平台拆分为三个产品方向,分别对应语音 AI 的三种生产力角色:
注:三个方向共享同一底层模型能力,但面向的用户场景和交付物形态不同。个人用户可从 CosyFlow 入手,企业可从 CosyAgent 开始验证。
一个诚实的注脚:语音过去只是「听见」和「念出来」,现在它能理解上下文、做逻辑判断、完成任务。以下三个案例来自 CosyVoice Studio 的实际场景。
语音是一种高度依赖场景的数据。会议室里的多人讨论、开放空间的远距离拾音、方言表达、客服场景的实时对话——这些复杂情况不是单纯扩大模型规模就能解决的。阿里拥有大量真实场景作为训练场。
场景产生需求 → 技术解决问题 → 产品获得反馈 → 模型持续升级。
海量 C 端语音对话数据,覆盖日常沟通、内容创作、信息查询,口语表达丰富多样。
会议、沟通、协作等办公场景,复杂环境下的语音识别与会议记录,在真实工作流中不断验证。
导航语音、位置播报,要求语音合成具备稳定性、自然度和实时响应能力。
高并发、长链路、复杂业务问题的客服场景,考验 AI 能否听懂并完成服务任务。
注:以上四个场景覆盖了语音交互的主要维度——日常对话、办公协作、实时导航、复杂客服。每个场景都为模型提供了差异化的训练信号。
答案并不神秘:阿里拥有国内最完整的语音场景生态。从 C 端对话到 B 端办公,从出行导航到电商客服,语音模型在真实业务中反复迭代,而不是在实验室里闭门训练。
这种「场景飞轮」的运转逻辑可以拆解为一条链路:
CosyVoice Studio 的推出,意味着阿里把语音能力从幕后模型推向前台产品。但最终能走多远,取决于这些能力能否在更多真实企业场景中被持续使用和验证。
一个值得注意的行业背景:2026 年第一季度,全球语音 AI 赛道融资总额已超过 70 亿美元。海外已经跑出 ElevenLabs 等估值超百亿美金的全链路平台,而国内一直缺少一个真正意义上的语音生产力基建产品。CosyVoice Studio 的发布,标志着这个缺口正在被填补。
语音 AI 的竞争正在从「谁识别更准、谁声音更像真人」转向「谁能把语音融入真实工作流,让声音变成可理解、可调用、可执行的信息」。模型能力只是入场券,场景和闭环才是真正的壁垒。
CosyVoice Studio 已面向个人和企业用户开放,登录官网即可体验「听、创、聊」全链路能力。
cosyvoice.aliyun.com → 立即体验个人用户可直接使用 CosyFlow 与 CosyCreative,企业用户可申请 CosyAgent 内测。