🎤 语音AI · 平台发布

国内首个AI语音生产力平台CosyVoice Studio发布,Qwen-Audio登顶全球语音榜

8月7日,阿里巴巴推出国内首个AI语音生产力平台CosyVoice Studio,整合语音识别、语音合成、实时语音交互三类核心能力,覆盖「听、创、聊」全链路。其自研的Qwen-Audio-3.0-Realtime在第三方评测平台Artificial Analysis上以84.1%的综合指数夺冠,语音推理、智能体表现、对话动态三个子项均列世界第一。

综合公开信息整理 2026-08-07 全文约 4 分钟读完
#阿里 #CosyVoice Studio #AI语音 #Qwen-Audio #语音生产力
🥇 全球第一 Artificial Analysis 语音综合指数
84.1% Qwen-Audio-3.0-Realtime 综合得分
3 项 语音推理 · 智能体 · 对话动态均夺冠
⚡ 30 秒速览
  • 一个平台,三种能力:CosyVoice Studio 整合「听、创、聊」全链路,覆盖个人效率、内容创作、企业服务三大方向。
  • 模型底子全球领先:Qwen-Audio-3.0-Realtime 在 Artificial Analysis 语音综合指数中排名第一,三个子项均为世界冠军。
  • 从记录到生产:语音输入不再只是转文字,而是直接产出结构化报告、邮件、待办等可交付成果。
  • 场景即壁垒:千问、钉钉、高德、淘天等真实业务为模型提供持续训练数据,形成「场景→数据→模型→产品」闭环。
  • 行业信号:国内语音 AI 从单点工具竞争,正式进入平台级能力竞争阶段。

01全球第一的语音模型 四项指标全部领跑

在第三方评测平台 Artificial Analysis 7月28日的语音综合指数(Speech to Speech Index)榜单中,Qwen-Audio-3.0-Realtime 以 84.1% 的综合得分摘得桂冠。更关键的是,它在所有子项上均未失手。

🥇 综合指数Speech to Speech Index
84.1
语音推理Speech Reasoning
世界第一
智能体表现Agent Performance
世界第一
对话动态Conversation Dynamics
世界第一

注:柱形图为相对展示,非零起点;综合指数 84.1% 为 Artificial Analysis 平台公开数据,三个子项排名根据官方评测结果标注。该榜单覆盖全球主要语音模型,全程自动化评测。

02从单点工具到全链路平台

过去,语音 AI 的能力散落在不同工具里:转写用 A 产品,合成用 B 平台,对话系统需要独立对接。企业想用语音能力,往往要拼凑多个模块。CosyVoice Studio 做的事情很直接——把这三件事放在同一个平台上。

过去:单点工具模式

语音识别、合成、对话各自独立,用户需要分别采购并自行集成,体验割裂,部署成本高。

CosyVoice Studio:全链路平台

「听、创、聊」一体化,从采集到理解到产出,一条链路走完,个人和企业都能直接使用。

平台拆分为三个产品方向,分别对应语音 AI 的三种生产力角色:

CosyFlow 个人效率 · 语音→工作成果
CosyCreative 内容创作 · 声音→内容资产
CosyAgent 企业服务 · 语音→业务执行

注:三个方向共享同一底层模型能力,但面向的用户场景和交付物形态不同。个人用户可从 CosyFlow 入手,企业可从 CosyAgent 开始验证。

03三个方向,一个平台 语音 AI 正在变成「能干活的东西」

一个诚实的注脚:语音过去只是「听见」和「念出来」,现在它能理解上下文、做逻辑判断、完成任务。以下三个案例来自 CosyVoice Studio 的实际场景。

📋 CosyFlow:通勤路上口述,下车已有完整邮件个人效率

  • 输入方式:用户在路上用语音口述一段工作安排,包含任务分配、时间节点和注意事项。
  • AI 处理:自动去除口语化表达(停顿、重复、临时修正),理解任务之间的依赖关系。
  • 交付成果:直接输出一封结构化的正式邮件,包含待办清单与责任人分配。
关键变化:语音输入从「记录工具」变成「内容生产工具」——用户不再需要二次整理。

🎙️ CosyCreative:一段文本,一分钟生成播客内容创作

  • 输入:将一篇早报文本(约 1500 字)粘贴到创作框,选择声音风格与音色。
  • AI 处理:自动摘要核心信息,生成口语化播报脚本,匹配语气和节奏。
  • 交付成果:约一分钟生成完整播报音频,可直接用于内容分发。
实测效果:从文本到可用的音频内容,全程约 60 秒,过去需要录音、剪辑、配音多个环节。

🤖 CosyAgent:语音驱动的企业服务智能体企业服务

  • 场景:客户通过语音描述售后问题,Agent 需要理解问题、查询知识库、生成解决方案。
  • AI 处理:连接企业知识库与业务系统,识别客户意图,完成多轮对话与任务执行。
  • 交付成果:直接生成工单、解决方案与后续步骤,全程语音交互。
语音 Agent 的价值不再只是降低人工成本,而是成为企业服务体系中的新入口。

04藏在场景里的护城河

语音是一种高度依赖场景的数据。会议室里的多人讨论、开放空间的远距离拾音、方言表达、客服场景的实时对话——这些复杂情况不是单纯扩大模型规模就能解决的。阿里拥有大量真实场景作为训练场。

场景产生需求 → 技术解决问题 → 产品获得反馈 → 模型持续升级。

💬

千问 App

海量 C 端语音对话数据,覆盖日常沟通、内容创作、信息查询,口语表达丰富多样。

📎

钉钉

会议、沟通、协作等办公场景,复杂环境下的语音识别与会议记录,在真实工作流中不断验证。

🗺️

高德

导航语音、位置播报,要求语音合成具备稳定性、自然度和实时响应能力。

🛒

淘天

高并发、长链路、复杂业务问题的客服场景,考验 AI 能否听懂并完成服务任务。

注:以上四个场景覆盖了语音交互的主要维度——日常对话、办公协作、实时导航、复杂客服。每个场景都为模型提供了差异化的训练信号。

05为什么是阿里做出来了?

答案并不神秘:阿里拥有国内最完整的语音场景生态。从 C 端对话到 B 端办公,从出行导航到电商客服,语音模型在真实业务中反复迭代,而不是在实验室里闭门训练。

这种「场景飞轮」的运转逻辑可以拆解为一条链路:

真实场景数据积累模型迭代产品升级更多场景

CosyVoice Studio 的推出,意味着阿里把语音能力从幕后模型推向前台产品。但最终能走多远,取决于这些能力能否在更多真实企业场景中被持续使用和验证。

一个值得注意的行业背景:2026 年第一季度,全球语音 AI 赛道融资总额已超过 70 亿美元。海外已经跑出 ElevenLabs 等估值超百亿美金的全链路平台,而国内一直缺少一个真正意义上的语音生产力基建产品。CosyVoice Studio 的发布,标志着这个缺口正在被填补。

编辑核心判断

语音 AI 的竞争正在从「谁识别更准、谁声音更像真人」转向「谁能把语音融入真实工作流,让声音变成可理解、可调用、可执行的信息」。模型能力只是入场券,场景和闭环才是真正的壁垒。

现在就能用

CosyVoice Studio 已面向个人和企业用户开放,登录官网即可体验「听、创、聊」全链路能力。

cosyvoice.aliyun.com → 立即体验

个人用户可直接使用 CosyFlow 与 CosyCreative,企业用户可申请 CosyAgent 内测。