🎙️ 语音模型 · 智能体评测

xAI 发布 Grok Voice 2.0,登顶语音智能体评测,首响 0.7 秒为前五唯一亚秒级

7 月 30 日,马斯克旗下 xAI 推出新一代语音到语音模型 Grok Voice Think Fast 2.0。在 Artificial Analysis 的 Tau Voice 语音智能体基准测试中,该模型以 56.5% 得分排名第一,击败 OpenAI、Google、阿里千问等厂商;平均首音频响应时间仅 0.70 秒,是榜单前五名中唯一低于 1 秒的模型,每小时使用成本仅 4.80 美元,比 GPT-Realtime-2.1 便宜约 2.2 倍。

来源:公开报道 2025-07-30 全文约 3 分钟读完
#xAI #Grok Voice #语音智能体 #Tau Voice
🥇 第 1 名 Tau Voice 语音智能体评测
0.70 首音频响应,前五唯一亚秒级
$4.80/时 输入音频定价,比 GPT 便宜 2.2 倍

⚡ 30 秒速览

  • 赢了什么:Tau Voice 语音智能体测试 56.5% 排名第一;Speech-to-Speech 综合指数 82.9% 位列第二,仅次于千问 Qwen Audio 3.0 Realtime Plus(84.1%)。
  • 快了多少:首响 0.70 秒,较前代 1.25 秒缩短 44%;前五名中唯一低于 1 秒,GPT-Realtime-2.1 High 需 1.21 秒。
  • 便宜多少:每小时 4.80 美元,GPT-Realtime-2.1 High 为 10.75 美元,便宜约 2.2 倍;较前代 3.00 美元有所上涨。
  • 怎么做到:支持「边说边推理」,中位数推理 Token 消耗仅前代 40%,工具调用常在首句话结束前启动。
  • 何时可用:8 月 5 日成为默认模型,面向开发者和企业开放。

01两份榜单,一冠一亚

Artificial Analysis 同时维护两套语音模型评测:Speech-to-Speech 综合指数衡量端到端语音能力,Tau Voice 专测语音智能体任务完成能力。Grok Voice Think Fast 2.0 在两份榜单上表现如下:

Tau Voice · 语音智能体评测
🥇 Grok Voice Think Fast 2.0xAI
56.5

该模型在此榜单击败 OpenAI、Google、阿里千问等厂商语音模型,但原始报道未逐一列出其他厂商具体分数,无法绘制完整排行。

Speech-to-Speech 综合指数
🥇 Qwen Audio 3.0 Realtime Plus阿里通义千问
84.1
🥈 Grok Voice Think Fast 2.0xAI
82.9

注:Speech-to-Speech 指数柱形自 80 分起缩放,非零起点;千问领先 1.2 个百分点。两份榜单评测口径不同,不可直接横比。

首音频响应时间 · 越短越快
Grok Voice Think Fast 2.0xAI
0.70
GPT-Realtime-2 HighOpenAI
1.14
GPT-Realtime-2.1 HighOpenAI
1.21
Grok Voice Think Fast 1.0xAI(前代)
1.25

注:柱长代表响应时间(秒),越短越快。以 1.25 秒为满刻度。Grok Voice 2.0 是前五名中唯一低于 1 秒的模型。

02开发者实测:对话几乎无停顿

📞 多轮实时电话:愤怒客户 vs 客服接线员实测

  • AI 公司 Helionova AI CEO Nick White 在旗下产品 Tradecraft 上完成全栈语音实时升级,称「绝对是一次飞跃式的进步」。
  • 实测中,他让 Grok Voice 扮演因维修人员爽约而愤怒投诉的客户,自己扮演客服接线员,围绕预约迟到展开多轮实时对话。
  • 模型几乎无明显停顿,能根据对话内容持续推进情节,并针对客服回答实时反馈。
Nick White 评价:「绝对是一次飞跃式的进步」

🖥️ 终端工具集成:连续指令快速响应实测

  • 开发者将 Think Fast 2.0 集成进终端工具 GrokTerm,测试者先让模型介绍新版本亮点,模型以极快速度回应。
  • 随后连续发出「切换赛博朋克主题」「切回原主题」「切到另一屏幕」「再切回赛博朋克」等指令,模型均快速响应并完成操作,全程对答如流

🔧 内部工程师评价团队发声

  • xAI 软件工程师 Parker Conrad 发文称,语音团队为此倾注大量努力,模型的智能水平、准确性和能力「几乎让人感觉不真实」。
  • 他认为 Think Fast 2.0 向「开箱即用」的目标迈进了一大步——「这本就是语音模型应有的样子」。

03三个维度的跃升与 0.7 秒背后的原理

Think Fast 2.0 的升级集中在模型能力、响应速度、推理效率三方面。与前代 1.0 对比:

Think Fast 1.0(前代)

综合得分 75.7%|Full Duplex Bench 77.8%|首响 1.25 秒|推理 Token 消耗 100%

Think Fast 2.0(新一代)

综合得分 82.9%(+7.2pp)|Full Duplex Bench 95.1%(+17.3pp)|首响 0.70 秒(-44%)|推理 Token 仅 40%

97.2%Big Bench Audio 语音推理
95.1%Full Duplex 双工交互
1.4×转写准确率提升(vs 前代)
10×噪声场景识别误差降低

Big Bench Audio 测语音推理,Full Duplex Bench 测多人实时交互。在覆盖 24 种语言、数千条短语的转写测试中,相比 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升约 1.5–2 倍;在背景噪声大、电话压缩等真实场景下,识别误差可降低约 10 倍。

0.70 秒首响的关键,在于 Think Fast 系列支持边说边推理——不同于许多语音模型需要先完成推理再生成语音,它在说话的同时完成推理,因此能在保持低延迟的同时处理复杂任务。

接收语音边说边推理首句话内启动工具调用生成回应

中位数推理 Token 消耗仅为上一代约 40%,意味着工具调用通常能够在模型第一句话结束前便开始执行。此外,研发团队利用大量强化学习数据让模型更接近真实人类交流方式:更多使用短句表达,一次只提一个问题,避免冗长重复——即使背后正在完成复杂流程规划,用户也不会明显感受到等待。

编辑视角

本文核心数据来自 xAI 官方发布与 Artificial Analysis 榜单,属厂商单方披露 + 第三方评测混合来源。Tau Voice 排名第一和 0.70 秒首响有外部机构背书,可信度较高;但「飞跃式进步」「让人感觉不真实」等评价均来自 xAI 员工或合作开发者,带有明显立场偏向。Speech-to-Speech 综合指数上千问仍领先 1.2 个百分点,xAI 在端到端语音能力上并非全面第一。

读者应带着两条背景读这条新闻:其一,Tau Voice 是新设基准,参评模型数量和评测口径尚需观察;其二,8 月 5 日默认模型升级后,实际企业场景表现才是真正的验金石。

语音模型竞争的主战场,正在从「听清 + 说清」转向「听懂 + 做完」——谁先让语音智能体在客服、销售等真实业务中跑通闭环,谁就拿到下一轮入场券。

怎么用

Think Fast 2.0 将于 8 月 5 日成为 xAI 默认语音模型,面向开发者与企业开放接入。每小时输入音频 4.80 美元。

x.ai → 开发者文档