🎤 语音智能体 · 榜单速递
Grok Voice Think Fast 2.0 登顶智能体评测榜首,响应仅 0.7 秒,定价比竞品便宜约 2.2 倍
7 月 30 日,SpaceXAI 发布新一代语音模型 Grok Voice Think Fast 2.0,在 Tau Voice 智能体基准测试中以 56.5% 得分排名第一,击败 OpenAI、Google、阿里千问等厂商的语音模型;同时以 0.70 秒首音频响应时间成为前五名中唯一低于 1 秒的模型,定价每小时仅 4.80 美元,较 GPT-Realtime-2.1 High 便宜约 2.2 倍。
综合公开信息整理•
2025-07-30•
全文约 3 分钟读完
#SpaceXAI
#Grok Voice
#语音智能体
#Tau Voice
#Think Fast 2.0
🥇 第 1 名
Tau Voice 智能体基准 · 多厂商参评
0.70秒
首音频响应时间 · 前五唯一低于 1 秒
4.80美元/时
输入定价 · 比 GPT-Realtime-2.1 High 便宜约 2.2 倍
⚡ 30 秒速览
- 赢了多少:Tau Voice 智能体测试 56.5% 排名第一;Speech-to-Speech 综合 82.9% 位列第二,仅次于千问 Qwen Audio 3.0 Realtime Plus(84.1%)。
- 快多少:首音频响应 0.70 秒,比 GPT-Realtime-2.1 High(1.21 秒)快约 42%,比前代 Think Fast 1.0(1.25 秒)快 44%。
- 便宜多少:每小时 4.80 美元,仅为 GPT-Realtime-2.1 High(10.75 美元/小时)的约 45%,便宜约 2.2 倍。
- 哪里更强:支持"边说边推理",中位数推理 Token 消耗仅为上一代约 40%;背景噪声下识别误差降低约 10 倍。
- 谁在验证:多位开发者实测给出好评,Helionova AI CEO 称"绝对是一次飞跃式的进步"。
01双榜成绩:智能体第一,综合第二
在权威评测机构 Artificial Analysis 的语音到语音指数(Speech to Speech Index)中,Grok Voice Think Fast 2.0 高推理能力版本以 82.9% 的综合得分位列第二,仅次于千问 Qwen Audio 3.0 Realtime Plus(84.1%)。但在衡量智能体性能的 Tau Voice 基准测试中,该模型以 56.5% 的得分排名第一,击败了 OpenAI、Google、阿里千问等厂商的语音模型。
一个诚实的注脚:
两个榜单考察的能力方向不同——Speech-to-Speech 综合指数评估语音识别、合成、理解等全链路,而 Tau Voice 专门衡量智能体在真实任务中的自主完成能力。Think Fast 2.0 在智能体维度上做到了行业第一。
🥇 Grok Voice Think Fast 2.0SpaceXAI · Tau Voice 智能体
56.5
Qwen Audio 3.0 Realtime Plus阿里千问
84.1*
GPT-Realtime-2.1 HighOpenAI
—
注:Tau Voice 智能体榜单与 Speech-to-Speech 综合榜单为不同评测体系,分数不可直接横向对比。* 为 Speech-to-Speech 综合得分,此处仅作参考。
02Tau Voice:测的是语音智能体能不能干活
Tau Voice 与传统的语音识别评测不同——它不考"听没听清",而是考"听懂之后能不能把事办成"。这包括多轮对话、工具调用、任务拆解与结果交付。
换句话说,它考的是"语音智能体"而不是"语音识别器"。
传统语音评测
考转写准确率、语音合成自然度,与真实任务交付距离较远。
Tau Voice 智能体基准
考语音智能体能否自主完成复杂任务,包括多轮对话、工具调用、流程执行。
56.5%Tau Voice 得分
97.2%Big Bench Audio
95.1%Full Duplex Bench
0.70s首音频响应
注:Big Bench Audio 衡量语音推理能力,Full Duplex Bench 衡量多人实时语音交互体验。三项指标从不同维度反映模型能力。
Think Fast 2.0 在 Full Duplex Bench 上达到 95.1%,相比上一代 77.8% 提升明显,说明其在多人对话场景下的实时交互能力有了质的飞跃。
03三个维度看懂升级
Think Fast 2.0 的升级集中在三个方向:响应速度、推理效率、语音识别。每一项都有具体数据支撑。
速度方面:平均首次语音响应时间仅 0.70 秒,快于 GPT-Realtime-2 High(1.14 秒)、GPT-Realtime-2.1 High(1.21 秒)以及 Think Fast 1.0(1.25 秒),是前五名中唯一低于 1 秒的模型。
推理效率方面:不同于许多语音模型需要先完成推理再生成语音,Think Fast 系列支持"一边说话一边完成推理"。Think Fast 2.0 进一步优化了推理 Token 利用效率,中位数推理 Token 消耗仅为上一代约 40%,工具调用通常能在模型第一句话结束前便开始执行。
语音识别方面:在覆盖 24 种语言、数千条短语的测试中,Think Fast 2.0 整体转写准确率相比 Think Fast 1.0 提升约 1.4 倍,相比 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升约 1.5 至 2 倍。在背景噪声较大、电话压缩等真实场景下,识别误差可降低约 10 倍。
对话方式也进行了调整:研发团队利用大量强化学习数据,让模型更接近真实的人类交流方式,更多使用短句表达,一次只提一个问题,避免冗长重复。
04开发者实测:"飞跃式进步"
多位开发者在社交平台上分享了他们的实测体验,从不同角度验证了 Think Fast 2.0 的能力。
🎯 全栈语音实时升级:Tradecraft 产品集成实测好评
- AI 公司 Helionova AI 的 CEO Nick White 在 X 上分享,已在旗下产品 Tradecraft 上完成面向 grok-voice-think-fast-2.0 的全栈语音实时升级,称"绝对是一次飞跃式的进步"。
- 他让 Grok Voice 扮演一名因维修人员爽约而愤怒投诉的客户,自己则扮演客服接线员,双方围绕预约迟到展开多轮实时电话对话。
- 整个过程中,模型几乎没有明显停顿,能够根据对话内容持续推进情节,并针对客服回答实时作出反馈。
实测结论:多轮对话自然流畅,情节推进与实时反馈能力出色。
🖥️ 终端工具集成:GrokTerm 演示操作指令实时响应
- 另一位开发者将 Think Fast 2.0 集成进终端工具 GrokTerm,展示其对话速度与指令执行能力。
- 测试者连续发出"将应用主题切换为赛博朋克风格""切回原主题""切到另一边屏幕""再切回赛博朋克"等指令,模型均快速响应并完成操作,全程对答如流。
实测结论:指令理解准确,操作执行连贯,几乎无延迟感。
💬 团队内部评价:"向着'开箱即用'迈进了一大步"官方视角
- SpaceXAI 软件工程师 Parker Conrad 发文称:"整个语音团队为此倾注了大量的努力、思考和热爱。模型的智能水平、准确性和能力几乎让人感觉不真实。"
- 他进一步指出:"语音领域仍然充满摩擦,Think Fast 2.0 向着'开箱即用'的目标迈进了一大步——这本就是语音模型应有的样子。"
内部评价:智能水平与准确性"几乎让人感觉不真实"。
05语音模型竞争进入"智能体时代"
过去一年,OpenAI、Google 与阿里千问等厂商持续升级实时语音模型,竞争重点逐渐从语音识别、语音合成,转向复杂任务处理、多轮对话以及工具调用能力。
从此次发布来看,SpaceXAI 延续了这一方向。一方面,Think Fast 2.0 进一步提升了语音推理、实时交互和语音识别能力;另一方面,通过"边说边推理"、更低的推理 Token 消耗以及更快的工具调用速度,其希望让语音智能体能够真正承担客服、电话助手、销售等真实业务场景。
一个值得关注的信号:
从 Artificial Analysis 最新榜单来看,Think Fast 2.0 已经在语音智能体能力(Tau Voice)上取得第一,并跻身 Speech-to-Speech 综合榜单前列。随着 8 月 5 日默认模型完成升级,其实际表现也将在更多开发者和企业应用中接受进一步验证。
语音识别→语音理解→任务拆解→工具调用→结果交付
注:语音智能体的能力链路正在从"听写"向"办事"延伸,Think Fast 2.0 在链路后半段表现突出。
编辑核心判断
语音模型的竞争已经翻篇——不再比谁"听"得更准,而是比谁"办"得更利落。Think Fast 2.0 在智能体维度上的登顶,标志着语音 AI 从工具属性向"数字员工"属性的关键转折。定价仅为竞品一半,意味着这场变革的普惠性可能比想象中来得更快。
▶现在就能用
Grok Voice Think Fast 2.0 已通过 SpaceXAI 平台开放,开发者可接入 API 体验。8 月 5 日默认模型将完成升级,届时能力进一步开放。
体验 Grok Voice Think Fast 2.0 →
定价:每分钟 0.08 美元(约每小时 4.80 美元)