🎙️ 语音模型 · 技术发布

谷歌 CEO 官宣 Gemini 3.5 Transcribe:能删"嗯啊"、会改口误,语音转录从听写走向成稿

8 月 26 日,谷歌 CEO Pichai 亲自在 X 上官宣新一代语音转文本模型 Gemini 3.5 Transcribe。它不再满足于逐字听写——自动清理语气词、理解临时改口,把口语直接整理成接近成稿的文本。流式转录词错误率 4.0%,非流式 2.6%,延迟较上一代缩短 70%

综合公开信息整理 2026-08-26 全文约 4 分钟读完
#Gemini 3.5 Transcribe #语音转文本 #Speech AI #谷歌
4.0% 流式转录词错误率 · 实时场景
2.6% 非流式转录词错误率 · 录音处理
70% 转录延迟较 Chirp 3 缩短

⚡ 30 秒速览

  • 新在哪:Smart Transcription 自动删除"嗯""啊"与重复表达,理解临时改口,输出带标点、格式的成稿级文本。
  • 性能:流式词错误率 4.0%,非流式 2.6%;延迟较 Chirp 3 缩短 70%,实时返回低于 1 秒。
  • 硬能力:85+ 种语言自动识别、最多 8 人说话人分离、逐词时间戳、1000 词自定义词表。
  • 定价:实时转录约 $0.009/分钟,非实时约 $0.005/分钟,附免费测试额度。
  • 争议:X 上出现"谷歌看不清形势"的批评——行业狂卷 Agent,谷歌却发布转录模型。
  • 另一种读法:这不是旧问题。语音 Agent 进入生产之前,最缺的正是"稳定听懂人类"这一层。

01性能:数字在说话 Artificial Analysis 第三方测评

谷歌引用 Artificial Analysis 的测评数据给出两项核心指标:实时流式转录的平均词错误率为 4.0%,非流式录音处理为 2.6%。词错误率衡量的是替换、删除和新增词语所占的比例——数值越低,转录结果越接近原始语音。

4.0%流式词错误率
2.6%非流式词错误率
70%延迟较 Chirp 3 缩短
85+支持语言与地区变体

词错误率越低越好。但不同测试集的语言、噪声与口音分布会影响成绩,这两组数字不能代表模型在所有录音条件下的准确率。

低错误率只是入场券。

真正拉开体验差距的是延迟。实时版本通过 WebSocket 持续接收语音,以低于一秒的延迟返回阶段性转录结果,最终延迟较上一代 Chirp 3 缩短 70%——语音输入第一次可以像对话一样流畅,而不是说完再等三秒。

02从"听写"到"整理" 输出目标变了

过去的语音识别追求忠实记录:讲了什么,就逐字写下什么。但真实口语里全是语气词、重复、停顿和临时改口——即便每个字都识别对了,结果仍然没法直接读。

传统 ASR · 逐字听写

"嗯""啊"、重复、口误全部保留。输出只是原始速记,仍需人工二次整理才能使用。

Smart Transcription · 智能整理

清理语气词与重复、根据上下文处理自我修正、补充标点与格式,并执行逆文本规范化。

两个例子最直观。

"我们周二开会——不,改成周三。" 模型理解后半句是对前面内容的修正,最终文本保留正确结果。"twenty six million dollars" 则被直接转换为 $26M——英文口述金额自动写成财务简写。

但"整理"也有代价。新闻采访、法律取证这类需要逐字核对的场景,自动删改可能改变说话人的原意。为此模型保留了 Verbatim 模式,可输出更接近逐字的记录。是否启用智能格式化,应当由场景决定——更整洁不等于更准确

03它到底能干什么? 三个典型场景

🎙️ 技术采访:专业名词不再"听岔" 自定义词表

  • 提前把 KubernetesBigQuery、产品名与人名加入词表,引导模型优先识别。
  • 词表上限 1000 个词,谷歌建议实际控制在 100 词以内效果更好。
  • 显著减少专业术语被识别成同音词的情况,比如把框架名听成常见英文单词。
适合场景:技术播客与开发者访谈的初稿生成,配合人工校对效率最高。

🌍 跨国会议:中英混说不用设置语言 85+ 语言

  • 自动判断当前语言,无需提前设置;一句话内或同一段对话中切换语言也能继续转录。
  • 针对嘈杂环境、不同口音做了专门优化,并增强对电话号码、邮编、订单号等字符混合信息的识别。
  • 说话人分离支持最多 8 人,不同语音片段自动分配标签。
诚实注脚:3 人以上说话人分离目前仍属实验性能力,误标可能需要人工修正。

🎬 音频后期:逐词时间戳 字幕友好

  • 输出每个词在录音中的起止时间,方便制作字幕、检索原话、定位采访片段。
  • 启用说话人分离或时间戳后,单次录音上限 30 分钟;普通转录支持最长 1 小时
  • 同一个 API 下,实时与非实时两个版本覆盖不同工作流。
限制提醒:1 小时上限意味着它更适合访谈片段,整场大会录音需要切分处理。

04争议:谷歌"看不清形势"? 来自用户的两记重锤

在行业狂卷多模态与 Coding Agent 的当下,单独发布一款语音转文本模型,表面看像"还在解决上一代问题"。X 上不乏直白的批评,最尖锐的一击来自一位 Gemini Ultra 付费用户。

🗣️ Gemini Ultra 用户

"我已经后悔升级。额外功能只有在模型能力和产品迭代真正跟上行业进度时才有意义。"他曾经相信 Demis Hassabis 领导下的 DeepMind 能帮谷歌赢下竞争,但随着 Demis 不再负责日常运营,他感觉"DeepMind 的灵魂已经离开了",谷歌面对的只剩一场赤裸的模型能力较量。

💬 X 网友

"你们看不清形势啊。"当同行都在强调更强的 Agent、端到端语音交互和复杂任务执行时,谷歌却把一款转录模型推到台前,付费用户会自然产生一种产品节奏与行业焦点错位的感觉。

需要把两件事分开看。

这些批评更多反映的是用户对谷歌整体 AI 进展与产品体验的不满,而不能单凭一款转录模型的发布,就判断其技术路线已经落后。节奏错位确实存在,但二者不能直接画等号。

05另一种读法:语音 Agent 的地基

把 Gemini 3.5 Transcribe 放进更长的时间线,结论会不一样。它的目标不是重新发明听写工具,而是补齐语音 Agent 进入生产环境前最基础、也最容易被忽视的一层:让机器先稳定听懂人类。

原始语音 结构化成稿 意图理解 Agent 执行

谷歌的野心不在最左一格。清理语气词、理解修正、输出格式化文本——本质是把语音从原始输入整理成适合模型继续处理的结构化上下文。

在客服、会议、采访、医疗记录这些场景里,背景噪声、多人同时说话、临时改口、中途切换语言,都会直接打断后续 Agent 的执行。自动删掉"嗯""啊"、理解自我修正,正是为了把这些变量在入口处消化掉。

谷歌已经开始集成:Android 版 Gboard 的 Rambler 功能把口述转为格式化文本;macOS 版 Gemini 应用能结合屏幕上下文,用语音指令调用其他模型完成总结、改写和图片生成

转录是入口,不是终点。

编辑核心判断

把一款转录模型放在聚光灯下,不代表谷歌站错了位置——语音 Agent 的地基,恰恰是稳定听懂人类。真正的风险是,转录若沦为孤立服务,价值便到此为止。语音交互的下半场,比的不是谁听得更清楚,而是谁听完之后能做成更多事。

现在就能用

开发者已可通过 Google AI Studio 中的 Gemini API 调用,提供 gemini-3.5-transcribe-livegemini-3.5-transcribe 两个版本;实时转录约 $0.009/分钟,非实时约 $0.005/分钟,附免费测试额度。

Google AI Studio → 创建 API Key 开始体验