Gemini 3.5 Live Translate 发布,语音翻译进入"流式对话"时代——70+语言实时互译,延迟仅数秒
6 月 9 日,谷歌发布 Gemini 3.5 Live Translate,一款面向实时语音到语音翻译的音频模型。它支持 70+ 种语言的自动检测与互译,生成自然流畅的翻译语音,同时保留说话人的语调、节奏与音高,延迟仅数秒。
6 月 9 日,谷歌发布 Gemini 3.5 Live Translate,一款面向实时语音到语音翻译的音频模型。它支持 70+ 种语言的自动检测与互译,生成自然流畅的翻译语音,同时保留说话人的语调、节奏与音高,延迟仅数秒。
过去二十年,谷歌翻译从文本翻译起步,逐步走向语音。但一个核心痛点始终未解决:传统语音翻译是"逐轮"的——机器必须等用户说完一整句,才开始翻译。对话中的停顿、等待、节奏断裂,让跨语言交流始终隔着一层"玻璃"。
Gemini 3.5 Live Translate 改变了这个逻辑。它采用流式生成架构,在说话人讲话的同时就开始翻译,输出语音仅落后原声数秒。模型在"等待更多上下文以提升质量"和"立即翻译以保持同步"之间动态平衡,结果是一种接近真人同传的流畅体验。
一个关键细节:翻译语音会保留原声的语调、节奏和音高——这意味着你不仅能听懂内容,还能感知到说话人的情绪与强调。
注:流式翻译并非简单地将语音识别+翻译+合成三个步骤流水线化,而是端到端音频模型直接输出翻译语音,中间环节的延迟累计被压缩到最低。
谷歌翻译每月处理超过 一万亿 个词,服务全球数十亿用户。但数据量只是基础——真正的验证来自复杂场景中的实际表现。
除了 Grab,CJ ENM、LiveKit 等企业也在早期测试中给出了类似评价——翻译质量、准确率与低延迟是三个被反复提及的关键词。
注:合作伙伴测试覆盖了出行、娱乐、会议等多个垂直领域,非单一场景验证。
语音翻译的价值不在技术指标,而在具体场景中能否真正消除语言障碍。以下三个场景,代表了三种不同的"语言距离"。
"一个会议室里,有人说日语、有人说法语、有人说葡萄牙语——不再需要统一中转英语。" Google Meet 中的翻译能力从仅支持 5 种语言跃升至 70+ 种,组合超过 2000 种,且界面优化为即时切换。
"在巴塞罗那的市场里,摊主用西班牙语介绍商品,你从耳机里听到流利的英语翻译。" Google Translate App 的 Live 翻译功能现已支持 70+ 语言,连接耳机即可体验,且保留原声语调。
"在博物馆听西班牙语讲解,把手机贴到耳边,就像接电话一样听到英语翻译。" Android 端新增"聆听模式",无需耳机即可通过听筒获取翻译,适合快速、私密的场景。
注:以上场景均基于已发布功能,非概念演示。噪声鲁棒性确保在嘈杂环境中仍可正常使用。
Gemini 3.5 Live Translate 不是简单的"语音识别 + 机器翻译 + 语音合成"三者串联。它在架构层面做了三个关键改变:
ASR 识别 → 文本翻译 → TTS 合成。每步独立优化,但延迟累积,且丢失语调、节奏等副语言信息。
端到端音频模型,直接输出翻译语音。保留原声的语调、节奏和音高,延迟压缩至数秒,且支持动态平衡上下文质量与实时性。
具体来说,技术链路可以概括为:
其中两个能力值得单独强调:
噪声鲁棒性——模型在嘈杂、不可预测的环境中仍能保持翻译质量,这对出行、户外等场景至关重要。
多语言自动检测——无需手动设置源语言和目标语言,模型自动识别并处理,降低了使用门槛。
注:端到端架构意味着模型直接学习"音频→音频"的映射,而非经过中间文本表示,这是保留语调的关键。
语音翻译正在从"工具"进化为"对话基础设施"。Gemini 3.5 Live Translate 证明了延迟、语调保留和语言覆盖这三个核心指标可以同时突破。但一个诚实的注脚是:70+ 语言中,不同语种对的翻译质量仍存在差异,低资源语言的流式表现还有提升空间——真正的"语言巴别塔"尚未完全打通,但方向已经清晰。
开发者可通过 Gemini Live API 与 Google AI Studio 接入;企业用户可在 Google Meet 中体验;个人用户更新 Google Translate App(Android / iOS)即可使用 Live 翻译功能。
Google Translate → 体验 Live 翻译