🎤 模型 · 技术发布

Gemini 3.5 Live Translate 发布,语音翻译进入"流式对话"时代——70+语言实时互译,延迟仅数秒

6 月 9 日,谷歌发布 Gemini 3.5 Live Translate,一款面向实时语音到语音翻译的音频模型。它支持 70+ 种语言的自动检测与互译,生成自然流畅的翻译语音,同时保留说话人的语调、节奏与音高,延迟仅数秒。

综合公开信息整理 2026-06-09 全文约 3 分钟读完
#Gemini 3.5 #Live Translate #语音翻译 #流式对话 #Google AI
70+ 支持语言,自动检测无需手动切换
数秒 延迟,持续跟随说话人节奏
连续 生成,非逐轮等待,流式输出

⚡ 30 秒速览

  • 核心突破:从"逐轮翻译"升级为"流式连续生成"——不等待说话人说完,实时输出翻译语音,延迟仅数秒。
  • 语言覆盖:自动检测 70+ 语言,支持 2000+ 语种组合,不再局限于仅与英语互译。
  • 保留原声特质:翻译语音保留说话人的语调、节奏和音高,听感更自然,接近真人同传。
  • 三端同步落地:面向开发者通过 Gemini Live API 开放;企业用户在 Google Meet 中可用;个人用户通过 Google Translate App(Android/iOS)体验。
  • 安全水印:所有生成音频均嵌入 SynthID 水印,确保可追溯,防止滥用。

01语音翻译的"流式时刻"从逐轮到连续

过去二十年,谷歌翻译从文本翻译起步,逐步走向语音。但一个核心痛点始终未解决:传统语音翻译是"逐轮"的——机器必须等用户说完一整句,才开始翻译。对话中的停顿、等待、节奏断裂,让跨语言交流始终隔着一层"玻璃"。

Gemini 3.5 Live Translate 改变了这个逻辑。它采用流式生成架构,在说话人讲话的同时就开始翻译,输出语音仅落后原声数秒。模型在"等待更多上下文以提升质量"和"立即翻译以保持同步"之间动态平衡,结果是一种接近真人同传的流畅体验。

一个关键细节:翻译语音会保留原声的语调、节奏和音高——这意味着你不仅能听懂内容,还能感知到说话人的情绪与强调。

注:流式翻译并非简单地将语音识别+翻译+合成三个步骤流水线化,而是端到端音频模型直接输出翻译语音,中间环节的延迟累计被压缩到最低。

02为什么可信?二十年的积累 + 真实场景验证

谷歌翻译每月处理超过 一万亿 个词,服务全球数十亿用户。但数据量只是基础——真正的验证来自复杂场景中的实际表现。

🚕 Grab:每月 1000 万次语音通话的翻译需求真实场景验证

  • 东南亚出行平台 Grab 的司机与乘客之间,每月产生超过 1000 万次 语音通话,涉及多种语言混用。
  • Gemini 3.5 Live Translate 被用于实时翻译司机与乘客的对话,覆盖接驾沟通、路线确认、费用说明等场景。
  • 测试反馈显示:模型在噪声环境(路边、车内、人群)中仍能保持稳定的翻译质量,且延迟在可接受范围内。
合作伙伴评价:翻译质量、准确率和低延迟均获得积极反馈,被评价为"可投入实际业务的水平"。

除了 Grab,CJ ENM、LiveKit 等企业也在早期测试中给出了类似评价——翻译质量、准确率与低延迟是三个被反复提及的关键词。

注:合作伙伴测试覆盖了出行、娱乐、会议等多个垂直领域,非单一场景验证。

03它能做什么?三个典型场景

语音翻译的价值不在技术指标,而在具体场景中能否真正消除语言障碍。以下三个场景,代表了三种不同的"语言距离"。

🌍

跨国会议:2000+ 语种组合同场对话

"一个会议室里,有人说日语、有人说法语、有人说葡萄牙语——不再需要统一中转英语。" Google Meet 中的翻译能力从仅支持 5 种语言跃升至 70+ 种,组合超过 2000 种,且界面优化为即时切换。

🎧

个人旅行:戴上耳机,听懂全世界

"在巴塞罗那的市场里,摊主用西班牙语介绍商品,你从耳机里听到流利的英语翻译。" Google Translate App 的 Live 翻译功能现已支持 70+ 语言,连接耳机即可体验,且保留原声语调。

📱

私密聆听:手机贴耳,翻译不打扰他人

"在博物馆听西班牙语讲解,把手机贴到耳边,就像接电话一样听到英语翻译。" Android 端新增"聆听模式",无需耳机即可通过听筒获取翻译,适合快速、私密的场景。

注:以上场景均基于已发布功能,非概念演示。噪声鲁棒性确保在嘈杂环境中仍可正常使用。

04为什么能做到?技术架构的三层跃迁

Gemini 3.5 Live Translate 不是简单的"语音识别 + 机器翻译 + 语音合成"三者串联。它在架构层面做了三个关键改变:

传统方案(流水线式)

ASR 识别 → 文本翻译 → TTS 合成。每步独立优化,但延迟累积,且丢失语调、节奏等副语言信息。

Gemini 3.5 流式方案

端到端音频模型,直接输出翻译语音。保留原声的语调、节奏和音高,延迟压缩至数秒,且支持动态平衡上下文质量与实时性。

具体来说,技术链路可以概括为:

流式音频输入语言自动检测端到端翻译生成保留语调输出SynthID 水印嵌入

其中两个能力值得单独强调:

噪声鲁棒性——模型在嘈杂、不可预测的环境中仍能保持翻译质量,这对出行、户外等场景至关重要。

多语言自动检测——无需手动设置源语言和目标语言,模型自动识别并处理,降低了使用门槛。

注:端到端架构意味着模型直接学习"音频→音频"的映射,而非经过中间文本表示,这是保留语调的关键。

编辑核心判断

语音翻译正在从"工具"进化为"对话基础设施"。Gemini 3.5 Live Translate 证明了延迟、语调保留和语言覆盖这三个核心指标可以同时突破。但一个诚实的注脚是:70+ 语言中,不同语种对的翻译质量仍存在差异,低资源语言的流式表现还有提升空间——真正的"语言巴别塔"尚未完全打通,但方向已经清晰。

现在就能用

开发者可通过 Gemini Live API 与 Google AI Studio 接入;企业用户可在 Google Meet 中体验;个人用户更新 Google Translate App(Android / iOS)即可使用 Live 翻译功能。

Google Translate → 体验 Live 翻译