🤖 模型 · 技术落地

手语翻译模型 SL2T 商用落地:BLEURT 达 70,覆盖 50+ 手语,已接入手机输入法

谷歌 DeepMind 正式推出大规模多语言手语转文本模型 SL2T,首批搭载于 Pixel 11 的 Gboard 与 Live Transcribe,支持美国手语→英文实时翻译。用户可直接对手机打手语,用于搜索、写消息、向 Gemini 提问。

综合公开信息整理 2026-08-13 全文约 4 分钟读完
#谷歌DeepMind #手语翻译 #SL2T #AI for Good #实时转写
🥇 BLEURT 70 零样本美国手语→英文翻译 · 目前最强
10万+ 小时训练数据,多语言覆盖
50+ 种手语纳入训练,含约 1/4 美国手语

⚡ 30 秒速览

  • 核心突破:SL2T 是首个以消费产品形态落地的手语翻译模型,BLEURT 零样本得分 70,是目前最强的美国手语→英文翻译系统。
  • 技术路径:手机端先提取身体关键点坐标,仅发送几何数据到服务器,原始视频实时丢弃,隐私优先。
  • 可用场景:搜索网页、撰写消息/文档、向 Gemini 提问、Live Transcribe 实时回复——手语像语音一样成为输入方式。
  • 坦诚局限:首批仅支持美国手语→英文;罕见手势、快速手指拼写、被动语态、空间描述、时态判断仍有明显错误。
  • 社区参与:聋人社区从构想、数据收集到用户测试全程参与,谷歌成立 AI 手语顾问委员会(AISLAC)。

01技术突破:从实验室到手机输入法

SL2T 并非又一个学术基准模型。它直接嵌入 Pixel 11 的 Gboard 输入法和 Live Transcribe 实时转写应用,让手语翻译第一次以系统级功能的形式出现在消费产品中。

与去年同类的实验室模型相比,SL2T 在 FLEURS-ASL 测试中零样本 BLEURT 得分达到 70,明显高于此前所有公开结果。BLEURT 是衡量翻译流畅度与语义保真度的综合指标,70 分意味着模型在未见过的数据上仍能保持较高的翻译质量。

传统手语翻译方案

依赖手语手套或固定词库映射,无法处理全身动作与独立语法,本质是"手势→单词"的简单对应。

SL2T 直接翻译范式

通过身体关键点坐标序列直接生成文字,不经过中间标注,完整保留面部表情、空间结构等语言信息。

70BLEURT 得分
10万+小时训练数据
50+手语种类
1/4为美国手语数据

注:BLEURT 得分来自 FLEURS-ASL 测试集的零样本评估,70 分为目前公开最高。柱形图与数字格中的数据均基于谷歌 DeepMind 官方发布。

02手语翻译,为什么这么难?

语音转写是"同语言的声音→文字",手语翻译是跨语言的视觉→语言——这是两个完全不同的难度等级。

1

手语是独立语言,不是手势编码

手语拥有独立的语法、词法和空间结构,与英语完全不同。将手语"逐词映射"为英文,就像用词典逐词翻译日语——注定失败。SL2T 需要真正的机器翻译,而不是手势到单词的查表。

2

模型必须学会"看见"全身动作

手语通过手、手臂、躯干、头部和面部同时发生的动作传递含义。在高帧率下准确追踪这些动作,是计算量极高的计算机视觉任务。SL2T 借助 MediaPipe Holistic 在手机端完成关键点提取,仅将几何坐标发送至服务器。

3

隐私与实时性的双重约束

手语翻译必须实时完成,且不能上传原始视频。SL2T 在手机端丢弃原始画面,仅发送坐标序列,在保护隐私的同时实现流畅翻译。这对端侧模型和网络延迟都提出了极高要求。

注:上述三大挑战是手语翻译领域公认的核心瓶颈,SL2T 在每一项上都做出了工程取舍与创新。

03它到底能做什么?四个真实场景

SL2T 让手语像语音输入一样自然。以下是首批落地的典型用例。

🔍 网页搜索:用手语直接搜 实时转写

  • 用户对手机打手语,SL2T 实时转写为英文查询文本,直接调用搜索引擎。
  • 无需手动打字,搜索结果以文字形式呈现,完整闭环。
  • 测试用户反馈:使用美国手语输入比输入英文更快、更自然
场景价值:将手语从"被辅助的输入方式"提升为"第一语言的输入方式"。

✍️ 消息撰写:手语输入,文字输出 多平台支持

  • 在 Gboard 中直接用手语撰写消息、邮件或文档,SL2T 将手语序列翻译为英文文本。
  • 支持连续输入,系统能够处理手语中的空间结构和同时发生的动作。
  • 适用于即时通讯、笔记记录、文档起草等日常写作场景。
用户评价:"比打字快得多,而且不用看键盘。"——早期测试者反馈。

🤖 Gemini 交互:向 AI 助手打手语 多模态

  • 用户直接用手语向 Gemini 提问或交代任务,SL2T 实时翻译,Gemini 理解并执行。
  • 可用于查询信息、安排日程、设置提醒等复杂交互。
  • 手语成为与 AI 助手交互的自然语言通道,不再依赖文字输入。
意义:手语用户第一次能够以自己最习惯的语言与 AI 助手完整对话。

💬 Live Transcribe 实时回复:对话不掉线 双向沟通

  • 在 Live Transcribe 中,用户用手语回复对话,SL2T 实时翻译为英文显示给对方。
  • 对方说话内容实时转写为文字,手语用户无需反复打字即可参与对话。
  • 实现听人→手语用户之间的双向自然交流,打破沟通壁垒。
社会价值:让约 7000 万聋人及听障人士在日常生活场景中更平等地参与沟通。

04隐私优先的设计:坐标而非视频

一个诚实的注脚:手语翻译天然涉及摄像头权限,隐私保护不是可选项,而是及格线

SL2T 的架构设计围绕隐私展开。手机端的 MediaPipe Holistic 模型在本地实时追踪用户身体上的 543 个关键点,仅将几何坐标发送至服务器进行翻译。原始摄像头画面在完成关键点提取后立即丢弃,不留存、不传输。

翻译阶段,SL2T 将坐标序列直接映射为文字,绕过了传统手语翻译研究中常用的中间标注环节。谷歌认为,直接翻译不仅能更好地保留面部表情和空间结构等信息,也摆脱了人工标注的词汇范围限制——模型可以学习到超越预设词表的表达。

🛡️

原始视频本地丢弃

手机端完成关键点提取后,原始画面立即删除,不上传服务器。

📐

543 个关键点追踪

覆盖手、手臂、躯干、头部、面部,完整捕捉全身动作。

🧠

直接翻译,无中间标注

坐标序列→文字,避免传统标注的信息损失与词汇限制。

🌐

多语言联合训练

50+ 手语一起训练,共享底层结构,效果优于单语模型。

注:关键点数量与处理流程基于谷歌 DeepMind 官方技术说明。多语言联合训练的实验结论来自内部对比测试。

05为什么是现在?

手语翻译的技术探索已经持续了二十年。从数据手套到视觉识别,从固定词库到端到端模型,每一代技术都在解决一个核心矛盾:手语是全身的、立体的、即时的语言,而传统技术只能捕捉局部的、线性的、延迟的信号

SL2T 的突破不在于某一个单项指标,而在于它同时满足了翻译质量、实时性、隐私保护、产品集成四个维度的要求,并且真正进入了消费产品。从实验室到手机输入法,这一步比任何基准分数的提升都更难。

但话说回来:首批仅支持美国手语到英文,覆盖面有限;在罕见手势、快速手指拼写、被动语态、空间描述和时态判断上,模型仍会出错。手语翻译的全面商用,还有很长的路要走。

编辑核心判断

SL2T 最值得关注的不是 BLEURT 70 分,而是它让手语翻译跨越了"技术可行"到"产品可用"的鸿沟。但首批仅覆盖一种手语方向,且在手势识别与语法理解上仍有明显短板——AI 包容性的真正兑现,需要从"能用"走向"好用"。

现在就能用

SL2T 已搭载于 Pixel 11 的 Gboard 输入法与 Live Transcribe 应用,登录后即可体验手语搜索、消息撰写与 Gemini 交互。

deepmind.google → 了解详情