手语翻译模型 SL2T 商用落地:BLEURT 达 70,覆盖 50+ 手语,已接入手机输入法
谷歌 DeepMind 正式推出大规模多语言手语转文本模型 SL2T,首批搭载于 Pixel 11 的 Gboard 与 Live Transcribe,支持美国手语→英文实时翻译。用户可直接对手机打手语,用于搜索、写消息、向 Gemini 提问。
谷歌 DeepMind 正式推出大规模多语言手语转文本模型 SL2T,首批搭载于 Pixel 11 的 Gboard 与 Live Transcribe,支持美国手语→英文实时翻译。用户可直接对手机打手语,用于搜索、写消息、向 Gemini 提问。
SL2T 并非又一个学术基准模型。它直接嵌入 Pixel 11 的 Gboard 输入法和 Live Transcribe 实时转写应用,让手语翻译第一次以系统级功能的形式出现在消费产品中。
与去年同类的实验室模型相比,SL2T 在 FLEURS-ASL 测试中零样本 BLEURT 得分达到 70,明显高于此前所有公开结果。BLEURT 是衡量翻译流畅度与语义保真度的综合指标,70 分意味着模型在未见过的数据上仍能保持较高的翻译质量。
依赖手语手套或固定词库映射,无法处理全身动作与独立语法,本质是"手势→单词"的简单对应。
通过身体关键点坐标序列直接生成文字,不经过中间标注,完整保留面部表情、空间结构等语言信息。
注:BLEURT 得分来自 FLEURS-ASL 测试集的零样本评估,70 分为目前公开最高。柱形图与数字格中的数据均基于谷歌 DeepMind 官方发布。
语音转写是"同语言的声音→文字",手语翻译是跨语言的视觉→语言——这是两个完全不同的难度等级。
手语拥有独立的语法、词法和空间结构,与英语完全不同。将手语"逐词映射"为英文,就像用词典逐词翻译日语——注定失败。SL2T 需要真正的机器翻译,而不是手势到单词的查表。
手语通过手、手臂、躯干、头部和面部同时发生的动作传递含义。在高帧率下准确追踪这些动作,是计算量极高的计算机视觉任务。SL2T 借助 MediaPipe Holistic 在手机端完成关键点提取,仅将几何坐标发送至服务器。
手语翻译必须实时完成,且不能上传原始视频。SL2T 在手机端丢弃原始画面,仅发送坐标序列,在保护隐私的同时实现流畅翻译。这对端侧模型和网络延迟都提出了极高要求。
注:上述三大挑战是手语翻译领域公认的核心瓶颈,SL2T 在每一项上都做出了工程取舍与创新。
SL2T 让手语像语音输入一样自然。以下是首批落地的典型用例。
一个诚实的注脚:手语翻译天然涉及摄像头权限,隐私保护不是可选项,而是及格线。
SL2T 的架构设计围绕隐私展开。手机端的 MediaPipe Holistic 模型在本地实时追踪用户身体上的 543 个关键点,仅将几何坐标发送至服务器进行翻译。原始摄像头画面在完成关键点提取后立即丢弃,不留存、不传输。
翻译阶段,SL2T 将坐标序列直接映射为文字,绕过了传统手语翻译研究中常用的中间标注环节。谷歌认为,直接翻译不仅能更好地保留面部表情和空间结构等信息,也摆脱了人工标注的词汇范围限制——模型可以学习到超越预设词表的表达。
手机端完成关键点提取后,原始画面立即删除,不上传服务器。
覆盖手、手臂、躯干、头部、面部,完整捕捉全身动作。
坐标序列→文字,避免传统标注的信息损失与词汇限制。
50+ 手语一起训练,共享底层结构,效果优于单语模型。
注:关键点数量与处理流程基于谷歌 DeepMind 官方技术说明。多语言联合训练的实验结论来自内部对比测试。
手语翻译的技术探索已经持续了二十年。从数据手套到视觉识别,从固定词库到端到端模型,每一代技术都在解决一个核心矛盾:手语是全身的、立体的、即时的语言,而传统技术只能捕捉局部的、线性的、延迟的信号。
SL2T 的突破不在于某一个单项指标,而在于它同时满足了翻译质量、实时性、隐私保护、产品集成四个维度的要求,并且真正进入了消费产品。从实验室到手机输入法,这一步比任何基准分数的提升都更难。
但话说回来:首批仅支持美国手语到英文,覆盖面有限;在罕见手势、快速手指拼写、被动语态、空间描述和时态判断上,模型仍会出错。手语翻译的全面商用,还有很长的路要走。
SL2T 最值得关注的不是 BLEURT 70 分,而是它让手语翻译跨越了"技术可行"到"产品可用"的鸿沟。但首批仅覆盖一种手语方向,且在手势识别与语法理解上仍有明显短板——AI 包容性的真正兑现,需要从"能用"走向"好用"。
SL2T 已搭载于 Pixel 11 的 Gboard 输入法与 Live Transcribe 应用,登录后即可体验手语搜索、消息撰写与 Gemini 交互。
deepmind.google → 了解详情