Google DeepMind8月12日 发布了 SL2T——一款已走出实验室、被装进手机的手语翻译模型。它运行在 Pixel 11 的 GboardLive Transcribe 中,让聋人用户可以对着摄像头打手语,而不是打字。

训练数据难题

手语 AI 过去一直受限于语料规模。SL2T 使用了超过 10万小时 的手语视频训练,涵盖 50 多种手语,其中约 25% 为美国手语。DeepMind 报告称,它在 FLEURS-ASL 上取得了 70 BLEURT 的零样本得分,并表示这一结果显著高于此前已发表的任何结果。

隐私设计如何运作

姿态提取在设备端完成,使用的是 MediaPipe Holistic。原始视频会被丢弃;只有几何关键点——关节位置、手型、面部点位——会被继续处理。对于一个对准家庭中摄像头的系统来说,这种架构选择比任何相关政策表述都更重要。

真正上线了什么

此次发布的功能是 Pixel 11 上的 ASL 到英语。更多设备和语言对被描述为将陆续推出,但未给出时间。手语并不是口语的方言——它们有自己的语法,而 ASL 与英国手语也并不互通——因此每一种语言对都更接近一个独立问题,而不是一个翻译设置。

基准测试的边界

70 BLEURT 这一数据由公司自行报告,未经过独立评估。与真实手语使用场景相比,FLEURS-ASL 的范围也相当有限;真实场景包含地区差异以及非手动标记——即通过眉毛、嘴部和头部位置传达的语法信息,而关键点流水线可能无法均匀捕捉这些信息。

这项发布为何重要

无障碍 AI 已经带来过一长串令人印象深刻、却从未真正落地的演示。把模型放进零售手机的默认键盘里,才是更难迈出的一步;这也把问题从“研究是否有效”转向“聋人用户是否会发现它足够实用,能跟上日常对话的速度”。