谷歌DeepMind发布SL2T模型并集成至Pixel 11

8月13日 10:22
该多语言手语转文本模型通过设备端实时解析美国手语动作生成英文,内置于Gboard与Live Transcribe应用,旨在为听障群体提供替代传统键盘输入的非语音交互方案。

谷歌旗下DeepMind实验室正式推出大规模多语言手语转文本(SL2T)翻译模型,并将该功能首次部署至消费级智能手机Pixel 11系列的Gboard键盘与Live Transcribe应用中。此次更新标志着手语人工智能技术从科研阶段走向大众产品,使全球约7000万听力障碍人士能够利用手语进行数字交互。初期功能仅支持将美国手语(ASL)转换为英文文本,计划后续扩展至更多语种及安卓设备。用户通过手机前置摄像头捕捉动作,即可在搜索、消息撰写或与Gemini对话等场景中实现无需打字的自然输入体验。测试表明,相较于传统英语打字,使用美国手语进行输入在速度与流畅度上更具优势。

SL2T模型基于超过50种手语、累计10万小时的数据集训练而成,其中约四分之一的数据来自美国手语语料。该模型摒弃了以往依赖中间注释的转换逻辑,直接解析人体动作生成的空间信息以理解手语语义,能够同步处理面部表情、肢体位置及唇部运动等多模态特征。在技术实现上,DeepMind强调手语作为独立自然语言的语法特性,要求系统具备真正的机器翻译能力而非简单的词汇映射。模型在FLEURS-ASL基准测试中取得70分BLEURT零样本得分,这一结果被官方确认为当前领域内的最优成绩。联合训练策略使模型在跨方言与不同熟练度用户场景下的表现优于单一语言版本。

在隐私保护机制方面,SL2T采用设备端处理架构。系统利用MediaPipe Holistic实时追踪手部、面部及躯干共130个关键点坐标,仅将脱敏后的姿态特征数据用于计算,原始视频流不会上传至服务器并在本地即时销毁。该功能的落地依托于DeepMind此前开源的SignGemma模型及其在WaveNet、Euphonia等无障碍技术领域的积累。随着谷歌、科大讯飞、华为及苹果等企业持续投入,AI辅助技术正加速从实验室验证转向实际消费产品应用,为听障群体构建更平等的数字接入环境。