Google DeepMind发布大规模多语言手语转文本模型SL2T,已率先集成至Pixel 11的Gboard键盘和Live Transcribe应用,首批支持美国手语转英文。模型使用超10万小时数据训练、覆盖50多种手语,在FLEURS-ASL基准上取得70 BLEURT零样本分数。隐私设计上,端侧仅追踪约130处关键点坐标,原始视频即时删除、不上传云端。全球约7000万听障人士使用200多种手语,谷歌计划后续扩展更多手语种类。

Google DeepMind发布大规模多语言手语转文本模型SL2T,已率先集成至Pixel 11的Gboard键盘和Live Transcribe应用,首批支持美国手语转英文。模型使用超10万小时数据训练、覆盖50多种手语,在FLEURS-ASL基准上取得70 BLEURT零样本分数。隐私设计上,端侧仅追踪约130处关键点坐标,原始视频即时删除、不上传云端。全球约7000万听障人士使用200多种手语,谷歌计划后续扩展更多手语种类。
