从手势到文字:DeepMind模型教智能手机识别手语

20 八月 202617 视图

SL2T开发首次让聋人和听力困难的用户能够在应用程序中直接用手势进行交流:单词出现在屏幕上而不是手动文字输入. 该模型接受了来自50多种手语的数据培训,并且已经在像素11上工作,同时维护隐私——只有运动坐标被发送到服务器,而不是视频.

从手势到文字:DeepMind模型教智能手机识别手语

或

世界上有200多种手语,对大约7 000万聋人和听力困难的人来说,手语是主要的交流手段。 直到最近,人工智能才在日常产品中勉强被用来翻译这些语言. Google DeepMind决定解决这个问题:新的SL2T(符号语言对文本)模式将手语翻译为文本,并且已经被集成到熟悉的应用程序中.

用户可以使用手势"拼写",而不是在键盘上打字. 特效是推出 在Gboard和关于像素11智能手机的Live Translacy字幕应用中——第一个配对将是美国手语(ASL)和英语. 以后会承诺更多的语言和设备.

这在实践中意味着什么? 您可以用手势搜索网页, 撰写信件或文档, 甚至可以和 Gemini 助理人员。 在Live Translatis中,您可以在谈话中直接以手势回应,而不切换到文本聊天. 测试者认为,这种交流比英语打字更快,更自然. 对于聋人社区来说,这不仅仅是方便:手语是文化认同的基础,在数字世界中能够使用它意味着很多.

为什么这么难

手语不是"手语"——它们是独立的自然语言,有自己的语法和词汇. 因此,签名对文本翻译不能简化为将每个手势与一个字逐一匹配. 意义通过手,身体,头部运动和面部表情同时传递,模型必须实时高精度地跟踪这一切.

早期的尝试,如"签名语言手套",根本上是受到限制的,正是因为他们把标志当作普通词的代码. 真正的机器翻译需要理解语言的结构,包括空间构造和非手动标记. 现代模型从大型数据集学习:SL2T使用超过10万小时的视频,跨越超过50种手语,大约四分之一专门用于ASL. 不同语言和方言的联合培训有助于找到共同的模式,产生比每种语言的单独模式更好的结果。

翻译工作如何

该模型不处理视频流,而是使用紧凑的表示:它跟踪关键正体点的坐标,并将坐标的顺序转换成文字. 这同时解决了两个问题——减少计算负荷和保护隐私. 原视频立即被删除,只有几何坐标被发送到服务器进行翻译. 点追踪由内置的MediaPipe Hollistic模型处理.

翻译直接发生,没有中间注释(glosses). 这种方法可以传达非人工标记和空间构造等方面,避免人为的词汇限制. 具有数据量的质量尺度,作为基准确认:在FLEURS-ASL(sd-test)测试中,该模型实现了70BLEURT的零射分,远超以往所有系统.

实际改进也很重要。 开发者将流线延迟降到最低,教模型不要在非信号输入上产生幻觉,占了左手用户(约占10%)的比重,在对方手持智能手机时提高了单手签名的识别度.

隐私与未来

这是手语的AI第一次搬出 并进入大众消费品。 一些设备已经具备了SL2T技术,预计沿途会有更多的语言和平台. 对于聋人和听力困难的社区来说,这开启了完全数字包容的道路:现在你可以使用普通的智能手机用自己的母语自由交流.

这种系统的未来在于手语和口语之间更自然、更快的互动。 下一代的模型不仅能够翻译单个短语,而且能够保持完整的对话,保留情感和风格的细微差别. 这不仅会改变技术,而且会改变数百万人的日常生活。

常问问题

SL2T 来自 DeepMind – 将手语翻译为文本