或
世界上有200多种手语,对大约7 000万聋人和听力困难的人来说,手语是主要的交流手段。 直到最近,人工智能才在日常产品中勉强被用来翻译这些语言. Google DeepMind决定解决这个问题:新的SL2T(符号语言对文本)模式将手语翻译为文本,并且已经被集成到熟悉的应用程序中.
用户可以使用手势"拼写",而不是在键盘上打字. 特效是推出 在Gboard和关于像素11智能手机的Live Translacy字幕应用中——第一个配对将是美国手语(ASL)和英语. 以后会承诺更多的语言和设备.
这在实践中意味着什么? 您可以用手势搜索网页, 撰写信件或文档, 甚至可以和 Gemini 助理人员。 在Live Translatis中,您可以在谈话中直接以手势回应,而不切换到文本聊天. 测试者认为,这种交流比英语打字更快,更自然. 对于聋人社区来说,这不仅仅是方便:手语是文化认同的基础,在数字世界中能够使用它意味着很多.
为什么这么难
手语不是"手语"——它们是独立的自然语言,有自己的语法和词汇. 因此,签名对文本翻译不能简化为将每个手势与一个字逐一匹配. 意义通过手,身体,头部运动和面部表情同时传递,模型必须实时高精度地跟踪这一切.
早期的尝试,如"签名语言手套",根本上是受到限制的,正是因为他们把标志当作普通词的代码. 真正的机器翻译需要理解语言的结构,包括空间构造和非手动标记. 现代模型从大型数据集学习:SL2T使用超过10万小时的视频,跨越超过50种手语,大约四分之一专门用于ASL. 不同语言和方言的联合培训有助于找到共同的模式,产生比每种语言的单独模式更好的结果。

翻译工作如何
该模型不处理视频流,而是使用紧凑的表示:它跟踪关键正体点的坐标,并将坐标的顺序转换成文字. 这同时解决了两个问题——减少计算负荷和保护隐私. 原视频立即被删除,只有几何坐标被发送到服务器进行翻译. 点追踪由内置的MediaPipe Hollistic模型处理.
翻译直接发生,没有中间注释(glosses). 这种方法可以传达非人工标记和空间构造等方面,避免人为的词汇限制. 具有数据量的质量尺度,作为基准确认:在FLEURS-ASL(sd-test)测试中,该模型实现了70BLEURT的零射分,远超以往所有系统.
实际改进也很重要。 开发者将流线延迟降到最低,教模型不要在非信号输入上产生幻觉,占了左手用户(约占10%)的比重,在对方手持智能手机时提高了单手签名的识别度.
隐私与未来
这是手语的AI第一次搬出 并进入大众消费品。 一些设备已经具备了SL2T技术,预计沿途会有更多的语言和平台. 对于聋人和听力困难的社区来说,这开启了完全数字包容的道路:现在你可以使用普通的智能手机用自己的母语自由交流.
这种系统的未来在于手语和口语之间更自然、更快的互动。 下一代的模型不仅能够翻译单个短语,而且能够保持完整的对话,保留情感和风格的细微差别. 这不仅会改变技术,而且会改变数百万人的日常生活。




