От жеста к тексту: модель DeepMind учит смартфоны распознавать жестовые языки

20 августа 20262 просмотров

Разработка SL2T впервые даёт глухим и слабослышащим пользователям возможность общаться жестами прямо в приложениях: слова появляются на экране вместо ручного набора текста. Модель обучалась на данных более чем полусотни жестовых языков и уже работает на Pixel 11, при этом сохраняя приватность — на сервер уходят только координаты движений, а не видео.

От жеста к тексту: модель DeepMind учит смартфоны распознавать жестовые языки

Что нового

В мире существует более 200 жестовых языков, и для примерно 70 миллионов глухих и слабослышащих людей они служат основным средством общения. До последнего времени искусственный интеллект почти не использовался для перевода этих языков в повседневных продуктах. Google DeepMind решила исправить эту ситуацию: новая модель SL2T (sign-language-to-text) переводит жестовую речь в текст и уже встраивается в знакомые приложения.

Пользователи смогут «диктовать» жестами вместо набора на клавиатуре. Функция появляется в Gboard и приложении для субтитров Live Transcribe на смартфонах Pixel 11 — первой парой станет американский жестовый язык (ASL) и английский. Позже обещают расширить список языков и устройств.

Что это даёт на практике? Можно жестами искать информацию в интернете, составлять сообщения или документы и даже обращаться к ассистенту Gemini. В Live Transcribe появится возможность отвечать жестами прямо во время разговора, не переключаясь на переписку. По словам тестировщиков, такое общение получается быстрее и естественнее, чем набор текста на английском. Для сообщества глухих это не просто удобство: жестовый язык — основа культурной идентичности, и возможность использовать его в цифровой среде значит очень много.

Почему это сложно

Жестовые языки — не «английский на руках», а самостоятельные естественные языки с собственной грамматикой и лексикой. Поэтому перевод «жест-в-текст» нельзя свести к последовательному сопоставлению жеста со словом. Смысл передаётся одновременно движениями рук, корпуса, головы и мимикой, и модель должна отслеживать всё это с высокой точностью в реальном времени.

Ранние попытки вроде «перчаток для языка жестов» были принципиально ограничены именно потому, что рассматривали жесты как кодировку обычных слов. Настоящий машинный перевод требует понимания структуры языка, включая пространственные конструкции и немануальные маркеры. Современные модели учатся на больших массивах данных: SL2T использовала более 100 000 часов видео по более чем 50 жестовым языкам, причём примерно четверть приходится на ASL. Совместное обучение на разных языках и диалектах помогает находить общие закономерности и даёт лучший результат, чем раздельные модели для каждого языка.

Как устроен перевод

Вместо обработки видеопотока модель использует компактное представление: она отслеживает координаты ключевых точек тела и превращает последовательность этих координат в текст. Это решает сразу две задачи — снижает вычислительную нагрузку и защищает приватность. Исходное видео немедленно удаляется, а на сервер для перевода отправляются только геометрические координаты. За отслеживание точек отвечает встроенная модель MediaPipe Holistic.

Перевод происходит напрямую, без промежуточных аннотаций (глосс). Такой подход позволяет передать такие аспекты, как немануальные маркеры и пространственные конструкции, и избежать искусственных ограничений словаря. Качество масштабируется вместе с объёмом данных, что подтверждают бенчмарки: по тесту FLEURS-ASL (sd-test) модель показывает zero-shot результат 70 BLEURT, значительно опережая все предыдущие системы.

Практические улучшения тоже важны. Разработчики минимизировали задержку потокового вывода, научили модель не галлюцинировать на нежестовых входных данных, учли леворуких пользователей (их около 10%) и улучшили распознавание одноручного жестикулирования, когда вторая рука занята смартфоном.

Приватность и будущее

Это первый случай, когда ИИ для жестовых языков выходит из лаборатории в массовые потребительские продукты. Технология SL2T уже доступна в некоторых устройствах, и в дальнейшем стоит ожидать новые языки и платформы. Для сообщества глухих и слабослышащих открывается путь к полноценному цифровому включению: теперь можно свободно общаться на родном языке, используя обычный смартфон.

Будущее таких систем видится в более естественном и быстром взаимодействии между жестовыми и звуковыми языками. Следующие поколения моделей смогут не только переводить отдельные фразы, но и поддерживать полноценный диалог, сохраняя нюансы эмоций и стиля. И это изменит не только технологии, но и повседневную жизнь миллионов людей.

Часто задаваемые вопросы

Похожие материалы

Все материалы