Google представила SL2T — многоязычную модель-переводчик, которая распознаёт язык жестов и сразу преобразует его в текст. Новинка дебютирует на смартфонах Pixel 11 и уже интегрирована в приложения Gboard и Live Transcribe.
На старте технология поддерживает только американский язык жестов с переводом на английский. При этом модель обучалась на более чем 100 тысячах часов данных, охватывающих 50 разных жестовых языков — это позволило системе выявить общие закономерности между ними.
За распознавание отвечает встроенная модель компьютерного зрения MediaPipe Holistic. Она отслеживает положение лица, рук, туловища и тела человека, но на сервер для обработки отправляются только координаты движений, а не видеозапись — это решает вопросы приватности пользователей.
SL2T преобразует жесты напрямую в текст, минуя промежуточные аннотации. Такой подход позволяет точнее интерпретировать невербальные выражения и пространственную грамматику, свойственную языку жестов.
Разработчики предусмотрели поддержку левшей и правшей, а также людей, использующих для общения только одну руку — вторая при этом может держать телефон. Инженеры также поработали над снижением задержки и минимизацией ошибок распознавания.
Важное отличие новой модели — она анализирует не только движения рук, но и мимику, положение головы и туловища, которые часто несут дополнительный смысл в жестовой речи.
Благодаря SL2T пользователи смогут отправлять поисковые запросы, писать письма и сообщения, редактировать документы и даже давать команды ИИ-ассистенту Gemini, используя привычный язык жестов вместо ручного ввода текста.
Модель также работает в Live Transcribe, что позволяет переводить жестовую речь в реальном времени во время видеозвонков. В Google DeepMind заявили, что технология призвана сделать возможности искусственного интеллекта доступными для 70 миллионов человек по всему миру, общающихся на языках жестов.
В дальнейшем компания планирует расширить поддержку на другие жестовые языки, а также разработать модели, способные генерировать жестовую речь напрямую.
