Google DeepMind представляет модель SL2T для диктовки на американском жестовом языке на телефонах Pixel
Новая система перевода преобразует жестовый ввод в текст в Gboard и Live Transcribe, начиная с американского жестового языка на английский на Pixel 11.

Ключевые моменты
- Google DeepMind запустила SL2T — модель перевода жестового языка в текст, которая преобразует американский жестовый язык в письменный английский на телефоне.
- SL2T впервые появляется на Pixel 11 в составе Gboard, клавиатурного приложения Google, и Live Transcribe, инструмента субтитрирования.
- Модель была обучена на основе более чем 100 000 часов жестовой речи на более чем 50 жестовых языках, около четверти из которых — американский жестовый язык.
- На тесте FLEURS-ASL SL2T получила 70 баллов BLEURT без задачно-ориентированной доводки, что, по словам команды, значительно превышает любые ранее опубликованные результаты.
- Для защиты конфиденциальности телефон отправляет на сервер только координаты точек тела, а не видео с камеры, и удаляет исходное видео.
В течение десятилетий голосовое диктование позволяло слышащим людям общаться со своими телефонами вместо печати. Глухие пользователи в основном были лишены этого удобства.
Google DeepMind хочет это изменить. Лаборатория выпустила SL2T, что означает sign-language-to-text — модель, которая наблюдает за тем, как человек подает знаки, и создает письменный текст на другом языке. Теперь она встроена в два приложения на Pixel 11: Gboard, клавиатуру, и Live Transcribe, которое отображает произнесенные слова в виде субтитров.
Первая версия обрабатывает американский жестовый язык на английский. Обещаны дополнительные устройства и языки.
Что пользователь может с этим делать?
Подавать знаки в любом месте, где бы они обычно печатали. Именно в этом заключается предложение, и оно конкретное.
В Gboard глухой пользователь может подавать знаки для поиска в интернете, написания сообщения, составления документа или обращения к Gemini, чат-боту Google, для выполнения задачи. В Live Transcribe они могут подавать знаки в ответ во время личного разговора вместо того, чтобы печатать текст на телефоне. Тестировщики Google сказали, что подача знаков на американском жестовом языке казалась быстрее и естественнее, чем печать на английском.
Это важно, потому что жестовые языки — это не английский, переданный жестами. Это полнофункциональные языки со своей грамматикой, созданные из движений рук, рук, лица, головы и туловища, происходящих одновременно.
Как работает модель?
SL2T выполняет две сложные задачи одновременно: внимательно наблюдает за телом, а затем переводит между двумя разными языками.
Встроенный в устройство инструмент MediaPipe Holistic отслеживает точки подающего знаки, такие как суставы, локти и ориентиры лица. На серверы Google передаются только эти координаты. Видео с камеры остается на телефоне и удаляется. Этот выбор дизайна составляет историю конфиденциальности, и это значительный выбор.
Серверная модель затем переводит движущиеся точки прямо в английский текст. Более старые системы часто проходили через промежуточное письменное обозначение, называемое «глосс». SL2T пропускает этот шаг, что, по словам Google, избегает ограничения словаря и позволяет качеству улучшаться по мере поступления большего количества данных.
Обучение использовало более 100 000 часов жестовой речи на более чем 50 жестовых языках. Примерно четверть была американским жестовым языком. Обучение на многих языках одновременно, по словам команды, помогло модели изучить структуры, общие для них.
Насколько это хорошо на самом деле?
Хорошо, с честными ограничениями. На FLEURS-ASL, открытом наборе тестов для перевода американского жестового языка на английский, SL2T получила 70 баллов BLEURT без задачно-ориентированной доводки. BLEURT — это автоматизированная оценка качества переводов. Google называет эту цифру намного выше предыдущих результатов.
Эталоны — это не вся история. Команда перечисляет реальные режимы отказа: редкие знаки, быстрая дактилология (один пример превратил «prey» в «grey»), пассивные предложения и время когда контекст ограничен. Инженеры также работали над проблемами, которые тест не выявит, включая задержку потока, галлюцинаторный текст, когда никто не подает знаки, односторонняя подача знаков при удержании телефона и справедливую производительность примерно для 10% подающих знаки, которые являются левшами.
Кто его формировал?
Глухие сотрудники с самого начала. Проект был задуман Сэмом Сепа, глухим инженером в Google, и глухие партнеры участвовали в сборе данных, тестировании пользователями и проверке влияния.
Google также создала Консультативный комитет по жестовому языку AI с участием глухих организаций и экспертов и опубликовала совместный отчет об влиянии вместе с выпуском SL2T 1.0 в Gboard и Live Transcribe.
Что должны извлечь читатели из этого?
Если вы или кто-то из ваших знакомых использует американский жестовый язык и владеет Pixel 11, диктовка жестами теперь встроена в клавиатуру и Live Transcribe. Ожидайте шероховатостей на редких или быстрых знаках. Ожидайте расширения списка языков.
Для всех остальных это один из первых случаев, когда AI жестового языка вышел из исследовательской лаборатории и попал в готовый потребительский продукт.



