New-ZZZ
RU / EN
Влияние на общество 12 августа 2026

Google представила ИИ для перевода жестового языка в текст пользователям Pixel

Р
Редакция New-ZZZ
DeepMind Blog · 3 дня назад

Google представила sign-language-to-text, или SL2T, — многоязычную модель ИИ, предназначенную для перевода жестовой речи в письменный язык. По словам компании, эта система выводит технологии ИИ для жестовых языков в потребительские продукты, не ограничивая их исследовательскими демонстрациями. Первоначально она поддерживает перевод с американского жестового языка на английский в Gboard и Live Transcribe на Pixel 11; в дальнейшем планируется поддержка большего числа устройств и жестовых языков. Более широкая цель — сделать языковые технологии доступными для части из примерно 70 миллионов глухих и слабослышащих людей, использующих более 200 жестовых языков по всему миру.

Интеграция с Gboard предоставляет глухим пользователям основанную на жестах альтернативу печатному вводу. Человек может общаться с телефоном на жестовом языке при поиске в интернете, написании сообщения или документа, а также при взаимодействии с Gemini, чтобы получить ответ на вопрос или выполнить задачу. В Live Transcribe пользователи могут передавать свою часть разговора жестами вместо того, чтобы каждый раз печатать ответы. Участники тестирования рассказали Google, что общение на ASL таким способом кажется более быстрым, естественным и приятным, чем выражение тех же мыслей на письменном английском. Главное изменение продукта заключается в том, что жестовая речь теперь может служить универсальным способом ввода везде, где пользователи обычно печатают.

Google подчёркивает, что жестовые языки — это самостоятельные естественные языки и важнейшая часть культуры глухих, а не визуальная форма записи окружающих их устных языков. Глухие и слабослышащие люди также по-разному владеют жестовой и устной речью, чтением и письмом, поэтому доступность требует поддержки нескольких способов общения. Обработка жестового языка может предоставить сообществам глухих удобства, сопоставимые с распознаванием речи и голосовым вводом, а также помочь преодолеть коммуникационный барьер между глухими и слышащими людьми.

Создать такую систему значительно сложнее, чем преобразовать речь в текст. При расшифровке речи последовательность звуков обычно сопоставляется со словами того же языка. Системы перевода жестов в текст должны выполнять полноценный перевод, поскольку такие языки, как ASL, имеют собственную лексику и грамматику. Нельзя надёжно перевести предложение, просто сопоставив каждому отдельному жесту английское слово. Именно поэтому более ранние концепции вроде оснащённых датчиками перчаток для жестового языка были изначально ограничены: они фокусировались главным образом на движениях рук, хотя жестовые языки — это не просто «английский на руках».

Вторая сложность — визуальное понимание. Значение может одновременно выражаться руками, предплечьями, туловищем, головой, мимикой и расположением движений в пространстве. Система ИИ должна с высокой частотой кадров отслеживать эти тонкие физические детали и интерпретировать, как они взаимодействуют друг с другом. Для этого необходимы как сложные технологии компьютерного зрения, так и языковая модель, способная переводить структуры, которые могут не соответствовать порядку слов или правилам письменного английского языка. SL2T призвана объединить визуальное восприятие всего тела с полноценным машинным переводом, а не рассматривать жестовую речь как последовательность изолированных жестов.

Google обучила модель более чем на 100 000 часов материалов, охватывающих свыше 50 жестовых языков, причём на ASL приходится около четверти обучающих данных. Набор данных учитывает различия в языках, диалектах и уровне владения жестовой речью у пользователей. Согласно экспериментам компании, совместное многоязычное обучение помогает модели выявлять общие для жестовых языков структуры и даёт лучшие результаты, чем обучение отдельных систем только для одного языка. Этот подход также лежит в основе заявления Google о том, что архитектура достаточно универсальна для расширения за пределы первоначальной версии с переводом с ASL на английский.

Система защиты конфиденциальности не предусматривает отправку необработанного видео с камеры на сервер перевода. MediaPipe Holistic — модель, работающая непосредственно на устройстве, — определяет ключевые точки позы, соответствующие точкам на теле человека, использующего жестовый язык. После этого исходное видео можно немедленно удалить, а для перевода передаётся только полученная последовательность геометрических координат. SL2T обрабатывает изменения этих координат и генерирует потоковый текстовый ответ. Это сокращает объём визуально идентифицируемой информации, обрабатываемой сервером, хотя сам перевод по-прежнему выполняется на стороне сервера.

SL2T также не использует промежуточное представление, называемое глоссами. Глоссы — это письменные обозначения, которые обычно применяются для аннотирования жестов в исследовательских наборах данных, однако Google утверждает, что они не способны полностью передать такие особенности, как мимические и другие немануальные сигналы или пространственные конструкции. Кроме того, фиксированный словарь глосс может ограничивать возможности обучения модели. Переводя ключевые точки позы непосредственно в текст, SL2T устраняет это искусственное ограничение словаря и позволяет повышать качество по мере появления более разнообразных обучающих данных.

Google называет SL2T своей самой совершенной на сегодняшний день моделью перевода жестового языка и ссылается на бенчмарк FLEURS-ASL sd-test, измеряющий качество перевода с ASL на английский. Компания сообщает о результате 70 BLEURT в режиме zero-shot, то есть модель оценивается на бенчмарке без специального обучения на его тестовых примерах. Значимость заключается не только в заявленных результатах бенчмарка, но и во внедрении лежащей в их основе модели в качестве повседневной функции доступности. Первоначальная версия пока ограничена переводом с ASL на английский и отдельными программными продуктами Pixel, поэтому её практическое влияние будет зависеть от надёжности в реальных условиях, расширения списка поддерживаемых устройств и того, насколько успешно Google добавит множество жестовых языков, используемых различными сообществами.

Почему это важно

  • Технология предоставляет глухим и слабослышащим пользователям естественный способ ввода на жестовом языке для выполнения повседневных задач на телефоне.
  • Обучение на данных более чем 50 жестовых языков может способствовать расширению поддержки за пределы ASL.
  • Архитектура на основе ключевых точек ограничивает доступ серверов к исходным видеозаписям с камеры, обеспечивая при этом практичный перевод.

Ключевые факты

  • SL2T запускается на Pixel 11 с функцией диктовки с ASL на английский язык в Gboard и Live Transcribe.
  • Модель обучили на более чем 100 000 часов данных, охватывающих свыше 50 жестовых языков.
  • MediaPipe Holistic преобразует видео в ключевые точки позы непосредственно на устройстве, после чего их координаты отправляются для перевода.
  • SL2T переводит ключевые точки непосредственно в текст без использования промежуточных глоссовых аннотаций.
  • Google сообщает, что в режиме zero-shot модель набрала 70 баллов BLEURT в тесте sd-test бенчмарка FLEURS-ASL.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.