Google представил модель для перевода жестового языка в текст в реальном времени
...
Искусственный интеллект
Чтение занимает время?
Вы можете слушать статьиНовый этап в понимании жестового языка
Команда DeepMind от Google представила SL2T — модель, которая переводит жестовый язык в текст в реальном времени. Технология уже работает на смартфонах Pixel 11 и интегрирована в приложения Gboard и Live Transcribe, делая жестовый язык более доступным.
Как работает SL2T?
Модель не переводит видео напрямую. Специальное приложение на устройстве преобразует видеозапись в координаты, которые отправляются на серверы Google. Такой подход сохраняет конфиденциальность пользователей. SL2T переводит эти координаты сразу в текст, а не в glosses — упрощённые обозначения жестов, которые не отражают всю сложность и нелинейность жестового языка.
Обучение и разнообразие данных
DeepMind обучала SL2T на базе более 100000 часов данных жестового языка. Около четверти из них — американский жестовый язык (ASL). В настоящее время модель переводит только с ASL на английский, но она обучалась и на других жестовых языках, что позволит в будущем расширить поддержку. По всему миру более 70 миллионов людей с нарушениями слуха используют свыше 200 различных жестовых языков.
Значение для людей
Эта технология не только облегчает повседневное общение людей с нарушениями слуха, но и способствует их социальной интеграции. Представители DeepMind отмечают: «Люди с нарушениями слуха смогут пользоваться обработкой жестового языка так же эффективно, как слышащие — обработкой устной речи».
Перспективы развития
Google планирует расширить поддержку SL2T на другие жестовые языки и устройства. Это позволит технологии охватить более широкую аудиторию и существенно изменить качество жизни людей с нарушениями слуха.
Презентация SL2T открывает новую главу в технологиях распознавания жестового языка и может кардинально улучшить коммуникацию для миллионов людей по всему миру.