Google представил модель для перевода жестового языка в текст в реальном времени

Ссылка скопирована

...

Сегодня, 15:30

Искусственный интеллект

Чтение занимает время?

Вы можете слушать статьи

Новый этап в понимании жестового языка

Команда DeepMind от Google представила SL2T — модель, которая переводит жестовый язык в текст в реальном времени. Технология уже работает на смартфонах Pixel 11 и интегрирована в приложения Gboard и Live Transcribe, делая жестовый язык более доступным.

Как работает SL2T?

Модель не переводит видео напрямую. Специальное приложение на устройстве преобразует видеозапись в координаты, которые отправляются на серверы Google. Такой подход сохраняет конфиденциальность пользователей. SL2T переводит эти координаты сразу в текст, а не в glosses — упрощённые обозначения жестов, которые не отражают всю сложность и нелинейность жестового языка.

Обучение и разнообразие данных

DeepMind обучала SL2T на базе более 100000 часов данных жестового языка. Около четверти из них — американский жестовый язык (ASL). В настоящее время модель переводит только с ASL на английский, но она обучалась и на других жестовых языках, что позволит в будущем расширить поддержку. По всему миру более 70 миллионов людей с нарушениями слуха используют свыше 200 различных жестовых языков.

Значение для людей

Эта технология не только облегчает повседневное общение людей с нарушениями слуха, но и способствует их социальной интеграции. Представители DeepMind отмечают: «Люди с нарушениями слуха смогут пользоваться обработкой жестового языка так же эффективно, как слышащие — обработкой устной речи».

Перспективы развития

Google планирует расширить поддержку SL2T на другие жестовые языки и устройства. Это позволит технологии охватить более широкую аудиторию и существенно изменить качество жизни людей с нарушениями слуха.

Презентация SL2T открывает новую главу в технологиях распознавания жестового языка и может кардинально улучшить коммуникацию для миллионов людей по всему миру.

Ссылка скопирована