Grok Voice Transcribe 2.0 улучшает точность распознавания речи вдвое

Ссылка скопирована

...

Сегодня, 02:00

Искусственный интеллект

Чтение занимает время?

Вы можете слушать статьи

Grok Voice Transcribe 2.0: новый уровень распознавания речи

18 сентября была представлена новая версия Grok Voice Transcribe 2.0. Стоимость услуг осталась прежней: пакетная обработка стоит 0,10 доллара в час, потоковая — 0,20 доллара в час. Главное преимущество обновления — двукратное повышение точности по сравнению с предыдущей версией.

Точность и поддержка нескольких языков

Grok Voice Transcribe 2.0 занял первое место по точности среди 32 потоковых моделей. Внутренние тесты сравнивали его с ElevenLabs Scribe v2 и Deepgram Nova-3. Особенно впечатляет многоязычная производительность: в 19 языках доля ошибок при распознавании коротких голосовых команд снизилась с 20,6% до 6,8%.

Широкое применение технологии

Модель ежедневно обрабатывает десятки тысяч звонков в службу поддержки, миллионы часов видеозаписей и используется в голосовом помощнике автомобилей Tesla. Это подтверждает её надёжность и эффективность в реальных условиях.

Дополнительные функции и вопросы конфиденциальности

В бесплатный пакет входят распознавание говорящих, временные метки на уровне слов и выделение ключевых терминов. Однако в соответствии с европейским законодательством аудиозаписи считаются персональными данными. Компания пока не раскрыла подробности о способах сбора и хранения этих данных, что требует внимания.

Перспективы и планы

Старая версия Grok Voice Transcribe 1.0 будет выведена из эксплуатации в ближайшие недели, а пользователи автоматически перейдут на новую. Компания Atlassian оценивает обновлённую модель как более точную и уже использует её для транскрипции всех видео на платформе Loom.

Эти инновации открывают новые возможности для надёжного и эффективного распознавания речи в многоязычных и сложных условиях.

Ссылка скопирована