Компания VK улучшила свою технологию автоматического распознавания речи, применяемую в различных сервисах экосистемы. Команда AI VK обновила систему ASR на основе моделей машинного обучения, и новая версия стала распознавать речь на 20% точнее, чем предыдущая.
ASR преобразует голосовой сигнал в текст: аудио переводится в цифровой формат, очищается от шумов, затем система анализирует особенности звучания и определяет произносимые слова. Нейросетевые модели и крупные языковые модели помогают учитывать контекст и смысловые связи, что делает транскрипцию более естественной и корректной.
Для улучшения технологии её дообучили на расширенном датасете, используя аудиодорожки из публичных роликов «VK Видео». Это позволило системе лучше понимать разнообразие темпа и манеры речи. По внутренним тестам, новая модель опережает зарубежные решения по качеству распознавания русскоязычных звуковых дорожек.
ASR-технологии VK применяются для создания субтитров в «VK Видео» и «VK Клипах», используются на образовательной платформе «Учи.ру», а также обрабатывают голосовые сообщения в мессенджере «ВКонтакте». Кроме того, система помогает в корпоративных задачах — расшифровке встреч и создании кратких сводок — и улучшает мультимодальные модели для рекомендательной системы Discovery.
Обновлённая версия уже внедрена в «VK Видео» и «VK Клипах» и используется во внутренних сервисах компании. В дальнейшем её добавят и в другие продукты группы. Команда AI VK также планирует увеличить точность обработки голосовых сообщений, расширить языковую поддержку и внедрить диаризацию для разделения речи разных спикеров.