Введение

Обнаружение присутствия или отсутствия человеческой речи. Обнаружение голосовой активности (VAD), также известное как обнаружение речевой активности или просто обнаружение речи, – это определение наличия или отсутствия человеческой речи, используемое в системах обработки речи. Основные области применения VAD включают диаризацию говорящих, кодирование речи и распознавание речи. VAD упрощает обработку речи и может использоваться для отключения определенных процессов во время неречевых фрагментов аудиозаписи, предотвращая ненужное кодирование и передачу пакетов тишины в приложениях Voice over Internet Protocol (VoIP), что позволяет экономить вычислительные ресурсы и пропускную способность сети. VAD является важной технологией, обеспечивающей работу широкого спектра приложений, основанных на речи. Поэтому было разработано множество алгоритмов VAD, предлагающих различные характеристики и компромиссы между задержкой, чувствительностью, точностью и вычислительной сложностью. Некоторые алгоритмы VAD также предоставляют дополнительный анализ, например, определение того, является ли речь звонкой, глухой или непрерывной. Обнаружение голосовой активности обычно не зависит от языка. Впервые его применение было исследовано для систем временной интерполяции речи (TASI).

Приложения

VAD является неотъемлемой частью различных систем речевой связи, таких как аудиоконференции, подавление эхо, распознавание речи, кодирование речи, идентификация говорящего и hands-free телефония. В области мультимедийных приложений VAD обеспечивает одновременное использование голосовых и данных приложений. Аналогично, в универсальных мобильных телекоммуникационных системах (UMTS) он управляет и снижает среднюю битовую скорость, а также повышает общее качество кодирования речи. В сотовых радиосистемах (например, GSM и CDMA), основанных на режиме прерывистой передачи (DTX), VAD играет важную роль в увеличении емкости системы за счет снижения интерференции по соседнему каналу и энергопотребления в портативных цифровых устройствах. В приложениях обработки речи обнаружение голосовой активности имеет большое значение, поскольку неречевые фрагменты часто отбрасываются. Для широкого спектра приложений, таких как цифровая мобильная радиосвязь, цифровая одновременная передача голоса и данных (DSVD) или хранение речи, желательно обеспечить прерывистую передачу параметров кодирования речи. Преимущества могут включать снижение среднего энергопотребления в мобильных устройствах, повышение средней битовой скорости для одновременных сервисов, таких как передача данных, или увеличение емкости запоминающих устройств. Однако улучшение в значительной степени зависит от процента пауз в речи и надежности VAD, используемого для обнаружения этих интервалов. С одной стороны, выгодно иметь низкий процент речевой активности. С другой стороны, обрывы, то есть потеря миллисекунд активной речи, должны быть сведены к минимуму для сохранения качества. Это критическая проблема для алгоритма VAD в условиях сильного шума.

Использование в телемаркетинге

Одно из спорных применений VAD связано с использованием предсказательных набирателей телемаркетинговыми компаниями. Чтобы максимизировать производительность операторов, телемаркетинговые компании настраивают предсказательные набиратели для обзвона большего количества номеров, чем у них есть доступных операторов, зная, что большинство звонков завершатся либо отсутствием ответа, либо попаданием на автоответчик. Когда человек отвечает, он обычно произносит короткую фразу ("Здравствуйте", "Добрый вечер" и т.п.), после чего следует короткая пауза. Сообщения автоответчиков обычно длятся от 3 до 15 секунд непрерывной речи. Правильно настроив параметры VAD, набиратель может определить, ответил на звонок человек или машина, и, если это человек, перевести звонок свободному оператору. Если система обнаруживает сообщение автоответчика, набиратель автоматически сбрасывает вызов. Часто даже при правильном определении ответа человека, свободного оператора может не оказаться, что приводит к "тихому звонку". Использование многосекундной приветственной фразы, например, "Пожалуйста, назовите себя, и я могу поднять трубку", может блокировать такие автоматизированные звонки.

Реализация

Одним из ранних стандартов VAD является стандарт, разработанный British Telecom для использования в общеевропейской цифровой сотовой мобильной телефонной службе в 1991 году. Он использует обратную фильтрацию, обученную на неречевых сегментах, для фильтрации фонового шума, чтобы затем более надежно использовать простой пороговый уровень мощности для определения наличия речи. Стандарт G.729 вычисляет следующие признаки для своего VAD: линейные спектральные частоты, полная энергия полосы, низкочастотная энергия (<1 кГц) и скорость пересечения нуля. Он применяет простую классификацию с использованием фиксированной границы принятия решения в пространстве, определяемом этими признаками, а затем применяет сглаживание и адаптивную коррекцию для улучшения оценки. Стандарт GSM включает два варианта VAD, разработанных ETSI. Вариант 1 вычисляет отношение сигнал/шум (SNR) в девяти диапазонах и применяет пороговое значение к этим значениям. Вариант 2 вычисляет различные параметры: мощность канала, речевые метрики и мощность шума. Затем он применяет пороговое значение к речевым метрикам, используя порог, который изменяется в зависимости от оцененного SNR. Аудиобиблиотека сжатия Speex использует процедуру под названием Improved Minima Controlled Recursive Averaging, которая использует сглаженное представление спектральной мощности, а затем анализирует минимумы сглаженной периодограммы. Начиная с версии 1.2, она была заменена на то, что автор назвал "костылем". Lingua Libre, инструмент и проект языковой документации Wikimedia, использует VAD для обеспечения записи множества произношений за короткий промежуток времени. Библиотека VAD Android использует комбинацию моделей GMM и DNN, таких как WebRTC GMM, Silero DNN и Yamnet DNN. Эта библиотека превосходит многие модели промышленного уровня как по качеству, так и по производительности.