Введение
Алгоритм ITU-T, объективно измеряющий качество голоса
Perceptual Speech Quality Measure (PSQM) — это вычислительный и модельный алгоритм, определенный в Рекомендации ITU-T P.861, который объективно оценивает и количественно определяет качество голоса речевых кодеков в полосе частот голоса (300–3400 Гц). Он может использоваться для оценки производительности этих речевых кодеков при различных уровнях входного сигнала, говорящих, скоростях передачи данных и транскодировании. Рекомендация P.861 была отозвана и заменена Рекомендацией ITU-T P.862 (PESQ), которая содержит усовершенствованный алгоритм оценки речи.
Зачем его используют
Использование стандарта PSQM позволяет автоматизированным методологиям тестирования, основанным на моделировании, объективно оценивать как разборчивость речи, так и качество передачи голоса. Для упрощения этого тестирования разработаны различные программные и/или аппаратные средства. Это приводит к существенной экономии затрат и времени по сравнению с традиционной практикой, заключающейся в использовании больших групп людей для субъективной оценки голосовых сигналов и определения качества голоса. Более того, это обеспечивает получение объективных, надежных и воспроизводимых результатов. Это особенно важно для операторов телефонной связи, которые обязаны поддерживать высокие стандарты качества обслуживания.
Алгоритм
PSQM использует алгоритм психоакустического математического моделирования (как перцептивного, так и когнитивного) для анализа голосовых сигналов до и после передачи, выдавая значение PSQM, которое является мерой ухудшения качества сигнала и изменяется от 0 (отсутствие ухудшения) до 6,5 (максимальное ухудшение). Этот результат, в свою очередь, может быть преобразован в среднюю оценку субъективного качества (MOS), общепринятую меру воспринимаемого качества принимаемого медиаконтента по числовой шкале от 1 до 5. Значение 1 указывает на неприемлемое, плохое качество звука, а значение 5 – на высокое качество звука без каких-либо ощутимых дефектов. Алгоритм PSQM преобразует физический сигнал(ы) в психоакустическую область, имеющую смысловое значение для восприятия, посредством ряда нелинейных процессов, таких как преобразование во временную и частотную области, частотное искажение и искажение интенсивности. Качество кодированной речи оценивается на основе различий во внутреннем представлении. Эти различия используются для вычисления шумовых помех как функции времени и частоты. Помимо перцептивного моделирования, алгоритм PSQM использует когнитивное моделирование, такое как шкалирование громкости и асимметричное маскирование, для достижения высокой корреляции между субъективными и объективными измерениями.
Ограничения
PSQM в оригинальной концепции не был разработан с учетом сетевых возмущений качества обслуживания, часто встречающихся в приложениях Voice over IP, таких как потеря пакетов, изменчивость задержки (джиттер) или непоследовательная последовательность пакетов. Эти условия обычно приводят к некорректным результатам при моделировании высокой сетевой нагрузки, не учитывая реальное снижение воспринимаемого качества голоса. Попытки воспроизвести сетевые неисправности путем внесения значительной потери пакетов приводят к значениям PSQM, которые соответствуют искусственно завышенным значениям MOS. Для преодоления этого ограничения был разработан PSQM+ путем модификации исходного алгоритма. PSQM+ генерирует результаты, которые, по-видимому, точнее отражают ухудшение производительности речевых кодеков в реалистичных условиях сетевой нагрузки.
Другие соображения
Другие проблемы связаны с отсутствием стандартизации тестовых сигналов, используемых для оценки различных речевых кодеков. PSQM обеспечивает более надежные и согласованные значения MOS при использовании в соответствии с рекомендованными ITU методами объективной и субъективной оценки качества (ITU T P.800/P.830/P.861). Эти рекомендации ITU T предусматривают использование эталонных голосовых сигналов как мужского, так и женского пола со средним уровнем -20 дБ. Тип, пол, длительность, усиление голоса или сигнала могут оказывать незначительное влияние на значение PSQM или оценку MOS, равно как и пороговые уровни, количество совершенных вызовов и другие параметры конфигурации среды. При сравнении измерений качества голоса необходимо учитывать используемый сигнал, условия окружающей среды и конфигурацию. Существует множество речевых кодеков, применяемых в широком спектре приложений. Для соответствия системным требованиям требуется тщательный выбор подходящих речевых кодеков. Доступен список распространенных речевых кодеков и соответствующих им значений MOS, полученных с помощью PSQM/PSQM+ при различных условиях нагрузки сети.