Введение

Средний балл субъективной оценки (MOS) – это мера, используемая в области качества восприятия и телекоммуникационной инженерии, отражающая общее качество стимула или системы. Это арифметическое среднее значение индивидуальных оценок, которые испытуемые выставляют, выражая свое мнение о качестве работы системы, по заранее определенной шкале. Такие оценки обычно получают в ходе субъективного тестирования качества, но также могут быть вычислены алгоритмически. MOS широко используется для оценки качества видео, аудио и аудиовизуального контента, однако не ограничивается только этими типами контента. ITU-T определила различные способы указания MOS в Рекомендации ITU-T P.800.1, в зависимости от того, получена ли оценка в результате тестирования аудиовизуального, речевого, слухового, разговорного или видео качества.

Свойства МОС

MOS подвержен определенным математическим свойствам и искажениям. В целом, продолжаются дискуссии о целесообразности использования MOS для количественной оценки качества восприятия (Quality of Experience) в виде единого скалярного значения. Когда MOS получают с использованием категориальных рейтинговых шкал, он основывается – аналогично шкалам Ликерта – на порядковой шкале. В этом случае известен порядок элементов шкалы, но их интервалы неизвестны. Следовательно, математически некорректно вычислять среднее арифметическое по отдельным оценкам для определения центральной тенденции; вместо этого следует использовать медиану. Однако на практике и в определении MOS вычисление среднего арифметического считается допустимым. Показано, что для категориальных рейтинговых шкал (таких как ACR) отдельные элементы субъекты не воспринимают как равноудаленные друг от друга. Например, разрыв между оценками "Хорошо" и "Удовлетворительно" может быть больше, чем между "Хорошо" и "Отлично". Воспринимаемое расстояние также может зависеть от языка, на который переведена шкала. Однако существуют исследования, которые не смогли доказать существенного влияния перевода шкалы на полученные результаты. При сборе оценок MOS присутствуют и другие искажения. Помимо вышеупомянутых проблем с шкалами, которые воспринимаются нелинейно, существует так называемое "искажение выравнивания диапазона": в ходе субъективного эксперимента испытуемые склонны давать оценки, охватывающие всю шкалу. Это делает невозможным сравнение двух различных субъективных тестов, если диапазон представленного качества различается. Иными словами, MOS никогда не является абсолютной мерой качества, а лишь относительной, применимой к конкретному тесту, в котором он был получен. По вышеуказанным причинам – и из-за ряда других контекстуальных факторов, влияющих на воспринимаемое качество в субъективном тесте – значение MOS следует сообщать только при условии, что известен и сообщен контекст, в котором были получены эти значения. Значения MOS, полученные в разных контекстах и с использованием различных методик тестирования, не следует сравнивать напрямую. Рекомендация ITU T P.800.2 определяет, как следует представлять значения MOS. В частности, P.800.2 гласит: "Не имеет смысла напрямую сравнивать значения MOS, полученные в отдельных экспериментах, если только эти эксперименты не были специально разработаны для сравнения, и даже в этом случае данные должны быть статистически проанализированы для подтверждения обоснованности такого сравнения".

MOS для оценки качества речи и звука

Исторически MOS возник из субъективных оценок, где слушатели находились в "тихой комнате" и оценивали воспринимаемое качество телефонной связи. Эта методология тестирования использовалась в телекоммуникационной отрасли на протяжении десятилетий и была стандартизирована в Рекомендации ITU-T P.800. В ней указано, что "говорящий должен находиться в тихой комнате объемом от 30 до 120 м³ и с временем реверберации менее 500 мс (предпочтительно в диапазоне 200–300 мс). Уровень шума в комнате должен быть ниже 30 дБА без выраженных пиков в спектре". Требования к другим видам связи были аналогичным образом определены в последующих Рекомендациях ITU-T.

Оценка MOS с использованием моделей качества

Получение оценок MOS может быть трудоемким и дорогостоящим процессом, поскольку требует привлечения людей-оценщиков. Для различных вариантов использования, таких как разработка кодеков или мониторинг качества обслуживания, где качество необходимо оценивать многократно и автоматически, оценки MOS также могут быть предсказаны объективными моделями качества, которые, как правило, разрабатываются и обучаются на основе оценок MOS, полученных людьми. При использовании таких моделей возникает вопрос, насколько различия в MOS заметны для пользователей. Например, при оценке изображений по пятибалльной шкале MOS, изображение с оценкой MOS равной 5 должно быть заметно лучше по качеству, чем изображение с оценкой MOS равной 1. Однако, не очевидно, будет ли изображение с оценкой MOS 3,8 заметно лучше по качеству, чем изображение с оценкой MOS 3,6. Исследования, проведенные для определения минимальной разницы в MOS, воспринимаемой пользователями при оценке цифровых фотографий, показали, что для того, чтобы 75% пользователей смогли различить изображение более высокого качества, требуется разница в MOS примерно 0,46. Тем не менее, ожидания относительно качества изображения, а следовательно, и оценки MOS, меняются со временем в соответствии с изменением ожиданий пользователей. В результате, минимальные различия в MOS, заметные для пользователей и определяемые аналитическими методами, также могут меняться со временем.