Введение
Оценка качества видео с точки зрения восприятия человеком
Субъективное качество видео – это качество видео, воспринимаемое человеком. Оно связано с тем, как видео воспринимается зрителем (также называемым «наблюдателем» или «субъектом») и отражает его мнение об определенной видеопоследовательности. Это относится к области качества пользовательского опыта (Quality of Experience). Измерение субъективного качества видео необходимо, поскольку объективные алгоритмы оценки качества, такие как PSNR, показали слабую корреляцию с субъективными оценками. Субъективные оценки также могут использоваться в качестве эталонных данных для разработки новых алгоритмов. Субъективные тесты качества видео – это психофизические эксперименты, в которых группа зрителей оценивает заданный набор стимулов. Эти тесты достаточно затратны по времени (подготовка и проведение) и требуют значительных человеческих ресурсов, поэтому их необходимо тщательно проектировать. В ходе субъективных тестов качества видео, как правило, исходные видеопоследовательности (SRC – «источники») подвергаются различным воздействиям (HRC – «гипотетические схемы кодирования») для получения обработанных видеопоследовательностей (PVS).
Subjective video quality is video quality as experienced by humans. It is concerned with how video is perceived by a viewer (also called "observer" or "subject") and designates their opinion on a particular video sequence. It is related to the field of Quality of Experience. Measuring subjective video quality is necessary because objective quality assessment algorithms such as PSNR have been shown to correlate poorly with subjective ratings. Subjective ratings may also be used as ground truth to develop new algorithms. Subjective video quality tests are psychophysical experiments in which a number of viewers rate a given set of stimuli. These tests are quite expensive in terms of time (preparation and running) and human resources and must therefore be carefully designed. In subjective video quality tests, typically, SRCs ("Sources", i. e. original video sequences) are treated with various conditions (HRCs for "Hypothetical Reference Circuits") to generate PVSs ("Processed Video Sequences").
Выбор источника
Как правило, система должна быть протестирована с репрезентативным набором различного контента и характеристик контента. Например, можно выбрать отрывки из контента разных жанров, таких как фильмы боевики, новостные программы и мультфильмы. Длина исходного видео зависит от цели тестирования, но обычно используются последовательности продолжительностью не менее 10 секунд. Количество движения и пространственная детализация также должны быть разнообразными. Это гарантирует, что тест включает в себя последовательности различной сложности. Исходные материалы должны быть наивысшего качества. Не должно быть видимых артефактов кодирования или других свойств, ухудшающих качество исходной последовательности.
Настройки
Конструкция HRC зависит от исследуемой системы. Обычно на этом этапе вводят несколько независимых переменных, которые изменяют на нескольких уровнях. Например, для оценки качества видеокодека независимыми переменными могут быть программа для кодирования видео, целевая скорость передачи данных и целевое разрешение обрабатываемой последовательности. Рекомендуется выбирать настройки, которые обеспечат оценки, охватывающие весь спектр качества. Иными словами, при использовании шкалы абсолютной категоризации, тест должен демонстрировать последовательности, которые зрители оценят от плохого до отличного.
Количество зрителей
Зрителей также называют "наблюдателями" или "субъектами". Для исследования необходимо пригласить определенное минимальное количество зрителей, поскольку большее число участников повышает достоверность результатов эксперимента, например, за счет уменьшения стандартного отклонения усредненных оценок. Кроме того, существует риск исключения субъектов из-за ненадежного поведения при оценке. Минимальное количество субъектов, необходимое для субъективного исследования качества видео, не установлено строго. Согласно ITU T, возможно любое число от 4 до 40, где 4 – абсолютный минимум по статистическим соображениям, а приглашение более 40 субъектов не дает дополнительного эффекта. В целом, в эксперименте должны участвовать не менее 15 наблюдателей. Они не должны быть непосредственно вовлечены в оценку качества изображения как часть своей работы и не должны являться опытными экспертами-оценщиками. Однако большинство рекомендаций по количеству субъектов разработаны для измерения качества видео, с которым сталкиваются пользователи домашних телевизоров или ПК, где диапазон и разнообразие искажений, как правило, ограничены (например, только артефактами кодирования). Учитывая широкий диапазон и разнообразие дефектов, которые могут возникать в видео, снятых на мобильных устройствах и/или передаваемых по беспроводным сетям, как правило, может потребоваться большее число участников. Бруннстрём и Барковский предложили расчеты для оценки минимального необходимого количества субъектов на основе существующих субъективных тестов. Они утверждают, что для обеспечения статистически значимых различий при сравнении оценок может потребоваться большее число субъектов, чем обычно рекомендуется.
involved in picture quality evaluation as part of their work and should not be experienced assessors. However, most recommendations for the number of subjects have been designed for measuring video quality encountered by a home television or PC user, where the range and diversity of distortions tend to be limited (e. g., to encoding artifacts only). Given the large ranges and diversity of impairments that may occur on videos captured with mobile devices and/or transmitted over wireless networks, generally, a larger number of human subjects may be required. Brunnström and Barkowsky have provided calculations for estimating the minimum number of subjects necessary based on existing subjective tests. They claim that in order to ensure statistically significant differences when comparing ratings, a larger number of subjects than usually recommended may be needed.
Выбор зрителя
Зрители не должны быть специалистами, то есть не являться профессионалами в области видеокодирования или смежных областях. Это требование введено для исключения возможной субъективной предвзятости.
Испытательная среда
Субъективные тесты качества можно проводить в любых условиях. Однако, из-за возможных влияющих факторов из неоднородной среды, обычно рекомендуется проводить тесты в нейтральной среде, такой как специально оборудованная лаборатория. В такой лаборатории может быть обеспечена звукоизоляция, стены окрашены в нейтральный серый цвет и используются правильно откалиброванные источники света. Эти условия рекомендованы в нескольких стандартах. В данном случае, зрители оценивают качество, используя свой компьютер дома, а не участвуя в субъективном тесте качества в лабораторных условиях. Хотя этот метод позволяет получить больше результатов, чем при традиционных субъективных тестах, и при этом снизить затраты, необходимо тщательно проверять валидность и надежность полученных ответов.
Анализ результатов
Мнения зрителей обычно усредняются для получения среднего балла субъективной оценки (MOS). С этой целью метки категориальных шкал могут быть преобразованы в числовые значения. Например, ответы от "плохо" до "отлично" могут быть сопоставлены значениям от 1 до 5, после чего вычисляется среднее значение. Значения MOS всегда следует приводить с указанием их статистических доверительных интервалов, чтобы можно было оценить степень согласованности между оценщиками.
Скрининг субъектов
Часто перед оценкой результатов принимаются дополнительные меры. Отбор участников — это процесс исключения из дальнейшего анализа зрителей, чьи оценки считаются недействительными или ненадежными. Выявить недействительные оценки сложно, поскольку участники могли оценивать, не просматривая видео, или жульничать во время тестирования. Общую надежность участника можно определить с помощью различных процедур, некоторые из которых описаны в рекомендациях ITU-R и ITU-T. Например, корреляция между индивидуальными оценками участника и общей средней оценкой (MOS), рассчитанной для всех последовательностей, является хорошим показателем его надежности по сравнению с другими участниками теста.
Усовершенствованные модели
Оценивая стимулы, люди подвержены искажениям. Эти искажения могут приводить к различной и неточной оценке, а следовательно, к значениям MOS, не отражающим истинное качество стимула. В последние годы были предложены продвинутые модели, целью которых является формальное описание процесса оценки и последующее устранение погрешностей в субъективных оценках. Согласно Janowski et al., у испытуемых может быть систематическая ошибка, которая в целом смещает их оценки, а также неточность оценки, зависящая как от испытуемого, так и от оцениваемого стимула. Li et al. предложили различать непоследовательность испытуемого и неоднозначность контента.
Стандартные методы испытаний
Существует множество способов выбора подходящих последовательностей, системных настроек и методологий тестирования. Некоторые из них были стандартизированы. Они подробно описаны в ряде рекомендаций ITU-R и ITU-T, среди которых ITU-R BT.500 предоставляет исследователям больше свободы для проведения субъективных оценок качества в условиях, отличных от типичной испытательной лаборатории, но при этом требует от них предоставлять все детали, необходимые для воспроизводимости таких тестов.
Примеры
Ниже приведены примеры некоторых стандартизированных процедур тестирования.
Одно-стимул
ACR (Absolute Category Rating): В ITU-T P.910 отмечается, что для оценки достоверности передачи, особенно в системах высокого качества, следует использовать такие методы, как DCR. ACR и ACR HR лучше подходят для квалификационных тестов и – благодаря предоставлению абсолютных результатов – для сравнения систем. Метод PC обладает высокой дискриминационной способностью, но требует более продолжительных тестовых сессий.
Базы данных
Результаты субъективных тестов качества, включая использованные стимулы, называются базами данных. Ряд субъективных баз данных качества изображений и видео, полученных в ходе подобных исследований, был опубликован исследовательскими институтами в открытом доступе. Эти базы данных, некоторые из которых де-факто стали стандартами, используются инженерами телевидения, кино и видео по всему миру для разработки и тестирования моделей объективного качества, поскольку разработанные модели могут быть обучены на основе этих субъективных данных. Обзор общедоступных баз данных был составлен Группой экспертов по качеству видео, а видеоматериалы доступны в Библиотеке цифрового видео для потребителей.