Кіріспе
Стимулдың немесе жүйенің сапасын өлшеу шарасы. Орташа пікір баллы (MOS) – сапаны сезіну және телекоммуникациялық инженерия салаларында қолданылатын, стимулдың немесе жүйенің жалпы сапасын көрсететін өлшем. Бұл жүйе сапасының көрсеткіші туралы бағалаушының пікіріне сәйкес, алдын ала белгіленген шкала бойынша берілген жеке бағалардың арифметикалық орташасы болып табылады. Мұндай бағалаулар көбінесе субъективті сапаны бағалау сынақтары арқылы жиналады, бірақ оларды алгоритмдер арқылы да есептеуге болады. MOS бейне, аудио және аудиовизуалды сапаны бағалау үшін кеңінен қолданылады, бірақ осы мүмкіндіктермен ғана шектелмейді. ITU T P.800.1 ұсынымында аудиовизуалды, әңгімелік, тыңдау, сөйлеу немесе бейне сапасы сынақтарынан алынған нәтижелерге байланысты MOS-қа сілтеме жасаудың әртүрлі тәсілдері анықталған.
Mean opinion score (MOS) is a measure used in the domain of Quality of Experience and telecommunications engineering, representing overall quality of a stimulus or system. It is the arithmetic mean over all individual "values on a predefined scale that a subject assigns to his opinion of the performance of a system quality". Such ratings are usually gathered in a subjective quality evaluation test, but they can also be algorithmically estimated. MOS is a commonly used measure for video, audio, and audiovisual quality evaluation, but not restricted to those modalities. ITU T has defined several ways of referring to a MOS in Recommendation ITU T P.800.1, depending on whether the score was obtained from audiovisual, conversational, listening, talking, or video quality tests.
MOS қасиеттері
MOS белгілі бір математикалық қасиеттерге және қиыстықтарға жатады. Жалпы, тәжірибе сапасын бір скалярлық мәнмен сандық бағалау үшін MOS-тың пайдалылығы туралы пікірталас әлі де жалғасуда. МОС категориялық рейтинг шкалаларын қолдану арқылы алынғанда, ол Ликерт шкалаларына ұқсас ординарлық шкалаға негізделген. Бұл жағдайда шкаладағы элементтердің реті белгілі, бірақ олардың аралығы белгісіз. Сондықтан, орталық тенденцияны анықтау үшін жеке рейтингтердің орташа арифметикалық шамасын есептеу математикалық тұрғыдан дұрыс емес; оның орнына медиананы қолдану керек. Дегенмен, тәжірибеде және МОС анықтамасында арифметикалық орташаны есептеу қабылданады. Категориялық рейтинг шкалалары (мысалы, ACR) үшін жеке элементтер субъектілер үшін тең аралықта емес екені көрсетілген. Мысалы, «Жақсы» мен «Жарайды» арасындағы айырма «Жақсы» мен «Тамаша» арасындағы айырмадан үлкен болуы мүмкін. Қабылданатын қашықтық шкаланың аударма жасалған тіліне де байланысты болуы мүмкін. Алайда, шкаланың аудармасы алынған нәтижелерге елеулі әсер ететінін дәлелдей алмаған зерттеулер де бар. МОС рейтингтерін алу тәсілінде басқа да бірнеше қиыстықтар бар. Жоғарыда айтылған, сызықты емес қабылданатын шкалалармен байланысты мәселелерге қоса, «диапазонды теңестіру қиыстығы» деп аталатын нәрсе бар: субъективті эксперимент барысында субъектілер бүкіл рейтинг шкаласын қамтитын бағалар беруге бейім. Бұл ұсынылған сапа диапазоны әртүрлі болса, екі түрлі субъективті сынақты салыстыруды мүмкінсіз етеді. Басқаша айтқанда, МОС ешқашан сапаның абсолютті өлшемі емес, тек оны алған сынаққа қатысты. Жоғарыда айтылған себептерге және субъективті сынақта қабылданатын сапаға әсер ететін басқа да контексттік факторларға байланысты, МОС мәні тек мәндер жиналған контекст белгілі болса және осы контекст туралы хабарланса ғана хабарлануы керек. Сондықтан, әртүрлі контексттерде және сынақ жобаларында алынған МОС мәндерін тікелей салыстыруға болмайды. ITU T P.800.2 ұсынымы МОС мәндерін қалай баяндау керектігін көрсетеді. Атап айтқанда, P.800.2 былай дейді: егер эксперименттер нақты салыстыру үшін жоспарланбаса, жеке эксперименттерден алынған МОС мәндерін тікелей салыстыру мағынасыз, тіпті сонда да мұндай салыстырудың дұрыс екенін қамтамасыз ету үшін деректерді статистикалық талдаудан өткізу керек.
Сөйлеу және дыбыс сапасын бағалауға арналған MOS
MOS тарихи тұрғыдан алғанда, тыңдаушылардың "тыныш бөлмеде" отырып, телефон қоңырауының сапасын жеке бағалауынан туындаған субъективті өлшемдерден бастау алады. Бұл сынақ әдістемесі телефон индустриясында ондаған жылдар бойы қолданылып келді және ITU T P.800 ұсынымында стандартталды. Онда "сөйлеуші 30-дан 120 м³ көлемдегі, 500 мс-ден кем резонанс уақыты бар (көбінесе 200–300 мс аралығында) тыныш бөлмеде отыруы керек" деп нақты көрсетілген. Бөлмедегі шу деңгейі 30 дБА-дан төмен болуы керек, спектрде ең жоғары деңгейдегі жиіліктер болмауы тиіс. Басқа да түрлерге қойылатын талаптар кейінгі ITU T ұсынымдарында да сипатталған.
Сапалық модельдерді қолдану арқылы MOS бағалау
MOS рейтингін алу уақытты қажет ететін және қымбатқа соғуы мүмкін, себебі ол адам бағалаушыларды жұмысқа алуды талап етеді. Кодектерді әзірлеу немесе қызмет сапасын бақылау сияқты әртүрлі жағдайларда, сапаны қайта-қайта және автоматты түрде бағалау қажет болғанда, MOS баллдарын адамның MOS рейтингтерін пайдалана отырып әзірленген және оқытылған объективті сапа модельдерімен де болжауға болады. Мұндай модельдерді қолдану кезінде туындайтын сұрақ: пайда болған MOS айырмашылықтары пайдаланушыларға байқала ма? Мысалы, суреттерді бес балдық MOS шкаласы бойынша бағалағанда, MOS-ы 5-ке тең сурет сапасы жағынан MOS-ы 1-ге тең суреттен айқын жақсырақ болуы күтіледі. Ал, MOS-ы 3.8-ге тең сурет сапасы 3.6-ға тең суреттен айқын жақсырақ па, жоқ па, бұл анық емес. Цифрлық фотосуреттер үшін пайдаланушылардың сезіміне жеткілікті ең кіші MOS айырмашылығын анықтауға жасалған зерттеулер көрсеткендей, пайдаланушылардың 75%-ы жоғары сапалы суретті байқау үшін шамамен 0.46 MOS айырмашылығы қажет. Дегенмен, бейне сапасына қатысты күтулер, демек MOS, пайдаланушылар күтулерінің өзгеруімен уақыт өте келе өзгеріп отырады. Осының салдарынан, талдау әдістері арқылы анықталған ең аз байқалатын MOS айырмашылықтары да уақыт өте келе өзгеруі мүмкін.