Кіріспе
Әр мүшесі әр түрлі жиынтықтардың немесе сыныптардың біріне жататын популяцияны ескере отырып, жіктеу ережесі немесе жіктеуіш – бұл популяция жиынтығының элементтерінің әрқайсысын сыныптардың біріне жатқызу процедурасы. Нақты жіктеу – бұл популяцияның әрбір элементінің оған тиесілі сыныпқа дұрыс жатқызылуы. Байес жіктеуіші – классификацияланатын элементтердің белгілі қасиеттеріне (яғни, белгілеріне немесе регрессорларына) сүйене отырып, сыныптарды ең тиімді түрде анықтайтын жіктеуіш. Екі сыныпқа ғана бөлінетін мәселелер үшін қолданылатын ерекше жіктеу ережесі – екілік жіктеу.
Сынақтарды жіктеу ережесі
x және y жұптарынан тұратын деректер жиынтығын қарастыра отырып, мұнда x – популяцияның бір элементін, ал y – оның тиесілі класын білдіреді. h(x) жіктеу ережесі – әрбір x элементін болжанған классқа тағайындайтын функция. Бинарлық жіктеуде y белгісі тек екі мәннің біреуін ғана қабылдай алады. y<sub>i</sub> нақты белгілері белгілі болуы мүмкін, бірақ олар шамамен алынған мәндермен сәйкес келмей қалуы да мүмкін. Бинарлық жіктеуде дұрыс жіктелмеген элементтер жалған оң және жалған теріс деп аталады. Кейбір жіктеу ережелері статикалық функциялар болып табылады, ал кейбіреулері компьютерлік бағдарламалар болуы мүмкін. Компьютерлік жіктегіш статикалық жіктеу ережелерін үйренуге немесе іске асыруға қабілетті. Оқу деректер жиынтығы үшін y<sub>j</sub> нақты белгілері белгісіз, бірақ жіктеу процедурасының басты мақсаты – шамамен алынған мән нақты мәнге мүмкіндігінше жақын болуы. Мұндай шаманың сапасы болашақта байқаулар жасалатын жалпы популяцияның статистикалық немесе ықтималдық қасиеттері негізінде бағалануы керек. Берілген жіктеу ережесі бойынша жіктеу сынағы – бұл ережені бастапқы деректер жиынтығының шектеулі үлгісіне қолданудың нәтижесі.
Бинарлық және көп класты жіктеу
Классификацияны екі бөлек мәселе ретінде қарастыруға болады: екілік классификация және көп сыныпты классификация. Екілік классификацияда, жақсы түсінілетін міндетте, тек екі сынып қатысады, ал көп сыныпты классификацияда объектіні бірнеше сыныптың біріне жатқызу қажет. Көптеген классификация әдістері екілік классификация үшін арнайы әзірленгендіктен, көп сыныпты классификация көбінесе бірнеше екілік классификаторларды біріктіріп қолдануды талап етеді. Маңыздысы, көптеген практикалық екілік классификация мәселелерінде екі топ симметриялы емес – жалпы дәлдіктен гөрі, қателердің әртүрлі түрлерінің салыстырмалы үлесі маңыздырақ. Мысалы, медициналық тестілеуде, жалған оң нәтиже (ауру жоқ кезде анықтау) жалған теріс нәтижеден (ауру бар кезде анықтамау) әртүрлі қарастырылады. Көп сыныпты классификацияларда сыныптар симметриялық (барлық қателер теңдесіз) немесе асимметриялық қарастырылуы мүмкін, соңғысы әлдеқайда күрделі. Екілік классификация әдістеріне пробит регрессиясы және логистикалық регрессия жатады. Көп сыныпты классификация әдістеріне мультиномиалдық пробит және мультиномиалдық логит жатады.
Жалған позитивтер
Жалған оң нәтижелер тест дұрыс емес (қате) оң нәтиже көрсеткен кезде пайда болады. Мысалы, қандай да бір ауруды анықтау үшін жасалған медициналық тест, науқаста ауру жоқ болса да, аурудың бар екенін көрсететін оң нәтиже бере алады. Жалған оң нәтиже шатасу матрицасындағы жоғарғы оң жақ (жағдай теріс X тест нәтижесі оң) жасушасымен белгіленеді.
Жалған теріс
Екінші жағынан, жалған теріс нәтижелер тестің теріс нәтижені қате немесе дұрыс емес түрде көрсетуінен туындайды. Мысалы, қандай да бір ауруды анықтау үшін жасалған медициналық тест науқаста аурудың бар екенін көрсетпесе де, шындығында науқас сол ауруға шалдыққан болуы мүмкін. Жалған теріс нәтижелер шатасу матрицасында (Confusion matrix) «жағдай оң, сынақ нәтижесі теріс» бөлімінде көрсетіледі.
Нағыз оң сандар
Нағыз оң нәтижелер тест дұрыс оң нәтиже берген кезде шығады. Мысалы, ауруды анықтау үшін жасалған медициналық тестте пациентте ауру бар екені көрсетілуі мүмкін. Пациенттің қосымша тестілеуі аурудың бар екенін растағанда бұл нақты болады. Нағыз оң көрсеткіш шатасу матрицасындағы сол жақ жоғарғы (Ауру бар X тест нәтижесі оң) жасушасымен белгіленеді.
Нағыз теріс
Нағыз теріс нәтиже – тест дұрыс түрде теріс нәтиже беретін кезде шығады. Мысалы, қандай да бір ауруды анықтау үшін жасалған медициналық тест, пациенттің ауруы жоқ екенін көрсете алады. Бұл, пациенттің тестілеу нәтижесі де аурудың жоқ екенін растағанда дұрыс болып табылады. Нағыз теріс, шатасу матрицасында әдетте төменгі оң жақтан (Жағдай теріс X тест нәтижесі теріс) көрсетіледі.
Жалған позитивтер
Байес теоремасын оң нәтиженің жалған оң нәтиже болу ықтималдығын анықтау үшін қолданамыз. Егер ауру сирек кездесетін болса, онда оң нәтижелердің көпшілігі жалған оң нәтижелер болуы мүмкін, тіпті тест салыстырмалы түрде дәл болса да. Әдемі қарапайым тұрғыдан алғанда, тек 5% оң нәтижелер ғана жалған деп ойлауға болады, бірақ бұл өте қате, кейін көретін боламыз. Халықтың тек 0,1%-ы ғана осы ауруға шалдыққан деп есептейік, сондықтан кездейсоқ таңдалған науқастың ауруы болуының алдын ала ықтималдығы 0,001-ге тең. Оң нәтижелі тесттің жалған оң нәтижеге айналу ықтималдығын есептеу үшін Байес теоремасын қолдана аламыз. Сондықтан оң нәтиженің жалған оң нәтиже болу ықтималдығы шамамен 1 – 0,019 = 0,98, яғни 98% құрайды. Тесттің жоғары дәлдігіне қарамастан, аурудың таралуы өте төмен болғандықтан, оң нәтиже көрсеткен науқастардың басым көпшілігі аурудан зардап шекпейді. Дегенмен, тесттен оң нәтиже алған, бірақ ауруы бар пациенттердің үлесі (0,019) тестке дейін ауруы бар адамдардың үлесінен (0,001) 19 есе жоғары. Осылайша, тесттің пайдасы бар, және қайта тексеру нәтижелердің сенімділігін арттыруы мүмкін. Жалған оң нәтижелердің проблемасын азайту үшін, науқаста ауру болмаған жағдайда тест теріс нәтижені өте дәл көрсетуі керек. Егер тест ауруы жоқ науқастарда 0,999 ықтималдығымен теріс нәтиже көрсетсе, онда 1 – 0,5 = 0,5 жалған оң нәтиже болу ықтималдығын білдіреді.
so that 1 − 0.5 = 0.5 now is the probability of a false positive.
Нағыз теріс
Сонымен қатар, біз Байес теоремасын нағыз теріс нәтиже ықтималдығын есептеу үшін де қолдана аламыз. Жоғарыда келтірілген мысалдарды пайдаланып: Егер тексерілген науқаста ауру болса, тест 99% жағдайда оң нәтиже береді, яғни 0,99 ықтималдығымен. Теріс нәтиже нағыз теріс болуының ықтималдығы 0,9999494 немесе 99,99%-ды құрайды. Ауру сирек кездесетін және оң нәтижелердің саны жоғары, сондай-ақ теріс нәтижелердің саны да жоғары болғандықтан, бұл жоғары нағыз теріс көрсеткіштің пайда болуына әкеледі.
If a tested patient has the disease, the test returns a positive result 99% of the time, or with a probability of 0.99. The probability that a negative result is a true negative is 0.9999494 or 99.99%. Since the disease is rare and the positive to positive rate is high and the negative to negative rate is also high, this will produce a large True Negative rate.
Сезімталдық пен ерекшелік бар жіктеуішті өлшеу
Классификаторды оқыту кезінде оның өнімділігін сезімталдық және ерекшелік сияқты қабылданған өлшемдер арқылы бағалауға болады. Классификаторды аурудың таралуына байланысты монета лақтыратын кездейсоқ классификатормен салыстыру пайдалы болуы мүмкін. Егер адамның ауруға шағу ықтималдығы болса, ал шақпау ықтималдығы болса, онда ауруды болжау үшін дәл сол ықтималдықты қолданатын кездейсоқ классификатор бар делік. Шынайы оң нәтиже ықтималдығы – науқастың ауруға шағу ықтималдығы мен кездейсоқ классификатордың дұрыс болжауының ықтималдығының көбейтіндісі, яғни . Сол сияқты, жалған теріс нәтиже ықтималдығы . Жоғарыдағы анықтамаларға сәйкес, осы классификатордың сезімталдығы , ал ерекшелігі . Демек, өлшемнің өзі аурудың таралуына тәуелсіз болғанымен, бұл кездейсоқ классификатордың өнімділігі аурудың таралуына байланысты. Классификатордың өнімділігі осы кездейсоқ классификаторға ұқсас болуы мүмкін, бірақ салмағы жақсырақ монетасы (жоғары сезімталдық және ерекшелік) бар. Сондықтан, бұл өлшемдерге аурудың таралуының әсері тиюі мүмкін. Өнімділікті бағалаудың баламалы әдісі – Мэтьюс корреляциялық коэффициенті, ол кез келген кездейсоқ классификатор үшін орташа есеппен 0-ге тең болады. Бұл ұғымды бинарлық емес классификацияға кеңейту шатасу матрицасын тудырады.
The probability of a true positive is the probability that the patient has the disease times the probability that the random classifier guesses this correctly, or With similar reasoning, the probability of a false negative is From the definitions above, the sensitivity of this classifier is With similar reasoning, we can calculate the specificity as
So, while the measure itself is independent of disease prevalence, the performance of this random classifier depends on disease prevalence. The classifier may have performance that is like this random classifier, but with a better weighted coin (higher sensitivity and specificity). So, these measures may be influenced by disease prevalence. An alternative measure of performance is the Matthews correlation coefficient, for which any random classifier will get an average score of 0. The extension of this concept to non binary classifications yields the confusion matrix.