Кіріспе

Статистиканы пайдалану арқылы деректерді жіктеу. Статистикада жіктеу – байқаудың (немесе байқаулардың) нақты бір санатқа (қосалқы популяцияларға) жататынын анықтау мәселесі. Мысалы, белгілі бір электрондық поштаны «спам» немесе «спам емес» класына жатқызу, немесе науқастың байқалған ерекшеліктері (жынысы, қан қысымы, белгілі бір симптомдардың болуы немесе болмауы және т.б.) негізінде науқасқа диагноз қою. Көбінесе жеке байқаулар сандық сипаттамалар жиынтығына дейін талданады, олар түрлі түсіндірме айнымалылар немесе белгілер деп аталады. Бұл қасиеттер әртүрлі болуы мүмкін (мысалы, қан тобы үшін «A», «B», «AB» немесе «O»), реттік (мысалы, «ірі», «орташа» немесе «кішкентай»), бүтін санмен өлшенетін (мысалы, электрондық поштадағы белгілі бір сөздің қайталану саны) немесе нақты санмен өлшенетін (мысалы, қан қысымын өлшеу) болады. Басқа жіктегіштер ұқсастық немесе қашықтық функциясын пайдаланып, байқауларды бұрынғы байқаулармен салыстыру арқылы жұмыс істейді. Жіктеуді жүзеге асыратын алгоритм, әсіресе нақты іске асыру кезінде, жіктегіш деп аталады. «Жіктегіш» термині кейде кіріс деректерін санатқа бейімдейтін жіктеу алгоритмімен іске асырылатын математикалық функцияны да білдіреді. Салалар бойынша терминология өте әртүрлі. Статистикада, жіктеу көбінесе логистикалық регрессия немесе осыған ұқсас процедура арқылы жасалатын болса, байқаулардың қасиеттері түсіндірме айнымалылар (немесе тәуелсіз айнымалылар, регрессорлар және т.б.) деп аталады, ал болжауға тиіс санаттар нәтижелер деп аталады, олар тәуелді айнымалының мүмкін мәндері болып саналады. Машиналық оқытуда байқаулар көбінесе мысалдар деп аталады, түсіндірме айнымалылар белгілер деп аталады (белгілер векторына біріктіріледі), ал болжауға болатын мүмкін санаттар – сыныптар. Басқа салалар әртүрлі терминологияны қолдануы мүмкін: мысалы, қоғамдық экологияда «жіктеу» термині әдетте кластерлік талдауды білдіреді.

Басқа проблемалармен байланысы

Классификация және кластерлеу – үлгілерді танудың жалпы проблемасының мысалдары, яғни берілген кіріс мәніне белгілі бір шығыс мәнін беру. Басқа мысалдар: регрессия, ол әрбір кіріске нақты сандық шығысты тағайындайды; мәндер тізбегінің әрбір мүшесіне сынып тағайындайтын тізбектік белгілеу (мысалы, сөздердің сөз тіркесіндегі рөлін анықтау, ол кіріс сөйлемдегі әрбір сөзге сөз тіркесінің бөлігін тағайындайды); синтаксистік құрылымын сипаттайтын талдау ағашын кіріс сөйлемге тағайындайтын талдау және т.б. Классификацияның маңызды бір тармағы – ықтималдық классификация. Осы сипаттағы алгоритмдер статистикалық қорытындыны қолданып, берілген мысал үшін ең жақсы сыныпты анықтайды. Басқа алгоритмдерден айырмашылығы, олар жай ғана "ең жақсы" сыныпты шығарады, ал ықтималдық алгоритмдер мысалдың мүмкін болатын әрбір сыныпқа жататын ықтималдығын шығарады. Ең жақсы сынып әдетте ең жоғары ықтималдығы бар сынып ретінде таңдалады. Дегенмен, мұндай алгоритмнің ықтималдық емес классификаторларға қарағанда көптеген артықшылықтары бар: ол өзінің таңдауына байланысты сенімділік деңгейін көрсете алады (әдетте, мұны жасай алатын классификатор сенімділік салмақты классификатор деп аталады). Сәйкесінше, егер кез келген нақты шығысты таңдау сенімділігі тым төмен болса, ол шешім қабылдаудан бас тарта алады. Ықтималдық классификаторлардың тудыратын ықтималдықтарының арқасында оларды үлкен машиналық оқыту міндеттеріне тиімдірек интеграциялауға болады, бұл қателердің таралуының алдын алуға көмектеседі.

Жиіліктілік процедуралары

Статистикалық жіктеу саласындағы алғашқы жұмыстарды Фишер екі топтық мәселелер аясында жүргізді, нәтижесінде Фишердің сызықтық ажырату функциясы жаңа деректерді топқа жіктеу ережесі ретінде пайда болды. Бұл ертедегі жұмыс екі топтың әрқайсысындағы деректердің көпөлшемді қалыпты үлестірімге ие екенін болжады. Осы мәселені екі топтан артық топтарға кеңейту де қарастырылды, бірақ жіктеу ережесі сызықтық болуы керек деген шектеу қойылды. Кейінірек, көпөлшемді қалыпты үлестірімге қатысты жұмыстар жіктегішке сызықтық емес болуға мүмкіндік берді: Махаланобис қашықтығының әртүрлі түзетулеріне негізделген бірнеше жіктеу ережелерін жасауға болады, сонда жаңа деректер ортасынан ең аз түзетілген қашықтықта орналасқан топқа жіктеледі.

Бейес әдістері

Фреквентистік процедуралардан өзгеше, Байес классификациясы процедуралары жалпы популяциядағы әртүрлі топтардың салыстырмалы көлемі туралы барлық қолжетімді ақпаратты ескерудің табиғи жолын ұсынады. Байес процедуралары есептеулер тұрғысынан шығынды болуы мүмкін, және Марков тізбегі Монте-Карло есептеулері ойдағыдай жасалмаған кезде, Байес кластерлеу ережелері үшін жуықтаулар жасалған. Кейбір Байес процедуралары топқа жататындық ықтималдығын есептеуді қамтиды: бұл жаңа бақылаудың әрқайсысына бір ғана топ атауын беруге қарағанда, көбірек мәлімет беретін нәтиже.

Бинарлық және көп класты жіктеу

Классификацияны екі бөлек мәселе ретінде қарастыруға болады: екі класты және көп класты классификация. Екі класты классификацияда, жақсы түсінілетін міндетте, тек екі класс қатысады, ал көп класты классификацияда объектіні бірнеше класс ішіндегі біреуіне жатқызу қажет. Көптеген классификация әдістері екі класты классификация үшін арнайы жасалғандықтан, көп класты классификация көбінесе бірнеше екі класты классификаторды біріктіріп қолдануды қажет етеді.

Өзіндік векторлары

Көптеген алгоритмдер жеке инстанцияны сипаттайды, оның санатын инстанцияның жеке, өлшенетін қасиеттерінің ерекшелік векторы арқылы болжауға болады. Әрбір қасиет ерекшелік деп аталады, сондай-ақ статистикада түсіндірмелі айнымалы (немесе тәуелсіз айнымалы) ретінде белгілі, бірақ ерекшеліктер статистикалық түрде тәуелді немесе тәуелсіз болуы мүмкін. Ерекшеліктер әртүрлі болуы мүмкін: екілік (мысалы, "қосулы" немесе "өшірулі"); санаттық (мысалы, қан тобы үшін "А", "В", "АВ" немесе "О"); реттік (мысалы, "ірі", "орташа" немесе "кішкентай"); бүтін санмен берілген (мысалы, электрондық поштадағы нақты бір сөздің кездесу саны); немесе нақты санмен берілген (мысалы, қан қысымын өлшеу). Егер инстанция сурет болса, ерекшелік мәндері суреттегі пиксельдерге сәйкес келуі мүмкін; егер инстанция мәтін болса, ерекшелік мәндері әртүрлі сөздердің жиілігін көрсетуі мүмкін. Кейбір алгоритмдер тек дискретті деректермен жұмыс істейді және нақты санмен немесе бүтін санмен берілген деректерді топтарға бөлуді (мысалы, 5-тен аз, 5-тен 10-ға дейін немесе 10-нан жоғары) талап етеді.

Алгоритмдер

Барлық деректер жиынтығына бір ғана жіктеу түрі жарамсыз болғандықтан, кең түрлі жіктеу алгоритмдерінің жиынтығы жасалған. Ең көп қолданылатындары:

Бағалау

Классификатордың өнімділігі жіктелетін деректердің ерекшеліктеріне үлкен дәрежеде байланысты. Барлық берілген мәселелерде ең жақсы жұмыс істейтін жалғыз классификатор жоқ (бұл құбылыс «тегін түскі ас жоқ» теоремасымен түсіндірілуі мүмкін). Классификаторлардың өнімділігін салыстыру және классификатордың өнімділігін анықтайтын деректердің қасиеттерін анықтау үшін әртүрлі эмпирикалық тесттер жүргізілді. Дегенмен, нақты бір мәселе үшін қолайлы классификаторды анықтау – ғылымнан гөрі көбінесе өнерге жатады. Дәлдік және толықтық көрсеткіштері – классификация жүйесінің сапасын бағалау үшін қолданылатын танымал метрикалар. Жақында, қабылдаушы операциялық сипаттамалық (ROC) қисықтары классификация алгоритмдерінің дұрыс және жалған оң көрсеткіштері арасындағы тепе-тәуелділікті бағалау үшін қолданыла бастады. Өнімділік метрикасы ретінде, белгісіздік коэффициенті қарапайым дәлдікке қарағанда артықшылыққа ие, себебі ол әртүрлі сыныптардың салыстырмалы мөлшеріне тәуелді емес. Бұдан әрі, ол сыныптарды жай ғана қайта реттегені үшін алгоритмді жазаламайды.