Кіріспе
Статистиканы пайдалану арқылы деректерді жіктеу. Статистикада жіктеу – байқаудың (немесе байқаулардың) нақты бір санатқа (қосалқы популяцияларға) жататынын анықтау мәселесі. Мысалы, белгілі бір электрондық поштаны «спам» немесе «спам емес» класына жатқызу, немесе науқастың байқалған ерекшеліктері (жынысы, қан қысымы, белгілі бір симптомдардың болуы немесе болмауы және т.б.) негізінде науқасқа диагноз қою. Көбінесе жеке байқаулар сандық сипаттамалар жиынтығына дейін талданады, олар түрлі түсіндірме айнымалылар немесе белгілер деп аталады. Бұл қасиеттер әртүрлі болуы мүмкін (мысалы, қан тобы үшін «A», «B», «AB» немесе «O»), реттік (мысалы, «ірі», «орташа» немесе «кішкентай»), бүтін санмен өлшенетін (мысалы, электрондық поштадағы белгілі бір сөздің қайталану саны) немесе нақты санмен өлшенетін (мысалы, қан қысымын өлшеу) болады. Басқа жіктегіштер ұқсастық немесе қашықтық функциясын пайдаланып, байқауларды бұрынғы байқаулармен салыстыру арқылы жұмыс істейді. Жіктеуді жүзеге асыратын алгоритм, әсіресе нақты іске асыру кезінде, жіктегіш деп аталады. «Жіктегіш» термині кейде кіріс деректерін санатқа бейімдейтін жіктеу алгоритмімен іске асырылатын математикалық функцияны да білдіреді. Салалар бойынша терминология өте әртүрлі. Статистикада, жіктеу көбінесе логистикалық регрессия немесе осыған ұқсас процедура арқылы жасалатын болса, байқаулардың қасиеттері түсіндірме айнымалылар (немесе тәуелсіз айнымалылар, регрессорлар және т.б.) деп аталады, ал болжауға тиіс санаттар нәтижелер деп аталады, олар тәуелді айнымалының мүмкін мәндері болып саналады. Машиналық оқытуда байқаулар көбінесе мысалдар деп аталады, түсіндірме айнымалылар белгілер деп аталады (белгілер векторына біріктіріледі), ал болжауға болатын мүмкін санаттар – сыныптар. Басқа салалар әртүрлі терминологияны қолдануы мүмкін: мысалы, қоғамдық экологияда «жіктеу» термині әдетте кластерлік талдауды білдіреді.
In statistics, classification is the problem of identifying which of a set of categories (sub populations) an observation (or observations) belongs to. Examples are assigning a given email to the "spam" or "non spam" class, and assigning a diagnosis to a given patient based on observed characteristics of the patient (sex, blood pressure, presence or absence of certain symptoms, etc.). Often, the individual observations are analyzed into a set of quantifiable properties, known variously as explanatory variables or features. These properties may variously be categorical (e. g. "A", "B", "AB" or "O", for blood type), ordinal (e. g. "large", "medium" or "small"), integer valued (e. g. the number of occurrences of a particular word in an email) or real valued (e. g. a measurement of blood pressure). Other classifiers work by comparing observations to previous observations by means of a similarity or distance function. An algorithm that implements classification, especially in a concrete implementation, is known as a classifier. The term "classifier" sometimes also refers to the mathematical function, implemented by a classification algorithm, that maps input data to a category. Terminology across fields is quite varied. In statistics, where classification is often done with logistic regression or a similar procedure, the properties of observations are termed explanatory variables (or independent variables, regressors, etc. ), and the categories to be predicted are known as outcomes, which are considered to be possible values of the dependent variable. In machine learning, the observations are often known as instances, the explanatory variables are termed features (grouped into a feature vector), and the possible categories to be predicted are classes. Other fields may use different terminology: e. g. in community ecology, the term "classification" normally refers to cluster analysis.
Басқа проблемалармен байланысы
Классификация және кластерлеу – үлгілерді танудың жалпы проблемасының мысалдары, яғни берілген кіріс мәніне белгілі бір шығыс мәнін беру. Басқа мысалдар: регрессия, ол әрбір кіріске нақты сандық шығысты тағайындайды; мәндер тізбегінің әрбір мүшесіне сынып тағайындайтын тізбектік белгілеу (мысалы, сөздердің сөз тіркесіндегі рөлін анықтау, ол кіріс сөйлемдегі әрбір сөзге сөз тіркесінің бөлігін тағайындайды); синтаксистік құрылымын сипаттайтын талдау ағашын кіріс сөйлемге тағайындайтын талдау және т.б. Классификацияның маңызды бір тармағы – ықтималдық классификация. Осы сипаттағы алгоритмдер статистикалық қорытындыны қолданып, берілген мысал үшін ең жақсы сыныпты анықтайды. Басқа алгоритмдерден айырмашылығы, олар жай ғана "ең жақсы" сыныпты шығарады, ал ықтималдық алгоритмдер мысалдың мүмкін болатын әрбір сыныпқа жататын ықтималдығын шығарады. Ең жақсы сынып әдетте ең жоғары ықтималдығы бар сынып ретінде таңдалады. Дегенмен, мұндай алгоритмнің ықтималдық емес классификаторларға қарағанда көптеген артықшылықтары бар: ол өзінің таңдауына байланысты сенімділік деңгейін көрсете алады (әдетте, мұны жасай алатын классификатор сенімділік салмақты классификатор деп аталады). Сәйкесінше, егер кез келген нақты шығысты таңдау сенімділігі тым төмен болса, ол шешім қабылдаудан бас тарта алады. Ықтималдық классификаторлардың тудыратын ықтималдықтарының арқасында оларды үлкен машиналық оқыту міндеттеріне тиімдірек интеграциялауға болады, бұл қателердің таралуының алдын алуға көмектеседі.
It can output a confidence value associated with its choice (in general, a classifier that can do this is known as a confidence weighted classifier). Correspondingly, it can abstain when its confidence of choosing any particular output is too low. Because of the probabilities which are generated, probabilistic classifiers can be more effectively incorporated into larger machine learning tasks, in a way that partially or completely avoids the problem of error propagation.
Жиіліктілік процедуралары
Статистикалық жіктеу саласындағы алғашқы жұмыстарды Фишер екі топтық мәселелер аясында жүргізді, нәтижесінде Фишердің сызықтық ажырату функциясы жаңа деректерді топқа жіктеу ережесі ретінде пайда болды. Бұл ертедегі жұмыс екі топтың әрқайсысындағы деректердің көпөлшемді қалыпты үлестірімге ие екенін болжады. Осы мәселені екі топтан артық топтарға кеңейту де қарастырылды, бірақ жіктеу ережесі сызықтық болуы керек деген шектеу қойылды. Кейінірек, көпөлшемді қалыпты үлестірімге қатысты жұмыстар жіктегішке сызықтық емес болуға мүмкіндік берді: Махаланобис қашықтығының әртүрлі түзетулеріне негізделген бірнеше жіктеу ережелерін жасауға болады, сонда жаңа деректер ортасынан ең аз түзетілген қашықтықта орналасқан топқа жіктеледі.
Бейес әдістері
Фреквентистік процедуралардан өзгеше, Байес классификациясы процедуралары жалпы популяциядағы әртүрлі топтардың салыстырмалы көлемі туралы барлық қолжетімді ақпаратты ескерудің табиғи жолын ұсынады. Байес процедуралары есептеулер тұрғысынан шығынды болуы мүмкін, және Марков тізбегі Монте-Карло есептеулері ойдағыдай жасалмаған кезде, Байес кластерлеу ережелері үшін жуықтаулар жасалған. Кейбір Байес процедуралары топқа жататындық ықтималдығын есептеуді қамтиды: бұл жаңа бақылаудың әрқайсысына бір ғана топ атауын беруге қарағанда, көбірек мәлімет беретін нәтиже.
Бинарлық және көп класты жіктеу
Классификацияны екі бөлек мәселе ретінде қарастыруға болады: екі класты және көп класты классификация. Екі класты классификацияда, жақсы түсінілетін міндетте, тек екі класс қатысады, ал көп класты классификацияда объектіні бірнеше класс ішіндегі біреуіне жатқызу қажет. Көптеген классификация әдістері екі класты классификация үшін арнайы жасалғандықтан, көп класты классификация көбінесе бірнеше екі класты классификаторды біріктіріп қолдануды қажет етеді.
Өзіндік векторлары
Көптеген алгоритмдер жеке инстанцияны сипаттайды, оның санатын инстанцияның жеке, өлшенетін қасиеттерінің ерекшелік векторы арқылы болжауға болады. Әрбір қасиет ерекшелік деп аталады, сондай-ақ статистикада түсіндірмелі айнымалы (немесе тәуелсіз айнымалы) ретінде белгілі, бірақ ерекшеліктер статистикалық түрде тәуелді немесе тәуелсіз болуы мүмкін. Ерекшеліктер әртүрлі болуы мүмкін: екілік (мысалы, "қосулы" немесе "өшірулі"); санаттық (мысалы, қан тобы үшін "А", "В", "АВ" немесе "О"); реттік (мысалы, "ірі", "орташа" немесе "кішкентай"); бүтін санмен берілген (мысалы, электрондық поштадағы нақты бір сөздің кездесу саны); немесе нақты санмен берілген (мысалы, қан қысымын өлшеу). Егер инстанция сурет болса, ерекшелік мәндері суреттегі пиксельдерге сәйкес келуі мүмкін; егер инстанция мәтін болса, ерекшелік мәндері әртүрлі сөздердің жиілігін көрсетуі мүмкін. Кейбір алгоритмдер тек дискретті деректермен жұмыс істейді және нақты санмен немесе бүтін санмен берілген деректерді топтарға бөлуді (мысалы, 5-тен аз, 5-тен 10-ға дейін немесе 10-нан жоғары) талап етеді.
Алгоритмдер
Барлық деректер жиынтығына бір ғана жіктеу түрі жарамсыз болғандықтан, кең түрлі жіктеу алгоритмдерінің жиынтығы жасалған. Ең көп қолданылатындары:
Бағалау
Классификатордың өнімділігі жіктелетін деректердің ерекшеліктеріне үлкен дәрежеде байланысты. Барлық берілген мәселелерде ең жақсы жұмыс істейтін жалғыз классификатор жоқ (бұл құбылыс «тегін түскі ас жоқ» теоремасымен түсіндірілуі мүмкін). Классификаторлардың өнімділігін салыстыру және классификатордың өнімділігін анықтайтын деректердің қасиеттерін анықтау үшін әртүрлі эмпирикалық тесттер жүргізілді. Дегенмен, нақты бір мәселе үшін қолайлы классификаторды анықтау – ғылымнан гөрі көбінесе өнерге жатады. Дәлдік және толықтық көрсеткіштері – классификация жүйесінің сапасын бағалау үшін қолданылатын танымал метрикалар. Жақында, қабылдаушы операциялық сипаттамалық (ROC) қисықтары классификация алгоритмдерінің дұрыс және жалған оң көрсеткіштері арасындағы тепе-тәуелділікті бағалау үшін қолданыла бастады. Өнімділік метрикасы ретінде, белгісіздік коэффициенті қарапайым дәлдікке қарағанда артықшылыққа ие, себебі ол әртүрлі сыныптардың салыстырмалы мөлшеріне тәуелді емес. Бұдан әрі, ол сыныптарды жай ғана қайта реттегені үшін алгоритмді жазаламайды.