Кіріспе

Мүмкін болатын шектеулі мәндерді қабылдай алатын айнымалы. Статистикада, санаттық айнымалы (сонымен қатар сапалық айнымалы деп те аталады) – бұл шектеулі және әдетте белгілі бір саны бар мүмкін мәндердің біреуін қабылдай алатын айнымалы, соның нәтижесінде әрбір жеке тұлға немесе басқа байқау бірлігі белгілі бір топқа немесе номиналды санатқа жатады. Компьютер ғылымында және математиканың кейбір салаларында санаттық айнымалылар санамалар немесе санамалы типтер деп аталады. Көбінесе (бірақ осы мақалада емес), санаттық айнымалының кез келген мүмкін мәні деңгей деп аталады. Кездейсоқ санаттық айнымалымен байланысты ықтималдық таралуы санаттық таралу деп аталады. Санаттық деректер – бұл санаттық айнымалылардан немесе осы формаға түрлендірілген деректерден тұратын статистикалық деректер түрі, мысалы, топтастырылған деректер. Нақтырақ айтқанда, санаттық деректер сапалық деректерді санау немесе кестеге түсіру арқылы жинақталған байқаулардан немесе белгілі интервалдарда топтастырылған сандық деректерді байқаудан алынуы мүмкін. Көбінесе, таза санаттық деректер контингенттік кесте түрінде жинақталады. Алайда, әсіресе деректерді талдау кезінде, "санаттық деректер" термині кейбір санаттық айнымалыларды қамтитын, сонымен қатар санаттық емес айнымалыларды да қамтитын дерек жиынтықтарына қолданылады. Дәл екі мәнді қабылдай алатын санаттық айнымалы екілік немесе дихотомиялық айнымалы деп аталады; Бернулли айнымалы – маңызды ерекше жағдай. Екіден астам мүмкін мәні бар санаттық айнымалылар политомиялық айнымалылар деп аталады; әдетте, санаттық айнымалылар политомиялық деп есептеледі, егер басқаша көрсетілмесе. Дискреттеу – үздіксіз деректерді санаттық деректер ретінде қарау. Дихотомизация – үздіксіз деректерді немесе политомиялық айнымалыларды екілік айнымалылар ретінде қарау. Регрессиялық талдау көбінесе санатқа жататын мүшелікті бір немесе бірнеше сандық фиктивті айнымалылар арқылы қарастырады.

Нөмірлік

Статистикалық өңдеуді жеңілдету үшін категориялық айнымалыларға сандық индекстер тағайындалуы мүмкін, мысалы, K-жолды категориялық айнымалы үшін 1-ден K-ға дейін (яғни, дәл K мүмкін мәнді қабылдайтын айнымалы). Дегенмен, әдетте, бұл сандар кездейсоқ болып табылады және нақты бір мәнді көрсетуден басқа ешқандай мағынасы жоқ, тек белгілі бір мәнге ыңғайлы атау беруге мүмкіндік береді. Басқаша айтқанда, категориялық айнымалыдағы мәндер номинативтік шкалада орналасқан: олардың әрқайсысы логикалық жағынан бөлек түсініктерді білдіреді, міндетті түрде реттелмейді және сандармен сияқты манипуляцияланбайды. Оның орнына, эквиваленттілік, жиынға жату және басқа жиынға қатысты операциялар қолданылады. Осының салдарынан, категориялық айнымалылар жиынының орташа тенденциясы оның модасымен анықталады; орташа және медиана анықталмайды. Мысалы, адамдар жиыны болғанда, олардың тегіне сәйкес келетін категориялық айнымалылар жиынын қарастыруға болады. Біз эквиваленттілік (екі адамның тегі бірдей ме), жиынға жату (адамның аты белгілі бір тізімде бар ма), санау (қанша адамның тегі бірдей) немесе моданы табу (қай есім жиі кездеседі) сияқты операцияларды қарастыра аламыз. Алайда, Смит + Джонсонның "қосындысын" есептеуге немесе Смит Джонсоннан "кем" немесе "көп" екенін сұрауға болмайды. Осының нәтижесінде, атаулар жиынында "орташа есім" (орташа) немесе "ортаңғы есім" (медиана) қандай екенін сұраудың мәні жоқ. Бұл әліпбилік реттілік ұғымын ескермейді, ол атаулардың өзінде емес, оларды құру тәсіліндегі қасиет. Мысалы, егер есімдерді кириллицада жазып, әріптердің кириллицалық ретін қарастырсақ, "Смит < Джонсон" бағалаудың нәтижесі латын әліпбиінде жазылғандағы нәтижеден өзгеше болуы мүмкін; ал егер есімдерді қытай иероглифтерімен жазсақ, "Смит < Джонсон" бағалауға мүлдем болмайды, өйткені мұндай иероглифтер үшін тұрақты рет анықталмаған. Алайда, егер есімдерді жазылған күйінде, мысалы, латын әліпбиінде қарастырып, стандартты әліпбилік реттілікке сәйкес реттілікті анықтасақ, онда оларды реттік шкалада анықталған реттік айнымалыларға айналдырған боламыз.

Мүмкін мәндер саны

Категориялық кездейсоқ айнымалылар әдетте статистикалық тұрғыдан категориялық үлестіру арқылы сипатталады, бұл кез келген K жолды категориялық айнымалыны K мүмкін нәтижелердің әрқайсысы үшін жеке көрсетілген ықтималдықтармен өрнектеуге мүмкіндік береді. Мұндай көп санатты категориялық айнымалылар көбінесе әртүрлі санаттардың пайда болу жиілігінің әр мүмкін комбинациясын есептейтін мультиномиалдық үлестіруді қолдана отырып талданады. Категориялық нәтижелер бойынша регрессиялық талдау мультиномиалдық логистикалық регрессия, мультиномиалдық пробит немесе дискретті таңдау моделінің ұқсас түрі арқылы жүзеге асырылады. Екі ғана мүмкін нәтижеге ие болатын категориялық айнымалылар (мысалы, "иә" мен "жоқ" немесе "жетістік" пен "жетіспеушілік") екілік айнымалылар (немесе Бернулли айнымалылары) деп аталады. Маңыздылығына байланысты, бұл айнымалылар көбінесе жеке категория ретінде қарастырылады, оларға бөлек үлестіру (Бернулли үлестіруі) және бөлек регрессия модельдері (логистикалық регрессия, пробит регрессиясы және т.б.) тән. Нәтижесінде, "категориялық айнымалы" термині көбінесе 3 немесе одан көп нәтижеге ие жағдайлар үшін резервтеледі, кейде екілік айнымалыға қарама-қарсы көп жолды айнымалы деп аталады. Сондай-ақ, санаттардың саны алдын ала белгіленбеген жағдайларда категориялық айнымалыларды қарастыруға болады. Мысалы, белгілі бір сөзді сипаттайтын категориялық айнымалы үшін біз сөздіктің көлемін алдын ала білмеуіміз мүмкін, және әлі кездеспеген сөздерді кездестіру мүмкіндігін ескеруіміз қажет. Категориялық үлестіру мен мультиномиалдық логистикалық регрессияны қамтитын стандартты статистикалық модельдер санаттардың саны алдын ала белгілі деп есептейді, ал санаттардың санын өзгерту қиынға түседі. Мұндай жағдайларда, одан да жетілдірілген техникаларды қолдану қажет. Мысалы, Дирихле процесі, ол параметрлік емес статистика саласына жатады. Мұндай жағдайда, санаттардың шексіз саны бар деп логикалық тұрғыдан болжанады, бірақ кез келген уақытта олардың көпшілігі (іс жүзінде, шекті санды қоспағанда) ешқашан көрінбеген. Барлық формулалар осы уақытқа дейін нақты көрінген санаттардың саны тұрғысынан беріледі, (шексіз) әлеуетті санаттардың жалпы саны емес, және статистикалық үлестірулерді біртіндеп жаңарту әдістері жасалады, соның ішінде "жаңа" санаттарды қосу.

Құпиялылық кодтамасы

Ақылсыз кодтау – бұл бұрынғы кодтау жүйелерінде қолданылған "0", "1" және "-1" сандарының орнына кездейсоқ мәндерді қолдану жағдайында пайда болады. Бұл әдіс айнымалылардың дұрыс орташа мәнін бере алғанымен, ақылсыз кодтауды қолдануға кеңес берілмейді, себебі ол түсіндіруге қиын статистикалық нәтижелерге алып келуі мүмкін.

Тіркелгендер

Көшірулер – категориялық мәндерді төмен өлшемді нақты (кейде кешенді) векторлық кеңістікке түрлендіру, әдетте, мұндайда ұқсас мәндерге ұқсас векторлар сәйкес келеді, немесе векторларды тиісті қолданыс үшін пайдалы ететін белгілі бір критерийлерге қарай жасалады. Көбінесе кездесетін ерекше жағдай – сөздік көшірулер, онда категориялық айнымалының мүмкін мәндері тілдегі сөздер болып табылады, ал мәгіналары жақын сөздерге ұқсас векторлар беріледі.

Өзара әрекеттесулер

Үш немесе одан көп айнымалылардың арақатынасын қарастырғанда өзара әсерлесу туындауы мүмкін, бұл екі айнымалының үшінші айнымалыға бірдей әсерінің қосымша болмайтын жағдайды сипаттайды. Өзара әсерлесулер категориялық айнымалылармен екі түрде кездесе алады: категориялық айнымалылардың өзара әрекеттесуі немесе категориялық және үздіксіз айнымалылардың өзара әрекеттесуі.

Категориялық түрлендіргіш өзара әрекеттесулері бойынша

Бұл типтегі өзара әрекеттесу екі категориялық айнымалы болғанда туындайды. Мұндай өзара әрекеттесуді зерттеу үшін зерттеушінің гипотезасына ең сәйкес келетін кодтау жүйесі қолданылады. Кодтардың көбейтіндісі өзара әрекеттесуді анықтайды. Содан кейін b мәні есептеліп, өзара әрекеттесудің маңыздылығы бағаланады.

Үздіксіз өзгермелі өзара әрекеттесулер бойынша категорикалық

Қарапайым еңіс талдауы – регрессияда қолданылатын, өзара әсерлесуді талдау үшін ANOVA-дағы қарапайым әсерлер талдауына ұқсас, кең таралған пост-хок тест. Бұл тестте біз бір тәуелсіз айнымалының екінші тәуелсіз айнымалының нақты мәндеріндегі қарапайым еңісін зерттейміз. Мұндай тест үздіксіз айнымалылармен ғана шектелмейді, тәуелсіз айнымалы категориялық болған кезде де қолданылуы мүмкін. Деректердің номиналды сипатынан (яғни, үздіксіз айнымалы жағдайында деректерді жоғары, орташа және төмен деңгейлерде талдауға болады, орташадан 1 стандарттық қате жоғары, орташада және орташадан 1 стандарттық қате төмен мәндерін тағайындауға болады) өзара әсерлесуді тексеру үшін мәндерді үздіксіз айнымалы жағдайындағыдай еркін таңдауға болмайды. Категориялық жағдайда біз қарапайым еңісті зерттеу үшін әрбір топ үшін қарапайым регрессия теңдеуін қолданамыз. Қарапайым еңіс талдауында деректерді түсіндіруді жеңілдету үшін айнымалыларды стандарттау немесе центртеу жиі қолданылады; алайда, категориялық айнымалыларды стандарттауға немесе центртеуге болмайды. Бұл тестті барлық кодтау жүйелерімен қолдануға болады.