Кіріспе

Статистикадағы іріктеу әдістемесі

Статистикада кластерлік іріктеу – статистикалық популяцияда өзара біртекті, бірақ ішінде әртүрлілік болатын топтар байқалғанда қолданылатын іріктеу жоспары. Ол көбінесе маркетингтік зерттеулерде қолданылады. Осы іріктеу жоспарындағы барлық популяция осы топтарға (кластерлер деп аталады) бөлінеді және топтардың қарапайым кездейсоқ үлгісі таңдалады. Содан кейін әр кластердегі элементтер іріктелді. Егер іріктелген әр кластердегі барлық элементтер іріктелсе, онда бұл "бір кезеңді" кластерлік іріктеу жоспары деп аталады. Егер осы топтардың әрқайсысынан элементтердің қарапайым кездейсоқ ішінамасы таңдалса, онда бұл "екі сатылы" кластерлік іріктеу жоспары деп аталады. Кластерлік іріктеуді қолданудың басты себебі – қажетті дәлдікті сақтай отырып, жалпы сұхбаттар санын және шығындарды азайту. Белгілі бір үлгі көлемі үшін, күтілетін кездейсоқ қате, популяциядағы айырмашылықтың көп бөлігі топтар арасында емес, топтардың ішінде болған кезде кішірек болады.

Кластерлік элементтік

Кластердегі халық мүмкіндігінше әртүрлі болуы керек, бірақ кластерлер арасында біртектілік болуы тиіс. Әрбір кластер жалпы халықтың кіші масштабтағы көрінісі болуы керек. Кластерлер бір-бірінен тәуелсіз және барлық халықты қамтуы тиіс. Зерттеуге қай кластерлерді қосу керектігін анықтау үшін тиісті кластерлердің кез келгені үшін кездейсоқ іріктеу әдісі қолданылады. Бір сатылы кластерлік іріктеуде таңдалған кластерлердің әрқайсысынан барлық элементтер іріктеледі. Екі сатылы кластерлік іріктеуде таңдалған кластерлердің әрқайсысынан алынған элементтерге кездейсоқ іріктеу әдісі қолданылады. Кластерлік іріктеу мен стратификацияланған іріктеудің басты айырмашылығы – кластерлік іріктеуде кластер іріктеу бірлігі ретінде қарастырылады, сондықтан іріктеу кластерлер тобында (кем дегенде бірінші сатыда) жүргізіледі. Стратификацияланған іріктеуде іріктеу әрбір стратаның ішіндегі элементтер арасында жүргізіледі. Стратификацияланған іріктеуде әрбір стратадан кездейсоқ үлгі алынады, ал кластерлік іріктеуде тек таңдалған кластерлер іріктеледі. Кластерлік іріктеуді қолданудың басты себебі – іріктеу тиімділігін арттыру арқылы шығындарды азайту. Бұл стратификацияланған іріктеуден өзгеше, ондағы мақсат – дәлдікті арттыру. Сондай-ақ, кластерлерден элементтерді іріктеу үшін кем дегенде екі сатыны қамтитын көп сатылы кластерлік іріктеу де бар.

Топтамалардың көлемі әр түрлі болғанда

Саналған параметрді өзгертпей, кластерлік сынамалау кластерлер шамамен бірдей мөлшерде болған кезде бөгде жағдайға түспейді. Бұл жағдайда параметр барлық таңдалған кластерлерді біріктіру арқылы есептеледі. Кластерлер әр түрлі мөлшерде болған кезде бірнеше нұсқа бар: Бір әдіс – кластерлерді іріктеу, содан кейін сол кластердегі барлық элементтерді зерттеу. Тағы бір әдіс – екі кезеңді әдіс, таңдалған кластерлердің әрқайсысынан бірліктердің белгіленген үлесін (құнға байланысты 5% немесе 50% немесе басқа сан) іріктеу. Осы нұсқалардан алынған үлгіге сүйенсек, бөгде бағалаушы шығады. Алайда, үлгі көлемі алдын ала белгіленбейді. Бұл бағалаушының стандартты қатесі үшін күрделі формулаға, сондай-ақ зерттеу жоспарының түсініктілігімен байланысты мәселелерге әкеледі (өйткені қуаттылық талдауы мен шығындарды бағалау көбінесе нақты үлгі өлшеміне қатысты). Үшінші мүмкін шешім – мөлшеріне пропорционалды ықтималдықты пайдалану. Осы үлгі алу жоспарында кластерді таңдау ықтималдығы оның көлеміне пропорционалды, сондықтан үлкен кластердің іріктеу ықтималдығы кішкентай кластерге қарағанда жоғары. Бұл жердегі артықшылығы – кластерлер іріктеудің ықтималдық мөлшерімен пропорционалды түрде таңдалған кезде, әрбір іріктелген кластерде сұхбат алудың бірдей саны жүргізілуі керек, сондықтан әрбір іріктелген бірлік іріктеудің бірдей ықтималдығына ие болады.

Кластерлік сынама алудың қолданылуы

Кластерлік іріктеудің мысалы – аумақтық іріктеу немесе географиялық кластерлік іріктеу. Әрбір кластер – аумақтық үлгі алу тізіміндегі географиялық аймақ. Географиялық тұрғыдан шашыраңқы орналасқан халықты зерттеу қымбатқа түсетіндіктен, жергілікті аумақта бірнеше респондентті кластерге біріктіру арқылы қарапайым кездейсоқ іріктеуге қарағанда үлкен экономияға қол жеткізуге болады. Бағалаудың дәлдігін сақтау үшін жалпы үлгі көлемін арттыру қажет болуы мүмкін, бірақ шығындарды үнемдеу мұндай үлгі көлемінің өсуін мүмкін етеді. Халық санағын ұйымдастыру үшін әдеттегі бірінші қадам – барлық географиялық аумақты санақ аудандарына немесе далалық жұмысты ұйымдастыру үшін санақ учаскелеріне бөлу. Санақ аудандары көптеген түрдегі зерттеулерде кластерлік іріктеудің бірінші кезеңдік бірліктері ретінде де пайдалы болуы мүмкін. Халық санағы ескірген жағдайда, жеке тұлғалардың тізімін әлеуметтік-экономикалық зерттеу үшін үлгі алу тізімі ретінде тікелей пайдалануға болмайды. Бүкіл санақты жаңарту экономикалық тұрғыдан орынсыз. Жақсы балама – ескі санақ аудандарын сақтап, қала маңындағы сияқты өте динамикалық аудандарда жаңартулар жасау, санақ аудандарының үлгісін таңдау және таңдалған санақ аудандарындағы жеке тұлғалар немесе үй шаруашылықтарының тізімін жаңарту. Кластерлік іріктеу соғыстар, ашаршылықтар және табиғи апаттар сияқты жағдайлардағы төмен өлім-жітімді бағалау үшін қолданылады.

Балық шаруашылығы ғылымы

Балық популяциясынан жай кездейсоқ үлгі алуға жақындасқанша мүмкін емес, ол үшін жеке балықтарды жеке-жеке және кездейсоқ түрде ұстау қажет болар еді. Мұның себебі, балық аулау құралдары балықтарды топтап (немесе кластерлермен) ұстайды. Коммерциялық балық аулауда үлгі алу кезінде теңізде жұмыс істеуге кеткен шығын көбінесе жеке және кездейсоқ түрде аулауларды таңдауға мүмкіндік бермейді. Сондықтан, бақылаулар кеме немесе балық аулау сапары бойынша одан әрі топтастырылады.

Артықшылықтар

Басқа үлгі алу жоспарларына қарағанда арзан болуы мүмкін, мысалы, жол шығындары мен басқару шығындары азаяды. Іске асырылу мүмкіндігі: Бұл үлгі алу жоспары ірі популяцияларды ескереді. Осы топтардың өте шағын болуына байланысты, басқа үлгі алу жоспарын қолдану өте қымбатқа түседі. Экономикалық тиімділік: Бұл әдісте шығындардың екі маңызды мәселесі – саяхат және тізімдеу едәуір төмендейді. Мысалы, қаладағы әрбір үй шаруашылығы туралы зерттеу ақпаратын жинау өте қымбатқа түседі, ал қаланың түрлі аймақтары туралы ақпаратты жинау экономикалық жағынан тиімдірек болады. Мұнда саяхат және тізімдеу жұмыстары күрт азаяды. Өзгергіштіктің төмендеуі: егер кластер ішіндегі объектілер арасында теріс кластерлік корреляция сирек кездессе, кластерлік үлгі алу арқылы алынған бағалаулар қарапайым кездейсоқ үлгі алудан алынған деректерге қарағанда дәлірек нәтиже береді (яғни, жобалау эффектісі 1-ден жоғары болады). Бұл жиі кездеспейтін жағдай. Негізгі қолданылуы: Егер барлық элементтердің үлгі алу тізімі қолжетімді болмаса, кластерлік үлгі алуға ғана жүгінуге болады.

Кемшіліктер

Үлгілеудегі қателік жоғары болса, оны жобалау әсері арқылы көрсетуге болады: кластерлік зерттеу үлгілерінен алынған бағалаушының дисперсиясы мен, дәл сондай сенімді, кездейсоқ таңдамадан алынған, бірақ кластерленбеген зерттеудегі субъектілер үлгісінен алынған бағалаушының дисперсиясы арасындағы қатынас. Кластер ішіндегі субъектілер арасындағы кластерлік корреляция неғұрлым жоғары болса, жобалау әсері де соғұрлым нашарлайды (яғни, 1-ден үлкен мәнге жетеді). Бұл бағалаушының дисперсиясының күтілетін өсуін көрсетеді. Басқаша айтқанда, кластерлер арасындағы әртүрлілік пен кластер ішіндегі субъектілер арасындағы біртектілік неғұрлым көп болса, бағалаушылардың дәлдігі төмендейді. Өйткені мұндай жағдайларда, мүмкіндігінше көп кластерлерді таңдап, әр кластерден субъектілердің кішкентай ғана үлгісін алу тиімді (яғни, екі сатылы кластерлік үлгілеу). Күрделілік. Кластерлік үлгілеу күрделірек және жоспарлау мен талдауға көбірек назар қажет етеді (мысалы, параметрлерді бағалау кезінде субъектілердің салмағын, сенімділік интервалдарын және т.б. ескеру қажет).

Екі кезеңді кластерлік іріктеу

Екі сатылы кластерлік сынама алу, көп сатылы сынама алудың қарапайым түрі, бірінші сатыда кластерлік сынамаларды таңдау арқылы және содан кейін әрбір сынамаланған кластерден элементтердің сынамасын таңдау арқылы жүзеге асырылады. Жалпы саны N кластерден тұратын популяцияны қарастырайық. Бірінші сатыда n кластер әдеттегі кластерлік сынама алу әдісімен іріктеледі. Екінші сатыда көбінесе қарапайым кездейсоқ сынама алу қолданылады. Ол әр кластерде жеке қолданылады және әртүрлі кластерлерден таңдалған элементтердің саны міндетті түрде бірдей болмайды. Сауалнама жүргізушілердің жалпы кластерлер саны N, іріктелген кластерлер саны n және іріктелген кластерлерден алынатын элементтер саны алдын ала анықталуы керек. Екі сатылы кластерлік сынама алу мақсаты – зерттеу шығындарын азайту және бір мезгілде маңызды бағалаулармен байланысты белгісіздікті бақылау. Бұл әдіс денсаулық сақтау және әлеуметтік ғылымдар салаларында қолданылуы мүмкін. Мысалы, зерттеушілер өлім-жітімділікті зерттеу үшін Ирак халқының өкілдік үлгісін жасау үшін екі сатылы кластерлік сынама алуды пайдаланды. Бұл әдіспен сынама алу басқа әдістерге қарағанда жылдам және сенімді болуы мүмкін, сондықтан бұл әдіс қазіргі кезде жиі қолданылады.

Кластерлер саны аз болған кездегі қорытынды

Кластерлік үлгі алу әдістері кластерлердің аз санымен жұмыс істегенде маңызды қателіктерге алып келуі мүмкін. Мысалы, штаттық немесе қалалық деңгейдегі бірліктерді топтастыру қажет болуы мүмкін, бұл бірліктердің саны аз және тұрақты болуы мүмкін. Панельдік деректерге қатысты микроэконометрикалық әдістер көбінесе қысқа панельдерді қолданады, бұл кластерлер бойынша аздаған байқаулар мен көптеген кластерлерге ұқсас. Кіші кластерлік проблеманы қосымша параметрлік проблема ретінде қарастыруға болады. Нүктелік бағалаулардың дәлдігі жеткілікті болса, асимптотиканың күшіне енуі үшін кластерлердің саны қажет. Кластерлердің саны аз болса, бағаланған ковариациялық матрица төмен қарай қате болуы мүмкін. Кластерлердің аз саны сериялық корреляция болғанда немесе Моултон контекстіндегідей кластерлік корреляция болғанда тәуекел тудырады. Кластерлердің саны аз болғанда, кездейсоқ шок болған кезде байқаулар арасындағы сериялық корреляцияны немесе Моултон жағдайындағы кластерлік корреляцияны төмен бағалауға бейімбіз. Көптеген зерттеулер сериялық корреляцияның салдары мен кіші кластерлік проблеманы атап көрсетті. Моултон коэффициентінің аясында кіші кластерлік проблеманың интуитивті түсіндірмесі Моултон коэффициентінің формуласынан алынуы мүмкін. Қарапайымдық үшін бір кластердегі байқаулар саны n деп белгіленеді дейік. Төменде кластерлеуге түзетілген ковариациялық матрицаны білдіреді, кластерлеуге түзетілмеген ковариациялық матрицаны білдіреді, ал ρ кластерлік корреляцияны білдіреді: Сол жақтағы қатынас түзетілмеген сценарийдің дәлдікті қаншалықты жоғары бағалайтынын көрсетеді. Сондықтан жоғары сан бағаланған ковариациялық матрицаның төмен қарай қате екенін білдіреді. Кіші кластерлік проблеманы үлкен n ретінде қарастыруға болады: деректер тұрақты болғанда және кластерлердің саны аз болса, кластер ішіндегі деректер саны жоғары болуы мүмкін. Осыдан келіп, кластерлердің саны аз болған кезде қорытындының дұрыс жабылуы болмайды.