Кіріспе

Дәл статистикалық гипотезаны тексеру
Пермутациялық тест (оны қайта рандомизациялау тесті немесе шатастыру тесті деп те атайды) – қарама-қайшылық арқылы дәлелдеуді қолданатын дәл статистикалық гипотезаны тексеру. Пермутациялық тестке екі немесе одан көп үлгі кіреді. Нөлдік гипотеза – барлық үлгілер бірдей таралымнан алынған. Нөлдік гипотеза бойынша, тест статистикасының таралымы байқалған деректердің мүмкін қайта орналасуында тест статистикасының барлық мүмкін мәндерін есептеу арқылы алынады. Сондықтан пермутациялық тесттер – қайта сынаудың бір түрі. Пермутациялық тесттерді бастапқы деректерді пермутациялау арқылы нөлдік гипотеза бойынша алынған суррогатты деректерді тексеру ретінде түсінуге болады. Басқаша айтқанда, эксперименттік жобадағы субъектілерге емдеу тағайындау әдісі сол жобаның талдауында шағылыстырылады. Егер нөлдік гипотеза бойынша белгілер алмастырылатын болса, нәтижесінде алынған тесттер нақты маңыздылық деңгейлерін береді; сондай-ақ алмастырылуды қараңыз. Бұл тесттерден сенімділік интервалдарын шығаруға болады. Теория 1930 жылдары Рональд Фишер мен Э. Дж. Г. Питманның еңбектерінен қалыптасқан. Пермутациялық тесттерді рандомизацияланған тесттермен шатастыруға болмайды.

Әдіс

Пермутациялық сынақтың негізгі идеясын түсіндіру үшін, екі топтан – A және B – әрбір жеке тұлға үшін кездейсоқ айнымалыларды және жинаймыз, олардың үлгілік орташалары мен болып табылады, және біз олардың бірдей үлестірілімнен алынған-жоқ екенін білуіміз керек. A және B топтарынан алынған үлгі көлемі мен болсын. Пермутациялық сынақ үлгідегі орташа мәндер арасындағы байқалатын айырмашылықтың, белгілі бір маңыздылық деңгейінде, A тобынан алынған деректер B тобынан алынған деректермен бірдей үлестірілімнен алынған деген H нөлдік гипотезасын қабылдамау үшін жеткілікті үлкен екенін анықтау үшін жасалады. Сынақ келесідей жүргізіледі. Біріншіден, екі үлгідегі орташа айырмашылық есептеледі: бұл сынақ статистикасының байқалған мәні болып табылады. Келесі, A және B топтарының байқаулары біріктіріледі, және жинақталған мәндерді A және B топтарына көлемдері мен болатын екі топқа бөлудің барлық мүмкін жолдары үшін үлгідегі орташа айырмашылық есептеліп, тіркеледі (яғни, A және B топтық белгілерінің барлық пермутациялары үшін). Осы есептелген айырмашылықтардың жиынтығы – топтық белгілер алмастырылатын (яғни, кездейсоқ тағайындалатын) нөлдік гипотеза бойынша, осы үлгі үшін ықтимал айырмашылықтардың нақты үлестірілімі болып табылады. Сынақтың бір жақты p-мәні орташа айырмашылықтан үлкен болатын пермутациялардың үлесі ретінде есептеледі. Сынақтың екі жақты p-мәні абсолютті айырмашылықтан үлкен болатын пермутациялардың үлесі ретінде есептеледі. Пермутациялық сынақтардың көптеген іске асырылуы байқалған деректердің өзін пермутациялардың бірі ретінде есептеуді талап етеді, сондықтан пермутацияның p-мәні ешқашан нөлге тең болмайды. Егер сынақтың жалғыз мақсаты нөлдік гипотезаны қабылдамау немесе қабылдау болса, онда тіркелген айырмашылықтарды сұрыптап, содан кейін байқалған мән олардың ортаңғы пайызында бар ма, жоқ па, соны байқауға болады. Егер жоқ болса, онда біз маңыздылық деңгейінде бірдей ықтималдық қисықтары гипотезасын қабылдамаймыз. Жұпталған үлгілер үшін жұпталған пермутациялық сынақты қолдану қажет.

Артықшылықтар

Кез келген сынақ статистикасы үшін, оның таралуы белгілі немесе белгісіз болғанына қарамастан, пермутациялық сынақтар қолданылады. Осылайша, зерттеуші әрқашан гипотеза мен балама арасында ең жақсы ажырату мүмкіндігін беретін және шығындарды азайтатын статистиканы таңдауға құқылы. Пермутациялық сынақтар теңгерімсіз жобаларды талдау және санаттық, реттік және метрикалық деректердің қоспалары бойынша тәуелді сынақтарды біріктіру үшін пайдаланылуы мүмкін (Песарин, 2001). Олар сондай-ақ сандыққа айналдырылған (яғни, сандарға түрлендірілген) сапалық деректерді талдау үшін де қолданылады. Пермутациялық сынақтар дәстүрлі параметрлік сынақтардың (мысалы, t-сынақтары, ANOVA) негізгі статистикалық талаптарына сәйкес келмейтін сандық деректерді талдау үшін өте ыңғайлы болуы мүмкін, PERMANOVA қараңыз. 1980 жылдарға дейін, эталондық таралымды құру үлкен үлгі көлеміне ие емес деректер жиынтығы үшін тым қиын болды. 1980 жылдардан бері, салыстырмалы түрде арзан, жылдам компьютерлердің және арнайы жағдайларда қолданылатын жаңа, күрделі алгоритмдердің дамуы пермутациялық сынақ әдістерін көптеген мәселелерді шешуде тиімді етті. Бұл сонымен қатар, негізгі статистикалық бағдарламалық пакеттерге нақты сынақ опцияларын қосуға және бірнеше және көп айнымалы нақты сынақтарды жүргізуге, сондай-ақ сынаққа негізделген «нақты» сенімділік интервалдарын есептеуге арналған мамандандырылған бағдарламалық жасақтаманың пайда болуына әкелді.

Шектеулер

Пермутациялық сынақтың маңызды болжамы – бақылаулардың нөлдік гипотеза бойынша бір-бірімен алмастырылуы мүмкін болуы. Бұл болжамның маңызды салдары – орналасу айырмашылығын тексеру (мысалы, пермутациялық t-тест) нормальділік болжамында тең дисперсияны талап етеді. Осы тұрғыдан алғанда, классикалық пермутациялық t-тест классикалық Студенттің t-тестісімен (Бехренс-Фишер мәселесі) бірдей кемшілікке ие. Бұл мәселені классикалық t-тест тең емес дисперсияларды өңдеу үшін кеңейтілгендей шешуге болады: Уэлш статистикасын еркіндік дәрежесіне Саттертвейт түзетуімен қолдану арқылы. Осы жағдайда үшінші балама – бутстрапқа негізделген тесттерді пайдалану. Статистик Филипп Гуд пермутациялық және бутстрап тесттерінің арасындағы айырмашылықты былай түсіндіреді: «Пермутациялар үлестірімдерге қатысты гипотезаларды тексереді; бутстраптар параметрлерге қатысты гипотезаларды тексереді. Осының салдарынан, бутстрапта талаптар азырақ». Бутстрап тесттері нақты емес. Кейбір жағдайларда, дұрыс нормаланған статистикаға негізделген пермутациялық тест, алмастырылу мүмкіндігі болжамы бұзылған жағдайда да асимптотикалық түрде нақты болуы мүмкін. Бутстрапқа негізделген тесттер нөлдік гипотезамен сынауға мүмкіндік береді және демек, эквиваленттілікті тексеруге қолайлы.

Монте-Карло сынақтары

Асимптотикалық эквивалентті пермутациялық сынақ, деректердің мүмкін болатын реттелулерінің саны өте көп болғанда, оларды ыңғайлы түрде толық санау мүмкін болмаған жағдайда жасалады. Бұл, Монте-Карло әдісімен үлгі алу арқылы анықталатын эталондық үлестіруді құру арқылы іске асырылады, ол мүмкін болатын репликалардың кішкентай (пермутациялардың жалпы санына шаққанда) кездейсоқ үлгісін таңдайды. Бұл әдісті кез келген деректер жиынында кез келген пермутациялық сынаққа қолдануға болатынын түсіну, қолданбалы статистика саласындағы маңызды жаңалық болды. Бұл тәсілге ең ерте белгілі сілтемелер – Eden және Yates (1933) және Dwass (1957) еңбектері. Пермутациялық сынақтың осы түрі әртүрлі атаулармен белгілі: жуық пермутациялық сынақ, Монте-Карло пермутациялық сынақтары немесе кездейсоқ пермутациялық сынақтар. Кездейсоқ пермутациялардан кейін, биномиалдық үлестірілімге сүйенген p-мәніне сенімділік интервалын есептеуге болады, қараңыз Биномиалдық пропорцияға сенімділік интервалы. Мысалы, егер кездейсоқ пермутациялардан кейін p-мәні деп бағаланса, онда нақты p-мәніне (барлық мүмкін пермутацияларды тексеру нәтижесінде алынатын) 99% сенімділік интервалы болады. Екінші жағынан, p-мәнін бағалаудың мақсаты көбінесе , нөлдік гипотезаны қабылдамау шегі қайда екенін анықтау болып табылады (әдетте ). Жоғарыдағы мысалда сенімділік интервалы p-мәні 0,05-тен кіші болу мүмкіндігі шамамен 50% екенін ғана көрсетеді, яғни нөлдік гипотезаны қабылдамау керек пе, жоқ па, бұл мүлдем белгісіз. Егер тек үшін ғана білу маңызды болса, қателік ықтималдығы өте төмен болғанша, мәлімдеме дұрыс немесе жалған екені анықталатынша симуляцияны жалғастыру логикалық. Қателіктердің қабылданған ықтималдығына шектеу қойылған жағдайда (әдетте немесе керісінше табылу ықтималдығы), қанша пермутация жасау керек деген сұрақ, осы уақытқа дейін жүргізілген симуляциялардың нәтижелеріне сүйене отырып, пермутация жасауды қашан тоқтату керек деген сұраққа айналады, соның нәтижесінде (немесе ) кем дегенде үлкен ықтималдықпен дұрыс екеніне кепілдік беру үшін (әдетте өте кішкентай мән таңдалады, мысалы 1/1000). Осы мақсатқа жету үшін, минимал қосымша есептеу шығындарымен енгізілетін тоқтату ережелері әзірленді. Шындығында, нақты p-мәніне байланысты, шешімге дерлік сенімділікпен қол жеткізу үшін қажетті симуляциялар саны өте аз (мысалы, 5-тен кем емес және көбінесе 100-ден аспайды) екені жиі байқалады.