Кіріспе
Дәл статистикалық гипотезаны тексеру
Пермутациялық тест (оны қайта рандомизациялау тесті немесе шатастыру тесті деп те атайды) – қарама-қайшылық арқылы дәлелдеуді қолданатын дәл статистикалық гипотезаны тексеру. Пермутациялық тестке екі немесе одан көп үлгі кіреді. Нөлдік гипотеза – барлық үлгілер бірдей таралымнан алынған. Нөлдік гипотеза бойынша, тест статистикасының таралымы байқалған деректердің мүмкін қайта орналасуында тест статистикасының барлық мүмкін мәндерін есептеу арқылы алынады. Сондықтан пермутациялық тесттер – қайта сынаудың бір түрі. Пермутациялық тесттерді бастапқы деректерді пермутациялау арқылы нөлдік гипотеза бойынша алынған суррогатты деректерді тексеру ретінде түсінуге болады. Басқаша айтқанда, эксперименттік жобадағы субъектілерге емдеу тағайындау әдісі сол жобаның талдауында шағылыстырылады. Егер нөлдік гипотеза бойынша белгілер алмастырылатын болса, нәтижесінде алынған тесттер нақты маңыздылық деңгейлерін береді; сондай-ақ алмастырылуды қараңыз. Бұл тесттерден сенімділік интервалдарын шығаруға болады. Теория 1930 жылдары Рональд Фишер мен Э. Дж. Г. Питманның еңбектерінен қалыптасқан. Пермутациялық тесттерді рандомизацияланған тесттермен шатастыруға болмайды.
A permutation test (also called re randomization test or shuffle test) is an exact statistical hypothesis test making use of the proof by contradiction. A permutation test involves two or more samples. The null hypothesis is that all samples come from the same distribution Under the null hypothesis, the distribution of the test statistic is obtained by calculating all possible values of the test statistic under possible rearrangements of the observed data. Permutation tests are, therefore, a form of resampling. Permutation tests can be understood as surrogate data testing where the surrogate data under the null hypothesis are obtained through permutations of the original data. In other words, the method by which treatments are allocated to subjects in an experimental design is mirrored in the analysis of that design. If the labels are exchangeable under the null hypothesis, then the resulting tests yield exact significance levels; see also exchangeability. Confidence intervals can then be derived from the tests. The theory has evolved from the works of Ronald Fisher and E. J. G. Pitman in the 1930s. Permutation tests should not be confused with randomized tests.
Әдіс
Пермутациялық сынақтың негізгі идеясын түсіндіру үшін, екі топтан – A және B – әрбір жеке тұлға үшін кездейсоқ айнымалыларды және жинаймыз, олардың үлгілік орташалары мен болып табылады, және біз олардың бірдей үлестірілімнен алынған-жоқ екенін білуіміз керек. A және B топтарынан алынған үлгі көлемі мен болсын. Пермутациялық сынақ үлгідегі орташа мәндер арасындағы байқалатын айырмашылықтың, белгілі бір маңыздылық деңгейінде, A тобынан алынған деректер B тобынан алынған деректермен бірдей үлестірілімнен алынған деген H нөлдік гипотезасын қабылдамау үшін жеткілікті үлкен екенін анықтау үшін жасалады. Сынақ келесідей жүргізіледі. Біріншіден, екі үлгідегі орташа айырмашылық есептеледі: бұл сынақ статистикасының байқалған мәні болып табылады. Келесі, A және B топтарының байқаулары біріктіріледі, және жинақталған мәндерді A және B топтарына көлемдері мен болатын екі топқа бөлудің барлық мүмкін жолдары үшін үлгідегі орташа айырмашылық есептеліп, тіркеледі (яғни, A және B топтық белгілерінің барлық пермутациялары үшін). Осы есептелген айырмашылықтардың жиынтығы – топтық белгілер алмастырылатын (яғни, кездейсоқ тағайындалатын) нөлдік гипотеза бойынша, осы үлгі үшін ықтимал айырмашылықтардың нақты үлестірілімі болып табылады. Сынақтың бір жақты p-мәні орташа айырмашылықтан үлкен болатын пермутациялардың үлесі ретінде есептеледі. Сынақтың екі жақты p-мәні абсолютті айырмашылықтан үлкен болатын пермутациялардың үлесі ретінде есептеледі. Пермутациялық сынақтардың көптеген іске асырылуы байқалған деректердің өзін пермутациялардың бірі ретінде есептеуді талап етеді, сондықтан пермутацияның p-мәні ешқашан нөлге тең болмайды. Егер сынақтың жалғыз мақсаты нөлдік гипотезаны қабылдамау немесе қабылдау болса, онда тіркелген айырмашылықтарды сұрыптап, содан кейін байқалған мән олардың ортаңғы пайызында бар ма, жоқ па, соны байқауға болады. Егер жоқ болса, онда біз маңыздылық деңгейінде бірдей ықтималдық қисықтары гипотезасын қабылдамаймыз. Жұпталған үлгілер үшін жұпталған пермутациялық сынақты қолдану қажет.
The test proceeds as follows. First, the difference in means between the two samples is calculated: this is the observed value of the test statistic,
Next, the observations of groups and are pooled, and the difference in sample means is calculated and recorded for every possible way of dividing the pooled values into two groups of size and (i. e., for every permutation of the group labels A and B). The set of these calculated differences is the exact distribution of possible differences (for this sample) under the null hypothesis that group labels are exchangeable (i. e., are randomly assigned). The one sided p value of the test is calculated as the proportion of sampled permutations where the difference in means was greater than The two sided p value of the test is calculated as the proportion of sampled permutations where the absolute difference was greater than Many implementations of permutation tests require that the observed data itself be counted as one of the permutations so that the permutation p value will never be zero. Alternatively, if the only purpose of the test is to reject or not reject the null hypothesis, one could sort the recorded differences, and then observe if is contained within the middle % of them, for some significance level If it is not, we reject the hypothesis of identical probability curves at the significance level. For paired samples the paired permutation test needs to be applied.
Артықшылықтар
Кез келген сынақ статистикасы үшін, оның таралуы белгілі немесе белгісіз болғанына қарамастан, пермутациялық сынақтар қолданылады. Осылайша, зерттеуші әрқашан гипотеза мен балама арасында ең жақсы ажырату мүмкіндігін беретін және шығындарды азайтатын статистиканы таңдауға құқылы. Пермутациялық сынақтар теңгерімсіз жобаларды талдау және санаттық, реттік және метрикалық деректердің қоспалары бойынша тәуелді сынақтарды біріктіру үшін пайдаланылуы мүмкін (Песарин, 2001). Олар сондай-ақ сандыққа айналдырылған (яғни, сандарға түрлендірілген) сапалық деректерді талдау үшін де қолданылады. Пермутациялық сынақтар дәстүрлі параметрлік сынақтардың (мысалы, t-сынақтары, ANOVA) негізгі статистикалық талаптарына сәйкес келмейтін сандық деректерді талдау үшін өте ыңғайлы болуы мүмкін, PERMANOVA қараңыз. 1980 жылдарға дейін, эталондық таралымды құру үлкен үлгі көлеміне ие емес деректер жиынтығы үшін тым қиын болды. 1980 жылдардан бері, салыстырмалы түрде арзан, жылдам компьютерлердің және арнайы жағдайларда қолданылатын жаңа, күрделі алгоритмдердің дамуы пермутациялық сынақ әдістерін көптеген мәселелерді шешуде тиімді етті. Бұл сонымен қатар, негізгі статистикалық бағдарламалық пакеттерге нақты сынақ опцияларын қосуға және бірнеше және көп айнымалы нақты сынақтарды жүргізуге, сондай-ақ сынаққа негізделген «нақты» сенімділік интервалдарын есептеуге арналған мамандандырылған бағдарламалық жасақтаманың пайда болуына әкелді.
Шектеулер
Пермутациялық сынақтың маңызды болжамы – бақылаулардың нөлдік гипотеза бойынша бір-бірімен алмастырылуы мүмкін болуы. Бұл болжамның маңызды салдары – орналасу айырмашылығын тексеру (мысалы, пермутациялық t-тест) нормальділік болжамында тең дисперсияны талап етеді. Осы тұрғыдан алғанда, классикалық пермутациялық t-тест классикалық Студенттің t-тестісімен (Бехренс-Фишер мәселесі) бірдей кемшілікке ие. Бұл мәселені классикалық t-тест тең емес дисперсияларды өңдеу үшін кеңейтілгендей шешуге болады: Уэлш статистикасын еркіндік дәрежесіне Саттертвейт түзетуімен қолдану арқылы. Осы жағдайда үшінші балама – бутстрапқа негізделген тесттерді пайдалану. Статистик Филипп Гуд пермутациялық және бутстрап тесттерінің арасындағы айырмашылықты былай түсіндіреді: «Пермутациялар үлестірімдерге қатысты гипотезаларды тексереді; бутстраптар параметрлерге қатысты гипотезаларды тексереді. Осының салдарынан, бутстрапта талаптар азырақ». Бутстрап тесттері нақты емес. Кейбір жағдайларда, дұрыс нормаланған статистикаға негізделген пермутациялық тест, алмастырылу мүмкіндігі болжамы бұзылған жағдайда да асимптотикалық түрде нақты болуы мүмкін. Бутстрапқа негізделген тесттер нөлдік гипотезамен сынауға мүмкіндік береді және демек, эквиваленттілікті тексеруге қолайлы.
Монте-Карло сынақтары
Асимптотикалық эквивалентті пермутациялық сынақ, деректердің мүмкін болатын реттелулерінің саны өте көп болғанда, оларды ыңғайлы түрде толық санау мүмкін болмаған жағдайда жасалады. Бұл, Монте-Карло әдісімен үлгі алу арқылы анықталатын эталондық үлестіруді құру арқылы іске асырылады, ол мүмкін болатын репликалардың кішкентай (пермутациялардың жалпы санына шаққанда) кездейсоқ үлгісін таңдайды. Бұл әдісті кез келген деректер жиынында кез келген пермутациялық сынаққа қолдануға болатынын түсіну, қолданбалы статистика саласындағы маңызды жаңалық болды. Бұл тәсілге ең ерте белгілі сілтемелер – Eden және Yates (1933) және Dwass (1957) еңбектері. Пермутациялық сынақтың осы түрі әртүрлі атаулармен белгілі: жуық пермутациялық сынақ, Монте-Карло пермутациялық сынақтары немесе кездейсоқ пермутациялық сынақтар. Кездейсоқ пермутациялардан кейін, биномиалдық үлестірілімге сүйенген p-мәніне сенімділік интервалын есептеуге болады, қараңыз Биномиалдық пропорцияға сенімділік интервалы. Мысалы, егер кездейсоқ пермутациялардан кейін p-мәні деп бағаланса, онда нақты p-мәніне (барлық мүмкін пермутацияларды тексеру нәтижесінде алынатын) 99% сенімділік интервалы болады. Екінші жағынан, p-мәнін бағалаудың мақсаты көбінесе , нөлдік гипотезаны қабылдамау шегі қайда екенін анықтау болып табылады (әдетте ). Жоғарыдағы мысалда сенімділік интервалы p-мәні 0,05-тен кіші болу мүмкіндігі шамамен 50% екенін ғана көрсетеді, яғни нөлдік гипотезаны қабылдамау керек пе, жоқ па, бұл мүлдем белгісіз. Егер тек үшін ғана білу маңызды болса, қателік ықтималдығы өте төмен болғанша, мәлімдеме дұрыс немесе жалған екені анықталатынша симуляцияны жалғастыру логикалық. Қателіктердің қабылданған ықтималдығына шектеу қойылған жағдайда (әдетте немесе керісінше табылу ықтималдығы), қанша пермутация жасау керек деген сұрақ, осы уақытқа дейін жүргізілген симуляциялардың нәтижелеріне сүйене отырып, пермутация жасауды қашан тоқтату керек деген сұраққа айналады, соның нәтижесінде (немесе ) кем дегенде үлкен ықтималдықпен дұрыс екеніне кепілдік беру үшін (әдетте өте кішкентай мән таңдалады, мысалы 1/1000). Осы мақсатқа жету үшін, минимал қосымша есептеу шығындарымен енгізілетін тоқтату ережелері әзірленді. Шындығында, нақты p-мәніне байланысты, шешімге дерлік сенімділікпен қол жеткізу үшін қажетті симуляциялар саны өте аз (мысалы, 5-тен кем емес және көбінесе 100-ден аспайды) екені жиі байқалады.
On the other hand, the purpose of estimating the p value is most often to decide whether , where is the threshold at which the null hypothesis will be rejected (typically ). In the example above, the confidence interval only tells us that there is roughly a 50% chance that the p value is smaller than 0.05, i. e. it is completely unclear whether the null hypothesis should be rejected at a level
If it is only important to know whether for a given , it is logical to continue simulating until the statement can be established to be true or false with a very low probability of error. Given a bound on the admissible probability of error (the probability of finding that when in fact or vice versa), the question of how many permutations to generate can be seen as the question of when to stop generating permutations, based on the outcomes of the simulations so far, in order to guarantee that the conclusion (which is either or ) is correct with probability at least as large as ( will typically be chosen to be extremely small, e. g. 1/1000.) Stopping rules to achieve this have been developed which can be incorporated with minimal additional computational cost. In fact, depending on the true underlying p value it will often be found that the number of simulations required is remarkably small (e. g. as low as 5 and often not larger than 100) before a decision can be reached with virtual certainty.