Нақты мағыналық тесттер және олардың ерекшеліктері
Exact test
Нақтылық сынағы: null гипотеза дұрыс болса, барлық шарттар орындалады. I тип қателік деңгейін сақтайды. Fisher және Boschloo сынақтарын қарастырады. 📊🔍
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Дәл (маңыздылық) сынағы – егер нөлдік гипотеза дұрыс болса, сынақ статистикасының таралуын есептеу кезінде жасалған барлық шарттар орындалатын сынақ. Дәл сынақты қолдану, сынақтың I типтегі қателік деңгейін, сынақтың қажетті маңыздылық деңгейінде сақтайтын маңыздылық сынағын қамтамасыз етеді. Мысалы, нөлдік гипотеза дұрыс болатын көптеген сынамаларда қайталағанда, белгілі бір маңыздылық деңгейіндегі дәл сынақ, ең көп дегенде сол деңгейде ғана нәтижесін қабылдамайды. Бұл шамамен есептелген сынақтан өзгеше, онда қажетті I типтегі қателік деңгейі шамамен ғана сақталады (яғни, сынақ > 5% жағдайда қабылдануы мүмкін), ал бұл шамамен есептеуді сынама көлемін жеткілікті түрде үлкен ету арқылы қалаған деңгейге жақындатуға болады. Дискретті сынақ статистикасына негізделген дәл сынақтар консервативті болуы мүмкін, яғни нақты қабылдамау деңгейі номиналды маңыздылық деңгейінен төмен болуы мүмкін. Мысалы, бұл Фишердің дәл сынағы мен оның күштірек альтернативасы – Бошлудың сынағы үшін де осыған ұқсас. Егер сынақ статистикасы үздіксіз болса, онда ол маңыздылық деңгейіне дәл жетеді. Параметрлік сынақтар, дәл статистикада қолданылатындай, параметрлік шарттар толық орындалғанда дәл сынақтар болып табылады, бірақ практикада «дәл (маңыздылық) сынақ» термині параметрлік емес сынақтар үшін, яғни параметрлік шарттарға сүйенбеген сынақтар үшін ғана қолданылады. Дегенмен, практикада параметрлік емес сынақ бағдарламалық құралдарының көпшілігі маңыздылық мәнін алу үшін асимптотикалық алгоритмдерді қолданады, бұл сынақты дәл емес етеді. Сондықтан, статистикалық талдау нәтижесі «дәл сынақ» деп аталса немесе «дәл p мәні» көрсетілсе, бұл сынақ параметрлік шарттарсыз анықталғанын және шамамен есептелген алгоритмдерді пайдаланбай бағаланғанын білдіреді. Бірақ, бұл параметрлік сынақтың барлық параметрлік шарттар толық орындалған жағдайда қолданылғанын да білдіруі мүмкін, бірақ нақты жағдайда мұны толыққанды дәлелдеу көбінесе мүмкін емес. Биномдық немесе Пуассон таралымдарына негізделген сынақтар, параметрлік сынақтардың дәл екендігіне сенімді болатын ерекше жағдайларға жатады. «Пермутациялық сынақ» термині кейде «дәл сынақ» терминімен синоним ретінде қолданылады, бірақ барлық пермутациялық сынақтар дәл сынақтар екенін, бірақ барлық дәл сынақтар пермутациялық сынақтар емес екенін есте ұстаған жөн.
An exact (significance) test is a test such that if the null hypothesis is true, then all assumptions made during the derivation of the distribution of the test statistic are met. Using an exact test provides a significance test that maintains the type I error rate of the test at the desired significance level of the test. For example, an exact test at a significance level of , when repeated over many samples where the null hypothesis is true, will reject at most of the time. This is in contrast to an approximate test in which the desired type I error rate is only approximately maintained (i. e.: the test might reject > 5% of the time), while this approximation may be made as close to as desired by making the sample size sufficiently large. Exact tests that are based on discrete test statistics may be conservative, indicating that the actual rejection rate lies below the nominal significance level As an example, this is the case for Fisher's exact test and its more powerful alternative, Boschloo's test. If the test statistic is continuous, it will reach the significance level exactly. Parametric tests, such as those used in exact statistics, are exact tests when the parametric assumptions are fully met, but in practice, the use of the term exact (significance) test is reserved for non parametric tests, i. e., tests that do not rest on parametric assumptions. However, in practice, most implementations of non parametric test software use asymptotical algorithms to obtain the significance value, which renders the test non exact. Hence, when a result of statistical analysis is termed an “exact test” or specifies an “exact p value”, this implies that the test is defined without parametric assumptions and is evaluated without making use of approximate algorithms. In principle, however, this could also signify that a parametric test has been employed in a situation where all parametric assumptions are fully met, but it is in most cases impossible to prove this completely in a real world situation. Exceptions in which it is certain that parametric tests are exact include tests based on the binomial or Poisson distributions. The term permutation test is sometimes used as a synonym for exact test, but it should be kept in mind that all permutation tests are exact tests, but not all exact tests are permutation tests.
Мысал: Пирсонның хи-квадрат тестісі мен нақты тест
Бұл тұжырымдаманың қарапайым мысалы Пирсонның хи-квадраттық сынағының жуықталған сынақ екенін атап өтуді қамтиды. Алты жақты ойыншық текшесінің "әділ" екенін анықтау үшін Пирсонның хи-квадраттық сынағы қолданылсын, яғни ол алты мүмкін нәтиженің әрқайсысын тең жиілікпен шығарады. Егер текше n рет лақтырылса, онда әр нәтиже n/6 рет көрінуі күтіледі. Сынақ статистикасы:
A simple example of this concept involves the observation that Pearson's chi squared test is an approximate test. Suppose Pearson's chi squared test is used to ascertain whether a six sided die is "fair", indicating that it renders each of the six possible outcomes equally often. If the die is thrown n times, then one "expects" to see each outcome n/6 times. The test statistic is
мұнда Xk – k нәтижесінің байқалған саны. Егер "әділдік" нөлдік гипотезасы дұрыс болса, онда сынақ статистикасының ықтималдық таралуын үлгінің көлемін n жеткілікті үлкен етіп, 5 еркіндік дәрежесімен хи-квадраттық таралымға қалағанша жақын етуге болады. Алайда, егер n кішкентай болса, хи-квадраттық таралымға негізделген ықтималдықтар жеткілікті жақын жуықтама болуы мүмкін емес. Осы сынақ статистикасының белгілі бір мәннен асып кетуінің нақты ықтималдығын табу үшін сынақ статистикасының осындай үлкен мәнін тудыратын эксперименттің барлық нәтижелерін комбинаторлық түрде санау қажет болады. Сондықтан, дәл осы сынақ статистикасын қолдануға бола ма деген сұрақ туындайды. Ықтималдық қатынасы сынағы тиімдірек болуы мүмкін, ал сынақ статистикасы жоғарыда көрсетілгенге монотонды функция болмауы да мүмкін.
where Xk is the number of times outcome k is observed. If the null hypothesis of "fairness" is true, then the probability distribution of the test statistic can be made as close as desired to the chi squared distribution with 5 degrees of freedom by making the sample size n sufficiently large. On the other hand, if n is small, then the probabilities based on chi squared distributions may not be sufficiently close approximations. Finding the exact probability that this test statistic exceeds a certain value would then require a combinatorial enumeration of all outcomes of the experiment that gives rise to such a large value of the test statistic. It is then questionable whether the same test statistic ought to be used. A likelihood ratio test might be preferred, and the test statistic might not be a monotone function of the one above.
Мысал: Фишердің нақты сынағы
Фишердің нақты сынағы, 1930 жылдары Рональд Фишер және Е. Дж. Г. Питманның еңбектеріне негізделген, іріктеме таралуының (шекті мәндерге шартты түрде) нақты белгілі болғандықтан нақты болып табылады. Бұл Пирсонның хи-квадраттық сынағымен салыстырылуы керек, ол (бірдей бұлжымайтын гипотезаны тексергенімен) нақты емес, себебі сынақ статистикасының таралуы тек асимптотикалық жағдайда ғана дұрыс.
Fisher's exact test, based on the work of Ronald Fisher and E. J. G. Pitman in the 1930s, is exact because the sampling distribution (conditional on the marginals) is known exactly. This should be compared with Pearson's chi squared test, which (although it tests the same null) is not exact because the distribution of the test statistic is only asymptotically correct.