Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Статистикалық маңыздылық сынағы
Statistical significance test
Фишердің нақты сынағы – контингенттік кестелерді талдау үшін қолданылатын статистикалық маңыздылық сынағы. Практикада үлгі көлемі шағын болған кезде қолданылғанымен, ол барлық үлгі көлемдері үшін жарамды. Ол өнертабысымен Рональд Фишердің есімімен аталады және «нақты сынақтар» класына жатады, себебі бұл сынақтарда нөлдік гипотезадан ауытқудың маңыздылығын (мысалы, p-мәні) жуықтауға сүйенбей, дәл есептеуге болады. Көптеген статистикалық сынақтардағыдай, үлгі көлемі шексіздікке ұлғайғанда ғана жуықтау нақты болатын жағдайда бұл сынақтар дәлдікпен ерекшеленеді. Фишер бұл сынақты Мюриэл Бристольдің сөзінен кейін ойлап тапқан, ол шай немесе сүт алдымен кесеге қосылғанын анықтай алатынын айтқан. Ол оның дәлелдемесін «әйелдің шайды дәм татуы» эксперименті арқылы тексерген.
Fisher's exact test is a statistical significance test used in the analysis of contingency tables. Although in practice it is employed when sample sizes are small, it is valid for all sample sizes. It is named after its inventor, Ronald Fisher, and is one of a class of exact tests, so called because the significance of the deviation from a null hypothesis (e. g., p value) can be calculated exactly, rather than relying on an approximation that becomes exact in the limit as the sample size grows to infinity, as with many statistical tests. Fisher is said to have devised the test following a comment from Muriel Bristol, who claimed to be able to detect whether the tea or the milk was added first to her cup. He tested her claim in the "lady tasting tea" experiment.
p-саны сынақтары
Байқалған деректердің маңыздылығын есептеу үшін, яғни нөлдік гипотеза дұрыс болса, деректерді осыдан да экстремалды немесе одан да экстремалды бақылаудың жалпы ықтималдығын есептеу үшін, біз осы екі кесте үшін p мәндерін есептеуіміз керек және оларды қосып алуымыз керек. Бұл бір жақты сынақ береді, онда p шамамен 0,001346076 + 0,000033652 = 0,001379728 болады. Мысалы, R статистикалық есептеу ортасында бұл мән fisher.test(rbind(c(1,9),c(11,3)), alternative="less")$p.value арқылы алынуы мүмкін, ал Python-да scipy.stats.fisher_exact(table=[[1,9],[11,3]], alternative="less") (мұнда алдыңғы қатынас коэффициенті де, p мәні де алынады) арқылы есептелуі мүмкін. Бұл мәнді бақыланған деректер ұсынған дәлелдердің жиынтығы ретінде түсіндіруге болады – немесе нөлдік гипотеза үшін (ерлер мен әйелдер арасындағы оқушылардың үлесінде ешқандай айырмашылық жоқ) одан да экстремалды кесте. P мәні неғұрлым аз болса, нөлдік гипотезаны қабылдамау үшін дәлелдер соғұрлым көп болады; сондықтан мұндағы дәлелдер ерлер мен әйелдердің оқушы болу ықтималдығы бірдей емес екенін көрсетеді. Екі жақты сынақ үшін біз бірдей дәрежеде экстремалды, бірақ кері бағытталған кестелерді де қарастыруымыз керек. Өкінішке орай, кестелерді «экстремалды» деп жіктеу мәселелі. R-дегі fisher.test функциясы қолданатын тәсіл – байқалған кестенің ықтималдығынан кем немесе оған тең ықтималдығы бар барлық кестелердің ықтималдықтарын қосып p мәнін есептеу болып табылады. Мұндағы мысалда екі жақты p мәні бір жақты мәннен екі есе көп, бірақ жалпы алғанда, симметриялық үлгілеу таралымы бар сынақ статистикасынан айырмашылығы, кішкентай сандар бар кестелер үшін бұл мәндер едәуір өзгеше болуы мүмкін.
In order to calculate the significance of the observed data, i. e. the total probability of observing data as extreme or more extreme if the null hypothesis is true, we have to calculate the values of p for both these tables, and add them together. This gives a one tailed test, with p approximately 0.001346076 + 0.000033652 = 0.001379728. For example, in the R statistical computing environment, this value can be obtained as fisher. test(rbind(c(1,9),c(11,3)), alternative="less")$p. value, or in Python, using scipy. stats. fisher exact(table=[[1,9],[11,3]], alternative="less") (where one receives both the prior odds ratio and the p value). This value can be interpreted as the sum of evidence provided by the observed data—or any more extreme table—for the null hypothesis (that there is no difference in the proportions of studiers between men and women). The smaller the value of p, the greater the evidence for rejecting the null hypothesis; so here the evidence is strong that men and women are not equally likely to be studiers. For a two tailed test we must also consider tables that are equally extreme, but in the opposite direction. Unfortunately, classification of the tables according to whether or not they are 'as extreme' is problematic. An approach used by the fisher. test function in R is to compute the p value by summing the probabilities for all tables with probabilities less than or equal to that of the observed table. In the example here, the 2 sided p value is twice the 1 sided value—but in general these can differ substantially for tables with small counts, unlike the case with test statistics that have a symmetric sampling distribution.
Даулар
Фишердің сынағы нақты p-мәндерін бергеніне қарамастан, кейбір авторлар оның консервативті екенін, яғни нақты қабылдамау деңгейі номиналды маңыздылық деңгейінен төмен екенін айтады. Бұл көрінетін қайшылық дискретті статистиканы тұрақты маңыздылық деңгейлерімен үйлестіруден туындайды. Нақтырақ айтқанда, 5% деңгейіндегі маңыздылық сынағы үшін келесі ұсынысты қарастырайық: Фишердің сынағы 5%-қа тең немесе одан кіші p-мәнін беретін әрбір кесте үшін бұл гипотезаны қабылдамаңыз. Кестелердің барлық жиынтығы дискретті болғандықтан, теңдікке қол жеткізілетін кесте болмауы мүмкін. Егер кейбір кестелер үшін мүмкін болатын ең үлкен p-мәні 5%-дан кіші болса, онда ұсынылған сынақ сол деңгейде тиімді сынақтан өтеді. Кішкентай үлгілер үшін бұл деңгей 5%-дан айтарлықтай төмен болуы мүмкін. Бұл мәселені болдырмау үшін көптеген авторлар дискретті мәселелерді шешу кезінде тұрақты маңыздылық деңгейлерін қолданудан аулақ болуға кеңес береді. Фишердің сынағынан алынған p-мәндері шеттік жиындыларға байланысты таралымнан шығады. Осы тұрғыдан алғанда, сынақ тек шартты таралым үшін ғана нақты, ал бастапқы кестеде шеттік жиындылар тәжірибеден тәжірибеге өзгеруі мүмкін. Шеттік мәндер бекітілмеген жағдайда 2x2 кестесі үшін нақты p-мәнін алуға болады. Мысалы, Барнардтың сынағы кездейсоқ шеттерге мүмкіндік береді. Алайда, кейбір авторлар шеттік жиындылардың (шамамен) қосымша екенін айтады, бұл мүмкіндіктер қатынасы туралы қорытындылар жасау үшін тиісті ықтималдық функциясы шеттік сәттілік деңгейіне байланысты болуы керек дегенді білдіреді. Олардың пікірінше, бұл әдіс, әсіресе 2x2 кестелерінде, күштірек. Сонымен қатар, Бошлудің сынағы Фишердің нақты сынағынан біркелкі күштірек болатын нақты сынақ болып табылады. Көптеген қазіргі заманғы статистикалық пакеттер Фишер сынақтарының маңыздылығын есептейді, кейбір жағдайларда хи-квадрат жуықтауы да қабылданады. Статистикалық бағдарламалық қамтамасыздандырулардың нақты есептеулері әдетте жоғарыда сипатталғандардан өзгеше болады, себебі факторлардың үлкен мәндерінен туындаған сандық қиындықтар болуы мүмкін. Бір қарапайым, жақсырақ есептеу әдісі гамма функциясына немесе логарифмдік гамма функциясына сүйенеді, бірақ гипергеометриялық және биномдық ықтималдықтарды дәл есептеу әдістері белсенді зерттеу саласы болып қала береді. Категориялық, стратификацияланған деректер үшін Фишердің сынағының орнына Кохран-Мантель-Хензель сынағы қолданылуы керек. Чой және басқалар.
Despite the fact that Fisher's test gives exact p values, some authors have argued that it is conservative, i. e. that its actual rejection rate is below the nominal significance level. The apparent contradiction stems from the combination of a discrete statistic with fixed significance levels. To be more precise, consider the following proposal for a significance test at the 5% level: reject the null hypothesis for each table to which Fisher's test assigns a p value equal to or smaller than 5%. Because the set of all tables is discrete, there may not be a table for which equality is achieved. If is the largest p value smaller than 5% which can actually occur for some table, then the proposed test effectively tests at the level. For small sample sizes, might be significantly lower than 5%. To avoid the problem, many authors discourage the use of fixed significance levels when dealing with discrete problems. The p values derived from Fisher's test come from the distribution that conditions on the margin totals. In this sense, the test is exact only for the conditional distribution and not the original table where the margin totals may change from experiment to experiment. It is possible to obtain an exact p value for the 2×2 table when the margins are not held fixed. Barnard's test, for example, allows for random margins. However, some authors The argument that the marginal totals are (almost) ancillary implies that the appropriate likelihood function for making inferences about this odds ratio should be conditioned on the marginal success rate. of it suggest that this method is more powerful, particularly in 2×2 tables. Furthermore, Boschloo's test is an exact test that is uniformly more powerful than Fisher's exact test by construction. Most modern statistical packages will calculate the significance of Fisher tests, in some cases even where the chi squared approximation would also be acceptable. The actual computations as performed by statistical software packages will as a rule differ from those described above, because numerical difficulties may result from the large values taken by the factorials. A simple, somewhat better computational approach relies on a gamma function or log gamma function, but methods for accurate computation of hypergeometric and binomial probabilities remains an active research area. For stratified categorical data the Cochran–Mantel–Haenszel test must be used instead of Fisher's test. Choi et al.