Введение

Тест статистической значимости

Точный тест Фишера — это тест статистической значимости, используемый при анализе таблиц сопряженности. Хотя на практике он применяется при небольших размерах выборки, он валиден для любых размеров выборки. Он назван в честь своего изобретателя, Рональда Фишера, и относится к классу точных тестов, так называемых, потому что значимость отклонения от нулевой гипотезы (например, p-значение) может быть вычислена точно, а не основываться на приближении, которое становится точным только при стремлении размера выборки к бесконечности, как это происходит во многих статистических тестах. Говорят, что Фишер разработал этот тест после замечания Мюриэль Бристоль, которая утверждала, что способна определить, что было налито в чашку первым — чай или молоко. Он проверил её утверждение в эксперименте «леди, пробующей чай».

испытания на p-значение

Для того, чтобы рассчитать значимость наблюдаемых данных, то есть общую вероятность наблюдения данных столь же экстремальных или более экстремальных, если нулевая гипотеза верна, необходимо вычислить значения p для обеих этих таблиц и сложить их вместе. Это дает односторонний тест, где p приблизительно равно 0,001346076 + 0,000033652 = 0,001379728. Например, в статистической вычислительной среде R это значение можно получить как fisher.test(rbind(c(1,9),c(11,3)), alternative="less")$p.value, а в Python – используя scipy.stats.fisher_exact(table=[[1,9],[11,3]], alternative="less") (где вычисляется как отношение шансов до начала исследования, так и значение p). Это значение можно интерпретировать как сумму доказательств, предоставляемых наблюдаемыми данными – или любой более экстремальной таблицей – в пользу нулевой гипотезы (о том, что нет различий в пропорциях изучающих среди мужчин и женщин). Чем меньше значение p, тем больше доказательств для отклонения нулевой гипотезы; следовательно, в данном случае имеются веские основания полагать, что мужчины и женщины не имеют одинаковой вероятности быть изучающими. Для двухстороннего теста также необходимо учитывать таблицы, которые столь же экстремальны, но в противоположном направлении. К сожалению, классификация таблиц по критерию того, являются ли они «настолько же экстремальными», является проблематичной. Подход, используемый функцией fisher.test в R, заключается в вычислении значения p путем суммирования вероятностей для всех таблиц с вероятностями, меньшими или равными вероятности наблюдаемой таблицы. В данном примере двустороннее значение p в два раза больше одностороннего значения, но в общем случае они могут существенно различаться для таблиц с небольшим количеством наблюдений, в отличие от тестовых статистик, имеющих симметричное выборочное распределение.

Противоречия

Несмотря на то, что тест Фишера дает точные значения p, некоторые авторы утверждают, что он консервативен, то есть его фактический уровень отклонения гипотезы ниже номинального уровня значимости. Очевидное противоречие возникает из-за сочетания дискретной статистики с фиксированными уровнями значимости. Для большей точности рассмотрим следующее предложение для проверки значимости на уровне 5%: отклонить нулевую гипотезу для каждой таблицы, для которой тест Фишера присваивает значение p, равное или меньшее 5%. Поскольку множество всех таблиц дискретно, может не существовать таблицы, для которой достигается равенство. Если – наибольшее значение p, меньшее 5%, которое может фактически встретиться для некоторой таблицы, то предлагаемый тест фактически проверяет на уровне . Для небольших размеров выборки может быть значительно меньше 5%. Чтобы избежать этой проблемы, многие авторы не рекомендуют использовать фиксированные уровни значимости при работе с дискретными задачами. Значения p, полученные из теста Фишера, исходят из распределения, обусловленного суммарными значениями по строкам и столбцам. В этом смысле тест точен только для условного распределения, а не для исходной таблицы, где суммарные значения по строкам и столбцам могут меняться от эксперимента к эксперименту. Возможно получить точное значение p для таблицы 2×2, когда границы не фиксированы. Например, тест Барнарда допускает случайные границы. Однако некоторые авторы утверждают, что маргинальные суммы (почти) являются дополнительными параметрами, что соответствующая функция правдоподобия для получения выводов об этом отношении шансов должна быть обусловлена маргинальной вероятностью успеха. Они предполагают, что этот метод более мощный, особенно для таблиц 2×2. Кроме того, тест Бошлу – это точный тест, который по построению обладает большей мощностью, чем точный тест Фишера. Большинство современных статистических пакетов будут вычислять значимость тестов Фишера, в некоторых случаях даже там, где приближение хи-квадрат также было бы приемлемо. Фактические вычисления, выполняемые статистическими программными пакетами, как правило, отличаются от описанных выше, поскольку числовые трудности могут возникать из-за больших значений факториалов. Более простой и несколько лучший вычислительный подход основан на гамма-функции или логарифмической гамма-функции, но методы точного вычисления гипергеометрических и биномиальных вероятностей остаются активной областью исследований. Для стратифицированных категориальных данных следует использовать тест Кокрана–Мантеля–Хензеля вместо теста Фишера. Чой и др.