Точные и приближенные статистические тесты: принципы и применение.
Exact test
Точные тесты в статистике: проверка гипотез с гарантированным уровнем значимости. Отличие от приближенных тестов, консерватизм и примеры (Fisher, Boschloo).
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Точный (значимый) тест – это тест, при котором, если нулевая гипотеза верна, выполняются все предположения, сделанные при выводе распределения тестовой статистики. Использование точного теста обеспечивает проверку значимости, которая поддерживает уровень ошибки первого рода на желаемом уровне значимости теста. Например, точный тест с уровнем значимости α, при повторении на большом количестве выборок, где нулевая гипотеза верна, будет отвергать её не более чем в α случаев. Это отличается от приближенного теста, в котором желаемый уровень ошибки первого рода поддерживается лишь приблизительно (то есть тест может отвергать гипотезу более чем в α случаев), при этом данное приближение может быть сделано сколь угодно близким к α путем увеличения размера выборки. Точные тесты, основанные на дискретной тестовой статистике, могут быть консервативными, то есть фактический уровень отклонения гипотезы может быть ниже номинального уровня значимости. Например, это справедливо для точного теста Фишера и его более мощной альтернативы – теста Бошлу. Если тестовая статистика непрерывна, то она достигнет уровня значимости точно. Параметрические тесты, используемые в точной статистике, являются точными тестами, когда параметрические предположения выполняются в полной мере, но на практике термин "точный (значимый) тест" обычно используется для обозначения непараметрических тестов, то есть тестов, не опирающихся на параметрические предположения. Однако на практике большинство программных реализаций непараметрических тестов используют асимптотические алгоритмы для получения значения значимости, что делает тест неточным. Следовательно, когда результат статистического анализа называется "точным тестом" или указывает "точное p-значение", это подразумевает, что тест определен без параметрических предположений и оценивается без использования приближенных алгоритмов. В принципе, это также может означать, что параметрический тест был применен в ситуации, когда все параметрические предположения выполняются в полной мере, но в реальных условиях полностью доказать это обычно невозможно. Исключения, когда точность параметрических тестов гарантирована, включают тесты, основанные на биномиальном или распределении Пуассона. Термин "перестановочный тест" иногда используется как синоним "точного теста", но следует помнить, что все перестановочные тесты являются точными тестами, но не все точные тесты являются перестановочными тестами.
An exact (significance) test is a test such that if the null hypothesis is true, then all assumptions made during the derivation of the distribution of the test statistic are met. Using an exact test provides a significance test that maintains the type I error rate of the test at the desired significance level of the test. For example, an exact test at a significance level of , when repeated over many samples where the null hypothesis is true, will reject at most of the time. This is in contrast to an approximate test in which the desired type I error rate is only approximately maintained (i. e.: the test might reject > 5% of the time), while this approximation may be made as close to as desired by making the sample size sufficiently large. Exact tests that are based on discrete test statistics may be conservative, indicating that the actual rejection rate lies below the nominal significance level As an example, this is the case for Fisher's exact test and its more powerful alternative, Boschloo's test. If the test statistic is continuous, it will reach the significance level exactly. Parametric tests, such as those used in exact statistics, are exact tests when the parametric assumptions are fully met, but in practice, the use of the term exact (significance) test is reserved for non parametric tests, i. e., tests that do not rest on parametric assumptions. However, in practice, most implementations of non parametric test software use asymptotical algorithms to obtain the significance value, which renders the test non exact. Hence, when a result of statistical analysis is termed an “exact test” or specifies an “exact p value”, this implies that the test is defined without parametric assumptions and is evaluated without making use of approximate algorithms. In principle, however, this could also signify that a parametric test has been employed in a situation where all parametric assumptions are fully met, but it is in most cases impossible to prove this completely in a real world situation. Exceptions in which it is certain that parametric tests are exact include tests based on the binomial or Poisson distributions. The term permutation test is sometimes used as a synonym for exact test, but it should be kept in mind that all permutation tests are exact tests, but not all exact tests are permutation tests.
Пример: тест Чи-квадрат Пирсона против точного теста
Простой пример этой концепции заключается в том, что тест хи-квадрат Пирсона является приближенным тестом. Предположим, тест хи-квадрат Пирсона используется для определения, является ли шестигранный кубик "честным", то есть выдает ли он каждый из шести возможных исходов с одинаковой частотой. Если кубик бросают n раз, то ожидается, что каждый исход появится n/6 раз. Статистика теста равна
A simple example of this concept involves the observation that Pearson's chi squared test is an approximate test. Suppose Pearson's chi squared test is used to ascertain whether a six sided die is "fair", indicating that it renders each of the six possible outcomes equally often. If the die is thrown n times, then one "expects" to see each outcome n/6 times. The test statistic is
где Xk – число раз, когда наблюдается исход k. Если нулевая гипотеза о "честности" верна, то распределение вероятностей статистики теста можно сделать сколь угодно близким к распределению хи-квадрат со 5 степенями свободы, увеличив размер выборки n до достаточно большого значения. С другой стороны, если n мало, то вероятности, основанные на распределении хи-квадрат, могут быть недостаточно точными приближениями. Определение точной вероятности того, что эта статистика теста превысит определенное значение, потребует комбинаторного перечисления всех исходов эксперимента, приводящих к такому большому значению статистики теста. В этом случае возникает вопрос, следует ли использовать ту же статистику теста. Тест отношения правдоподобия может быть предпочтительнее, и статистика теста может не быть монотонной функцией предыдущей.
where Xk is the number of times outcome k is observed. If the null hypothesis of "fairness" is true, then the probability distribution of the test statistic can be made as close as desired to the chi squared distribution with 5 degrees of freedom by making the sample size n sufficiently large. On the other hand, if n is small, then the probabilities based on chi squared distributions may not be sufficiently close approximations. Finding the exact probability that this test statistic exceeds a certain value would then require a combinatorial enumeration of all outcomes of the experiment that gives rise to such a large value of the test statistic. It is then questionable whether the same test statistic ought to be used. A likelihood ratio test might be preferred, and the test statistic might not be a monotone function of the one above.
Пример: точный тест Фишера
Точный тест Фишера, разработанный Рональдом Фишером и Э. Дж. Г. Питманом в 1930-х годах, является точным, поскольку распределение выборки (при условии фиксированных пороговых значений) известно точно. Это следует сопоставить с критерием хи-квадрат Пирсона, который (хотя и проверяет ту же нулевую гипотезу) не является точным, так как распределение статистики критерия верно лишь асимптотически.
Fisher's exact test, based on the work of Ronald Fisher and E. J. G. Pitman in the 1930s, is exact because the sampling distribution (conditional on the marginals) is known exactly. This should be compared with Pearson's chi squared test, which (although it tests the same null) is not exact because the distribution of the test statistic is only asymptotically correct.