Введение

Точный (значимый) тест – это тест, при котором, если нулевая гипотеза верна, выполняются все предположения, сделанные при выводе распределения тестовой статистики. Использование точного теста обеспечивает проверку значимости, которая поддерживает уровень ошибки первого рода на желаемом уровне значимости теста. Например, точный тест с уровнем значимости α, при повторении на большом количестве выборок, где нулевая гипотеза верна, будет отвергать её не более чем в α случаев. Это отличается от приближенного теста, в котором желаемый уровень ошибки первого рода поддерживается лишь приблизительно (то есть тест может отвергать гипотезу более чем в α случаев), при этом данное приближение может быть сделано сколь угодно близким к α путем увеличения размера выборки. Точные тесты, основанные на дискретной тестовой статистике, могут быть консервативными, то есть фактический уровень отклонения гипотезы может быть ниже номинального уровня значимости. Например, это справедливо для точного теста Фишера и его более мощной альтернативы – теста Бошлу. Если тестовая статистика непрерывна, то она достигнет уровня значимости точно. Параметрические тесты, используемые в точной статистике, являются точными тестами, когда параметрические предположения выполняются в полной мере, но на практике термин "точный (значимый) тест" обычно используется для обозначения непараметрических тестов, то есть тестов, не опирающихся на параметрические предположения. Однако на практике большинство программных реализаций непараметрических тестов используют асимптотические алгоритмы для получения значения значимости, что делает тест неточным. Следовательно, когда результат статистического анализа называется "точным тестом" или указывает "точное p-значение", это подразумевает, что тест определен без параметрических предположений и оценивается без использования приближенных алгоритмов. В принципе, это также может означать, что параметрический тест был применен в ситуации, когда все параметрические предположения выполняются в полной мере, но в реальных условиях полностью доказать это обычно невозможно. Исключения, когда точность параметрических тестов гарантирована, включают тесты, основанные на биномиальном или распределении Пуассона. Термин "перестановочный тест" иногда используется как синоним "точного теста", но следует помнить, что все перестановочные тесты являются точными тестами, но не все точные тесты являются перестановочными тестами.

Пример: тест Чи-квадрат Пирсона против точного теста

Простой пример этой концепции заключается в том, что тест хи-квадрат Пирсона является приближенным тестом. Предположим, тест хи-квадрат Пирсона используется для определения, является ли шестигранный кубик "честным", то есть выдает ли он каждый из шести возможных исходов с одинаковой частотой. Если кубик бросают n раз, то ожидается, что каждый исход появится n/6 раз. Статистика теста равна

где Xk – число раз, когда наблюдается исход k. Если нулевая гипотеза о "честности" верна, то распределение вероятностей статистики теста можно сделать сколь угодно близким к распределению хи-квадрат со 5 степенями свободы, увеличив размер выборки n до достаточно большого значения. С другой стороны, если n мало, то вероятности, основанные на распределении хи-квадрат, могут быть недостаточно точными приближениями. Определение точной вероятности того, что эта статистика теста превысит определенное значение, потребует комбинаторного перечисления всех исходов эксперимента, приводящих к такому большому значению статистики теста. В этом случае возникает вопрос, следует ли использовать ту же статистику теста. Тест отношения правдоподобия может быть предпочтительнее, и статистика теста может не быть монотонной функцией предыдущей.

Пример: точный тест Фишера

Точный тест Фишера, разработанный Рональдом Фишером и Э. Дж. Г. Питманом в 1930-х годах, является точным, поскольку распределение выборки (при условии фиксированных пороговых значений) известно точно. Это следует сопоставить с критерием хи-квадрат Пирсона, который (хотя и проверяет ту же нулевую гипотезу) не является точным, так как распределение статистики критерия верно лишь асимптотически.