Введение

Альтернативные способы вычисления статистической значимости параметра, полученного из набора данных.

В проверке статистической значимости односторонний и двухсторонний тесты являются альтернативными способами вычисления статистической значимости параметра, полученного из набора данных, на основе тестовой статистики. Двухсторонний тест уместен, если предполагаемое значение больше или меньше определенного диапазона значений, например, если результат тестирования может быть выше или ниже определенного диапазона баллов. Этот метод используется для проверки нулевой гипотезы, и если предполагаемое значение попадает в критическую область, альтернативная гипотеза принимается вместо нулевой. Односторонний тест уместен, если предполагаемое значение может отклоняться от исходного значения только в одном направлении – влево или вправо, но не в обоих. Примером может служить вопрос, производит ли машина более одного процента бракованной продукции. В этом случае, если предполагаемое значение попадает в одностороннюю критическую область, в зависимости от интересующего направления (больше или меньше), альтернативная гипотеза принимается вместо нулевой. Другие названия – односторонние и двусторонние тесты; термин "хвост" используется, поскольку крайние части распределений, где наблюдения приводят к отклонению нулевой гипотезы, малы и часто "затухают" к нулю, как в нормальном распределении (изображено справа, окрашено в зеленый цвет), или "кривой Гаусса" (окрашено в желтый цвет).

Приложения

Односторонние тесты используются для асимметричных распределений, имеющих один хвост, например, хи-квадратное распределение, которое часто применяется при оценке качества соответствия, или для одной стороны распределения, имеющего два хвоста, например, нормальное распределение, которое часто применяется при оценке местоположения; это соответствует заданию направления. Двусторонние тесты применимы только в случае наличия двух хвостов, например, в нормальном распределении, и соответствуют рассмотрению любого направления как значимого. В подходе Рональда Фишера нулевая гипотеза H0 отвергается, когда p-значение тестовой статистики достаточно экстремально (по отношению к распределению выборки тестовой статистики) и, следовательно, считается маловероятным, что оно является результатом случайности. Обычно это делается путем сравнения полученного p-значения с заданным уровнем значимости, обозначаемым α, при вычислении статистической значимости параметра. В одностороннем тесте "экстремальный" определяется заранее как "достаточно малый" или "достаточно большой" – значения в противоположном направлении считаются незначимыми. Можно сообщать о вероятности левого или правого хвоста как об одностороннем p-значении, что в конечном итоге соответствует направлению, в котором тестовая статистика отклоняется от H0. В двустороннем тесте "экстремальный" означает "достаточно малый или достаточно большой", и значения в любом направлении считаются значимыми. Для заданной тестовой статистики существует один двусторонний тест и два односторонних теста, по одному для каждого направления. При заданном уровне значимости критические области будут располагаться на двух концах распределения, каждая с площадью α для двустороннего теста. В качестве альтернативы, критическая область будет существовать только на одном конце хвоста с площадью α для одностороннего теста. Для заданного уровня значимости в двустороннем тесте для тестовой статистики соответствующие односторонние тесты для той же статистики будут считаться либо в два раза более значимыми (половина p-значения), если данные соответствуют направлению, указанному в тесте, либо вообще незначимыми (p-значение выше α), если данные соответствуют направлению, противоположному критической области, указанной в тесте. Например, при подбрасывании монеты, проверка, смещена ли она в сторону орла, является односторонним тестом, и получение данных "только орлы" будет считаться высокозначимым, в то время как получение данных "только решки" не будет значимым вообще (p = 1). Напротив, проверка, смещена ли она в любом направлении, является двусторонним тестом, и как "только орлы", так и "только решки" будут считаться высокозначимыми данными. В медицинских испытаниях, хотя обычно интересует, приводит ли лечение к результатам, лучшим, чем случайность, что предполагает односторонний тест; худший результат также интересен для научного сообщества, поэтому следует использовать двусторонний тест, который вместо этого соответствует проверке, приводит ли лечение к результатам, отличным от случайности, будь то лучше или хуже. В архетипическом эксперименте с дегустацией чая Фишер проверил, лучше ли дама отличает два типа приготовления чая, чем это возможно случайно, а не отличалась ли ее способность от случайности, и поэтому он использовал односторонний тест.

Пример подбрасывания монеты

При подбрасывании монеты нулевая гипотеза представляет собой последовательность испытаний Бернулли с вероятностью 0,5, что приводит к случайной величине X, равной 1 для орла и 0 для решки, а распространенной тестовой статистикой является выборочное среднее (количества орлов). Если проводится проверка на смещение монеты в сторону орла, используется односторонний тест – значимыми будут только большие количества орлов. В этом случае набор данных из пяти орлов (HHHHH) со средним значением выборки 1 имеет шанс появиться (5 последовательных бросков с 2 возможными исходами ((1/2)^5 = 1/32)). Это было бы значимо (отвергая нулевую гипотезу), если бы тест анализировался на уровне значимости (уровень значимости, соответствующий пороговому значению). Однако, если проводится проверка на смещение монеты в сторону орла или решки, используется двусторонний тест, и набор данных из пяти орлов (выборочное среднее 1) столь же экстремален, как и набор данных из пяти решек (выборочное среднее 0). В результате, p-значение будет , и это не будет значимо (не отвергая нулевую гипотезу), если тест анализировался на уровне значимости .

История

Значение p было введено Карлом Пирсоном в χ²-тесте Пирсона, где он определил P (исходное обозначение) как вероятность того, что статистическая величина примет значение, равное или превышающее заданный уровень. Это одностороннее определение, и распределение χ² асимметрично, принимая только неотрицательные значения и имея только один хвост – верхний. Оно измеряет степень соответствия данных теоретическому распределению, где нулевое значение соответствует полному совпадению с теоретическим распределением; таким образом, p-value измеряет вероятность получения такого плохого соответствия или худшего. Различие между односторонними и двусторонними тестами было популяризировано Рональдом Фишером в его влиятельной книге «Статистические методы для научных работников», где он особенно применил его к нормальному распределению, которое является симметричным распределением с двумя равными хвостами. Нормальное распределение чаще используется для оценки параметров, а не для проверки качества соответствия, и имеет два хвоста, отражающие вероятность того, что оценка параметра будет выше или ниже теоретического значения (например, выборочное среднее по сравнению с теоретическим средним). В случае симметричного распределения, такого как нормальное, одностороннее p-value равно ровно половине двустороннего p-value: он объясняет это тем, что конкретный набор данных может быть маловероятным (при нулевой гипотезе), но более экстремальные значения – более вероятными, поэтому, рассматривая это, конкретные, но не слишком маловероятные данные не следует считать статистически значимыми.

Специфические испытания

Если тестовая статистика следует t-распределению Стьюдента при нулевой гипотезе – что часто встречается, когда базовая переменная имеет нормальное распределение с неизвестным масштабом, – то тест называется односторонним или двусторонним t-тестом. Если тест проводится с использованием фактического среднего и дисперсии генеральной совокупности, а не оценок по выборке, то он называется односторонним или двусторонним Z-тестом. Статистические таблицы для t- и Z-распределений содержат критические значения как для односторонних, так и для двусторонних тестов. То есть они предоставляют критические значения, отсекающие область на одном или другом конце распределения выборки, а также критические значения, отсекающие области (вдвое меньшего размера) на обоих концах распределения выборки.