Введение

Тест статистической гипотезы. Тест Уилкоксона с подписями рангов – это непараметрический ранговый тест для проверки статистических гипотез, используемый для оценки положения генеральной совокупности на основе выборки данных или для сравнения положений двух генеральных совокупностей, используя две сопоставленные выборки. Одновыборочный вариант выполняет функцию, аналогичную одновыборочному t-критерию Стьюдента. Для двух сопоставленных выборок это тест на парные разности, подобный парному t-критерию Стьюдента (также известному как "t-критерий для сопоставленных пар" или "t-критерий для зависимых выборок"). Тест Уилкоксона может быть хорошей альтернативой t-критерию, когда средние значения генеральной совокупности не представляют интереса; например, когда необходимо проверить, является ли медиана генеральной совокупности отличной от нуля, или существует ли вероятность более 50%, что выборка из одной генеральной совокупности больше, чем выборка из другой генеральной совокупности.

История

Тест назван в честь Фрэнка Уилкоксона (1892–1965), который в одной статье предложил как его, так и тест суммы рангов для двух независимых выборок. Тест получил широкую известность благодаря Сидни Сигелю (1956) и его влиятельному учебнику по непараметрической статистике. Сигель использовал символ T для обозначения статистики теста, и поэтому тест иногда называют тестом Уилкоксона T.

Нули и ничьи

В реальных данных иногда случается, что есть выборка, равная нулю, или пара с равным значением. Также может возникнуть ситуация, когда имеются связанные выборки. Это означает, что для некоторого значения x существует несколько выборок, равных x (в случае одной выборки) или несколько пар с одинаковой разностью (в случае парных выборок). Это особенно часто встречается для дискретных данных. Когда это происходит, описанная выше процедура проверки гипотезы обычно не определена, поскольку нет способа однозначно ранжировать данные. (Единственное исключение – если есть только одна выборка, равная нулю, и нет других нулей или связанных значений.) В связи с этим статистику проверки гипотезы необходимо модифицировать.

Нули

Оригинальная статья Уилкоксона не рассматривала вопрос о наблюдениях (или, в случае парных выборок, о разностях), равных нулю. Однако в последующих обзорах он рекомендовал удалять нули из выборки. Затем стандартный тест знаковых рангов можно было применить к полученным данным, при условии отсутствия совпадений. Это теперь называется процедурой сокращенной выборки. Пратт заметил, что процедура сокращенной выборки может приводить к парадоксальному поведению. Он приводит следующий пример. Предположим, мы имеем дело с одновыборочной ситуацией и располагаем следующими тринадцатью наблюдениями: 0, 2, 3, 4, 6, 7, 8, 9, 11, 14, 15, 17, −18. Процедура сокращенной выборки удаляет ноль. Оставшимся данным присваиваются знаковые ранги: 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, −12. Это дает одностороннее p-значение , и, следовательно, выборка не является статистически значимо положительной при каком-либо уровне значимости. Пратт утверждает, что можно ожидать, что уменьшение наблюдений никак не должно приводить к тому, что данные будут казаться более положительными. Однако, если нулевое наблюдение уменьшить на величину, меньшую 2, или если все наблюдения уменьшить на величину, меньшую 1, то знаковые ранги станут следующими: −1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, −13. Это дает одностороннее p-значение . Следовательно, выборка будет признана статистически значимо положительной при любом уровне значимости. Парадокс заключается в том, что если находится между и , то уменьшение незначимой выборки приводит к тому, что она кажется статистически значимо положительной. Поэтому Пратт предложил процедуру знаковых рангов с учетом нуля. Эта процедура включает нули при ранжировании выборок. Однако она исключает их из тестовой статистики или, что эквивалентно, определяет, что процедура знаковых рангов с учетом нуля обладает несколькими желательными свойствами, которых нет у процедуры сокращенной выборки: увеличение наблюдаемых значений не делает статистически значимо положительную выборку незначимой и не делает незначимую выборку статистически значимо отрицательной. Если распределение наблюдений симметрично, то значения, при которых тест не отвергает гипотезу, образуют интервал. Выборка является статистически значимо положительной, незначимой или статистически значимо отрицательной тогда и только тогда, когда это так, если нулям присвоить произвольные ненулевые знаки, и тогда и только тогда, когда нули заменить ненулевыми значениями, абсолютная величина которых меньше, чем абсолютная величина любого ненулевого наблюдения. Для фиксированного порога значимости и для теста, который рандомизирован для достижения уровня точно , вероятность признания набора наблюдений статистически значимо положительным (соответственно, статистически значимо отрицательным) является не убывающей (соответственно, не возрастающей) функцией наблюдений. Пратт отмечает, что при сочетании процедуры знаковых рангов с учетом нуля с процедурой среднего ранга для разрешения совпадений полученный тест является согласованным тестом против альтернативной гипотезы, согласно которой для всех и разница между ними составляет не менее фиксированной константы, не зависящей от и .
Процедура знаковых рангов с учетом нуля имеет недостаток: когда появляются нули, нулевое распределение статистики теста изменяется, поэтому таблицы p-значений больше нельзя использовать. Когда данные представлены в шкале Лайкерта с равномерно расположенными категориями, процедура знаковых рангов с учетом нуля с большей вероятностью сохранит уровень ошибок первого рода, чем процедура сокращенной выборки. С точки зрения статистической эффективности не существует идеального правила обработки нулей. Коновер обнаружил примеры нулевых и альтернативных гипотез, которые показывают, что ни метод Уилкоксона, ни метод Пратта не являются однозначно лучше друг друга. При сравнении дискретного равномерного распределения с распределением, в котором вероятности линейно возрастают слева направо, метод Пратта превосходит метод Уилкоксона. При проверке биномиального распределения, центрированного в нуле, чтобы определить, равен ли параметр каждого испытания Бернулли , метод Уилкоксона превосходит метод Пратта.

Альтернативная статистика

Вилкоксон первоначально определил статистику суммы рангов Вилкоксона. Ранние авторы, такие как Сигель, придерживались определения Вилкоксона. Это подходит для двусторонних проверок гипотез, но не может быть использовано для односторонних проверок. Вместо присвоения рангов от 1 до n, также возможно присвоение рангов от 0 до n. Они называются модифицированными рангами. Модифицированная сумма рангов с учетом знака, модифицированная сумма положительных рангов и модифицированная сумма отрицательных рангов определяются аналогично , , и , но с использованием модифицированных рангов вместо обычных. Вероятность того, что сумма двух независимых случайных величин, распределенных по закону , будет положительной, может быть оценена как . При ограничении рассмотрения непрерывными распределениями, это является минимально смещенной несмещенной оценкой .

Размер эффекта

Для вычисления размера эффекта для теста с подписанным рангом можно использовать бисериальную корреляцию рангов. Если сообщается о статистике T, то корреляция рангов r равна статистике T, деленной на сумму общего ранга S, или r = T/S. Используя приведенный выше пример, статистика теста T = 9. Выборка размером 9 имеет общую сумму рангов S = (1 + 2 + 3 + 4 + 5 + 6 + 7 + 8 + 9) = 45. Следовательно, корреляция рангов равна 9/45, то есть r = 0,20. Если статистика T представлена, то эквивалентный способ вычисления корреляции рангов – это разность пропорций между двумя суммами рангов, что является формулой простой разности Kerby (2014). ALGLIB включает реализацию теста Уилкоксона с подписанным рангом на C++, C#, Delphi, Visual Basic и т.д. GNU Octave реализует различные односторонние и двусторонние версии теста в функции `wilcoxon_test`. SciPy включает реализацию теста Уилкоксона с подписанным рангом в Python. Accord.NET включает реализацию теста Уилкоксона с подписанным рангом на C# для приложений .NET. MATLAB реализует этот тест, используя "тест суммы рангов Уилкоксона", поскольку `[p,h] = signrank(x,y)` также возвращает логическое значение, указывающее на решение теста. Результат h = 1 указывает на отклонение нулевой гипотезы, а h = 0 указывает на невозможность отклонить нулевую гипотезу на уровне значимости 5%. Пакет Julia HypothesisTests включает тест Уилкоксона с подписанным рангом как `value(SignedRankTest(x, y))`. SAS PROC UNIVARIATE включает тест Уилкоксона с подписанным рангом в заголовках "Tests for Location" как "Signed Rank". Даже если эта процедура вычисляет статистику S, а не статистику W, полученное значение p все равно можно использовать для этого теста.