Введение
Тест статистической гипотезы. Тест Уилкоксона с подписями рангов – это непараметрический ранговый тест для проверки статистических гипотез, используемый для оценки положения генеральной совокупности на основе выборки данных или для сравнения положений двух генеральных совокупностей, используя две сопоставленные выборки. Одновыборочный вариант выполняет функцию, аналогичную одновыборочному t-критерию Стьюдента. Для двух сопоставленных выборок это тест на парные разности, подобный парному t-критерию Стьюдента (также известному как "t-критерий для сопоставленных пар" или "t-критерий для зависимых выборок"). Тест Уилкоксона может быть хорошей альтернативой t-критерию, когда средние значения генеральной совокупности не представляют интереса; например, когда необходимо проверить, является ли медиана генеральной совокупности отличной от нуля, или существует ли вероятность более 50%, что выборка из одной генеральной совокупности больше, чем выборка из другой генеральной совокупности.
The Wilcoxon signed rank test is a non parametric rank test for statistical hypothesis testing used either to test the location of a population based on a sample of data, or to compare the locations of two populations using two matched samples. The one sample version serves a purpose similar to that of the one sample Student's t test. For two matched samples, it is a paired difference test like the paired Student's t test (also known as the "t test for matched pairs" or "t test for dependent samples"). The Wilcoxon test can be a good alternative to the t test when population means are not of interest; for example, when one wishes to test whether a population's median is nonzero, or whether there is a better than 50% chance that a sample from one population is greater than a sample from another population.
История
Тест назван в честь Фрэнка Уилкоксона (1892–1965), который в одной статье предложил как его, так и тест суммы рангов для двух независимых выборок. Тест получил широкую известность благодаря Сидни Сигелю (1956) и его влиятельному учебнику по непараметрической статистике. Сигель использовал символ T для обозначения статистики теста, и поэтому тест иногда называют тестом Уилкоксона T.
Нули и ничьи
В реальных данных иногда случается, что есть выборка, равная нулю, или пара с равным значением. Также может возникнуть ситуация, когда имеются связанные выборки. Это означает, что для некоторого значения x существует несколько выборок, равных x (в случае одной выборки) или несколько пар с одинаковой разностью (в случае парных выборок). Это особенно часто встречается для дискретных данных. Когда это происходит, описанная выше процедура проверки гипотезы обычно не определена, поскольку нет способа однозначно ранжировать данные. (Единственное исключение – если есть только одна выборка, равная нулю, и нет других нулей или связанных значений.) В связи с этим статистику проверки гипотезы необходимо модифицировать.
Нули
Оригинальная статья Уилкоксона не рассматривала вопрос о наблюдениях (или, в случае парных выборок, о разностях), равных нулю. Однако в последующих обзорах он рекомендовал удалять нули из выборки. Затем стандартный тест знаковых рангов можно было применить к полученным данным, при условии отсутствия совпадений. Это теперь называется процедурой сокращенной выборки. Пратт заметил, что процедура сокращенной выборки может приводить к парадоксальному поведению. Он приводит следующий пример. Предположим, мы имеем дело с одновыборочной ситуацией и располагаем следующими тринадцатью наблюдениями: 0, 2, 3, 4, 6, 7, 8, 9, 11, 14, 15, 17, −18. Процедура сокращенной выборки удаляет ноль. Оставшимся данным присваиваются знаковые ранги: 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, −12. Это дает одностороннее p-значение , и, следовательно, выборка не является статистически значимо положительной при каком-либо уровне значимости. Пратт утверждает, что можно ожидать, что уменьшение наблюдений никак не должно приводить к тому, что данные будут казаться более положительными. Однако, если нулевое наблюдение уменьшить на величину, меньшую 2, или если все наблюдения уменьшить на величину, меньшую 1, то знаковые ранги станут следующими: −1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, −13. Это дает одностороннее p-значение . Следовательно, выборка будет признана статистически значимо положительной при любом уровне значимости. Парадокс заключается в том, что если находится между и , то уменьшение незначимой выборки приводит к тому, что она кажется статистически значимо положительной. Поэтому Пратт предложил процедуру знаковых рангов с учетом нуля. Эта процедура включает нули при ранжировании выборок. Однако она исключает их из тестовой статистики или, что эквивалентно, определяет, что процедура знаковых рангов с учетом нуля обладает несколькими желательными свойствами, которых нет у процедуры сокращенной выборки: увеличение наблюдаемых значений не делает статистически значимо положительную выборку незначимой и не делает незначимую выборку статистически значимо отрицательной. Если распределение наблюдений симметрично, то значения, при которых тест не отвергает гипотезу, образуют интервал. Выборка является статистически значимо положительной, незначимой или статистически значимо отрицательной тогда и только тогда, когда это так, если нулям присвоить произвольные ненулевые знаки, и тогда и только тогда, когда нули заменить ненулевыми значениями, абсолютная величина которых меньше, чем абсолютная величина любого ненулевого наблюдения. Для фиксированного порога значимости и для теста, который рандомизирован для достижения уровня точно , вероятность признания набора наблюдений статистически значимо положительным (соответственно, статистически значимо отрицательным) является не убывающей (соответственно, не возрастающей) функцией наблюдений. Пратт отмечает, что при сочетании процедуры знаковых рангов с учетом нуля с процедурой среднего ранга для разрешения совпадений полученный тест является согласованным тестом против альтернативной гипотезы, согласно которой для всех и разница между ними составляет не менее фиксированной константы, не зависящей от и .
Процедура знаковых рангов с учетом нуля имеет недостаток: когда появляются нули, нулевое распределение статистики теста изменяется, поэтому таблицы p-значений больше нельзя использовать. Когда данные представлены в шкале Лайкерта с равномерно расположенными категориями, процедура знаковых рангов с учетом нуля с большей вероятностью сохранит уровень ошибок первого рода, чем процедура сокращенной выборки. С точки зрения статистической эффективности не существует идеального правила обработки нулей. Коновер обнаружил примеры нулевых и альтернативных гипотез, которые показывают, что ни метод Уилкоксона, ни метод Пратта не являются однозначно лучше друг друга. При сравнении дискретного равномерного распределения с распределением, в котором вероятности линейно возрастают слева направо, метод Пратта превосходит метод Уилкоксона. При проверке биномиального распределения, центрированного в нуле, чтобы определить, равен ли параметр каждого испытания Бернулли , метод Уилкоксона превосходит метод Пратта.
0, 2, 3, 4, 6, 7, 8, 9, 11, 14, 15, 17, −18. The reduced sample procedure removes the zero. To the remaining data, it assigns the signed ranks:
1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, −12. This has a one sided p value of , and therefore the sample is not significantly positive at any significance level Pratt argues that one would expect that decreasing the observations should certainly not make the data appear more positive. However, if the zero observation is decreased by an amount less than 2, or if all observations are decreased by an amount less than 1, then the signed ranks become:
−1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, −13. This has a one sided p value of Therefore the sample would be judged significantly positive at any significance level The paradox is that, if is between and , then decreasing an insignificant sample causes it to appear significantly positive. Pratt therefore proposed the signed rank zero procedure. This procedure includes the zeros when ranking the samples. However, it excludes them from the test statistic, or equivalently it defines Pratt proved that the signed rank zero procedure has several desirable behaviors not shared by the reduced sample procedure:
Increasing the observed values does not make a significantly positive sample insignificant, and it does not make an insignificant sample significantly negative. If the distribution of the observations is symmetric, then the values of which the test does not reject form an interval. A sample is significantly positive, not significant, or significantly negative, if and only if it is so when the zeros are assigned arbitrary non zero signs, if and only if it is so when the zeros are replaced with non zero values which are smaller in absolute value than any non zero observation. For a fixed significance threshold , and for a test which is randomized to have level exactly , the probability of calling a set of observations significantly positive (respectively, significantly negative) is a non decreasing (respectively, non increasing) function of the observations. Pratt remarks that, when the signed rank zero procedure is combined with the average rank procedure for resolving ties, the resulting test is a consistent test against the alternative hypothesis that, for all , and differ by at least a fixed constant that is independent of and
The signed rank zero procedure has the disadvantage that, when zeros occur, the null distribution of the test statistic changes, so tables of p values can no longer be used. When the data is on a Likert scale with equally spaced categories, the signed rank zero procedure is more likely to maintain the Type I error rate than the reduced sample procedure. From the viewpoint of statistical efficiency, there is no perfect rule for handling zeros. Conover found examples of null and alternative hypotheses that show that neither Wilcoxon's and Pratt's methods are uniformly better than the other. When comparing a discrete uniform distribution to a distribution where probabilities linearly increase from left to right, Pratt's method outperforms Wilcoxon's. When testing a binomial distribution centered at zero to see whether the parameter of each Bernoulli trial is , Wilcoxon's method outperforms Pratt's.
Альтернативная статистика
Вилкоксон первоначально определил статистику суммы рангов Вилкоксона. Ранние авторы, такие как Сигель, придерживались определения Вилкоксона. Это подходит для двусторонних проверок гипотез, но не может быть использовано для односторонних проверок. Вместо присвоения рангов от 1 до n, также возможно присвоение рангов от 0 до n. Они называются модифицированными рангами. Модифицированная сумма рангов с учетом знака, модифицированная сумма положительных рангов и модифицированная сумма отрицательных рангов определяются аналогично , , и , но с использованием модифицированных рангов вместо обычных. Вероятность того, что сумма двух независимых случайных величин, распределенных по закону , будет положительной, может быть оценена как . При ограничении рассмотрения непрерывными распределениями, это является минимально смещенной несмещенной оценкой .
Размер эффекта
Для вычисления размера эффекта для теста с подписанным рангом можно использовать бисериальную корреляцию рангов. Если сообщается о статистике T, то корреляция рангов r равна статистике T, деленной на сумму общего ранга S, или r = T/S. Используя приведенный выше пример, статистика теста T = 9. Выборка размером 9 имеет общую сумму рангов S = (1 + 2 + 3 + 4 + 5 + 6 + 7 + 8 + 9) = 45. Следовательно, корреляция рангов равна 9/45, то есть r = 0,20. Если статистика T представлена, то эквивалентный способ вычисления корреляции рангов – это разность пропорций между двумя суммами рангов, что является формулой простой разности Kerby (2014). ALGLIB включает реализацию теста Уилкоксона с подписанным рангом на C++, C#, Delphi, Visual Basic и т.д. GNU Octave реализует различные односторонние и двусторонние версии теста в функции `wilcoxon_test`. SciPy включает реализацию теста Уилкоксона с подписанным рангом в Python. Accord.NET включает реализацию теста Уилкоксона с подписанным рангом на C# для приложений .NET. MATLAB реализует этот тест, используя "тест суммы рангов Уилкоксона", поскольку `[p,h] = signrank(x,y)` также возвращает логическое значение, указывающее на решение теста. Результат h = 1 указывает на отклонение нулевой гипотезы, а h = 0 указывает на невозможность отклонить нулевую гипотезу на уровне значимости 5%. Пакет Julia HypothesisTests включает тест Уилкоксона с подписанным рангом как `value(SignedRankTest(x, y))`. SAS PROC UNIVARIATE включает тест Уилкоксона с подписанным рангом в заголовках "Tests for Location" как "Signed Rank". Даже если эта процедура вычисляет статистику S, а не статистику W, полученное значение p все равно можно использовать для этого теста.