Введение

Непараметрический метод для проверки того, происходят ли выборки из одного распределения. Тест Крускала-Уоллиса по рангам, тест Крускала-Уоллиса (названный в честь Уильяма Крускала и У. Аллена Уоллиса) или однофакторная ANOVA по рангам. Он используется для сравнения двух или более независимых выборок одинакового или различного размера. Он является расширением теста Манна-Уитни U, который используется для сравнения только двух групп. Параметрическим эквивалентом теста Крускала-Уоллиса является однофакторный дисперсионный анализ (ANOVA). Значимый результат теста Крускала-Уоллиса указывает на то, что по крайней мере одна выборка стохастически доминирует над другой. Тест не определяет, где происходит это стохастическое доминирование или для скольких пар групп оно наблюдается. Для анализа конкретных пар выборок на предмет стохастического доминирования иногда используются тест Данна, парные тесты Манна-Уитни с поправкой Бонферрони или более мощный, но менее известный тест Коновера-Имана. Предполагается, что факторы существенно влияют на уровень отклика, и существует определенный порядок между ними: один фактор, как правило, дает наименьший отклик, другой – следующий по величине, и так далее. Поскольку это непараметрический метод, тест Крускала-Уоллиса не предполагает нормальное распределение остатков, в отличие от аналогичного однофакторного дисперсионного анализа. Если исследователь может предположить, что распределения для всех групп имеют одинаковую форму и масштаб, за исключением возможных различий в медианах, то нулевая гипотеза заключается в том, что медианы всех групп равны, а альтернативная гипотеза – в том, что медиана хотя бы одной популяции отличается от медианы хотя бы одной другой популяции. В противном случае невозможно определить, связано ли отклонение нулевой гипотезы со сдвигом в расположении или с разбросом групп. Это та же проблема, что возникает и при тесте Манна-Уитни. Если данные содержат потенциальные выбросы, если распределения популяций имеют тяжелые хвосты или если распределения популяций значительно скошены, тест Крускала-Уоллиса более эффективно выявляет различия между факторами, чем F-тест ANOVA. С другой стороны, если распределения популяций нормальные или имеют легкие хвосты и симметричны, то F-тест ANOVA, как правило, обладает большей мощностью, то есть вероятностью отклонить нулевую гипотезу, когда это действительно необходимо.

Точное распределение H

Чой и др. провели обзор двух методов, разработанных для вычисления точного распределения, предложили новый метод и сравнили точное распределение с его аппроксимацией хи-квадрат.

Реализация

Тест Крускала-Уоллиса может быть реализован во многих инструментах и языках программирования. Mathematica реализует тест как LocationEquivalenceTest. В Statistics Toolbox MATLAB есть функция kruskalwallis для вычисления p-значения для проверки гипотезы и отображения таблицы ANOVA. SAS использует процедуру "NPAR1WAY" для проведения теста. SPSS реализует тест с помощью процедуры "Непараметрические тесты". Minitab имеет реализацию в опции "Непараметрические методы". В пакете SciPy для Python функция scipy.stats.kruskal может возвращать результат теста и p-значение. Базовый пакет R содержит реализацию этого теста с использованием kruskal.test. Java предоставляет реализацию от Apache Commons. В Julia пакет HypothesisTests.jl имеет функцию KruskalWallisTest(groups::AbstractVector{<:Real}) для вычисления p-значения.