Введение
Статистическое сравнение порядковых рангов
В статистике корреляция рангов – это любая из нескольких статистик, измеряющих порядковую связь – взаимосвязь между ранжированиями различных порядковых переменных или различными ранжированиями одной и той же переменной, где "ранжирование" – это присвоение меток порядка "первый", "второй", "третий" и т.д. различным наблюдениям конкретной переменной. Коэффициент корреляции рангов измеряет степень сходства между двумя ранжированиями и может использоваться для оценки значимости связи между ними. Например, два распространенных непараметрических метода проверки значимости, использующих корреляцию рангов, – это U-критерий Манна-Уитни и критерий знаковых рангов Уилкоксона.
In statistics, a rank correlation is any of several statistics that measure an ordinal association—the relationship between rankings of different ordinal variables or different rankings of the same variable, where a "ranking" is the assignment of the ordering labels "first", "second", "third", etc. to different observations of a particular variable. A rank correlation coefficient measures the degree of similarity between two rankings, and can be used to assess the significance of the relation between them. For example, two common nonparametric methods of significance that use rank correlation are the Mann–Whitney U test and the Wilcoxon signed rank test.
Контекст
Если, например, одна переменная – это принадлежность к баскетбольной команде колледжа, а другая – к футбольной, можно проверить, существует ли связь между позициями этих команд в рейтингах: стремятся ли колледжи с более высоким рейтингом баскетбольной команды иметь более высокий рейтинг футбольной команды? Коэффициент ранговой корреляции может измерить эту связь, а оценка значимости коэффициента ранговой корреляции может показать, достаточно ли слаба выявленная связь, чтобы, скорее всего, быть случайностью. Если есть только одна переменная – принадлежность к футбольной команде колледжа, но она оценивается по двум разным рейтингам (например, тренерами и спортивными журналистами), то сходство этих двух рейтингов можно измерить с помощью коэффициента ранговой корреляции. В качестве другого примера, в таблице сопряженности, где в строках указаны уровни дохода (низкий, средний, высокий), а в столбцах – уровень образования (неполное среднее, среднее, высшее), ранговая корреляция измеряет связь между доходом и уровнем образования.
Корреляция ранга и бисерии
Джин Гласс (1965) отметил, что бисериал рангов можно вывести из коэффициента Спирмана. «Можно получить коэффициент, определенный для X, дихотомической переменной, и Y, переменной рангов, который оценивает rho Спирмана между X и Y так же, как бисериал r оценивает r Пирсона между двумя нормально распределенными переменными» (с. 91). Бисериальная корреляция рангов была предложена за девять лет до этого Эдвардом Кьюретоном (1956) как мера корреляции рангов в случае, когда ранги распределены по двум группам.
Формула простой разницы Керби
Дэйв Керби (2014) рекомендовал бисериальный коэффициент рангов в качестве способа знакомства студентов с ранговой корреляцией, поскольку общую логику можно объяснить на начальном уровне. Бисериальный коэффициент рангов – это корреляция, используемая в тесте Манна-Уитни, методе, который обычно рассматривается во вводных университетских курсах по статистике. Данные для этого теста состоят из двух групп, и для каждого участника группы результат ранжируется относительно всей выборки. Керби показал, что эту ранговую корреляцию можно выразить через две концепции: процент данных, подтверждающих выдвинутую гипотезу, и процент данных, не подтверждающих ее. Формула простого разложения Керби утверждает, что ранговая корреляция может быть выражена как разность между долей благоприятных свидетельств (f) и долей неблагоприятных свидетельств (u).
Пример и интерпретация
Чтобы проиллюстрировать вычисление, представим, что тренер тренирует бегунов на длинные дистанции в течение месяца, используя два метода. В группе А 5 бегунов, а в группе В – 4 бегуна. Выдвинутая гипотеза состоит в том, что метод А позволяет подготовить более быстрых бегунов. В забеге для оценки результатов выясняется, что бегуны из группы А действительно показали лучшие результаты, заняв следующие места: 1, 2, 3, 4 и 6. Соответственно, более медленные бегуны из группы В заняли места 5, 7, 8 и 9. Анализ проводится по парам, определяемым как сравнение участника из одной группы с участником из другой группы. Например, самый быстрый бегун в исследовании участвует в четырех парах: (1,5), (1,7), (1,8) и (1,9). Все четыре пары подтверждают гипотезу, поскольку в каждой паре бегун из группы А обогнал бегуна из группы В. Всего сформировано 20 пар, и 19 из них подтверждают гипотезу. Единственная пара, не поддерживающая гипотезу, состоит из бегунов, занявших 5-е и 6-е места, так как в этой паре бегун из группы В показал лучшее время. Согласно простой разностной формуле Керби, 95% данных подтверждают гипотезу (19 из 20 пар), а 5% – опровергают (1 из 20 пар), следовательно, коэффициент ранговой корреляции равен r = .95 − .05 = .90. Максимальное значение коэффициента корреляции r = 1, что означает, что 100% пар подтверждают гипотезу. Корреляция r = 0 указывает на то, что половина пар подтверждает гипотезу, а половина – нет; другими словами, ранги в выборках не различаются, и нет оснований полагать, что они взяты из двух разных популяций. Можно сказать, что размер эффекта r = 0 описывает отсутствие связи между принадлежностью к группе и рангами участников.