Введение

Измерение линейной корреляции

В статистике коэффициент корреляции Пирсона (PCC) — это коэффициент корреляции, измеряющий линейную корреляцию между двумя наборами данных. Он представляет собой отношение ковариации двух переменных к произведению их стандартных отклонений; таким образом, это, по сути, нормализованная мера ковариации, в результате чего значение всегда находится в диапазоне от -1 до 1. Как и сама ковариация, эта мера может отражать только линейную корреляцию переменных и не учитывает многие другие типы взаимосвязей или корреляций. В качестве простого примера, можно ожидать, что возраст и рост выборки подростков из старшей школы будут иметь коэффициент корреляции Пирсона значительно больше 0, но меньше 1 (поскольку значение 1 соответствовало бы нереалистично идеальной корреляции).

Название и история

Он был разработан Карлом Пирсоном на основе смежной идеи, предложенной Фрэнсисом Гальтоном в 1880-х годах, а математическая формула для неё была выведена и опубликована Огюстом Браве в 1844 году. Таким образом, наименование этого коэффициента является примером закона Стиглера.

Определение

Коэффициент корреляции Пирсона — это ковариация двух переменных, делённая на произведение их стандартных отклонений. Форма определения включает в себя "момент произведения", то есть среднее (первый момент относительно начала координат) произведения переменных, приведённых к среднему; отсюда и добавление "момент произведения" к названию.

Математические свойства

Значения коэффициентов корреляции Пирсона для выборки и генеральной совокупности лежат в диапазоне от -1 до 1 включительно. Корреляции, равные +1 или −1, соответствуют точкам данных, лежащим точно на прямой (в случае корреляции выборки), или двумерному распределению, полностью сосредоточенному на прямой (в случае корреляции генеральной совокупности). Коэффициент корреляции Пирсона симметричен: corr(X,Y) = corr(Y,X). Важным математическим свойством коэффициента корреляции Пирсона является его инвариантность относительно независимых изменений местоположения и масштаба в обеих переменных. То есть, мы можем преобразовать X в a + bX и Y в c + dY, где a, b, c и d – константы, причём b, d > 0, не изменяя коэффициент корреляции. (Это справедливо как для коэффициентов корреляции Пирсона генеральной совокупности, так и для выборки.) Более общие линейные преобразования изменяют корреляцию: об этом можно узнать в [укажите ссылку].

Интерпретация величины корреляции

Несколько авторов предложили рекомендации по интерпретации коэффициента корреляции. Интерпретация коэффициента корреляции зависит от контекста и целей исследования. Корреляция в 0,8 может оказаться очень низкой, если речь идет о проверке физического закона с использованием высокоточного оборудования, но может считаться очень высокой в социальных науках, где влияние различных осложняющих факторов может быть более существенным.

Использование пермутационного теста

Пермутационные тесты предоставляют прямой подход к проведению проверки гипотез и построению доверительных интервалов. Пермутационный тест для коэффициента корреляции Пирсона включает следующие два шага: используя исходные парные данные (xi, yi), случайным образом переопределите пары для создания нового набора данных (xi, yi′), где i′ является перестановкой множества {1, …, n}. Перестановка i′ выбирается случайным образом, при этом равные вероятности присваиваются всем n! возможным перестановкам. Это эквивалентно случайной выборке i′ без возвращения из множества {1, …, n}. В бутстрэпе, тесно связанном подходе, i и i′ совпадают и выбираются с возвращением из множества {1, …, n}; вычислите коэффициент корреляции r на основе рандомизированных данных. Для проведения пермутационного теста повторите шаги (1) и (2) большое количество раз. P-значение для пермутационного теста – это доля значений r, полученных на этапе (2), которые больше коэффициента корреляции Пирсона, рассчитанного для исходных данных. Здесь "больше" может означать больше по абсолютной величине или больше по знаку, в зависимости от того, требуется ли двухсторонний или односторонний тест.

Используя bootstrap

Бутстрап может быть использован для построения доверительных интервалов для коэффициента корреляции Пирсона. В "непараметрическом" бутстрапе n пар (xi, yi) повторно отбираются "с возвращением" из наблюдаемого набора n пар, и коэффициент корреляции r вычисляется на основе полученных повторных выборок. Эта процедура повторяется большое число раз, а эмпирическое распределение полученных значений r используется для аппроксимации выборочного распределения статистики. 95%-ный доверительный интервал для ρ можно определить как интервал от 2,5-го до 97,5-го процентиля повторно отобранных значений r.

Тестирование с использованием t-распределения Студента

Для пар из некоррелированного бивариантного нормального распределения, распределение выборки студентизированного коэффициента корреляции Пирсона следует t-распределению Стьюдента со степенями свободы n - 2. В частности, если исходные переменные имеют бивариантное нормальное распределение, то переменная

имеет t-распределение Стьюдента в нулевой гипотезе (при нулевой корреляции). Это справедливо приближенно, если наблюдаемые значения не являются нормальными, при достаточно больших размерах выборки. Для определения критических значений для r требуется обратная функция:

В качестве альтернативы можно использовать асимптотические методы для больших выборок. Другая ранняя работа содержит графики и таблицы для общих значений ρ при малых размерах выборки и обсуждает вычислительные методы. В случае, когда исходные переменные не имеют нормального распределения, распределение выборки коэффициента корреляции Пирсона следует t-распределению Стьюдента, но число степеней свободы уменьшается.

Используя точное распределение доверия

Доверительные интервалы и тесты могут быть вычислены на основе доверительного распределения. Точная плотность доверия для ρ равна

где – гауссова гипергеометрическая функция, а .

Реализация программного обеспечения

Базовый пакет статистики R вычисляет коэффициент корреляции с помощью функции `cor(x, y)`, а также (вместе со значением P) с помощью функции `cor.test(x, y)`. В библиотеке SciPy для Python это реализуется функцией `pearsonr(x, y)`. Библиотека Pandas для Python вычисляет коэффициент корреляции Пирсона по умолчанию, используя метод `pandas.DataFrame.corr`. В Wolfram Mathematica это делается с помощью функции `Correlation`, а также (вместе со значением P) с помощью функции `CorrelationTest`. Библиотека Boost C++ предоставляет функцию для вычисления коэффициента корреляции. В Excel для расчета коэффициента корреляции Пирсона используется встроенная функция `correl(array1, array2)`.