Введение
Измерение линейной корреляции
В статистике коэффициент корреляции Пирсона (PCC) — это коэффициент корреляции, измеряющий линейную корреляцию между двумя наборами данных. Он представляет собой отношение ковариации двух переменных к произведению их стандартных отклонений; таким образом, это, по сути, нормализованная мера ковариации, в результате чего значение всегда находится в диапазоне от -1 до 1. Как и сама ковариация, эта мера может отражать только линейную корреляцию переменных и не учитывает многие другие типы взаимосвязей или корреляций. В качестве простого примера, можно ожидать, что возраст и рост выборки подростков из старшей школы будут иметь коэффициент корреляции Пирсона значительно больше 0, но меньше 1 (поскольку значение 1 соответствовало бы нереалистично идеальной корреляции).
Название и история
Он был разработан Карлом Пирсоном на основе смежной идеи, предложенной Фрэнсисом Гальтоном в 1880-х годах, а математическая формула для неё была выведена и опубликована Огюстом Браве в 1844 году. Таким образом, наименование этого коэффициента является примером закона Стиглера.
Определение
Коэффициент корреляции Пирсона — это ковариация двух переменных, делённая на произведение их стандартных отклонений. Форма определения включает в себя "момент произведения", то есть среднее (первый момент относительно начала координат) произведения переменных, приведённых к среднему; отсюда и добавление "момент произведения" к названию.
Математические свойства
Значения коэффициентов корреляции Пирсона для выборки и генеральной совокупности лежат в диапазоне от -1 до 1 включительно. Корреляции, равные +1 или −1, соответствуют точкам данных, лежащим точно на прямой (в случае корреляции выборки), или двумерному распределению, полностью сосредоточенному на прямой (в случае корреляции генеральной совокупности). Коэффициент корреляции Пирсона симметричен: corr(X,Y) = corr(Y,X). Важным математическим свойством коэффициента корреляции Пирсона является его инвариантность относительно независимых изменений местоположения и масштаба в обеих переменных. То есть, мы можем преобразовать X в a + bX и Y в c + dY, где a, b, c и d – константы, причём b, d > 0, не изменяя коэффициент корреляции. (Это справедливо как для коэффициентов корреляции Пирсона генеральной совокупности, так и для выборки.) Более общие линейные преобразования изменяют корреляцию: об этом можно узнать в [укажите ссылку].
Интерпретация величины корреляции
Несколько авторов предложили рекомендации по интерпретации коэффициента корреляции. Интерпретация коэффициента корреляции зависит от контекста и целей исследования. Корреляция в 0,8 может оказаться очень низкой, если речь идет о проверке физического закона с использованием высокоточного оборудования, но может считаться очень высокой в социальных науках, где влияние различных осложняющих факторов может быть более существенным.
Использование пермутационного теста
Пермутационные тесты предоставляют прямой подход к проведению проверки гипотез и построению доверительных интервалов. Пермутационный тест для коэффициента корреляции Пирсона включает следующие два шага: используя исходные парные данные (xi, yi), случайным образом переопределите пары для создания нового набора данных (xi, yi′), где i′ является перестановкой множества {1, …, n}. Перестановка i′ выбирается случайным образом, при этом равные вероятности присваиваются всем n! возможным перестановкам. Это эквивалентно случайной выборке i′ без возвращения из множества {1, …, n}. В бутстрэпе, тесно связанном подходе, i и i′ совпадают и выбираются с возвращением из множества {1, …, n}; вычислите коэффициент корреляции r на основе рандомизированных данных. Для проведения пермутационного теста повторите шаги (1) и (2) большое количество раз. P-значение для пермутационного теста – это доля значений r, полученных на этапе (2), которые больше коэффициента корреляции Пирсона, рассчитанного для исходных данных. Здесь "больше" может означать больше по абсолютной величине или больше по знаку, в зависимости от того, требуется ли двухсторонний или односторонний тест.
Using the original paired data (xi, yi), randomly redefine the pairs to create a new data set (xi, yi′), where the i′ are a permutation of the set {1, ,n}. The permutation i′ is selected randomly, with equal probabilities placed on all n! possible permutations. This is equivalent to drawing the i′ randomly without replacement from the set {1, , n}. In bootstrapping, a closely related approach, the i and the i′ are equal and drawn with replacement from {1, , n};
Construct a correlation coefficient r from the randomized data. To perform the permutation test, repeat steps (1) and (2) a large number of times. The p value for the permutation test is the proportion of the r values generated in step (2) that are larger than the Pearson correlation coefficient that was calculated from the original data. Here "larger" can mean either that the value is larger in magnitude, or larger in signed value, depending on whether a two sided or one sided test is desired.
Используя bootstrap
Бутстрап может быть использован для построения доверительных интервалов для коэффициента корреляции Пирсона. В "непараметрическом" бутстрапе n пар (xi, yi) повторно отбираются "с возвращением" из наблюдаемого набора n пар, и коэффициент корреляции r вычисляется на основе полученных повторных выборок. Эта процедура повторяется большое число раз, а эмпирическое распределение полученных значений r используется для аппроксимации выборочного распределения статистики. 95%-ный доверительный интервал для ρ можно определить как интервал от 2,5-го до 97,5-го процентиля повторно отобранных значений r.
Тестирование с использованием t-распределения Студента
Для пар из некоррелированного бивариантного нормального распределения, распределение выборки студентизированного коэффициента корреляции Пирсона следует t-распределению Стьюдента со степенями свободы n - 2. В частности, если исходные переменные имеют бивариантное нормальное распределение, то переменная
имеет t-распределение Стьюдента в нулевой гипотезе (при нулевой корреляции). Это справедливо приближенно, если наблюдаемые значения не являются нормальными, при достаточно больших размерах выборки. Для определения критических значений для r требуется обратная функция:
В качестве альтернативы можно использовать асимптотические методы для больших выборок. Другая ранняя работа содержит графики и таблицы для общих значений ρ при малых размерах выборки и обсуждает вычислительные методы. В случае, когда исходные переменные не имеют нормального распределения, распределение выборки коэффициента корреляции Пирсона следует t-распределению Стьюдента, но число степеней свободы уменьшается.
Используя точное распределение доверия
Доверительные интервалы и тесты могут быть вычислены на основе доверительного распределения. Точная плотность доверия для ρ равна
где – гауссова гипергеометрическая функция, а .
Реализация программного обеспечения
Базовый пакет статистики R вычисляет коэффициент корреляции с помощью функции `cor(x, y)`, а также (вместе со значением P) с помощью функции `cor.test(x, y)`. В библиотеке SciPy для Python это реализуется функцией `pearsonr(x, y)`. Библиотека Pandas для Python вычисляет коэффициент корреляции Пирсона по умолчанию, используя метод `pandas.DataFrame.corr`. В Wolfram Mathematica это делается с помощью функции `Correlation`, а также (вместе со значением P) с помощью функции `CorrelationTest`. Библиотека Boost C++ предоставляет функцию для вычисления коэффициента корреляции. В Excel для расчета коэффициента корреляции Пирсона используется встроенная функция `correl(array1, array2)`.
Wolfram Mathematica via the Correlation function, or (with the P value) with CorrelationTest. The Boost C++ library via the correlation coefficient function. Excel has an in built correl(array1, array2) function for calculating the pearson's correlation coefficient.