Ковариация и корреляция: основные понятия и связь.
Covariance and correlation
Ковариация и корреляция в теории вероятностей: определения, формулы, связь с дисперсией и стандартным отклонением. Математическая статистика и анализ данных.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Концепции в теории вероятности и статистике
Concepts in probability and statistics
В теории вероятности и статистике математические концепции ковариации и корреляции очень похожи. Обе описывают степень, в которой две случайные величины или наборы случайных величин склонны отклоняться от своих математических ожиданий схожим образом. Если X и Y – две случайные величины со средними значениями (математическими ожиданиями) μX и μY и стандартными отклонениями σX и σY соответственно, то их ковариация и корреляция определяются следующим образом:
In probability theory and statistics, the mathematical concepts of covariance and correlation are very similar. Both describe the degree to which two random variables or sets of random variables tend to deviate from their expected values in similar ways. If X and Y are two random variables, with means (expected values) μX and μY and standard deviations σX and σY, respectively, then their covariance and correlation are as follows:
ковариация
covariance
корреляция
correlation
так, что
so that
где E – оператор математического ожидания. Важно отметить, что корреляция безразмерна, а ковариация измеряется в единицах, полученных путем перемножения единиц измерения двух переменных. Если Y всегда принимает те же значения, что и X, мы имеем ковариацию переменной с самой собой (т.е. ), которая называется дисперсией и чаще обозначается как квадрат стандартного отклонения. Корреляция переменной с самой собой всегда равна 1 (за исключением вырожденного случая, когда обе дисперсии равны нулю, поскольку X всегда принимает одно и то же значение, в этом случае корреляция не определена, так как её вычисление включает деление на 0). В более общем случае, корреляция между двумя переменными равна 1 (или –1), если одна из них всегда принимает значение, которое точно задается линейной функцией другой с соответственно положительным (или отрицательным) угловым коэффициентом. Хотя значения теоретических ковариаций и корреляций связаны вышеуказанным образом, вероятностные распределения выборочных оценок этих величин не связаны между собой простым способом и, как правило, требуют раздельного рассмотрения.
where E is the expected value operator. Notably, correlation is dimensionless while covariance is in units obtained by multiplying the units of the two variables. If Y always takes on the same values as X, we have the covariance of a variable with itself (i. e. ), which is called the variance and is more commonly denoted as the square of the standard deviation. The correlation of a variable with itself is always 1 (except in the degenerate case where the two variances are zero because X always takes on the same single value, in which case the correlation does not exist since its computation would involve division by 0). More generally, the correlation between two variables is 1 (or –1) if one of them always takes on a value that is given exactly by a linear function of the other with respectively a positive (or negative) slope. Although the values of the theoretical covariances and correlations are linked in the above way, the probability distributions of sample estimates of these quantities are not linked in any simple way and they generally need to be treated separately.
Многочисленные случайные переменные
При любом количестве случайных переменных, большем единицы, эти переменные можно объединить в случайный вектор, i-й элемент которого соответствует i-й случайной переменной. Затем дисперсии и ковариации можно представить в виде матрицы ковариаций, где элемент (i, j) – это ковариация между i-й и j-й случайными переменными. Точно так же корреляции можно представить в виде корреляционной матрицы.
With any number of random variables in excess of 1, the variables can be stacked into a random vector whose i th element is the i th random variable. Then the variances and covariances can be placed in a covariance matrix, in which the (i, j) element is the covariance between the i th random variable and the j th one. Likewise, the correlations can be placed in a correlation matrix.