Введение
Способ вывода информации из матриц перекрестной ковариантности. В статистике канонический корреляционный анализ (CCA), также называемый анализом канонических переменных, является способом вывода информации из матриц перекрестной ковариантности. Если у нас есть два вектора X = (X1, …, Xn) и Y = (Y1, …, Ym) случайных переменных, и между переменными существуют корреляции, то канонический корреляционный анализ найдет линейные комбинации X и Y, которые имеют максимальную корреляцию друг с другом. Т. Р. Кнапп отмечает, что «практически все часто встречающиеся параметрические тесты значимости можно рассматривать как частные случаи канонического корреляционного анализа, который является общей процедурой для исследования взаимосвязей между двумя наборами переменных». Метод был впервые представлен Гарольдом Хотеллингом в 1936 году, хотя математическая концепция в контексте углов между плоскостями была опубликована Камилем Жорданом в 1875 году. В настоящее время CCA является краеугольным камнем многомерной статистики и обучения на множественных представлениях, и было предложено большое количество интерпретаций и расширений, таких как вероятностный CCA, разреженный CCA, CCA на множественных представлениях, глубокий CCA и DeepGeoCCA. К сожалению, возможно, из-за его популярности, в литературе может наблюдаться непоследовательность в обозначениях, и мы пытаемся выделить такие несоответствия в этой статье, чтобы помочь читателю наилучшим образом использовать существующую литературу и доступные методы. Как и его сопутствующий метод PCA, CCA можно рассматривать в популяционной форме (соответствующей случайным векторам и их матрицам ковариантности) или в выборочной форме (соответствующей наборам данных и их выборочным матрицам ковариантности). Эти две формы почти точные аналоги друг друга, поэтому их различие часто упускается из виду, но они могут вести себя по-разному в многомерных пространствах. Далее мы приводим четкие математические определения для популяционной задачи и выделяем различные объекты в так называемом каноническом разложении. Понимание различий между этими объектами имеет решающее значение для интерпретации метода.
In statistics, canonical correlation analysis (CCA), also called canonical variates analysis, is a way of inferring information from cross covariance matrices. If we have two vectors X = (X1, , Xn) and Y = (Y1, , Ym) of random variables, and there are correlations among the variables, then canonical correlation analysis will find linear combinations of X and Y that have a maximum correlation with each other. T. R. Knapp notes that "virtually all of the commonly encountered parametric tests of significance can be treated as special cases of canonical correlation analysis, which is the general procedure for investigating the relationships between two sets of variables." The method was first introduced by Harold Hotelling in 1936, although in the context of angles between flats the mathematical concept was published by Camille Jordan in 1875. CCA is now a cornerstone of multivariate statistics and multi view learning, and a great number of interpretations and extensions have been proposed, such as probabilistic CCA, sparse CCA, multi view CCA, Deep CCA, and DeepGeoCCA. Unfortunately, perhaps because of its popularity, the literature can be inconsistent with notation, we attempt to highlight such inconsistencies in this article to help the reader make best use of the existing literature and techniques available. Like its sister method PCA, CCA can be viewed in population form (corresponding to random vectors and their covariance matrices) or in sample form (corresponding to datasets and their sample covariance matrices). These two forms are almost exact analogues of each other, which is why their distinction is often overlooked, but they can behave very differently in high dimensional settings. We next give explicit mathematical definitions for the population problem and highlight the different objects in the so called canonical decomposition understanding the differences between this objects is crucial for interpretation of the technique.
Определение СКВ населения с помощью корреляций
При наличии двух столбцовых векторов и случайных переменных с конечными вторыми моментами, можно определить перекрестную ковариацию как матрицу, элемент которой является ковариацией. На практике матрицу ковариации оценивают на основе выборочных данных из и (то есть из пары матриц данных). Канонический корреляционный анализ ищет последовательность векторов и таких, что случайные переменные и максимизируют корреляцию. (Скалярные) случайные переменные и являются первой парой канонических переменных. Затем ищут векторы, максимизирующие ту же корреляцию, при условии, что они некоррелированы с первой парой канонических переменных; это дает вторую пару канонических переменных. Эта процедура может быть продолжена до раз. Наборы векторов называются каноническими направлениями, векторами весов или просто весами. "Двойные" наборы векторов называются каноническими векторами нагрузок или просто нагрузками; их часто проще интерпретировать, чем веса.
Испытание гипотезы
Каждый ряд можно проверить на значимость следующим образом. Поскольку корреляции отсортированы, утверждение о том, что ряд равен нулю, подразумевает, что все последующие корреляции также равны нулю. Если у нас есть *n* независимых наблюдений в выборке, а *r<sub>i</sub>* – оценка корреляции для *i*-го ряда, то статистический критерий для *i*-го ряда выглядит так:
который асимптотически распределен по закону хи-квадрат с *n-i* степенями свободы при больших *n*. Поскольку все корреляции от *i* до *n* логически равны нулю (и также оцениваются как таковые), произведение для членов после этой точки не имеет значения. Следует отметить, что при малом размере выборки, когда *i* близко к *n*, мы гарантированно получим, что верхние корреляции будут равны 1, и, следовательно, тест становится бессмысленным.
Практическое применение
Типичное применение канонической корреляции в экспериментальном контексте – это анализ двух наборов переменных для выявления общих между ними характеристик. Например, в психологическом тестировании можно использовать два хорошо зарекомендовавших себя многомерных теста личности, такие как Инвентарь многофазной личности Миннесоты (MMPI-2) и NEO. Изучая взаимосвязь между факторами MMPI-2 и факторами NEO, можно получить представление о том, какие общие измерения присутствуют в обоих тестах и какая доля дисперсии между ними разделяется. Например, может оказаться, что измерение экстраверсии или невротизма объясняет значительную часть общей дисперсии между двумя тестами. Канонический корреляционный анализ также можно использовать для построения модели, связывающей два набора переменных, например, набор показателей эффективности и набор объясняющих переменных, или набор выходных данных и набор входных данных. К такой модели можно применять ограничения, чтобы обеспечить соответствие теоретическим требованиям или очевидным условиям. Этот тип модели известен как модель максимальной корреляции. Визуализация результатов канонической корреляции обычно выполняется с помощью столбчатых диаграмм, отображающих коэффициенты для двух наборов переменных для пар канонических переменных, демонстрирующих значимую корреляцию. Некоторые авторы предлагают визуализировать их в виде гелиографов – кругового формата с лучеобразными полосами, где каждая половина представляет один из наборов переменных.
Примеры
Пусть с нулевым математическим ожиданием, т.е. Если , т.е. и идеально коррелируют, то, например, и , так что первая (и единственная в этом примере) пара канонических переменных равна и . Если , т.е. и идеально антикоррелируют, то, например, и , так что первая (и единственная в этом примере) пара канонических переменных равна и .
If , i. e., and are perfectly correlated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
If , i. e., and are perfectly anticorrelated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
We notice that in both cases , which illustrates that the canonical correlation analysis treats correlated and anticorrelated variables similarly.
Мы замечаем, что в обоих случаях , что иллюстрирует, что анализ канонической корреляции одинаково относится к коррелированным и антикоррелированным переменным.
If , i. e., and are perfectly correlated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
If , i. e., and are perfectly anticorrelated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
We notice that in both cases , which illustrates that the canonical correlation analysis treats correlated and anticorrelated variables similarly.
Соединение с основными углами
Предполагая, что и имеют нулевые математические ожидания, то есть , их матрицы ковариации и могут рассматриваться как матрицы Грамма во внутреннем произведении для элементов и , соответственно. В этой интерпретации случайные величины, элементы и элементы рассматриваются как элементы векторного пространства с внутренним произведением, заданным ковариацией; см. Ковариация#Связь с внутренними произведениями. Определение канонических переменных и тогда эквивалентно определению главных векторов для пары подпространств, порожденных элементами и относительно этого внутреннего произведения. Канонические корреляции равны косинусам главных углов.
Отбеливание и вероятностный канонический анализ корреляции
CCA также можно рассматривать как специальное преобразование отбеливания, при котором случайные векторы и одновременно преобразуются таким образом, чтобы перекрестная корреляция между отбеленными векторами и стала диагональной. Канонические корреляции в этом случае интерпретируются как коэффициенты регрессии, связывающие и , и могут быть как положительными, так и отрицательными. Регрессионный подход к CCA также позволяет построить вероятностную генеративную модель с латентными переменными, где некоррелированные скрытые переменные отражают общую и уникальную изменчивость.