Кіріспе
Кроссты ковариациялық матрицалардан ақпаратты шығару тәсілі
Статистикада каноникалық корреляциялық талдау (ККА), сондай-ақ каноникалық вариациялар талдауы деп аталады, кроссты ковариациялық матрицалардан ақпаратты шығарудың бір жолы болып табылады. Егер бізде екі вектор X = (X1, …, Xn) және Y = (Y1, …, Ym) кездейсоқ айнымалылары болса және айнымалылар арасында корреляциялар болса, онда каноникалық корреляциялық талдау X және Y арасындағы ең жоғары корреляцияға ие болатын сызықтық комбинацияларды табады. Т. Р. Кнапп атап өткендей, "көбінесе кездесетін параметрлік маңыздылық сынақтарының барлығын каноникалық корреляциялық талдаудың ерекше жағдайлары ретінде қарастыруға болады, бұл екі айнымалылар жиынтығы арасындағы қатынастарды зерттеудің жалпы процедурасы". Бұл әдісті алғаш рет 1936 жылы Гарольд Хотеллинг енгізді, бірақ математикалық тұжырымдама пәтерлер арасындағы бұрыштар контекстінде Камилл Джордан 1875 жылы жариялаған. ККА қазір көпөлшемді статистиканың және көп көріністі оқытудың негізгі тасы болып табылады, және оның көптеген интерпретациялары мен кеңейтімдері ұсынылды, мысалы, ықтималдық ККА, сиретулі ККА, көп көріністі ККА, Deep CCA және DeepGeoCCA. Өкінішке орай, оның танымалдылығына байланысты, әдебиеттер нотацияда сәйкессіздіктерге толы болуы мүмкін, сондықтан біз оқырманға қолда бар әдебиеттер мен техникаларды тиімді пайдалануға көмектесу үшін осы мақалада мұндай сәйкессіздіктерді атап көрсетуге тырысамыз. Өзінің туыс әдісі PCA сияқты, ККА популяциялық формада (рандомдық векторларға және олардың ковариациялық матрицаларына сәйкес) немесе үлгілік формада (деректер жиынтықтарына және олардың үлгілік ковариациялық матрицаларына сәйкес) қарастырылуы мүмкін. Бұл екі форма бір-біріне шамамен толық аналогтар болып табылады, сондықтан олардың айырмашылығы көбінесе назардан тыс қалады, бірақ олар жоғары өлшемді жағдайларда өте әртүрлі болуы мүмкін. Келесіде біз популяциялық мәселеге қатысты нақты математикалық анықтамалар береміз және каноникалық декомпозиция деп аталатын түрлі объектілерді бөліп көрсетеміз. Бұл объектілер арасындағы айырмашылықтарды түсіну техниканы интерпретациялау үшін өте маңызды.
In statistics, canonical correlation analysis (CCA), also called canonical variates analysis, is a way of inferring information from cross covariance matrices. If we have two vectors X = (X1, , Xn) and Y = (Y1, , Ym) of random variables, and there are correlations among the variables, then canonical correlation analysis will find linear combinations of X and Y that have a maximum correlation with each other. T. R. Knapp notes that "virtually all of the commonly encountered parametric tests of significance can be treated as special cases of canonical correlation analysis, which is the general procedure for investigating the relationships between two sets of variables." The method was first introduced by Harold Hotelling in 1936, although in the context of angles between flats the mathematical concept was published by Camille Jordan in 1875. CCA is now a cornerstone of multivariate statistics and multi view learning, and a great number of interpretations and extensions have been proposed, such as probabilistic CCA, sparse CCA, multi view CCA, Deep CCA, and DeepGeoCCA. Unfortunately, perhaps because of its popularity, the literature can be inconsistent with notation, we attempt to highlight such inconsistencies in this article to help the reader make best use of the existing literature and techniques available. Like its sister method PCA, CCA can be viewed in population form (corresponding to random vectors and their covariance matrices) or in sample form (corresponding to datasets and their sample covariance matrices). These two forms are almost exact analogues of each other, which is why their distinction is often overlooked, but they can behave very differently in high dimensional settings. We next give explicit mathematical definitions for the population problem and highlight the different objects in the so called canonical decomposition understanding the differences between this objects is crucial for interpretation of the technique.
Халықтың КҚА-ның корреляциялар арқылы анықталуы
Екі бағандық вектор және шекті екінші моменттері бар кездейсоқ айнымалыларды қарастыра отырып, кресттік ковариацияны – оның әрбір ұясы ковариация болатын матрица деп анықтауға болады. Іс жүзінде, ковариациялық матрицаны және (яғни екі дерек матрицасынан) алынған үлгілік деректер негізінде бағалаймыз. Каноникалық корреляциялық талдау кездейсоқ айнымалылар және байланысты максималдайтын векторлар тізбегін іздейді. (скалярлық) кездейсоқ айнымалылар және – бұл каноникалық айнымалылардың бірінші жұбы. Содан кейін, бірінші каноникалық айнымалылар жұбымен корреляцияланбау шартымен бірдей корреляцияны максималдайтын векторлар ізделеді; бұл екінші каноникалық айнымалылар жұбын береді. Бұл процедура максималды рет қайталанады. Векторлар жиыны каноникалық бағыттар, салмақ векторлары немесе жай ғана салмақтар деп аталады. Векторлардың "қос" жиыны каноникалық жүктеме векторлары немесе жай ғана жүктемелер деп аталады; оларды салмақтарға қарағанда түсіндіру оңайырақ.
Гипотезаларды тексеру
Әрбір қатарды келесі әдіспен маңыздылығына тексеруге болады. Корреляциялар реттелгендіктен, қатар нөлге тең деп айту барлық келесі корреляциялардың да нөлге тең екенін білдіреді. Егер үлгіде тәуелсіз байқаулар болса және - үшін естілген корреляция болса, онда -інші қатар үшін тест статистикасы:
Бұл үлкен үшін χ² таралуымен асимптотикалық түрде таралады, ондағы бостандық дәрежесі . барлық корреляциялар логикалық түрде нөлге тең болғандықтан (және осылай бағаланғандықтан), осы нүктеден кейінгі мүшелердің көбейтіндісі маңызсыз. Үлгінің мөлшері кішкентай болған жағдайда, ең жоғары корреляциялар 1-ге тең болады, сондықтан тест мағынасыз.
Практикалық қолдану
Эксперименттік жағдайда каноникалық корреляцияны қолданудың ең көп таралған жолы – екі айнымалы жиынтығын алып, олардың арасындағы ортақ белгілерді анықтау. Мысалы, психологиялық тестілеуде, Миннесота көпфазалық тұлғалық инвентариі (MMPI 2) және NEO сияқты екі жақсы қалыптасқан көпөлшемді тұлғалық тесттерді қарастыруға болады. MMPI 2 факторларының NEO факторларымен қалай байланысқандығын қарастыру арқылы, тесттердің арасындағы ортақ өлшемдер мен ортақ дисперсияның мөлшерін анықтауға болады. Мысалы, экстраверсия немесе невротизм өлшемдері екі тест арасындағы ортақ дисперсияның маңызды бөлігін құрауы мүмкін. Каноникалық корреляциялық талдауды екі айнымалы жиынтығын байланыстыратын модельдік теңдеу құру үшін де пайдалануға болады, мысалы, өнімділік көрсеткіштерінің жиынтығы мен түсіндірмелі айнымалылардың жиынтығы немесе нәтижелер мен кірістер жиынтығы. Мұндай модельге теориялық талаптарға немесе интуитивті түсініктерге сәйкес келу үшін шектеулер қоюға болады. Бұл модель түрі максималды корреляция моделі деп аталады. Каноникалық корреляция нәтижелерін визуализациялау әдетте маңызды корреляцияны көрсететін каноникалық вариаттар жұптары үшін екі айнымалы жиынтығының коэффициенттерінің гистограммалары арқылы жүзеге асырылады. Кейбір авторлар оларды heliograph түрінде көрсету ұсынылады, яғни шеңбер пішіндес, сәулелерге ұқсас сызықтары бар форматта, мұнда әр жартысы екі айнымалы жиынтығын көрсетеді.
Мысалдар
Кез келгенді күтілетін мәні нөлге тең деп алайық, яғни, . Егер , яғни, және толық корреляцияланған болса, онда, мысалы, және , сондықтан бірінші (және осы мысалда ғана) каноникалық айнымалылар жұбы және болады. Егер , яғни, және толық антикорреляцияланған болса, онда, мысалы, және , сондықтан бірінші (және осы мысалда ғана) каноникалық айнымалылар жұбы және болады.
If , i. e., and are perfectly correlated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
If , i. e., and are perfectly anticorrelated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
We notice that in both cases , which illustrates that the canonical correlation analysis treats correlated and anticorrelated variables similarly.
Екі жағдайда да , екенін байқаймыз, бұл каноникалық корреляциялық талдаудың корреляцияланған және антикорреляцияланған айнымалыларды ұқсас қарастыратынын көрсетеді.
If , i. e., and are perfectly correlated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
If , i. e., and are perfectly anticorrelated, then, e. g., and , so that the first (and only in this example) pair of canonical variables is and
We notice that in both cases , which illustrates that the canonical correlation analysis treats correlated and anticorrelated variables similarly.
Негізгі бұрыштармен байланыс
Егер және нөлдік математикалық күтілуге ие болса, яғни , олардың ковариациялық матрицалары және сәйкесінше, грамдық матрицалар ретінде ішкі көбейтінді ретінде қарастырылуы мүмкін. Осы түсіндірмеде, кездейсоқ шамалар, және матрицаларының элементтері ковариациялықпен берілген ішкі көбейтіндіге ие векторлық кеңістіктің элементтері ретінде қарастырылады; қараңыз Ковариациялық#Ішкі көбейтінділермен байланысы. Каноникалық айнымалылар мен анықтамасы, осы ішкі көбейтіндіге қатысты және олардың элементтерімен құрылған қосалқы кеңістіктер жұбының бас векторларының анықтамасына тең. Каноникалық корреляциялар бас бұрыштардың косинусына тең.
Ағарту және ықтималдық каноникалық корреляциялық талдау
CCA сонымен қатар, кездейсоқ векторлар мен бір мезгілде олардың қиылыс корреляциясы диагональды болатындай етіп түрлендірілетін арнайы ағарту түрлендіруі ретінде қарастырылуы мүмкін. Каноникалық корреляциялар векторлар мен арасындағы байланысты көрсететін регрессия коэффициенттері ретінде түсіндіріледі және олар теріс болуы да мүмкін. CCA-ның регрессиялық тұрғысы сонымен қатар, ортақ және ортақ емес өзгергіштікті көрсететін байланысты емес жасырын айнымалылары бар CCA үшін жасырын айнымалы ықтималдық генеративтік моделін құруға мүмкіндік береді.