Канонический анализ: методы и применение в статистике.
Canonical analysis
Канонический анализ в статистике: регрессионный метод для анализа данных, выявляющий связи между группами переменных (предикторов и критериев). ρ, R, β.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
В статистике канонический анализ (от κανων – бар, мера, линейка) относится к семейству регрессионных методов анализа данных. Регрессионный анализ количественно определяет связь между предикторной переменной и переменной-критерием с помощью коэффициента корреляции r, коэффициента детерминации r² и стандартного коэффициента регрессии β. Множественный регрессионный анализ выражает связь между набором предикторных переменных и одной переменной-критерием с помощью множественного коэффициента корреляции R, множественного коэффициента детерминации R² и набора стандартных весов частной регрессии β₁, β₂, и т.д. Канонический корреляционный анализ отражает связь между набором предикторных переменных и набором переменных-критериев посредством канонических корреляций ρ₁, ρ₂, … и наборов канонических весов C и D.
In statistics, canonical analysis (from κανων bar, measuring rod, ruler) belongs to the family of regression methods for data analysis. Regression analysis quantifies a relationship between a predictor variable and a criterion variable by the coefficient of correlation r, coefficient of determination r2, and the standard regression coefficient β. Multiple regression analysis expresses a relationship between a set of predictor variables and a single criterion variable by the multiple correlation R, multiple coefficient of determination R2, and a set of standard partial regression weights β1, β2, etc. Canonical variate analysis captures a relationship between a set of predictor variables and a set of criterion variables by the canonical correlations ρ1, ρ2, , and by the sets of canonical weights C and D.
Канонический анализ
Канонический анализ относится к группе методов, включающих решение характеристического уравнения для нахождения его скрытых корней и векторов. Он описывает формальные структуры в гиперпространстве, инвариантные относительно вращения координат. В данном типе решения вращение сохраняет многие оптимизирующие свойства, при условии, что оно происходит определенным образом и в подпространстве соответствующего гиперпространства. Это вращение от структуры максимальной межпеременной корреляции к другой, более простой и осмысленной структуре повышает интерпретируемость канонических весов C и D. В этом канонический анализ отличается от канонического анализа вариатов Гарольда Хотеллинга (1936) (также называемого анализом канонической корреляции), предназначенного для получения максимальных (канонических) корреляций между предикторами и критериальными каноническими вариатами. Различие между каноническим анализом вариатов и каноническим анализом аналогично различию между анализом главных компонент и факторным анализом, каждый из которых имеет свой характерный набор общих факторов, собственных значений и собственных векторов.
Canonical analysis belongs to a group of methods which involve solving the characteristic equation for its latent roots and vectors. It describes formal structures in hyperspace invariant with respect to the rotation of their coordinates. In this type of solution, rotation leaves many optimizing properties preserved, provided it takes place in certain ways and in a subspace of its corresponding hyperspace. This rotation from the maximum intervariate correlation structure into a different, simpler and more meaningful structure increases the interpretability of the canonical weights C and D. In this the canonical analysis differs from Harold Hotelling's (1936) canonical variate analysis (also called the canonical correlation analysis), designed to obtain maximum (canonical) correlations between the predictor and criterion canonical variates. The difference between the canonical variate analysis and canonical analysis is analogous to the difference between the principal components analysis and factor analysis, each with its characteristic set of commonalities, eigenvalues and eigenvectors.
Канонический анализ (простой)
Канонический анализ — это многовариантный метод, предназначенный для определения взаимосвязей между группами переменных в наборе данных. Набор данных разделяется на две группы, X и Y, на основе общих характеристик. Цель канонического анализа — установить связь между X и Y, то есть выяснить, может ли некоторая форма представления X отражать Y. Метод работает путем нахождения линейных комбинаций переменных X (X1, X2 и т. д.) и переменных Y (Y1, Y2 и т. д.), которые демонстрируют наибольшую корреляцию. Эта комбинация известна как "первые канонические переменные", обычно обозначаемые U1 и V1, а пара U1 и V1 называется "канонической функцией". Последующие канонические функции, U2 и V2, ограничиваются таким образом, чтобы быть некоррелированными с U1 и V1. Все значения масштабируются так, чтобы дисперсия была равна 1. Также возможно построение связей, соответствующих теоретическим ограничениям или согласующихся с логикой и интуицией. Такие модели называются моделями максимальной корреляции. (Tofallis, 1999)
Canonical analysis is a multivariate technique which is concerned with determining the relationships between groups of variables in a data set. The data set is split into two groups X and Y, based on some common characteristics. The purpose of canonical analysis is then to find the relationship between X and Y, i. e. can some form of X represent Y. It works by finding the linear combination of X variables, i. e. X1, X2 etc., and linear combination of Y variables, i. e. Y1, Y2 etc., which are most highly correlated. This combination is known as the "first canonical variates" which are usually denoted U1 and V1, with the pair of U1 and V1 being called a "canonical function". The next canonical functions, U2 and V2 are then restricted so that they are uncorrelated with U1 and V1. Everything is scaled so that the variance equals 1. One can also construct relationships which are made to agree with constraint restrictions arising from theory or to agree with common sense/intuition. These are called maximum correlation models. (Tofallis, 1999)
Математически канонический анализ максимизирует UXYV при условиях UXXU = I и VYYV = I, где X и Y — матрицы данных (строки соответствуют наблюдениям, а столбцы — признакам).
Mathematically, canonical analysis maximizes UXYV subject to UXXU = I and VYYV = I, where X and Y are the data matrices (row for instance and column for feature).