Введение

В статистике канонический анализ (от κανων – бар, мера, линейка) относится к семейству регрессионных методов анализа данных. Регрессионный анализ количественно определяет связь между предикторной переменной и переменной-критерием с помощью коэффициента корреляции r, коэффициента детерминации r² и стандартного коэффициента регрессии β. Множественный регрессионный анализ выражает связь между набором предикторных переменных и одной переменной-критерием с помощью множественного коэффициента корреляции R, множественного коэффициента детерминации R² и набора стандартных весов частной регрессии β₁, β₂, и т.д. Канонический корреляционный анализ отражает связь между набором предикторных переменных и набором переменных-критериев посредством канонических корреляций ρ₁, ρ₂, … и наборов канонических весов C и D.

Канонический анализ

Канонический анализ относится к группе методов, включающих решение характеристического уравнения для нахождения его скрытых корней и векторов. Он описывает формальные структуры в гиперпространстве, инвариантные относительно вращения координат. В данном типе решения вращение сохраняет многие оптимизирующие свойства, при условии, что оно происходит определенным образом и в подпространстве соответствующего гиперпространства. Это вращение от структуры максимальной межпеременной корреляции к другой, более простой и осмысленной структуре повышает интерпретируемость канонических весов C и D. В этом канонический анализ отличается от канонического анализа вариатов Гарольда Хотеллинга (1936) (также называемого анализом канонической корреляции), предназначенного для получения максимальных (канонических) корреляций между предикторами и критериальными каноническими вариатами. Различие между каноническим анализом вариатов и каноническим анализом аналогично различию между анализом главных компонент и факторным анализом, каждый из которых имеет свой характерный набор общих факторов, собственных значений и собственных векторов.

Канонический анализ (простой)

Канонический анализ — это многовариантный метод, предназначенный для определения взаимосвязей между группами переменных в наборе данных. Набор данных разделяется на две группы, X и Y, на основе общих характеристик. Цель канонического анализа — установить связь между X и Y, то есть выяснить, может ли некоторая форма представления X отражать Y. Метод работает путем нахождения линейных комбинаций переменных X (X1, X2 и т. д.) и переменных Y (Y1, Y2 и т. д.), которые демонстрируют наибольшую корреляцию. Эта комбинация известна как "первые канонические переменные", обычно обозначаемые U1 и V1, а пара U1 и V1 называется "канонической функцией". Последующие канонические функции, U2 и V2, ограничиваются таким образом, чтобы быть некоррелированными с U1 и V1. Все значения масштабируются так, чтобы дисперсия была равна 1. Также возможно построение связей, соответствующих теоретическим ограничениям или согласующихся с логикой и интуицией. Такие модели называются моделями максимальной корреляции. (Tofallis, 1999)

Математически канонический анализ максимизирует UXYV при условиях UXXU = I и VYYV = I, где X и Y — матрицы данных (строки соответствуют наблюдениям, а столбцы — признакам).