Введение
Одновременное наблюдение и анализ более чем одной переменной результата.
Многовариантная статистика – это раздел статистики, охватывающий одновременное наблюдение и анализ более чем одной переменной результата, то есть многомерных случайных величин. Многовариантная статистика изучает различные цели и предпосылки различных видов многовариантного анализа, а также их взаимосвязь. Практическое применение многовариантной статистики к конкретной задаче может включать несколько типов унивариантного и многовариантного анализа для понимания взаимосвязей между переменными и их значимости для исследуемой проблемы. Кроме того, многовариантная статистика связана с многомерными распределениями вероятностей, как с точки зрения их использования для представления распределения наблюдаемых данных, так и с точки зрения их использования в статистическом выводе, особенно когда в рамках одного анализа представляют интерес несколько различных величин. Определенные типы задач, связанных с многомерными данными, например, простая и множественная линейная регрессия, обычно не рассматриваются как частные случаи многовариантной статистики, поскольку анализ проводится путем рассмотрения (унивариантного) условного распределения одной переменной результата при заданных значениях других переменных.
how these can be used to represent the distributions of observed data;
how they can be used as part of statistical inference, particularly where several different quantities are of interest to the same analysis. Certain types of problems involving multivariate data, for example simple linear regression and multiple regression, are not usually considered to be special cases of multivariate statistics because the analysis is dealt with by considering the (univariate) conditional distribution of a single outcome variable given the other variables.
Многовариантный анализ
Многовариантный анализ (МВА) основан на принципах многовариантной статистики. Обычно МВА используется для решения ситуаций, когда на каждой экспериментальной единице производится несколько измерений, и важны взаимосвязи между этими измерениями и их структура. Современная, пересекающаяся классификация МВА включает в себя: Анализ главных компонент (PCA) создает новый набор ортогональных переменных, содержащих ту же информацию, что и исходный набор. Он поворачивает оси изменчивости, чтобы получить новый набор ортогональных осей, упорядоченных таким образом, чтобы они суммировали уменьшающиеся доли изменчивости. Факторный анализ аналогичен PCA, но позволяет пользователю выделить заданное количество синтетических переменных, меньшее, чем в исходном наборе, оставляя оставшуюся необъясненную изменчивость в качестве ошибки. Выделенные переменные известны как латентные переменные или факторы; каждый из них может объяснять ковариацию в группе наблюдаемых переменных. Канонический корреляционный анализ выявляет линейные связи между двумя наборами переменных; это обобщенная (т.е. каноническая) версия бивариантной корреляции. Анализ избыточности (RDA) аналогичен каноническому корреляционному анализу, но позволяет пользователю получить заданное количество синтетических переменных из одного набора (независимых) переменных, которые объясняют максимально возможную дисперсию в другом (независимом) наборе. Это многомерный аналог регрессии. Анализ соответствий (CA), или взаимное усреднение, находит (как и PCA) набор синтетических переменных, которые суммируют исходный набор. Базовая модель предполагает различия по хи-квадрат между записями (случаями). Канонический (или "ограниченный") анализ соответствий (CCA) предназначен для обобщения совместной изменчивости в двух наборах переменных (как в анализе избыточности); представляет собой комбинацию анализа соответствий и многомерного регрессионного анализа. Базовая модель предполагает различия по хи-квадрат между записями (случаями). Многомерное шкалирование включает в себя различные алгоритмы для определения набора синтетических переменных, которые наилучшим образом представляют собой попарные расстояния между записями. Исходный метод – анализ главных координат (PCoA; основан на PCA). Дискриминантный анализ, или канонический дисперсионный анализ, пытается установить, можно ли использовать набор переменных для различения двух или более групп случаев. Линейный дискриминантный анализ (LDA) вычисляет линейный предиктор на основе двух наборов данных с нормальным распределением, чтобы обеспечить классификацию новых наблюдений. Кластерные системы распределяют объекты по группам (называемым кластерами) таким образом, чтобы объекты (случаи) из одного кластера были более похожи друг на друга, чем объекты из разных кластеров. Рекурсивное разбиение создает дерево решений, которое пытается правильно классифицировать членов популяции на основе дихотомической зависимой переменной. Искусственные нейронные сети расширяют методы регрессии и кластеризации на нелинейные многомерные модели. Статистическая графика, такая как туры, параллельные координатные графики, матрицы диаграмм рассеяния, может использоваться для изучения многомерных данных. Модели одновременных уравнений включают в себя более одного регрессионного уравнения с различными зависимыми переменными, оцениваемыми совместно. Векторная авторегрессия включает одновременную регрессию различных переменных временных рядов на их собственные и запаздывающие значения друг друга. Анализ главных кривых отклика (PRC) – это метод, основанный на RDA, который позволяет пользователю сосредоточиться на эффектах обработки с течением времени, корректируя изменения в контрольных обработках с течением времени. Иконография корреляций заключается в замене корреляционной матрицы диаграммой, где «значимые» корреляции представлены сплошной линией (положительная корреляция) или пунктирной линией (отрицательная корреляция).
Principal components analysis (PCA) creates a new set of orthogonal variables that contain the same information as the original set. It rotates the axes of variation to give a new set of orthogonal axes, ordered so that they summarize decreasing proportions of the variation. Factor analysis is similar to PCA but allows the user to extract a specified number of synthetic variables, fewer than the original set, leaving the remaining unexplained variation as error. The extracted variables are known as latent variables or factors; each one may be supposed to account for covariation in a group of observed variables. Canonical correlation analysis finds linear relationships among two sets of variables; it is the generalised (i. e. canonical) version of bivariate correlation. Redundancy analysis (RDA) is similar to canonical correlation analysis but allows the user to derive a specified number of synthetic variables from one set of (independent) variables that explain as much variance as possible in another (independent) set. It is a multivariate analogue of regression. Correspondence analysis (CA), or reciprocal averaging, finds (like PCA) a set of synthetic variables that summarise the original set. The underlying model assumes chi squared dissimilarities among records (cases). Canonical (or "constrained") correspondence analysis (CCA) for summarising the joint variation in two sets of variables (like redundancy analysis); combination of correspondence analysis and multivariate regression analysis. The underlying model assumes chi squared dissimilarities among records (cases). Multidimensional scaling comprises various algorithms to determine a set of synthetic variables that best represent the pairwise distances between records. The original method is principal coordinates analysis (PCoA; based on PCA). Discriminant analysis, or canonical variate analysis, attempts to establish whether a set of variables can be used to distinguish between two or more groups of cases. Linear discriminant analysis (LDA) computes a linear predictor from two sets of normally distributed data to allow for classification of new observations. Clustering systems assign objects into groups (called clusters) so that objects (cases) from the same cluster are more similar to each other than objects from different clusters. Recursive partitioning creates a decision tree that attempts to correctly classify members of the population based on a dichotomous dependent variable. Artificial neural networks extend regression and clustering methods to non linear multivariate models. Statistical graphics such as tours, parallel coordinate plots, scatterplot matrices can be used to explore multivariate data. Simultaneous equations models involve more than one regression equation, with different dependent variables, estimated together. Vector autoregression involves simultaneous regressions of various time series variables on their own and each other's lagged values. Principal response curves analysis (PRC) is a method based on RDA that allows the user to focus on treatment effects over time by correcting for changes in control treatments over time. Iconography of correlations consists in replacing a correlation matrix by a diagram where the “remarkable” correlations are represented by a solid line (positive correlation), or a dotted line (negative correlation).
Обращение с неполными данными
Очень часто в экспериментально полученном наборе данных значения некоторых компонентов отдельной точки данных оказываются пропущенными. Вместо того, чтобы отбрасывать всю точку данных, обычно прибегают к заполнению пропущенных значений, процесс, который называется "импутацией".
История
Учебник Андерсона 1958 года «Введение в многомерный статистический анализ» обучил целое поколение теоретиков и прикладных статистиков; в книге Андерсона особое внимание уделяется проверке гипотез с использованием критериев отношения правдоподобия и свойствам мощностных функций: допустимости, несмещенности и монотонности. Ранее многомерный статистический анализ (MVA) рассматривался исключительно в рамках статистической теории из-за больших объемов и сложности исходных данных, а также высоких вычислительных затрат. Однако благодаря значительному увеличению вычислительной мощности, MVA сейчас играет все более важную роль в анализе данных и широко применяется в омиксных науках.