Кіріспе
Бір мезгілде бірнеше нәтижелік айнымалыны бақылау және талдау. Көпөлшемді статистика – бір мезгілде бірнеше нәтижелік айнымалыны, яғни көпөлшемді кездейсоқ айнымалыларды бақылау және талдауды қамтитын статистиканың бір саласы. Көпөлшемді статистика әртүрлі көпөлшемді талдау түрлерінің мақсаттары мен негіздерін, сондай-ақ олардың бір-бірімен байланысын түсінуге қатысты. Нақты проблеманы шешу үшін көпөлшемді статистиканы қолдануда айнымалылар арасындағы қатынастарды және олардың зерттеліп отырған мәселеге қатыстылығын анықтау үшін бірнеше бірөлшемді және көпөлшемді талдау түрлері қолданылуы мүмкін. Бұған қоса, көпөлшемді статистика көпөлшемді ықтималдық үлестірімдерін де қарастырады, олар байқалған деректердің үлестірімін бейнелеуге және статистикалық қорытындылар жасауға, әсіресе бір талдауда бірнеше шама қызығушылық тудырған жағдайларда қолданылуы мүмкін. Мысалы, қарапайым сызықтық регрессия және көптік регрессия сияқты көпөлшемді деректерді қамтитын кейбір мәселелер әдетте көпөлшемді статистиканың ерекше жағдайлары деп есептелмейді, өйткені талдау басқа айнымалыларды ескере отырып, бір нәтижелік айнымалының (бірөлшемді) шартты үлестірімін қарастыру арқылы жүргізіледі.
Multivariate statistics is a subdivision of statistics encompassing the simultaneous observation and analysis of more than one outcome variable, i. e., multivariate random variables. Multivariate statistics concerns understanding the different aims and background of each of the different forms of multivariate analysis, and how they relate to each other. The practical application of multivariate statistics to a particular problem may involve several types of univariate and multivariate analyses in order to understand the relationships between variables and their relevance to the problem being studied. In addition, multivariate statistics is concerned with multivariate probability distributions, in terms of both
how these can be used to represent the distributions of observed data;
how they can be used as part of statistical inference, particularly where several different quantities are of interest to the same analysis. Certain types of problems involving multivariate data, for example simple linear regression and multiple regression, are not usually considered to be special cases of multivariate statistics because the analysis is dealt with by considering the (univariate) conditional distribution of a single outcome variable given the other variables.
Көпвариантты талдау
Көптүрлі талдау (МВА) көптүрлі статистика қағидаттарына негізделген. Әдетте, МВА әрбір эксперименттік бірлік бойынша бірнеше өлшемдер жасалғанда және осы өлшемдер мен олардың құрылымы арасындағы байланыстар маңызды жағдайларды шешу үшін қолданылады. Қазіргі заманғы, бір-бірімен байланысты МВА санаттарына мыналар жатады: Басты компоненттер талдауы (PCA) бастапқы жиынмен бірдей ақпаратты қамтитын ортогональді айнымалылардың жаңа жиынтығын құрайды. Ол өзгеру осін айналдырып, өзгерудің азаятын үлестерін қорытындылайтын ретпен орналасқан ортогональді осінің жаңа жиынтығын береді. Факторлық талдау PCA-ға ұқсас, бірақ пайдаланушыға бастапқы жиыннан кем санды синтетикалық айнымалыларды бөліп алуға мүмкіндік береді, ал қалған түсіндірілмеген өзгеруді қате ретінде қалдырады. Бөлінген айнымалылар жасырын айнымалылар немесе факторлар деп аталады; олардың әрқайсысы байқалатын айнымалылар тобындағы ковариацияны түсіндіруге арналған деп есептелуі мүмкін. Каноникалық корреляциялық талдау екі айнымалы жиынтығы арасындағы сызықтық байланыстарды анықтайды; бұл екі айнымалы корреляцияның жалпыланған (яғни каноникалық) нұсқасы. Редукциялық талдау (RDA) каноникалық корреляциялық талдауға ұқсас, бірақ пайдаланушыға басқа (тәуелсіз) жиынтықтағы мүмкіндігінше көп дисперсияны түсіндіретін (тәуелсіз) айнымалылардың бір жиынтығынан синтетикалық айнымалылардың белгілі бір санын алуға мүмкіндік береді. Бұл регрессияның көп өлшемді аналогы. Сәйкестік талдауы (CA) немесе өзара орташа есептеу (PCA сияқты) бастапқы жиынды қорытындылайтын синтетикалық айнымалылар жиынтығын анықтайды. Негізгі модель жазбалар (кезектер) арасындағы хи-квадрат ұқсастығын қабылдайды. Каноникалық (немесе "шектеулі") сәйкестік талдауы (CCA) екі айнымалы жиынтығындағы бірлескен өзгеруді қорытындылау үшін (редукциялық талдау сияқты); сәйкестік талдауы мен көптүрлі регрессиялық талдаудың үйлесімі. Негізгі модель жазбалар (кезектер) арасындағы хи-квадрат ұқсастығын қабылдайды. Көп өлшемді масштабтау жазбалар арасындағы жұптық қашықтықты ең жақсы көрсететін синтетикалық айнымалылар жиынтығын анықтау үшін әртүрлі алгоритмдерді қамтиды. Бастапқы әдіс – басты координаттар талдауы (PCoA; PCA негізінде). Дискриминанттық талдау немесе каноникалық вариативті талдау, айнымалылар жиынтығын екі немесе одан көп жағдай топтарын ажырату үшін қолдануға болатынын анықтауға тырысады. Сызықтық дискриминанттық талдау (LDA) жаңа байқауларды жіктеу үшін екі қалыпты таралымды деректер жиынтығынан сызықтық болжамды есептейді. Кластерлеу жүйелері объектілерді топтарға (кластерлер деп аталады) бөледі, сонда бір кластердегі объектілер (кезектер) әртүрлі кластерлердегі объектілерге қарағанда бір-біріне көбірек ұқсас болады. Рекурсивті бөлу популяция мүшелерін дихотомиялық тәуелді айнымалыға негізделген дұрыс жіктеуге тырысатын шешім ағашын құрайды. Жасанды нейрондық желілер регрессия және кластерлеу әдістерін сызықтық емес көптүрлі модельдерге дейін кеңейтеді. Түрлі турлар, параллель координаталар графигі, шашыраңқы график матрицасы сияқты статистикалық графиктер көптүрлі деректерді зерттеу үшін пайдаланылуы мүмкін. Бір мезгілдегі теңдеулер модельдерінде әртүрлі тәуелді айнымалылар бар, бірге бағаланған бір регрессия теңдеуінен артық болады. Векторлық авторегрессия әртүрлі уақыт сериясы айнымалыларының бір мезгілде регрессиясын өздерінің және бір-бірінің кешіктірілген мәндерін қамтиды. Басты жауап қисықтарын талдау (PRC) – RDA негізіндегі әдіс, ол пайдаланушыға уақыт өте келе бақылаудағы емдеудің өзгерістерін түзету арқылы уақыт өте келе емдеу әсерлеріне назар аударуға мүмкіндік береді. Корреляциялардың иконографиясы корреляция матрицасын диаграммамен ауыстырудан тұрады, онда "елеулі" корреляциялар тұтас сызықпен (оң корреляция) немесе нүктелі сызықпен (теріс корреляция) бейнеленеді.
Principal components analysis (PCA) creates a new set of orthogonal variables that contain the same information as the original set. It rotates the axes of variation to give a new set of orthogonal axes, ordered so that they summarize decreasing proportions of the variation. Factor analysis is similar to PCA but allows the user to extract a specified number of synthetic variables, fewer than the original set, leaving the remaining unexplained variation as error. The extracted variables are known as latent variables or factors; each one may be supposed to account for covariation in a group of observed variables. Canonical correlation analysis finds linear relationships among two sets of variables; it is the generalised (i. e. canonical) version of bivariate correlation. Redundancy analysis (RDA) is similar to canonical correlation analysis but allows the user to derive a specified number of synthetic variables from one set of (independent) variables that explain as much variance as possible in another (independent) set. It is a multivariate analogue of regression. Correspondence analysis (CA), or reciprocal averaging, finds (like PCA) a set of synthetic variables that summarise the original set. The underlying model assumes chi squared dissimilarities among records (cases). Canonical (or "constrained") correspondence analysis (CCA) for summarising the joint variation in two sets of variables (like redundancy analysis); combination of correspondence analysis and multivariate regression analysis. The underlying model assumes chi squared dissimilarities among records (cases). Multidimensional scaling comprises various algorithms to determine a set of synthetic variables that best represent the pairwise distances between records. The original method is principal coordinates analysis (PCoA; based on PCA). Discriminant analysis, or canonical variate analysis, attempts to establish whether a set of variables can be used to distinguish between two or more groups of cases. Linear discriminant analysis (LDA) computes a linear predictor from two sets of normally distributed data to allow for classification of new observations. Clustering systems assign objects into groups (called clusters) so that objects (cases) from the same cluster are more similar to each other than objects from different clusters. Recursive partitioning creates a decision tree that attempts to correctly classify members of the population based on a dichotomous dependent variable. Artificial neural networks extend regression and clustering methods to non linear multivariate models. Statistical graphics such as tours, parallel coordinate plots, scatterplot matrices can be used to explore multivariate data. Simultaneous equations models involve more than one regression equation, with different dependent variables, estimated together. Vector autoregression involves simultaneous regressions of various time series variables on their own and each other's lagged values. Principal response curves analysis (PRC) is a method based on RDA that allows the user to focus on treatment effects over time by correcting for changes in control treatments over time. Iconography of correlations consists in replacing a correlation matrix by a diagram where the “remarkable” correlations are represented by a solid line (positive correlation), or a dotted line (negative correlation).
Толық емес деректермен жұмыс істеу
Тәжірибелік жолмен алынған деректер жиынтығындағы бір дерек нүктесінің кейбір компоненттерінің мәндері жоқ болуы жиі кездеседі. Мұндай дерек нүктесін толығымен жоюдың орнына, жетіспейтін компоненттердің мәндерін "толықтыру" арқылы толтыру практикасы қолданылады, бұл процеске "импутация" (imputation) деп аталады.
Тарих
Андерсонның 1958 жылғы «Көпөлшемді статистикалық талдауға кіріспе» атты оқулығы теоретиктер мен қолданбалы статистиктердің бір буынына білім берді; Андерсонның кітабы ықтималдық қатынасы сынақтары арқылы гипотезаны тексеруге және қуат функцияларының қасиеттеріне – қабылдауға, бейтараптылыққа және монотондылыққа ерекше назар аударады. Бұрын көпөлшемді талдау (МВА) тек статистикалық теориялар контекстінде талқыланды, себебі негізгі деректер жиынтығының үлкен көлемі мен күрделілігі және оны жүзеге асыру үшін қажетті жоғары есептеу ресурстары. Есептеу қуатының күрт өсуіне байланысты, МВА қазір деректерді талдауда маңызды рөл атқарады және Омика салаларында кеңінен қолданылады.