Сыныптық ұқсастық бойынша жұмсақ тәуелсіз модельдеу (SIMCA) әдісі
Soft independent modelling of class analogies
Жұмыс істеу кластары бойынша тәуелсіз модельдеу (SIMCA) – деректерді жіктеуге арналған статистикалық әдіс. PCA арқылы санаттарды анықтайды, бірнеше санатқа жату мүмкіндігін ұсынады.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Сыныптық аналогия бойынша жұмсақ тәуелсіз модельдеу (SIMCA) – деректерді бақылау арқылы жіктеуге арналған статистикалық әдіс. Бұл әдіс атрибуттар жиынтығымен және олардың сыныпқа жататындығымен сипатталатын үлгілерден (немесе объектілерден) тұратын оқу деректері жиынтығын қажет етеді. "Жұмсақ" термині жіктегіштің үлгілерді бірнеше сыныпқа қатысты деп анықтауға мүмкіндігін көрсетеді, бұл үлгілерді бір-бірімен қабаттаспайтын сыныптарға міндетті түрде жіктеуді білдірмейді.
Soft independent modelling by class analogy (SIMCA) is a statistical method for supervised classification of data. The method requires a training data set consisting of samples (or objects) with a set of attributes and their class membership. The term soft refers to the fact the classifier can identify samples as belonging to multiple classes and not necessarily producing a classification of samples into non overlapping classes.
Әдіс
Классификациялау модельдерін құру үшін әр сыныпқа жататын үлгілер негізгі компоненттік талдау (PCA) арқылы талдау қажет; тек маңызды компоненттер ғана сақталады. Белгілі бір сынып үшін алынған модель сызық (бір негізгі компонент немесе ПК үшін), жазықтық (екі ПК үшін) немесе гипер жазықтық (екіден астам ПК үшін) түрінде болады. Үлгіленген әр сынып үшін сыныптауға қажетті сын қашықтықты анықтау үшін оқу деректерінің үлгілерінің сызықтан, жазықтықтан немесе гипер жазықтықтан (қалдық стандартты ауытқу ретінде есептеледі) орташа ортогональдық қашықтығы қолданылады. Бұл сын қашықтық F үлестіріміне негізделген және әдетте 95% немесе 99% сенімділік интервалдарын пайдалана отырып есептеледі. Жаңа бақылаулар әрбір ПК моделіне проекцияланады және қалдық қашықтықтар есептеледі. Егер бақылаудың модельден қалдық қашықтығы сол сыныптың статистикалық шегінен төмен болса, онда ол модель класына жатқызылады. Бақылау бірнеше сыныпқа жатуы мүмкін, ал модельдің сапасы бақылаулардың қанша сыныпқа жіктелетінінен анықталады. Классификация тиімділігі әдетте қабылдағыш-жұмыс сипаттамалары (ROC) арқылы көрсетіледі. Түпнұсқа SIMCA әдісінде әр сыныптың гипер жазықтығының шеттері сақталған негізгі компоненттер осі бойынша статистикалық бақылау шектерін белгілеу арқылы жабылады (яғни, ұпай мәні плюс және минус 0,5 есе стандартты ауытқу аралығында). SIMCA әдісінің соңғы бейімделулері гипер жазықтықты эллипсоидтар (мысалы, Хотеллингтің T2 немесе Махаланобис арақашықтығы) құру арқылы жабады. Мұндай түзетілген SIMCA әдістерін қолдану арқылы объектіні жіктеу үшін оның модельден ортогональдық қашықтығы және модель ішіндегі проекциясы (яғни, эллипсоидпен анықталған аймақтағы ұпай мәні) маңызды емес болуы керек.
In order to build the classification models, the samples belonging to each class need to be analysed using principal component analysis (PCA); only the significant components are retained. For a given class, the resulting model then describes either a line (for one Principal Component or PC), plane (for two PCs) or hyper plane (for more than two PCs). For each modelled class, the mean orthogonal distance of training data samples from the line, plane, or hyper plane (calculated as the residual standard deviation) is used to determine a critical distance for classification. This critical distance is based on the F distribution and is usually calculated using 95% or 99% confidence intervals. New observations are projected into each PC model and the residual distances calculated. An observation is assigned to the model class when its residual distance from the model is below the statistical limit for the class. The observation may be found to belong to multiple classes and a measure of goodness of the model can be found from the number of cases where the observations are classified into multiple classes. The classification efficiency is usually indicated by Receiver operating characteristics. In the original SIMCA method, the ends of the hyper plane of each class are closed off by setting statistical control limits along the retained principal components axes (i. e., score value between plus and minus 0.5 times score standard deviation). More recent adaptations of the SIMCA method close off the hyper plane by construction of ellipsoids (e. g. Hotelling's T2 or Mahalanobis distance). With such modified SIMCA methods, classification of an object requires both that its orthogonal distance from the model and its projection within the model (i. e. score value within the region defined by the ellipsoid) are not significant.
Қолдану
SIMCA классификациялау әдісі, әсіресе химетрия және спектроскопиялық деректерді талдау сияқты қолданбалы статистикалық салаларда кеңінен қолданысқа ие болды.
SIMCA as a method of classification has gained widespread use especially in applied statistical fields such as chemometrics and spectroscopic data analysis.