Мягкое моделирование независимых классов по аналогии (SIMCA) для классификации данных
Soft independent modelling of class analogies
Метод SIMCA: статистическая классификация данных, основанная на PCA. Определение принадлежности к классам с учетом вероятностей, а не жесткой категоризации.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Мягкое независимое моделирование по аналогии классов (SIMCA) – это статистический метод контролируемой классификации данных. Для работы метода требуется обучающий набор данных, состоящий из экземпляров (или объектов) с набором признаков и информацией об их классовой принадлежности. Термин "мягкий" указывает на то, что классификатор способен отнести экземпляр к нескольким классам одновременно, не обязательно разделяя их на непересекающиеся группы.
Soft independent modelling by class analogy (SIMCA) is a statistical method for supervised classification of data. The method requires a training data set consisting of samples (or objects) with a set of attributes and their class membership. The term soft refers to the fact the classifier can identify samples as belonging to multiple classes and not necessarily producing a classification of samples into non overlapping classes.
Метод
Для построения классификационных моделей необходимо проанализировать образцы, принадлежащие к каждому классу, с использованием анализа главных компонент (PCA); сохраняются только значимые компоненты. Для заданного класса полученная модель описывает либо линию (для одной главной компоненты или ГК), либо плоскость (для двух ГК), либо гиперплоскость (для более чем двух ГК). Для каждого моделируемого класса среднее ортогональное расстояние образцов обучающей выборки от прямой, плоскости или гиперплоскости (вычисляемое как среднеквадратическое отклонение остатков) используется для определения критического расстояния для классификации. Это критическое расстояние основано на F-распределении и обычно рассчитывается с использованием 95% или 99% доверительных интервалов. Новые наблюдения проецируются в каждую модель ГК, и вычисляются расстояния до остатков. Наблюдение присваивается классу модели, если расстояние до остатков от модели ниже статистического порога для этого класса. Наблюдение может быть отнесено к нескольким классам, а мера качества модели определяется по количеству случаев, когда наблюдения классифицируются в несколько классов. Эффективность классификации обычно оценивается с помощью характеристик рабочей кривой приемника (ROC). В оригинальном методе SIMCA концы гиперплоскости каждого класса ограничиваются установкой статистических контрольных пределов вдоль осей сохраненных главных компонент (то есть значение оценки между плюс и минус 0,5 стандартного отклонения оценки). В более поздних адаптациях метода SIMCA гиперплоскость ограничивается построением эллипсоидов (например, T² Хотэллинга или расстояние Махаланобиса). При использовании таких модифицированных методов SIMCA классификация объекта требует, чтобы его ортогональное расстояние от модели и его проекция внутри модели (то есть значение оценки в пределах области, определяемой эллипсоидом) не были статистически значимыми.
In order to build the classification models, the samples belonging to each class need to be analysed using principal component analysis (PCA); only the significant components are retained. For a given class, the resulting model then describes either a line (for one Principal Component or PC), plane (for two PCs) or hyper plane (for more than two PCs). For each modelled class, the mean orthogonal distance of training data samples from the line, plane, or hyper plane (calculated as the residual standard deviation) is used to determine a critical distance for classification. This critical distance is based on the F distribution and is usually calculated using 95% or 99% confidence intervals. New observations are projected into each PC model and the residual distances calculated. An observation is assigned to the model class when its residual distance from the model is below the statistical limit for the class. The observation may be found to belong to multiple classes and a measure of goodness of the model can be found from the number of cases where the observations are classified into multiple classes. The classification efficiency is usually indicated by Receiver operating characteristics. In the original SIMCA method, the ends of the hyper plane of each class are closed off by setting statistical control limits along the retained principal components axes (i. e., score value between plus and minus 0.5 times score standard deviation). More recent adaptations of the SIMCA method close off the hyper plane by construction of ellipsoids (e. g. Hotelling's T2 or Mahalanobis distance). With such modified SIMCA methods, classification of an object requires both that its orthogonal distance from the model and its projection within the model (i. e. score value within the region defined by the ellipsoid) are not significant.
Применение
SIMCA как метод классификации получил широкое распространение, особенно в прикладных статистических областях, таких как хемометрика и анализ спектроскопических данных.
SIMCA as a method of classification has gained widespread use especially in applied statistical fields such as chemometrics and spectroscopic data analysis.