Признаки в машинном обучении: что это такое? Выбор информативных признаков – ключ к эффективным алгоритмам классификации, регрессии и распознавания образов.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Измеримое свойство или характеристика
Measurable property or characteristic
В машинном обучении и распознавании образов, признак — это индивидуальное измеримое свойство или характеристика явления. Выбор информативных, различительных и независимых признаков является важнейшим элементом эффективных алгоритмов в распознавании образов, классификации и регрессии. Признаки обычно являются числовыми, но структурные признаки, такие как строки и графы, используются в синтаксическом распознавании образов. Понятие "признак" связано с понятием объясняющей переменной, используемой в статистических методах, таких как линейная регрессия.
In machine learning and pattern recognition, a feature is an individual measurable property or characteristic of a phenomenon. Choosing informative, discriminating and independent features is a crucial element of effective algorithms in pattern recognition, classification and regression. Features are usually numeric, but structural features such as strings and graphs are used in syntactic pattern recognition. The concept of "feature" is related to that of explanatory variable used in statistical techniques such as linear regression.
Типы характеристик
В разработке признаков обычно используются два типа признаков: числовые и категориальные. Числовые признаки – это непрерывные значения, которые можно измерить по шкале. Примеры числовых признаков включают возраст, рост, вес и доход. Числовые признаки могут использоваться в алгоритмах машинного обучения напрямую. Категориальные признаки – это дискретные значения, которые можно сгруппировать в категории. Примеры категориальных признаков включают пол, цвет и почтовый индекс. Категориальные признаки обычно требуют преобразования в числовые, прежде чем их можно будет использовать в алгоритмах машинного обучения. Это можно сделать с помощью различных методов, таких как one-hot encoding (кодирование одним горячим ключом), label encoding (кодирование метками) и ordinal encoding (порядковое кодирование). Тип признака, используемый в разработке признаков, зависит от конкретного алгоритма машинного обучения. Некоторые алгоритмы машинного обучения, такие как деревья решений, могут обрабатывать как числовые, так и категориальные признаки. Другие алгоритмы машинного обучения, такие как линейная регрессия, могут обрабатывать только числовые признаки.
In feature engineering, two types of features are commonly used: numerical and categorical. Numerical features are continuous values that can be measured on a scale. Examples of numerical features include age, height, weight, and income. Numerical features can be used in machine learning algorithms directly. Categorical features are discrete values that can be grouped into categories. Examples of categorical features include gender, color, and zip code. Categorical features typically need to be converted to numerical features before they can be used in machine learning algorithms. This can be done using a variety of techniques, such as one hot encoding, label encoding, and ordinal encoding. The type of feature that is used in feature engineering depends on the specific machine learning algorithm that is being used. Some machine learning algorithms, such as decision trees, can handle both numerical and categorical features. Other machine learning algorithms, such as linear regression, can only handle numerical features.
Классификация
Числовая характеристика может быть удобно описана вектором признаков. Один из способов достижения бинарной классификации – использование линейной предсказательной функции (связанной с перцептроном), принимающей на вход вектор признаков. Метод заключается в вычислении скалярного произведения между вектором признаков и вектором весов, и отнесении к классу тех наблюдений, результат для которых превышает заданный порог. Алгоритмы классификации на основе вектора признаков включают метод ближайших соседей, нейронные сети и статистические методы, такие как байесовский подход.
A numeric feature can be conveniently described by a feature vector. One way to achieve binary classification is using a linear predictor function (related to the perceptron) with a feature vector as input. The method consists of calculating the scalar product between the feature vector and a vector of weights, qualifying those observations whose result exceeds a threshold. Algorithms for classification from a feature vector include nearest neighbor classification, neural networks, and statistical techniques such as Bayesian approaches.
Векторы характеристик
В распознавании образов и машинном обучении вектор признаков – это n-мерный вектор числовых признаков, представляющих некоторый объект. Многие алгоритмы машинного обучения требуют числового представления объектов, поскольку такие представления облегчают обработку и статистический анализ. При представлении изображений значения признаков могут соответствовать пикселям изображения, а при представлении текстов признаками могут быть частоты встречаемости текстовых терминов. Векторы признаков эквивалентны векторам объясняющих переменных, используемых в статистических процедурах, таких как линейная регрессия. Векторы признаков часто комбинируются с весами посредством скалярного произведения для построения линейной предиктивной функции, используемой для определения оценки при прогнозировании. Векторное пространство, связанное с этими векторами, часто называют пространством признаков. Для уменьшения размерности пространства признаков можно использовать ряд методов понижения размерности. Признаки более высокого уровня могут быть получены из уже существующих признаков и добавлены к вектору признаков; например, при изучении заболеваний полезен признак «Возраст», который определяется как «Год смерти» минус «Год рождения». Этот процесс называется построением признаков. Построение признаков – это применение набора конструктивных операторов к существующему набору признаков, в результате чего создаются новые признаки. Примеры таких конструктивных операторов включают проверку условий равенства {=, ≠}, арифметические операторы {+,−,×, /}, операторы массивов {max(S), min(S), average(S)}, а также другие более сложные операторы, например, count(S,C), который подсчитывает количество признаков в векторе признаков S, удовлетворяющих некоторому условию C, или, например, расстояния до других классов распознавания, обобщенные некоторым распознающим устройством. Построение признаков долгое время считалось мощным инструментом для повышения точности и понимания структуры, особенно в задачах высокой размерности. Области применения включают изучение заболеваний и распознавание эмоций по речи.
In pattern recognition and machine learning, a feature vector is an n dimensional vector of numerical features that represent some object. Many algorithms in machine learning require a numerical representation of objects, since such representations facilitate processing and statistical analysis. When representing images, the feature values might correspond to the pixels of an image, while when representing texts the features might be the frequencies of occurrence of textual terms. Feature vectors are equivalent to the vectors of explanatory variables used in statistical procedures such as linear regression. Feature vectors are often combined with weights using a dot product in order to construct a linear predictor function that is used to determine a score for making a prediction. The vector space associated with these vectors is often called the feature space. In order to reduce the dimensionality of the feature space, a number of dimensionality reduction techniques can be employed. Higher level features can be obtained from already available features and added to the feature vector; for example, for the study of diseases the feature 'Age' is useful and is defined as Age = 'Year of death' minus 'Year of birth' This process is referred to as feature construction. Feature construction is the application of a set of constructive operators to a set of existing features resulting in construction of new features. Examples of such constructive operators include checking for the equality conditions {=, ≠}, the arithmetic operators {+,−,×, /}, the array operators {max(S), min(S), average(S)} as well as other more sophisticated operators, for example count(S,C) that counts the number of features in the feature vector S satisfying some condition C or, for example, distances to other recognition classes generalized by some accepting device. Feature construction has long been considered a powerful tool for increasing both accuracy and understanding of structure, particularly in high dimensional problems. Applications include studies of disease and emotion recognition from speech.
Отбор и извлечение
Первоначальный набор исходных признаков может быть избыточным и достаточно большим, что затрудняет или делает неэффективной оценку и оптимизацию. Поэтому предварительным этапом во многих приложениях машинного обучения и распознавания образов часто является выбор подмножества признаков или создание нового, сокращенного набора признаков для упрощения обучения, повышения обобщающей способности и интерпретируемости. Извлечение или отбор признаков – это сочетание искусства и науки; разработка систем для этого называется проектированием признаков. Это требует экспериментов с различными вариантами и сочетания автоматизированных методов с интуицией и знаниями эксперта в предметной области. Автоматизация этого процесса – это обучение признакам, когда машина не только использует признаки для обучения, но и сама изучает признаки.
The initial set of raw features can be redundant and large enough that estimation and optimization is made difficult or ineffective. Therefore, a preliminary step in many applications of machine learning and pattern recognition consists of selecting a subset of features, or constructing a new and reduced set of features to facilitate learning, and to improve generalization and interpretability. Extracting or selecting features is a combination of art and science; developing systems to do so is known as feature engineering. It requires the experimentation of multiple possibilities and the combination of automated techniques with the intuition and knowledge of the domain expert. Automating this process is feature learning, where a machine not only uses features for learning, but learns the features itself.