Введение

Измеримое свойство или характеристика

В машинном обучении и распознавании образов, признак — это индивидуальное измеримое свойство или характеристика явления. Выбор информативных, различительных и независимых признаков является важнейшим элементом эффективных алгоритмов в распознавании образов, классификации и регрессии. Признаки обычно являются числовыми, но структурные признаки, такие как строки и графы, используются в синтаксическом распознавании образов. Понятие "признак" связано с понятием объясняющей переменной, используемой в статистических методах, таких как линейная регрессия.

Типы характеристик

В разработке признаков обычно используются два типа признаков: числовые и категориальные. Числовые признаки – это непрерывные значения, которые можно измерить по шкале. Примеры числовых признаков включают возраст, рост, вес и доход. Числовые признаки могут использоваться в алгоритмах машинного обучения напрямую. Категориальные признаки – это дискретные значения, которые можно сгруппировать в категории. Примеры категориальных признаков включают пол, цвет и почтовый индекс. Категориальные признаки обычно требуют преобразования в числовые, прежде чем их можно будет использовать в алгоритмах машинного обучения. Это можно сделать с помощью различных методов, таких как one-hot encoding (кодирование одним горячим ключом), label encoding (кодирование метками) и ordinal encoding (порядковое кодирование). Тип признака, используемый в разработке признаков, зависит от конкретного алгоритма машинного обучения. Некоторые алгоритмы машинного обучения, такие как деревья решений, могут обрабатывать как числовые, так и категориальные признаки. Другие алгоритмы машинного обучения, такие как линейная регрессия, могут обрабатывать только числовые признаки.

Классификация

Числовая характеристика может быть удобно описана вектором признаков. Один из способов достижения бинарной классификации – использование линейной предсказательной функции (связанной с перцептроном), принимающей на вход вектор признаков. Метод заключается в вычислении скалярного произведения между вектором признаков и вектором весов, и отнесении к классу тех наблюдений, результат для которых превышает заданный порог. Алгоритмы классификации на основе вектора признаков включают метод ближайших соседей, нейронные сети и статистические методы, такие как байесовский подход.

Векторы характеристик

В распознавании образов и машинном обучении вектор признаков – это n-мерный вектор числовых признаков, представляющих некоторый объект. Многие алгоритмы машинного обучения требуют числового представления объектов, поскольку такие представления облегчают обработку и статистический анализ. При представлении изображений значения признаков могут соответствовать пикселям изображения, а при представлении текстов признаками могут быть частоты встречаемости текстовых терминов. Векторы признаков эквивалентны векторам объясняющих переменных, используемых в статистических процедурах, таких как линейная регрессия. Векторы признаков часто комбинируются с весами посредством скалярного произведения для построения линейной предиктивной функции, используемой для определения оценки при прогнозировании. Векторное пространство, связанное с этими векторами, часто называют пространством признаков. Для уменьшения размерности пространства признаков можно использовать ряд методов понижения размерности. Признаки более высокого уровня могут быть получены из уже существующих признаков и добавлены к вектору признаков; например, при изучении заболеваний полезен признак «Возраст», который определяется как «Год смерти» минус «Год рождения». Этот процесс называется построением признаков. Построение признаков – это применение набора конструктивных операторов к существующему набору признаков, в результате чего создаются новые признаки. Примеры таких конструктивных операторов включают проверку условий равенства {=, ≠}, арифметические операторы {+,−,×, /}, операторы массивов {max(S), min(S), average(S)}, а также другие более сложные операторы, например, count(S,C), который подсчитывает количество признаков в векторе признаков S, удовлетворяющих некоторому условию C, или, например, расстояния до других классов распознавания, обобщенные некоторым распознающим устройством. Построение признаков долгое время считалось мощным инструментом для повышения точности и понимания структуры, особенно в задачах высокой размерности. Области применения включают изучение заболеваний и распознавание эмоций по речи.

Отбор и извлечение

Первоначальный набор исходных признаков может быть избыточным и достаточно большим, что затрудняет или делает неэффективной оценку и оптимизацию. Поэтому предварительным этапом во многих приложениях машинного обучения и распознавания образов часто является выбор подмножества признаков или создание нового, сокращенного набора признаков для упрощения обучения, повышения обобщающей способности и интерпретируемости. Извлечение или отбор признаков – это сочетание искусства и науки; разработка систем для этого называется проектированием признаков. Это требует экспериментов с различными вариантами и сочетания автоматизированных методов с интуицией и знаниями эксперта в предметной области. Автоматизация этого процесса – это обучение признакам, когда машина не только использует признаки для обучения, но и сама изучает признаки.