Введение
В статистике наивные классификаторы Байеса – это семейство линейных "вероятностных классификаторов", которые исходят из предположения об условной независимости признаков при заданном целевом классе. Сила (наивность) этого предположения и дала классификатору его название. Эти классификаторы относятся к числу самых простых байесовских сетевых моделей. Наивные классификаторы Байеса обладают высокой масштабируемостью, требуя количества параметров, линейно зависящего от числа переменных (признаков/предикторов) в задаче обучения. Обучение по максимальному правдоподобию может быть выполнено путем вычисления выражения в замкнутой форме. Все эти названия отражают использование теоремы Байеса в правиле принятия решений классификатора, однако наивный Байес не всегда является байесовским методом. Тем не менее, всестороннее сравнение с другими алгоритмами классификации, проведенное в 2006 году, показало, что классификация Байеса уступает по эффективности другим подходам, таким как деревья решений с усилением или случайные леса. Преимуществом наивного Байеса является то, что для оценки необходимых для классификации параметров требуется лишь небольшое количество обучающих данных.
In statistics, naive Bayes classifiers are a family of linear "probabilistic classifiers" which assumes that the features are conditionally independent, given the target class. The strength (naivety) of this assumption is what gives the classifier its name. These classifiers are among the simplest Bayesian network models. Naive Bayes classifiers are highly scalable, requiring a number of parameters linear in the number of variables (features/predictors) in a learning problem. Maximum likelihood training can be done by evaluating a closed form expression, All these names reference the use of Bayes' theorem in the classifier's decision rule, but naive Bayes is not (necessarily) a Bayesian method. Still, a comprehensive comparison with other classification algorithms in 2006 showed that Bayes classification is outperformed by other approaches, such as boosted trees or random forests. An advantage of naive Bayes is that it only requires a small amount of training data to estimate the parameters necessary for classification.
Создание классификатора из вероятностной модели
До сих пор обсуждение позволило вывести независимую модель признаков, то есть вероятностную модель наивного Байеса. Классификатор наивного Байеса комбинирует эту модель с правилом принятия решений. Распространенное правило заключается в выборе наиболее вероятной гипотезы для минимизации вероятности неверной классификации; это известно как правило максимума апостериорной вероятности, или правило MAP. Соответствующий классификатор, байесовский классификатор, – это функция, которая присваивает метку класса для некоторого k следующим образом:
Оценка параметров и модели событий
Предыдущий класс может быть вычислен, предполагая равновероятные классы, то есть , или путем вычисления оценки вероятности класса на основе обучающего набора данных:
Для оценки параметров распределения признака необходимо предположить определенное распределение или построить непараметрические модели для признаков на основе обучающего набора данных. Предположения относительно распределения признаков называются "моделью событий" наивного байесовского классификатора. Для дискретных признаков, таких как те, что встречаются в классификации документов (включая фильтрацию спама), часто используются мультиномиальное и распределение Бернулли. Эти предположения приводят к двум различным моделям, которые часто смешивают.
Гаусский наивный Байес
При работе с непрерывными данными обычно предполагается, что непрерывные значения, связанные с каждым классом, распределены по нормальному (или гауссовскому) закону. Например, предположим, что обучающие данные содержат непрерывный признак. Сначала данные сегментируются по классам, а затем для каждого класса вычисляются среднее и дисперсия. Пусть – среднее значение признака для класса , а – несмещенная оценка дисперсии признака для класса . Предположим, что получено некоторое наблюдаемое значение . Тогда плотность вероятности этого значения при условии принадлежности к классу , то есть , может быть вычислена путем подстановки в уравнение нормального распределения, параметризованного и . Формально,
Другой распространенный метод обработки непрерывных значений – использование разбиения на интервалы (binning) для дискретизации значений признаков и получения нового набора признаков, распределенных по закону Бернулли. Некоторые источники утверждают, что это необходимо для использования наивного Байеса, но это неверно, так как дискретизация может привести к потере полезной информации, позволяющей различать классы.
Обсуждение
Несмотря на то, что далеко идущие предположения о независимости часто неточны, наивный классификатор Байеса обладает рядом свойств, которые делают его удивительно полезным на практике. В частности, разделение условных распределений признаков по классам означает, что каждое распределение можно независимо оценить как одномерное. Это помогает смягчить проблемы, возникающие из-за "проклятия размерности", такие как необходимость в наборах данных, размер которых экспоненциально растет с увеличением числа признаков. Хотя наивный Байес часто не дает точную оценку истинных вероятностей классов, это может быть несущественно для многих приложений. Например, наивный классификатор Байеса будет принимать правильное решение по правилу MAP, пока вероятность предсказанного класса будет выше, чем у любого другого. Это верно независимо от того, насколько незначительной или грубой является ошибка в оценке вероятности. Таким образом, классификатор в целом может быть достаточно устойчивым, чтобы игнорировать серьезные недостатки базовой наивной вероятностной модели. Другие причины наблюдаемого успеха наивного классификатора Байеса обсуждаются в литературе, указанной ниже.
Классификация лиц
Проблема: определить пол человека (мужской или женский) на основе измеренных признаков. Признаки включают рост, вес и размер стопы. Несмотря на то, что при использовании наивного байесовского классификатора мы рассматриваем эти признаки как независимые, в реальности это не так.