Наивті Байес классификаторы: сандық есептеуде қолданылатын, ықтималдыққа негізделген жіктеу алгоритмі. Шартты тәуелсіздік және Байес теоремасы негізінде жұмыс істейді.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Ықтималдық жіктеу алгоритмі
Probabilistic classification algorithm
Статистикада наив Байес жіктегіштері – мақсатты класс берілген кезде, белгілердің шартты түрде тәуелсіз екенін қабылдайтын сызықтық "ықтималдық жіктегіштерінің" отбасы. Осы қабылдаудың күштілігі (наивтігі) жіктегішке оның атын береді. Бұл жіктегіштер ең қарапайым Байес желілік модельдерінің қатарына жатады. Наив Байес жіктегіштері жоғары деңгейде кеңейтілген, олар оқу мәселесіндегі айнымалылардың (белгілер/болжаушылар) санына пропорционал параметрлерді қажет етеді. Максималды ықтималдықпен оқыту жабық түрдегі формуланы есептеу арқылы жүзеге асырылуы мүмкін. Бұл атаулардың бәрі жіктегіштің шешім қабылдау ережесінде Байес теоремасын қолдануға сілтеме жасайды, бірақ наив Байес (міндетті түрде) Байес әдісі емес. Дегенмен, 2006 жылы басқа жіктеу алгоритмдерімен жасалған толық салыстыру Байес жіктеуінің басқа тәсілдерге қарағанда, мысалы, күшейтілген ағаштарға немесе кездейсоқ ормандарға нашар орындалғанын көрсетті. Наив Байестің артықшылығы – жіктеу үшін қажетті параметрлерді бағалау үшін аз көлемде оқу деректерінің қажеттігі.
In statistics, naive Bayes classifiers are a family of linear "probabilistic classifiers" which assumes that the features are conditionally independent, given the target class. The strength (naivety) of this assumption is what gives the classifier its name. These classifiers are among the simplest Bayesian network models. Naive Bayes classifiers are highly scalable, requiring a number of parameters linear in the number of variables (features/predictors) in a learning problem. Maximum likelihood training can be done by evaluating a closed form expression, All these names reference the use of Bayes' theorem in the classifier's decision rule, but naive Bayes is not (necessarily) a Bayesian method. Still, a comprehensive comparison with other classification algorithms in 2006 showed that Bayes classification is outperformed by other approaches, such as boosted trees or random forests. An advantage of naive Bayes is that it only requires a small amount of training data to estimate the parameters necessary for classification.
Ықтималдық моделінен классификатор құру
Осыған дейінгі талқылау тәуелсіз белгілер моделін, яғни наив Байес ықтималдық моделін тудырды. Наив Байес жіктегіші осы модельді шешім қағидасымен үйлестіреді. Көп қолданылатын қағида – жіктеу қателігінің ықтималдығын ең төмендету үшін ең ықтимал гипотезаны таңдау; бұл максималды апостериорлы немесе MAP шешім қағидасы деп аталады. Сәйкес жіктегіш, яғни Байес жіктегіші, кейбір k үшін сынып атауын келесідей тағайындайтын функция болып табылады:
The discussion so far has derived the independent feature model, that is, the naive Bayes probability model. The naive Bayes classifier combines this model with a decision rule. One common rule is to pick the hypothesis that is most probable so as to minimize the probability of misclassification; this is known as the maximum a posteriori or MAP decision rule. The corresponding classifier, a Bayes classifier, is the function that assigns a class label for some k as follows:
Параметрлерді бағалау және оқиғалар үлгілері
Сыныптың априорі ықтималдығы тең мүмкіндікке ие кластарды қарастыру арқылы, яғни , немесе оқу жиынтығынан сынып ықтималдығын бағалау арқылы есептелуі мүмкін:
A class's prior may be calculated by assuming equiprobable classes, i. e., , or by calculating an estimate for the class probability from the training set:
Ерекшеліктің таралу параметрлерін бағалау үшін, таралуды қабылдау немесе оқу жиынтығынан ерекшеліктер үшін параметрлік емес модельдер құру қажет. Ерекшеліктердің таралуы туралы болжамдар наив Байес жіктегішінің "оқиғалар моделі" деп аталады. Құжаттарды жіктеуде кездесетіндей дискретті ерекшеліктер үшін (спам-сүзгілеуді қоса алғанда) мультиномиалдық және Бернулли таралымдары жиі қолданылады. Бұл болжамдар екі ерекше модельге әкеледі, олар көбінесе шатастырылады.
To estimate the parameters for a feature's distribution, one must assume a distribution or generate nonparametric models for the features from the training set. The assumptions on distributions of features are called the "event model" of the naive Bayes classifier. For discrete features like the ones encountered in document classification (include spam filtering), multinomial and Bernoulli distributions are popular. These assumptions lead to two distinct models, which are often confused.
Гаустың наив Байесі
Жалғаспалы деректермен жұмыс істегенде, әр сыныпқа байланысты үздіксіз мәндер қалыпты (немесе Гаусс) үлестірімі бойынша таратылады деген жиі кездесетін болжам бар. Мысалы, оқу деректерінде үздіксіз атрибут бар делік, деректер алдымен сыныптар бойынша сегменттеледі, содан кейін әр сыныпта орташа және дисперсия есептеледі. Сыныпқа байланысты мәндердің орташасы болсын, ал сыныпқа байланысты мәндердің Бессель түзетілген дисперсиясы болсын. Егер бір байқау мәні жиналған болса, онда сынып берілгендегі ықтималдық тығыздығы, яғни , орташасы және дисперсиясымен параметрленген қалыпты үлестіру теңдеуіне мән қою арқылы есептелуі мүмкін. Формальды түрде,
When dealing with continuous data, a typical assumption is that the continuous values associated with each class are distributed according to a normal (or Gaussian) distribution. For example, suppose the training data contains a continuous attribute, The data is first segmented by the class, and then the mean and variance of is computed in each class. Let be the mean of the values in associated with class , and let be the Bessel corrected variance of the values in associated with class Suppose one has collected some observation value Then, the probability density of given a class , i. e., , can be computed by plugging into the equation for a normal distribution parameterized by and Formally,
Үздіксіз мәндерді өңдеудің тағы бір кең таралған тәсілі – мүмкіндіктердің мәндерін дискреттеу үшін бинингті пайдалану және Бернулли үлестіріліміне ие жаңа мүмкіндіктер жиынтығын алу. Кейбір әдебиеттер бұл наив Байес қолдану үшін қажет деп көрсетеді, бірақ бұл рас емес, себебі дискреттеу айырмашылықты анықтайтын маңызды ақпаратты жоюы мүмкін.
Another common technique for handling continuous values is to use binning to discretize the feature values and obtain a new set of Bernoulli distributed features. Some literature suggests that this is required in order to use naive Bayes, but it is not true, as the discretization may throw away discriminative information.
Талқылау
Тәуелсіздік туралы алысқа бағытталған болжамдар көбінесе дұрыс болмаса да, наив Байес жіктегішінің тәжірибеде күтпегендей пайдалы болатын бірнеше қасиеттері бар. Атап айтқанда, сыныптық шартты белгілердің таралуының тәуелсіздігі, әрбір таралуды бір өлшемді таралу ретінде жеке бағалауға мүмкіндік береді. Бұл, деректер жиынтығының белгілер санымен экспоненциалды түрде өсуі сияқты, өлшемділік қарғысынан туындайтын мәселелерді жеңілдетуге көмектеседі. Наив Байес көбінесе дұрыс сыныптық ықтималдықтарды жақсы бағалай алмайды, бірақ бұл көптеген қолданбалар үшін міндетті талап болмауы мүмкін. Мысалы, наив Байес жіктегіші, дұрыс сынып басқа сыныптарға қарағанда ықтимал деп есептелгенше, дұрыс MAP шешім ережесі бойынша жіктеме жасайды. Бұл ықтималдық бағасы аздап немесе тіпті айтарлықтай дәл болмаса да дұрыс. Осылайша, жалпы жіктегіш өзінің негізіндегі наивтік ықтималдық моделіндегі айқын кемшіліктерді елемеуге жеткілікті төзімді болуы мүмкін. Наив Байес жіктегішінің байқалған табысының басқа себептері төменде сілтеме берілген әдебиеттерде талқыланады.
Despite the fact that the far reaching independence assumptions are often inaccurate, the naive Bayes classifier has several properties that make it surprisingly useful in practice. In particular, the decoupling of the class conditional feature distributions means that each distribution can be independently estimated as a one dimensional distribution. This helps alleviate problems stemming from the curse of dimensionality, such as the need for data sets that scale exponentially with the number of features. While naive Bayes often fails to produce a good estimate for the correct class probabilities, this may not be a requirement for many applications. For example, the naive Bayes classifier will make the correct MAP decision rule classification so long as the correct class is predicted as more probable than any other class. This is true regardless of whether the probability estimate is slightly, or even grossly inaccurate. In this manner, the overall classifier can be robust enough to ignore serious deficiencies in its underlying naive probability model. Other reasons for the observed success of the naive Bayes classifier are discussed in the literature cited below.
Адамның жіктелуі
Мәселе: өлшенген белгілерге сүйене отырып, берілген адамның ер немесе әйел екенін анықтау. Белгілерге бойы, салмағы және аяқ өлшемі кіреді. NB классификаторында оларды тәуелсіз деп қарастырғанымен, шындығында олардың арасында байланыс бар.
Problem: classify whether a given person is a male or a female based on the measured features. The features include height, weight, and foot size. Although with NB classifier we treat them as independent, they are not in reality.