Кіріспе
Басқа кездейсоқ айнымалыны байқаудан алынған пайда
Ақпарат теориясы мен машиналық оқытуда ақпарат алу – бұл Куллбек-Лейблер дивергенциясының синонимі; кездейсоқ айнымалы немесе сигнал туралы басқа кездейсоқ айнымалыны байқау арқылы алынған ақпарат мөлшері. Алайда, шешім ағаштары контекстінде бұл термин кейде өзара ақпаратпен синоним ретінде қолданылады, ол бір айнымалының бір айнымалы ықтималдық таралуының, екінші айнымалы берілгендегі шартты таралудан Куллбек-Лейблер дивергенциясының шартты күтілетін мәнін білдіреді. Кездейсоқ айнымалы А-ның 1=A=a мәнін қабылдауынан алынған кездейсоқ айнымалы X-тың ақпараттық пайдасы, x үшін алдын ала таралудың, a берілгендегі x үшін кейін ала таралудан Куллбек-Лейблер дивергенциясы ретінде анықталады. Ақпараттық пайданың күтілетін мәні – X және A арасындағы өзара ақпарат 1=I(X; A), яғни кездейсоқ айнымалы А күйін білу арқылы X энтропиясының азаюы. Машиналық оқытуда бұл ұғым X күйін ең жылдам шектеуге мүмкіндік беретін атрибуттардың басымдық тізбесін анықтау үшін қолданылуы мүмкін. Мұндай тізбек (әр кезеңдегі бұрынғы атрибуттарды зерттеу нәтижесіне байланысты) шешім ағашы деп аталады және машиналық оқыту саласында шешім ағашын құру деп аталады. Әдетте, жоғары өзара ақпаратқа ие атрибуттар басқа атрибуттарға қарағанда басымдыққа ие болуы керек.
Ресми анықтама
T оқу үлгілері жиынтығын білдірсін, мұндағы әрбір үлгі – үлгінің атрибутының немесе ерекшелігінің мәні, ал y – сәйкес сынып белгісі. Атрибут a үшін ақпараттық пайда Шеннон энтропиясы тұрғысынан келесідей анықталады. Атрибут a-ның v мәні үшін, атрибут a тең болатын T оқу кірістері жиынтығы ретінде анықталсын. Содан кейін атрибут a үшін T-нің ақпараттық пайдасы – оқу жиынтығының априорлық Шеннон энтропиясы мен шартты энтропия арасындағы айырмашылық. Өзара ақпарат, егер атрибут мәндерінің әрқайсысы үшін нәтиже атрибуты үшін бірегей жіктеме жасалса, атрибут үшін жалпы энтропияға тең болады. Бұл жағдайда жалпы энтропиядан алынып тасталған салыстырмалы энтропиялар 0-ге тең. Атап айтқанда, мәндер оқу жиынтығы деректерін өзара сәйкес келмейтін және толық қамтитын ішкі жиынтықтарға бөледі, соның нәтижесінде a атрибутының мәндері үшін категориялық ықтималдық таралу туындайды. Таралу мынадай түрде берілген. Бұл жағдайда, берілген T-нің ақпараттық пайдасы T-нің шартсыз Шеннон энтропиясы мен a-ға байланысты T-нің күтілетін энтропиясы арасындағы айырмашылық ретінде анықталуы мүмкін, мұнда күтілетін мән a-ның мәндеріндегі туындаған таралуға қатысты алынады.
The mutual information is equal to the total entropy for an attribute if for each of the attribute values a unique classification can be made for the result attribute. In this case, the relative entropies subtracted from the total entropy are 0. In particular, the values defines a partition of the training set data T into mutually exclusive and all inclusive subsets, inducing a categorical probability distribution on the values of attribute a. The distribution is given In this representation, the information gain of T given a can be defined as the difference between the unconditional Shannon entropy of T and the expected entropy of T conditioned on a, where the expectation value is taken with respect to the induced distribution on the values of a.
Кемшіліктері мен шешімдері
Ақпараттық пайда атрибуттың маңыздылығын анықтау үшін көбінесе жақсы өлшем болып табылады, бірақ ол мінсіз емес. Көптеген ерекше мәндерді қабылдай алатын атрибуттарға ақпараттық пайда қолданылғанда елеулі проблема туындайды. Мысалы, бір бизнес фирмасының клиенттерін сипаттайтын деректер үшін шешім ағашын құрастыруды қарастырайық. Ақпараттық пайда көбінесе қай атрибуттар ең маңызды екенін анықтау үшін қолданылады, осылайша оларды ағаштың тамырына жақын жерде тексеруге болады. Егер клиент фирманың мүшелік бағдарламасына мүше болса, кіріс атрибуттарының бірі клиенттің мүшелік нөмірі болуы мүмкін. Бұл атрибут жоғары өзара ақпаратқа ие, себебі ол әрбір клиентті бірегей түрде анықтайды, бірақ біз оны шешім ағашына қосуды қаламаймыз. Клиентті оның мүшелік нөміріне сүйене отырып қабылдау туралы шешім, бұрын көрмеген клиенттерге жалпыламау мүмкін (артық үйлесім). Бұл мәселе, егер тексеріліп жатқан үлгілерде көптеген ерекше мәндері бар бірнеше атрибуттар болса, туындауы мүмкін. Мұндай жағдайда, бұл атрибуттардың әрқайсысының ақпараттық пайдасы, осындай көптеген ерекше мәндері жоқ атрибуттарға қарағанда әлдеқайда жоғары болуы мүмкін. Бұл мәселені шешу үшін Росс Квинлан ақпараттық пайдасы орташа немесе одан жоғары болған атрибуттардың арасынан ең жоғары ақпараттық пайда коэффициентіне ие атрибутты таңдауды ұсынды. Бұл шешім ағашын көптеген ерекше мәндері бар атрибуттарды қарастырудан аулақ қылады, сонымен қатар өте төмен ақпараттық құнды атрибуттарға әділетсіз артықшылық бермейді, себебі ақпараттық құндылық ақпараттық пайдаға тең немесе жоғары.