Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Шешім ағашы алгоритмі
Decision tree algorithm
Шешім ағашын оқытуда ID3 (Iterative Dichotomiser 3) – Росс Квинлан жасаған, деректер жиынтығынан шешім ағашын жасауға арналған алгоритм. ID3, C4.5 алгоритмінің алдындағысы болып табылады және көбінесе машиналық оқыту және табиғи тілді өңдеу салаларында қолданылады.
In decision tree learning, ID3 (Iterative Dichotomiser 3) is an algorithm invented by Ross Quinlan used to generate a decision tree from a dataset. ID3 is the precursor to the C4.5 algorithm, and is typically used in the machine learning and natural language processing domain
Қорытынды
Деректер жиынтығының әрбір атрибутының энтропиясын есептеңіз. Деректер жиынтығын, ентропиясы ең төменгі болатын немесе ақпараттық пайдасы ең жоғары болатын атрибут бойынша кіші жиынтықтарға бөліңіз ("бөліңіз"). Осы атрибутты қамтитын шешім ағашының түйінін жасаңыз. Қалған атрибуттарды қолдана отырып, кіші жиынтықтар бойынша осы амалды қайталаңыз.
Calculate the entropy of every attribute of the data set Partition ("split") the set into subsets using the attribute for which the resulting entropy after splitting is minimized; or, equivalently, information gain is maximum. Make a decision tree node containing that attribute. Recurse on subsets using the remaining attributes.
Қасиеттері
ID3 оптималды шешімді кепілдемейді. Ол жергілікті оптималға тоқталуы мүмкін. Әр итерацияда деректер жиынтығын бөлу үшін жергілікті ең жақсы атрибутты таңдау арқылы ол ашкөз стратегияны қолданады. Оңтайлы шешім ағашын іздеу кезінде кері қайтуды қолдану арқылы алгоритмнің оңтайлылығын жақсартуға болады, бірақ бұл көбірек уақытты қажет етуі мүмкін. ID3 оқу деректеріне шамадан тыс үйлесуі мүмкін. Шамадан тыс үйлесуден сақтану үшін кішкентай шешім ағаштары үлкендерінен артық таңдалуы керек. Бұл алгоритм көбінесе кішкентай ағаштарды құрайды, бірақ әрқашан ең кішкентай мүмкін шешім ағашын құра бермейді. ID3 үздіксіз деректермен факторланған деректерге қарағанда жұмыс істеуге қиын (факторланған деректерде мүмкін мәндердің дискретті саны болады, бұл ықтимал тармақталу нүктелерін азайтады). Егер кез келген атрибуттың мәндері үздіксіз болса, онда осы атрибут бойынша деректерді бөлуге көптеген мүмкіндіктер бар, ал бөлуге ең жақсы мәнді табу уақытты көп алады.
ID3 does not guarantee an optimal solution. It can converge upon local optima. It uses a greedy strategy by selecting the locally best attribute to split the dataset on each iteration. The algorithm's optimality can be improved by using backtracking during the search for the optimal decision tree at the cost of possibly taking longer. ID3 can overfit the training data. To avoid overfitting, smaller decision trees should be preferred over larger ones. This algorithm usually produces small trees, but it does not always produce the smallest possible decision tree. ID3 is harder to use on continuous data than on factored data (factored data has a discrete number of possible values, thus reducing the possible branch points). If the values of any given attribute are continuous, then there are many more places to split the data on this attribute, and searching for the best value to split by can be time consuming.
Қолданылуы
ID3 алгоритмі деректер жиынтығында оқыту арқылы шешім ағашын құру үшін қолданылады, ол жадта сақталады. Іске қосылғанда, бұл шешім ағашы жаңа сынақ жағдайларын (ерекшелік векторларын) жіктеу үшін пайдаланылады, деректің ерекшеліктерін пайдаланып шешім ағашын басып өту арқылы жапырақ түйіндеріне жетеді.
The ID3 algorithm is used by training on a data set to produce a decision tree which is stored in memory. At runtime, this decision tree is used to classify new test cases (feature vectors) by traversing the decision tree using the features of the datum to arrive at a leaf node.