Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Өлшеуге болатын қасиет немесе ерекшелік
Measurable property or characteristic
Машиналық оқыту және үлгілерді тануда, ерекшелік – құбылыстың жеке өлшенетін қасиеті немесе ерекшелігі болып табылады. Ақпаратты, ажыратуға мүмкіндік беретін және тәуелсіз ерекшеліктерді таңдау – үлгілерді тану, жіктеу және регрессиядағы тиімді алгоритмдердің маңызды бөлігі. Ерекшеліктер көбінесе сандық болады, бірақ синтаксистік үлгілерді тануда жолдар мен графтар сияқты құрылымдық ерекшеліктер де қолданылады. "Ерекшелік" түсінігі, сызықтық регрессия сияқты статистикалық әдістерде қолданылатын түсіндірмелі айнымалымен байланысты.
In machine learning and pattern recognition, a feature is an individual measurable property or characteristic of a phenomenon. Choosing informative, discriminating and independent features is a crucial element of effective algorithms in pattern recognition, classification and regression. Features are usually numeric, but structural features such as strings and graphs are used in syntactic pattern recognition. The concept of "feature" is related to that of explanatory variable used in statistical techniques such as linear regression.
Өзгерістердің түрлері
Ерекшеліктерді жасауда екі түрлі ерекшеліктер жиі қолданылады: сандық және санаттық. Сандық ерекшеліктер – шкала бойынша өлшенетін үздіксіз мәндер. Сандық ерекшеліктерге жас, бой, салмақ және кіріс жатады. Сандық ерекшеліктерді машиналық оқыту алгоритмдерінде тікелей пайдалануға болады. Санаттық ерекшеліктер – санаттарға жіктеуге болатын дискретті мәндер. Санаттық ерекшеліктерге жыныс, түс және пошта индексі жатады. Санаттық ерекшеліктерді машиналық оқыту алгоритмдерінде пайдалану үшін, әдетте, сандық ерекшеліктерге түрлендіру қажет. Бұл бір-жолды кодтау, белгі кодтау және реттік кодтау сияқты әртүрлі техникаларды қолдану арқылы жасалуы мүмкін. Ерекшеліктерді жасауда қолданылатын ерекшелік түрі қолданылатын нақты машиналық оқыту алгоритміне байланысты. Кейбір машиналық оқыту алгоритмдері, мысалы, шешім ағаштары, сандық және санаттық ерекшеліктерді де өңдей алады. Ал басқа машиналық оқыту алгоритмдері, мысалы, сызықтық регрессия, тек сандық ерекшеліктерді ғана өңдей алады.
In feature engineering, two types of features are commonly used: numerical and categorical. Numerical features are continuous values that can be measured on a scale. Examples of numerical features include age, height, weight, and income. Numerical features can be used in machine learning algorithms directly. Categorical features are discrete values that can be grouped into categories. Examples of categorical features include gender, color, and zip code. Categorical features typically need to be converted to numerical features before they can be used in machine learning algorithms. This can be done using a variety of techniques, such as one hot encoding, label encoding, and ordinal encoding. The type of feature that is used in feature engineering depends on the specific machine learning algorithm that is being used. Some machine learning algorithms, such as decision trees, can handle both numerical and categorical features. Other machine learning algorithms, such as linear regression, can only handle numerical features.
Жіктеу
Сандық белгіні белгі векторы арқылы ыңғайлы түрде сипаттауға болады. Бинарлық жіктеуге қол жеткізудің бір жолы – кіріс ретінде белгі векторын пайдаланатын сызықтық болжау функциясын (перцептронмен байланысты) қолдану. Бұл әдіс белгі векторы мен салмақ векторы арасындағы скалярлық көбейтіндіні есептеуден тұрады, нәтижесі белгілі бір шектен асатын деректерді анықтауға мүмкіндік береді. Белгі векторы негізінде жіктеуге арналған алгоритмдерге жақын көршілер жіктеуі, нейрондық желілер және Байес тәсілдері сияқты статистикалық әдістер жатады.
A numeric feature can be conveniently described by a feature vector. One way to achieve binary classification is using a linear predictor function (related to the perceptron) with a feature vector as input. The method consists of calculating the scalar product between the feature vector and a vector of weights, qualifying those observations whose result exceeds a threshold. Algorithms for classification from a feature vector include nearest neighbor classification, neural networks, and statistical techniques such as Bayesian approaches.
Өзіндік векторлары
Үлгіні тану және машиналық оқытуда ерекшелік векторы – белгілі бір нысанды сипаттайтын сандық ерекшеліктердің n өлшемді векторы. Машиналық оқытудағы көптеген алгоритмдер нысандардың сандық өрнектелуін қажет етеді, себебі мұндай өрнектелулер өңдеуді және статистикалық талдауды жеңілдетеді. Кескіндерді өрнектеген кезде, ерекшелік мәндері кескіннің пиксельдеріне сәйкес келуі мүмкін, ал мәтіндерді өрнектеген кезде, ерекшеліктер мәтіндік терминдердің кездесу жиілігі болуы мүмкін. Ерекшелік векторлары статистикалық процедураларда, мысалы, сызықтық регрессияда қолданылатын түсіндірмелі айнымалылардың векторларымен тең. Ерекшелік векторлары көбінесе болжам жасау үшін ұпайды анықтауға қолданылатын сызықтық болжау функциясын құру үшін нүктелік көбейтінді арқылы салмақтармен біріктіріледі. Осы векторлармен байланысты векторлық кеңістік көбінесе ерекшелік кеңістігі деп аталады. Ерекшелік кеңістігінің өлшемділігін азайту үшін өлшемділікті азайтудың бірнеше әдістерін қолдануға болады. Жоғары деңгейдегі ерекшеліктерді бұрыннан бар ерекшеліктерден алуға және оларды ерекшелік векторына қосуға болады; мысалы, ауруларды зерттеу үшін «Жас» ерекшелігі пайдалы және ол «Жас» = «Өлім жылы» – «Туған жылы» деп анықталады. Бұл процесс ерекшеліктерді құрастыру деп аталады. Ерекшеліктерді құрастыру – жаңа ерекшеліктерді құруға әкелетін, қолданыстағы ерекшеліктер жиынтығына конструктивті операторлар жиынтығын қолдану. Мұндай конструктивті операторлардың мысалдары: {=, ≠} теңдік шарттарын, {+,−,×, /} арифметикалық операторларды, {max(S), min(S), average(S)} массив операторларын, сондай-ақ басқа да күрделі операторларды, мысалы, count(S,C) – ерекшелік векторы S-тағы C шартын қанағаттандыратын ерекшеліктердің санын санайтын функцияны немесе, мысалы, кейбір қабылдау құрылғысымен жалпыланған басқа тану сыныптарына дейінгі қашықтықтарды есептейтін функцияны қамтиды. Ерекшеліктерді құрастыру ұзақ уақыттан бері дәлдікті және құрылымды түсінуді арттырудың қуатты құралы болып саналады, әсіресе жоғары өлшемді мәселелерде. Қолданылуына ауруларды зерттеу және сөйлеу арқылы эмоцияларды тану жатады.
In pattern recognition and machine learning, a feature vector is an n dimensional vector of numerical features that represent some object. Many algorithms in machine learning require a numerical representation of objects, since such representations facilitate processing and statistical analysis. When representing images, the feature values might correspond to the pixels of an image, while when representing texts the features might be the frequencies of occurrence of textual terms. Feature vectors are equivalent to the vectors of explanatory variables used in statistical procedures such as linear regression. Feature vectors are often combined with weights using a dot product in order to construct a linear predictor function that is used to determine a score for making a prediction. The vector space associated with these vectors is often called the feature space. In order to reduce the dimensionality of the feature space, a number of dimensionality reduction techniques can be employed. Higher level features can be obtained from already available features and added to the feature vector; for example, for the study of diseases the feature 'Age' is useful and is defined as Age = 'Year of death' minus 'Year of birth' This process is referred to as feature construction. Feature construction is the application of a set of constructive operators to a set of existing features resulting in construction of new features. Examples of such constructive operators include checking for the equality conditions {=, ≠}, the arithmetic operators {+,−,×, /}, the array operators {max(S), min(S), average(S)} as well as other more sophisticated operators, for example count(S,C) that counts the number of features in the feature vector S satisfying some condition C or, for example, distances to other recognition classes generalized by some accepting device. Feature construction has long been considered a powerful tool for increasing both accuracy and understanding of structure, particularly in high dimensional problems. Applications include studies of disease and emotion recognition from speech.
Таңдау және алу
Шикі сипаттамалардың бастапқы жиынтығы артық болуы және бағалау мен оңтайландыруды қиын немесе тиімсіз ететіндей үлкен болуы мүмкін. Сондықтан, машиналық оқыту мен үлгіні танудың көптеген қолданбаларындағы алғашқы қадам – оқытуды жеңілдету, жалпылауды және түсіндірілуді жақсарту үшін сипаттамалардың кіші жиынтығын таңдау немесе жаңа, қысқартылған сипаттамалар жиынтығын құру болып табылады. Сипаттамаларды бөліп алу немесе таңдау – бұл өнер мен ғылымның үйлесімі; мұндай жүйелерді әзірлеу сипаттамаларды жасау (feature engineering) деп аталады. Бұл үшін көптеген мүмкіндіктерді тәжірибеден өткізу және автоматтандырылған техникаларды салалық сарапшының интуициясымен және білімімен үйлестіру қажет. Бұл процесті автоматтандыру – сипаттамаларды оқыту (feature learning) болып табылады, онда машина сипаттамаларды оқыту үшін ғана емес, сонымен қатар өзі оқып алады.
The initial set of raw features can be redundant and large enough that estimation and optimization is made difficult or ineffective. Therefore, a preliminary step in many applications of machine learning and pattern recognition consists of selecting a subset of features, or constructing a new and reduced set of features to facilitate learning, and to improve generalization and interpretability. Extracting or selecting features is a combination of art and science; developing systems to do so is known as feature engineering. It requires the experimentation of multiple possibilities and the combination of automated techniques with the intuition and knowledge of the domain expert. Automating this process is feature learning, where a machine not only uses features for learning, but learns the features itself.