Кіріспе
Модельді жалпылау және ауыстырып алу техникасы. Математика, статистика, қаржы және компьютерлік ғылымда, әсіресе машиналық оқыту және кері проблемаларда, реттеу – нәтижені "қарапайымдау" үшін өзгертетін процесс. Ол көбінесе дұрыс қойылмаған проблемалар үшін нәтиже алу немесе артық үйлесімділіктің (overfitting) алдын алу үшін қолданылады. Реттеу процедураларын көптеген жолдармен жіктеуге болады, бірақ келесі жіктеме ерекше пайдалы: Нақты реттеу – бұл оптимизациялау мәселесіне тікелей термин қосылғанда қолданылатын реттеу. Бұл термин алдын ала болжамдар, айыптар немесе шектеулер болуы мүмкін. Нақты реттеу көбінесе дұрыс қойылмаған оптимизациялау мәселелерімен қолданылады. Реттеу термині немесе айып, оңтайлы шешімді бірегей ету үшін оптимизациялау функциясына қосымша шығын салу арқылы әрекет етеді. Имплицитті реттеу – реттеудің басқа барлық түрлері. Бұған, мысалы, ерте тоқтату, берік шығын функциясын қолдану және аномалияларды (outliers) жою кіреді. Имплицитті реттеу қазіргі заманғы машиналық оқыту тәсілдерінде кеңінен қолданылады, соның ішінде терең нейрондық желілерді оқыту үшін стохастикалық градиенттік түсіру және ансамбль әдістері (мысалы, кездейсоқ ормандар және градиенттік күшейтілген ағаштар). Нақты реттеуде, проблемаға немесе модельге тәуелсіз, әрқашан өлшемнің ықтималдығына сәйкес келетін деректер термині және алдын ала болжамға сәйкес келетін реттеу термині болады. Байес статистикасын қолдана отырып, екеуін де біріктіре отырып, екі ақпарат көзін де қамтитын және бағалау процесін тұрақтандыратын постерриорлық (posterior) есептеуге болады. Екі мақсатты да теңгеріп, деректерге көбірек сенесіз бе, әлде жалпылауды күшейтесіз бе (артық үйлесімділікті болдырмау үшін) деп таңдайсыз. Барлық мүмкін реттеулерді зерттейтін жеке зерттеу саласы бар. Іс жүзінде, әдетте, белгілі бір реттеуді қолданып көріп, содан кейін осы таңдауды негіздеу үшін осы реттеуге сәйкес келетін ықтималдық тығыздығын анықтайды. Бұл сондай-ақ, ақылға қонымды немесе интуицияға сүйене отырып физикалық тұрғыдан да негізделуі мүмкін. Машиналық оқытуда деректер термині оқу деректеріне сәйкес келеді, ал реттеу – модельді таңдау немесе алгоритмге енгізілген өзгерістер болып табылады. Бұл әрқашан жалпылау қатесін азайтуға бағытталған, яғни бағалау жиынтығындағы оқытылған модельдің қателік көрсеткіші, емес оқу деректеріндегі. Реттеудің ең алғашқы қолданыстарының бірі – Тихонов реттеуі, ол ең кіші квадраттар әдісімен байланысты.
In mathematics, statistics, finance, and computer science, particularly in machine learning and inverse problems, regularization is a process that changes the result answer to be "simpler". It is often used to obtain results for ill posed problems or to prevent overfitting. Although regularization procedures can be divided in many ways, the following delineation is particularly helpful:
Explicit regularization is regularization whenever one explicitly adds a term to the optimization problem. These terms could be priors, penalties, or constraints. Explicit regularization is commonly employed with ill posed optimization problems. The regularization term, or penalty, imposes a cost on the optimization function to make the optimal solution unique. Implicit regularization is all other forms of regularization. This includes, for example, early stopping, using a robust loss function, and discarding outliers. Implicit regularization is essentially ubiquitous in modern machine learning approaches, including stochastic gradient descent for training deep neural networks, and ensemble methods (such as random forests and gradient boosted trees). In explicit regularization, independent of the problem or model, there is always a data term, that corresponds to a likelihood of the measurement and a regularization term that corresponds to a prior. By combining both using Bayesian statistics, one can compute a posterior, that includes both information sources and therefore stabilizes the estimation process. By trading off both objectives, one chooses to be more addictive to the data or to enforce generalization (to prevent overfitting). There is a whole research branch dealing with all possible regularizations. In practice, one usually tries a specific regularization and then figures out the probability density that corresponds to that regularization to justify the choice. It can also be physically motivated by common sense or intuition. In machine learning, the data term corresponds to the training data and the regularization is either the choice of the model or modifications to the algorithm. It is always intended to reduce the generalization error, i. e. the error score with the trained model on the evaluation set and not the training data. One of the earliest uses of regularization is Tikhonov regularization, related to the method of least squares.
Машиналық оқытудағы реттеу
Машиналық оқытудағы басты міндет – модельдерге жаңа, бұрын көрмеген деректер бойынша да нәтижелерді дәл болжауға мүмкіндік беру, тек таныс оқу деректерінде ғана емес. Жүйелендіру (регуляризация) – модель оқу деректерінің егжей-тегжейін жаттап алып, жаңа деректерге жалпылай алмағанда немесе модель оқу деректерінің күрделілігін түсінуге тым қарапайым болғанда туындайтын артық үйлесімділік (overfitting) және жеткіліксіз үйлесімділік (underfitting) мәселелерін шешу үшін өте маңызды. Бұл тұжырымды студенттерге жатталған жауаптарды еске түсірудің орнына, жаңа есептерді шешу үшін алған білімдерін қолдануды үйретумен салыстыруға болады. Жүйелендірудің мақсаты – модельдерге деректерді жаттап алудың орнына, олардың жалпы үлгілерін анықтауға көмектесу. Ерте тоқтату (Early Stopping), L1 және L2 жүйелендіру, сондай-ақ Dropout сияқты техникалар артық және жеткіліксіз үйлесімділіктің алдын алуға арналған, осылайша модельдің жаңа деректерге бейімделу және олармен жақсы жұмыс істеу қабілетін арттырып, модельдің жалпылау мүмкіндігін жақсартады. Жүйелендіру бірнеше мақсатқа қызмет ете алады, оның ішінде қарапайым модельдерді оқыту, модельдерді сирету (sparse) және оқу мәселесіне топтық құрылым енгізуге мүмкіндік беру. Осындай идея ғылымның көптеген салаларында пайда болды. Интегралдық теңдеулерге қолданылатын жүйелендірудің қарапайым түрі (Тихонов жүйелендіруі) – деректерге сәйкес келу мен шешімнің нормасын азайту арасындағы тепе-теңдік құру болып табылады. Соңғы уақытта жалпы өзгерісті жүйелендіруді қоса алғанда, сызықтық емес жүйелендіру әдістері кеңінен таралды.
Жалпылау
Регуляризацияны үйренген модельдің жалпылануын жақсарту тәсілі ретінде қарастыруға болады. Оқу мәселесінің мақсаты – барлық мүмкін кіріс деректері мен белгілері бойынша күтілетін қателікті ең төменге дейін азайтатын нәтижеге (белгіге) сәйкес келетін немесе оны болжайтын функцияны табу. Функцияның күтілетін қатесі:
мұнда және кіріс деректерінің және олардың белгілерінің домендерін білдіреді. Әдетте, оқу мәселелерінде кіріс деректері мен белгілерінің тек бір бөлігі ғана қолжетімді болады және олар белгілі бір шумен өлшенеді. Сондықтан күтілетін қате өлшенбейді, ал қолжетімді үлгілердегі эмпирикалық қате – ең жақсы алмастырушысы болып табылады:
Функция кеңістігінің күрделілігіне (формальды түрде, ядролық Гильберт кеңістігі) шектеулер қойылмаса, орынбасар эмпирикалық қатеде нөлдік шығынға ие болатын модель үйреніледі. Егер өлшемдер (мысалы, ) шумен жасалса, бұл модель артық үйлесімге (overfitting) ұшырауы және күтілетін қатесі нашарлауы мүмкін. Регуляризация модельді құру үшін қолданылатын функциялық кеңістіктің белгілі бір аймақтарын зерттеуге айыппұл салу арқылы жалпылауды жақсартады.
Тихонов реттеген ең кіші квадраттар
Ең кіші квадраттар жоғалу функциясы және Тихонов реттелуімен оқу мәселесі аналитикалық түрде шешіледі. Матрицалық түрінде жазылғанда, оптималды жағдай – жоғалу функциясының градиенті жағынан 0-ге тең болатын жағдай.
Мұнда үшінші тұжырым бірінші реттік шарт болып табылады. Оптимизациялау мәселесінің құрылысы бойынша, -ның басқа мәндері жоғалу функциясы үшін үлкен мәндер береді. Бұл екінші туындыны қарастыру арқылы растауға болады. Оқу кезінде алгоритм уақыт алады. Бұл шарттар матрицаны инверсиялауға және есептеуге сәйкес келеді. Тестілеу уақыт алады.
During training, this algorithm takes time. The terms correspond to the matrix inversion and calculating , respectively. Testing takes time.
Ерте тоқтату
Ерте тоқтатуды уақыт бойынша реттеу ретінде қарастыруға болады. Интуитивті түрде, градиенттік түсу сияқты оқу процедурасы итерациялардың артуымен күрделірек функцияларды үйренуге ұмтылады. Уақыт бойынша реттеу арқылы модельдің күрделілігін бақылауға болады, бұл жалпылау қабілетін жақсартады. Ерте тоқтату оқу үшін бір, статистикалық тәуелсіз валидация үшін бір және сынақ үшін бір деректер жиынтығын пайдалану арқылы іске асырылады. Модель валидациялық жиынтықтағы көрсеткіші жақсарғанша оқытылады, содан кейін сынақ жиынтығына қолданылады.
Жартылай бақылаудағы оқытуды реттеуші
Егер белгілерді жинау кіріс үлгілерінен қымбат болса, жартылай қадағаланатын оқыту пайдалы болуы мүмкін. Регуляризаторлар оқыту алгоритмдерін қадағалаусыз оқыту үлгілерінің құрылымын сақтайтын модельдерді оқытуға бағыттау үшін жасалған. Егер симметриялық салмақ матрицасы берілсе, регуляризаторды былай анықтауға болады: Егер нүктелер мен үшін кейбір қашықтық метрикасының нәтижесін кодтаса, онда бұл регуляризатор осы түсінікті қамтиды және келесіге тең болады: мұнда – графиктің индукциясы арқылы туындаған Лапласиандық матрицасы. Оптимизациялау мәселесі барлық қадағаланатын үлгілер үшін шектеу қолданылса, аналитикалық түрде шешілуі мүмкін. Сондықтан вектордың белгіленген бөлігі анық. Оның белгіленбеген бөлігі былай шешіледі: Псевдо-кері матрица алынады, өйткені оның диапазонымен бірдей.
If encodes the result of some distance metric for points and , it is desirable that This regularizer captures this intuition, and is equivalent to:
where is the Laplacian matrix of the graph induced by
The optimization problem can be solved analytically if the constraint is applied for all supervised samples. The labeled part of the vector is therefore obvious. The unlabeled part of is solved for by:
The pseudo inverse can be taken because has the same range as .
Көп тапсырмалы оқытуды реттеуші
Көп тапсырмалы оқытуда мәселелер бірдей уақытта қарастырылады, олардың әрқайсысы белгілі бір жағынан байланысты. Мақсат – болжамдық күші бар функцияларды үйрену, идеалды жағдайда, байланысты тапсырмалардың өзара әрекеттесуінен пайда табу. Бұл матрицаны үйренумен бірдей.
Бағаналардағы шамалы реттеуші
Бұл реттегіш әрбір баған үшін L2 нормасын және барлық бағандар бойынша L1 нормасын қолданады. Оны жақындығы бар әдістермен шешуге болады.
Ядролық норманы реттеу
жеке мәндік жіктемедегі өзіндік мәндер қайда орналасқан?
Орташа шектелген реттеу
Бұл реттегіш әрбір міндет үшін оқытылған функцияларды барлық міндеттер бойынша функциялардың жалпы орташасына жақын болуға шектейді. Бұл әрбір міндеттің басқа міндеттермен ортақ болуы күтілетін алдын ала білімді білдіруге көмектеседі. Мысалы, күнінің әртүрлі уақыттарында өлшенген қандағы темір деңгейін болжау, мұнда әрбір міндет жеке адамды көрсетеді.
Кластерлік орташа шектелген реттеу
мұнда тапсырмалардың жиынтығы бар. Бұл реттегіш орташа шектеулі реттегішке ұқсас, бірақ оның орнына бір кластердегі тапсырмалардың өзара ұқсастығын қамтамасыз етеді. Бұл күрделірек алдын ала ақпаратты қамтуға мүмкіндік береді. Бұл техника Netflix ұсыныстарын болжау үшін қолданылған. Кластер – бірдей талғамға ие адамдардың тобына сәйкес келеді.
График бойынша ұқсастық
Жалпы алғанда, тапсырмалар арасындағы ұқсастық функция арқылы анықталуы мүмкін. Регуляризатор модельді ұқсас тапсырмалар үшін ұқсас функцияларды үйренуге итермелейді, белгілі бір симметриялық ұқсастық матрицасы үшін.