Кіріспе

Модельді жалпылау және ауыстырып алу техникасы. Математика, статистика, қаржы және компьютерлік ғылымда, әсіресе машиналық оқыту және кері проблемаларда, реттеу – нәтижені "қарапайымдау" үшін өзгертетін процесс. Ол көбінесе дұрыс қойылмаған проблемалар үшін нәтиже алу немесе артық үйлесімділіктің (overfitting) алдын алу үшін қолданылады. Реттеу процедураларын көптеген жолдармен жіктеуге болады, бірақ келесі жіктеме ерекше пайдалы: Нақты реттеу – бұл оптимизациялау мәселесіне тікелей термин қосылғанда қолданылатын реттеу. Бұл термин алдын ала болжамдар, айыптар немесе шектеулер болуы мүмкін. Нақты реттеу көбінесе дұрыс қойылмаған оптимизациялау мәселелерімен қолданылады. Реттеу термині немесе айып, оңтайлы шешімді бірегей ету үшін оптимизациялау функциясына қосымша шығын салу арқылы әрекет етеді. Имплицитті реттеу – реттеудің басқа барлық түрлері. Бұған, мысалы, ерте тоқтату, берік шығын функциясын қолдану және аномалияларды (outliers) жою кіреді. Имплицитті реттеу қазіргі заманғы машиналық оқыту тәсілдерінде кеңінен қолданылады, соның ішінде терең нейрондық желілерді оқыту үшін стохастикалық градиенттік түсіру және ансамбль әдістері (мысалы, кездейсоқ ормандар және градиенттік күшейтілген ағаштар). Нақты реттеуде, проблемаға немесе модельге тәуелсіз, әрқашан өлшемнің ықтималдығына сәйкес келетін деректер термині және алдын ала болжамға сәйкес келетін реттеу термині болады. Байес статистикасын қолдана отырып, екеуін де біріктіре отырып, екі ақпарат көзін де қамтитын және бағалау процесін тұрақтандыратын постерриорлық (posterior) есептеуге болады. Екі мақсатты да теңгеріп, деректерге көбірек сенесіз бе, әлде жалпылауды күшейтесіз бе (артық үйлесімділікті болдырмау үшін) деп таңдайсыз. Барлық мүмкін реттеулерді зерттейтін жеке зерттеу саласы бар. Іс жүзінде, әдетте, белгілі бір реттеуді қолданып көріп, содан кейін осы таңдауды негіздеу үшін осы реттеуге сәйкес келетін ықтималдық тығыздығын анықтайды. Бұл сондай-ақ, ақылға қонымды немесе интуицияға сүйене отырып физикалық тұрғыдан да негізделуі мүмкін. Машиналық оқытуда деректер термині оқу деректеріне сәйкес келеді, ал реттеу – модельді таңдау немесе алгоритмге енгізілген өзгерістер болып табылады. Бұл әрқашан жалпылау қатесін азайтуға бағытталған, яғни бағалау жиынтығындағы оқытылған модельдің қателік көрсеткіші, емес оқу деректеріндегі. Реттеудің ең алғашқы қолданыстарының бірі – Тихонов реттеуі, ол ең кіші квадраттар әдісімен байланысты.

Машиналық оқытудағы реттеу

Машиналық оқытудағы басты міндет – модельдерге жаңа, бұрын көрмеген деректер бойынша да нәтижелерді дәл болжауға мүмкіндік беру, тек таныс оқу деректерінде ғана емес. Жүйелендіру (регуляризация) – модель оқу деректерінің егжей-тегжейін жаттап алып, жаңа деректерге жалпылай алмағанда немесе модель оқу деректерінің күрделілігін түсінуге тым қарапайым болғанда туындайтын артық үйлесімділік (overfitting) және жеткіліксіз үйлесімділік (underfitting) мәселелерін шешу үшін өте маңызды. Бұл тұжырымды студенттерге жатталған жауаптарды еске түсірудің орнына, жаңа есептерді шешу үшін алған білімдерін қолдануды үйретумен салыстыруға болады. Жүйелендірудің мақсаты – модельдерге деректерді жаттап алудың орнына, олардың жалпы үлгілерін анықтауға көмектесу. Ерте тоқтату (Early Stopping), L1 және L2 жүйелендіру, сондай-ақ Dropout сияқты техникалар артық және жеткіліксіз үйлесімділіктің алдын алуға арналған, осылайша модельдің жаңа деректерге бейімделу және олармен жақсы жұмыс істеу қабілетін арттырып, модельдің жалпылау мүмкіндігін жақсартады. Жүйелендіру бірнеше мақсатқа қызмет ете алады, оның ішінде қарапайым модельдерді оқыту, модельдерді сирету (sparse) және оқу мәселесіне топтық құрылым енгізуге мүмкіндік беру. Осындай идея ғылымның көптеген салаларында пайда болды. Интегралдық теңдеулерге қолданылатын жүйелендірудің қарапайым түрі (Тихонов жүйелендіруі) – деректерге сәйкес келу мен шешімнің нормасын азайту арасындағы тепе-теңдік құру болып табылады. Соңғы уақытта жалпы өзгерісті жүйелендіруді қоса алғанда, сызықтық емес жүйелендіру әдістері кеңінен таралды.

Жалпылау

Регуляризацияны үйренген модельдің жалпылануын жақсарту тәсілі ретінде қарастыруға болады. Оқу мәселесінің мақсаты – барлық мүмкін кіріс деректері мен белгілері бойынша күтілетін қателікті ең төменге дейін азайтатын нәтижеге (белгіге) сәйкес келетін немесе оны болжайтын функцияны табу. Функцияның күтілетін қатесі:

мұнда және кіріс деректерінің және олардың белгілерінің домендерін білдіреді. Әдетте, оқу мәселелерінде кіріс деректері мен белгілерінің тек бір бөлігі ғана қолжетімді болады және олар белгілі бір шумен өлшенеді. Сондықтан күтілетін қате өлшенбейді, ал қолжетімді үлгілердегі эмпирикалық қате – ең жақсы алмастырушысы болып табылады:

Функция кеңістігінің күрделілігіне (формальды түрде, ядролық Гильберт кеңістігі) шектеулер қойылмаса, орынбасар эмпирикалық қатеде нөлдік шығынға ие болатын модель үйреніледі. Егер өлшемдер (мысалы, ) шумен жасалса, бұл модель артық үйлесімге (overfitting) ұшырауы және күтілетін қатесі нашарлауы мүмкін. Регуляризация модельді құру үшін қолданылатын функциялық кеңістіктің белгілі бір аймақтарын зерттеуге айыппұл салу арқылы жалпылауды жақсартады.

Тихонов реттеген ең кіші квадраттар

Ең кіші квадраттар жоғалу функциясы және Тихонов реттелуімен оқу мәселесі аналитикалық түрде шешіледі. Матрицалық түрінде жазылғанда, оптималды жағдай – жоғалу функциясының градиенті жағынан 0-ге тең болатын жағдай.

Мұнда үшінші тұжырым бірінші реттік шарт болып табылады. Оптимизациялау мәселесінің құрылысы бойынша, -ның басқа мәндері жоғалу функциясы үшін үлкен мәндер береді. Бұл екінші туындыны қарастыру арқылы растауға болады. Оқу кезінде алгоритм уақыт алады. Бұл шарттар матрицаны инверсиялауға және есептеуге сәйкес келеді. Тестілеу уақыт алады.

Ерте тоқтату

Ерте тоқтатуды уақыт бойынша реттеу ретінде қарастыруға болады. Интуитивті түрде, градиенттік түсу сияқты оқу процедурасы итерациялардың артуымен күрделірек функцияларды үйренуге ұмтылады. Уақыт бойынша реттеу арқылы модельдің күрделілігін бақылауға болады, бұл жалпылау қабілетін жақсартады. Ерте тоқтату оқу үшін бір, статистикалық тәуелсіз валидация үшін бір және сынақ үшін бір деректер жиынтығын пайдалану арқылы іске асырылады. Модель валидациялық жиынтықтағы көрсеткіші жақсарғанша оқытылады, содан кейін сынақ жиынтығына қолданылады.

Жартылай бақылаудағы оқытуды реттеуші

Егер белгілерді жинау кіріс үлгілерінен қымбат болса, жартылай қадағаланатын оқыту пайдалы болуы мүмкін. Регуляризаторлар оқыту алгоритмдерін қадағалаусыз оқыту үлгілерінің құрылымын сақтайтын модельдерді оқытуға бағыттау үшін жасалған. Егер симметриялық салмақ матрицасы берілсе, регуляризаторды былай анықтауға болады: Егер нүктелер мен үшін кейбір қашықтық метрикасының нәтижесін кодтаса, онда бұл регуляризатор осы түсінікті қамтиды және келесіге тең болады: мұнда – графиктің индукциясы арқылы туындаған Лапласиандық матрицасы. Оптимизациялау мәселесі барлық қадағаланатын үлгілер үшін шектеу қолданылса, аналитикалық түрде шешілуі мүмкін. Сондықтан вектордың белгіленген бөлігі анық. Оның белгіленбеген бөлігі былай шешіледі: Псевдо-кері матрица алынады, өйткені оның диапазонымен бірдей.

Көп тапсырмалы оқытуды реттеуші

Көп тапсырмалы оқытуда мәселелер бірдей уақытта қарастырылады, олардың әрқайсысы белгілі бір жағынан байланысты. Мақсат – болжамдық күші бар функцияларды үйрену, идеалды жағдайда, байланысты тапсырмалардың өзара әрекеттесуінен пайда табу. Бұл матрицаны үйренумен бірдей.

Бағаналардағы шамалы реттеуші

Бұл реттегіш әрбір баған үшін L2 нормасын және барлық бағандар бойынша L1 нормасын қолданады. Оны жақындығы бар әдістермен шешуге болады.

Ядролық норманы реттеу

жеке мәндік жіктемедегі өзіндік мәндер қайда орналасқан?

Орташа шектелген реттеу

Бұл реттегіш әрбір міндет үшін оқытылған функцияларды барлық міндеттер бойынша функциялардың жалпы орташасына жақын болуға шектейді. Бұл әрбір міндеттің басқа міндеттермен ортақ болуы күтілетін алдын ала білімді білдіруге көмектеседі. Мысалы, күнінің әртүрлі уақыттарында өлшенген қандағы темір деңгейін болжау, мұнда әрбір міндет жеке адамды көрсетеді.

Кластерлік орташа шектелген реттеу

мұнда тапсырмалардың жиынтығы бар. Бұл реттегіш орташа шектеулі реттегішке ұқсас, бірақ оның орнына бір кластердегі тапсырмалардың өзара ұқсастығын қамтамасыз етеді. Бұл күрделірек алдын ала ақпаратты қамтуға мүмкіндік береді. Бұл техника Netflix ұсыныстарын болжау үшін қолданылған. Кластер – бірдей талғамға ие адамдардың тобына сәйкес келеді.

График бойынша ұқсастық

Жалпы алғанда, тапсырмалар арасындағы ұқсастық функция арқылы анықталуы мүмкін. Регуляризатор модельді ұқсас тапсырмалар үшін ұқсас функцияларды үйренуге итермелейді, белгілі бір симметриялық ұқсастық матрицасы үшін.