Кіріспе

Психологиядағы машиналық оқыту саласы. Күшейту оқыту (RL) – машиналық оқыту мен оптималды басқарудың салааралық саласы, ол жинақталған сыйақыны барынша арттыру үшін интеллектуалды агенттің динамикалық ортада қалай әрекет ету керектігін қарастырады. Күшейту оқыту – бақыланатын және бақыланбайтын оқытумен қатар машиналық оқытудың үш негізгі парадигмасының бірі. Күшейту оқыту, бақыланатын оқытудан айырмашылығы, белгіленген кіріс/шығыс жұптарын ұсыну қажеттілігі болмайды және суб-оптималды әрекеттерді нақты түзету қажеттілігі де жоқ. Оның орнына, назар ұзақ мерзімді сыйақыны барынша арттыру мақсатымен, зерттеу (жаңа аймақтарды тану) мен пайдалану (қазіргі білімді қолдану) арасындағы тепе-теңдікті табуға бағытталған, ал кері байланыс толық емес немесе кешіктірілуі мүмкін. Орта әдетте Марков шешім қабылдау процесі (MDP) түрінде сипатталады, себебі осы контексттегі көптеген күшейту оқыту алгоритмдері динамикалық бағдарламалау техникаларын қолданады. Классикалық динамикалық бағдарламалау әдістері мен күшейту оқыту алгоритмдерінің арасындағы басты айырмашылық – соңғылары Марков шешім қабылдау процесінің нақты математикалық моделін білмейді және нақты әдістерді қолдану мүмкін емес үлкен Марков шешім қабылдау процестерін мезгейді.

Кіріспе

Оның жалпылығына байланысты, күшейту оқыту көптеген салаларда зерттеледі, мысалы, ойын теориясы, басқару теориясы, операциялық зерттеулер, ақпарат теориясы, симуляцияға негізделген оңтайландыру, көп агентті жүйелер, ұжымдық интеллект және статистика. Операциялық зерттеулер мен басқару әдебиетінде күшейту оқыту шамамен динамикалық бағдарламалау немесе нейродинамикалық бағдарламалау деп аталады. Күшейту оқытудағы қызығушылық тудыратын мәселелер оптималды басқару теориясында да зерттелді, ол көбінесе оптималды шешімдердің болуы мен сипаттамасына және оларды дәл есептеу алгоритмдеріне қатысты, ал оқу немесе шамалаумен, әсіресе қоршаған ортаның математикалық моделі болмаған жағдайда, азаматтық көңіл бөлмейді. Негізгі күшейту оқыту Марков шешім қабылдау процесі ретінде модельделеді: қоршаған орта мен агент күйлерінің жиынтығы, ; агенттің іс-әрекеттер жиынтығы, ; уақыттағы күйден күйге өту ықтималдығы ( ), әрекеттен кейін күйге өтуден кейінгі дереу сыйақы. Күшейту оқытудың мақсаты – агенттің "сыйақы функциясын" немесе пайдаланушы ұсынған, дереу сыйақылардан жинақталатын оңтайлы немесе жақын оңтайлы саясатты үйренуі. Бұл жануарлар психологиясында кездесетін процестерге ұқсас. Мысалы, биологиялық ми ауырсыну мен аштық сияқты сигналдарды теріс күшейту ретінде, ал ләззат пен тамақ қабылдауды оң күшейту ретінде қабылдауға бейімделген. Кейбір жағдайларда жануарлар осы сыйақыларды оңтайландыруға бағытталған мінез-құлықтарға үйрене алады. Бұл жануарлар күшейту оқытуға қабілетті екенін көрсетеді. Негізгі күшейту оқыту агенті – АИ дискретті уақыт қадамдарында қоршаған ортамен өзара әрекеттеседі. Әрбір t уақытында агент ағымдағы күйді және сыйақыны алады, содан кейін ол қолжетімді іс-әрекеттер жиынтығынан іс-әрекетті таңдайды, ол кейіннен қоршаған ортаға жіберіледі. Қоршаған орта жаңа күйге өтеді және ауысумен байланысты сыйақы анықталады. Күшейту оқыту агентінің мақсаты – күтілетін жиынтық сыйақыны барынша арттыратын саясатты үйрену. Мәселені Марков шешім процесі ретінде тұжырымдау агенттің ағымдағы қоршаған ортаның күйін тікелей бақылайтынын болжайды; бұл жағдайда мәселенің толық байқалуы бар деп айтылады. Егер агент күйлердің тек бір бөлігіне ғана қолжеткізе алса немесе байқалатын күйлер шумен бұзылса, агенттің ішінара байқалуы бар деп айтылады және мәселе ресми түрде ішінара байқалатын Марков шешім процесі ретінде тұжырымдалуы керек. Екі жағдайда да агенттің қолжетімді іс-әрекеттер жиынтығы шектелуі мүмкін. Мысалы, шоттың қалдығының күйі оң болуы мүмкін; егер күйдің ағымдағы мәні 3 болса және күйдің ауысуы мәнді 4-ке төмендетуге тырысса, онда ауысуға рұқсат етілмейді. Агенттің өнімділігін оңтайлы әрекет ететін агенттің өнімділігімен салыстырғанда, өнімділіктің айырмашылығы өкініш ұғымын тудырады. Оңтайлы түрде әрекет ету үшін агент өзінің іс-әрекеттерінің ұзақ мерзімді салдары туралы ойлануы керек (яғни болашақ табысты максималдау), бірақ осыған байланысты дереу сыйақы теріс болуы мүмкін. Осылайша, күшейту оқыту ұзақ мерзімді және қысқа мерзімді сыйақының арасындағы тепе-теңдікті қамтитын мәселелерге өте жақсы сәйкес келеді. Ол әртүрлі мәселелерге сәтті қолданылды, соның ішінде энергия сақтау операцияларына, роботты басқаруға, фотоэлектр генераторларын жөнелтуге, арқанға, шашкаға, Го (AlphaGo) және автономды жүргізу жүйелеріне. Күшейту оқытуды қуатты ететін екі элемент бар: өнімділікті оңтайландыру үшін үлгілерді пайдалану және үлкен ортамен жұмыс істеу үшін функциялық шамалауды пайдалану. Осы екі негізгі компоненттің арқасында күшейту оқытуды мынадай жағдайларда үлкен ортада қолдануға болады: қоршаған ортаның моделі белгілі, бірақ талдамалық шешім жоқ; қоршаған ортаның тек симуляциялық моделі берілген (симуляцияға негізделген оңтайландыру тақырыбы); қоршаған орта туралы ақпаратты жинаудың жалғыз жолы онымен өзара әрекеттесу. Осы мәселелердің алғашқы екеуін жоспарлау мәселелері деп қарастыруға болады (негізінде модельдің қандай да бір түрі бар), ал соңғысын нағыз оқу мәселесі деп қарастыруға болады. Алайда, күшейту оқыту екі жоспарлау мәселесін де машиналық оқыту мәселесіне айналдырады.

Барлау

Барлау мен пайдалану арасындағы айырмашылық ең көп зерттелгені көп қарулы қарақшы мәселесі және Burnetas пен Katehakis (1997) еңбегіндегі шекті күй кеңістігі үшін Марков шешімдер процесі арқылы жүзеге асты. Күшейту оқытуы (Reinforcement learning) епті барлау механизмдерін қажет етеді; бағаланған ықтималдық таралымына сілтеме жасамай, кездейсоқ әрекеттер таңдау нашар нәтижелерге әкеледі. (Шағын) шекті Марков шешімдер процесі жақсы түсінілген. Дегенмен, күйлер санымен жақсы масштабталатын алгоритмдердің болмауына байланысты (немесе шексіз күй кеңістіктеріндегі мәселелерге масштабталуы), қарапайым барлау әдістері ең тиімді болып табылады. Мұндай әдістердің бірі – ашкөздік (greedy), онда параметр барлау мен пайдалану арақатынасын бақылайды. Ықтималдықпен , пайдалану таңдалады, ал агент ұзақ мерзімді әсері ең жақсы деп санайтын әрекетті таңдайды (әрекеттер арасындағы теңдік кездейсоқ түрде бұзылады). Басқаша айтқанда, ықтималдықпен , барлау таңдалады, ал әрекет кездейсоқ түрде біркелкі таңдалады. әдетте тұрақты параметр болып табылады, бірақ оны кесте бойынша (агенттің барлауын бірте-бірте азайту) немесе эвристикалық принциптерге сүйене отырып өзгертуге болады.

Басқаруды үйрену алгоритмдері

Тексеру мәселесін ескермегеннің өзінде, тіпті жағдай байқалатын болса (кейін қабылданады), бұрынғы тәжірибеге сүйене отырып, қай әрекеттердің жиынтық сыйақыны арттыратынын анықтау мәселесі шешілмейді.

Мемлекеттік-бағалы функция

Мемлекеттік құндылық функциясы күтілетін дисконтталған кіріс ретінде анықталады, белгілі бір күйден басталып, яғни , және одан кейін саясат бойынша қадамдар жасалады. Осылайша, құндылық функциясы шамамен, белгілі бір күйде болудың "қаншалықты жақсы" екенін бағалайды. TD әдістеріндегі есептеулер инкременттік (әр өтуден кейін жад өзгеріп, өту дерегі жойылатын) немесе топтық (өту деректері жиналып, бағалаулар жиын негізінде бір рет есептелетін) болуы мүмкін. Топтық әдістер, мысалы, ең кіші квадраттар уақытша айырмасы әдісі, үлгілердегі ақпаратты тиімдірек пайдалана алады, ал инкременттік әдістер жоғары есептеу немесе жад күрделілігіне байланысты топтық әдістерді қолдану мүмкін болмаған жағдайда ғана қолданылады. Кейбір әдістер екі тәсілді біріктіруге тырысады. Уақытша айырмаға негізделген әдістер төртінші мәселені де шешеді. TD-ге тән тағы бір мәселе – олардың рекурсивті Беллман теңдеуіне тәуелділігі. Көптеген TD әдістері Беллман теңдеулеріне тәуелді емес Монте-Карло әдістері мен Беллман теңдеулеріне толыққанды сүйенетін негізгі TD әдістері арасында үздіксіз интерполяциялайтын параметрді қамтиды. Бұл мәселенің әсерін азайтуға көмектеседі.

Функцияны шамалау әдістері

Бесінші мәселені шешу үшін функцияларды жуықтау әдістері қолданылады. Сызықтық функцияларды жуықтау әрбір күй-әрекет жұбына шекті өлшемді векторды тағайындайтын бейнелеуден басталады. Содан кейін, күй-әрекет жұбының мәні кейбір салмақтармен компоненттерді сызықтық комбинациялау арқылы алынады: Алгоритмдер жеке күй-әрекет жұптарымен байланысты мәндерді түзетудің орнына салмақтарды түзетуге көшеді. Параметриялық емес статистикалық идеяларға негізделген әдістер (өздерінің ерекшеліктерін құрастыра алатындары байқалады) зерттелді. Құндылық итерациясын бастапқы нүкте ретінде де пайдалануға болады, бұл Q-оқу алгоритміне және оның көптеген түрлеріне әкеледі. Q-ны көрсету үшін нейрондық желі қолданылғанда, оның ішінде терең Q-оқу әдістері, стохастикалық іздеу мәселелерінде түрлі қолданыстарға ие. Іс-әрекет мәндерін пайдаланудағы қиындық – олар бәсекелес іс-әрекет мәндерінің жоғары дәлдіктегі бағалауларын қажет етуі мүмкін, оларды қайтарымдардың шулы болуы кезінде алу қиын болуы мүмкін, бірақ бұл мәселе уақытша айырмашылық әдістерімен белгілі бір деңгейде азайтылады. «Сәйкес» функцияларды жуықтау әдісін қолдану жалпылық пен тиімділіктен айырылуға әкеледі.

Тікелей саясат іздеу

Балама әдіс – саясат кеңістігінде (немесе оның бір бөлігінде) тікелей іздеу, онда мәселе стохастикалық оптимизацияға айналады. Қолданылатын екі тәсіл бар: градиентке негізделген және градиентсіз әдістер. Градиентке негізделген әдістер (саясат градиенті әдістері) шекті өлшемді (параметрлік) кеңістіктен саясат кеңістігіне бейнелеуден басталады: параметрлік вектор берілген болса, оған сәйкес саясатты білдірсін. Өнімділік функциясын анықтау арқылы, белгілі бір шарттарда бұл функция параметрлік вектордың функциясы ретінде дифференциалданады. Егер градиент белгілі болса, градиенттік өрлеуді қолдануға болады. Бірақ градиенттің аналитикалық түрі болмағандықтан, тек қана шулы шамалау қол жетімді. Мұндай шамалауды әртүрлі жолдармен жасауға болады, мысалы, Уильямстың REINFORCE әдісі (модельдеуге негізделген оптимизация әдебиетінде ықтималдық қатынасы әдісі ретінде белгілі) сияқты алгоритмдерге алып келеді. Әдістердің үлкен тобы градиенттік ақпаратқа тәуелділіктен аулақ болады. Оларға симуляцияланған қайнату, кросс-энтропиялық іздеу немесе эволюциялық есептеу әдістері жатады. Көптеген градиентсіз әдістер (теориялық тұрғыдан және лимитте) жаһандық оптимумға жете алады. Саясатты іздеу әдістері шулы деректер болғанда баяу конвергенцияға ие болуы мүмкін. Мысалы, бұл эпизодтық мәселелерде траекториялар ұзақ болғанда және табыстардың дисперсиясы жоғары болғанда орын алады. Мұндай жағдайда уақытша айырмашылықтарға негізделген құндылық функцияларына негізделген әдістер көмектеседі. Соңғы жылдары актер-критик әдістері ұсынылып, түрлі мәселелерде жақсы нәтижелер көрсетті. Саясатты іздеу әдістері робототехника саласында қолданылған. Көптеген саясатты іздеу әдістері жергілікті оптимумдарда тұрып қалуы мүмкін (өйткені олар жергілікті іздеуге негізделген).

Модельге негізделген алгоритмдер

Ақырында, жоғарыда аталған әдістердің бәрін алдымен Марков шешім қабылдау процесінің моделін – қолданыстағы күйден жасалған әрекеттің нәтижесінде келесі күйдің қандай ықтималдықпен болатынын анықтайтын алгоритмдермен үйлестіруге болады. Мысалы, Dyna алгоритмі тәжірибеден модельді үйреніп, оны құндылық функциясын жақсарту үшін нақты ауысулармен қатар, модельденген ауысуларды да пайдаланады. Мұндай әдістер кейде параметрлік емес модельдерді қолдану арқылы кеңейтілуі мүмкін, мысалы, ауысулар жай ғана сақталып, оқу алгоритміне қайтадан беріледі. Модельге негізделген әдістер, модельге негізделмеген әдістерге қарағанда есептеулерді көп қажет етеді, ал олардың тиімділігі Марков шешім қабылдау процесін қаншалықты дәл үйренуге болатынына байланысты шектелуі мүмкін. Модельдерді құндылық функциясын жаңартудан өзге де жолдармен қолдануға болады. Мысалы, модельдік болжамды басқаруда модель мінез-құлықты тікелей өзгерту үшін қолданылады.

Қауымдастықты нығайту арқылы оқыту

Ассоциативтік нығайту оқу тапсырмалары стохастикалық оқу автоматтарының және қадағалаумен оқудың үлгілерді жіктеу тапсырмаларының ерекшеліктерін біріктіреді. Ассоциативтік нығайту оқу тапсырмаларында оқу жүйесі өзінің ортасымен жабық цикл бойынша өзара әрекеттеседі.

Терең нығайту арқылы оқыту

Бұл тәсіл терең нейрондық желіні қолдану арқылы күшейту оқытуды кеңейтеді және күй кеңістігін қатаң жобалау қажеттілігін жояды. Google DeepMind-тің ATARI ойындарын оқыту жұмысы терең күшейту оқытуына немесе тікелей күшейту оқытуына қызығушылықты арттырды.

Қарсылық терең нығайтуды үйрену

Қарсыластық терең нығайту арқылы оқыту – нығайту арқылы оқытудағы белсенді зерттеу саласы, ол үйренген саясаттардың осалдығына назар аударады. Осы зерттеу саласындағы кейбір жұмыстар бастапқыда нығайту арқылы оқыту саясаттарының көзге көрінбейтін қарсыластық манипуляцияларға ұшырайтынын көрсетті. Бұл осалдықтарды жоюға бағытталған әдістер ұсынылғанмен, соңғы зерттеулер көрсеткендей, бұл ұсынылған шешімдер терең нығайту арқылы оқыту саясаттарының қазіргі осалдықтарын толыққанды бейнелеуден қашық.

Қалыстырмалы үйрену

Қосалқы оқытуға бұлыңғыр логиканы енгізу арқылы, үздіксіз кеңістікте мемлекеттік-әрекеттік құндылық функциясын бұлыңғыр ережелермен жуықтау мүмкін болады. Бұлыңғыр ережелердің ЕГЕР-СОН (IF-THEN) форматы осы тәсілді нәтижелерді табиғи тілге жақын түрінде беруге ыңғайлы етеді. FRL-ді Бұлыңғыр Ереже Интерполяциясымен (Fuzzy Rule Interpolation) кеңейту, ең маңызды мемлекеттік-әрекеттік құндылықтарды (кардиналдық ережелерді) көрсету үшін қысқартылған, сирек бұлыңғыр ережелер жиынын пайдалануға мүмкіндік береді.

Кері күшейту арқылы оқыту

Кері күшейту арқылы оқытуда (IRL) ешқандай сыйақы функциясы берілмейді. Оның орнына, сарапшының байқалған мінез-құлқы негізінде сыйақы функциясы анықталады. Мақсаты – көбінесе оңтайлы немесе оңтайлыға жақын болатын байқалған мінез-құлықты еліктеу. Танымал IRL парадигмаларының бірі – максималды энтропиялық кері күшейту оқыту (MaxEnt IRL). MaxEnt IRL сыйақы функциясының сызықтық моделінің параметрлерін күтілетін белгілер санына сәйкес келетін шектеулерді ескере отырып, байқалатын траекториялардың ықтималдық таралуының энтропиясын максималдау арқылы бағалайды. Жақында MaxEnt IRL кездейсоқ пайдалылық кері күшейту оқыту (RU IRL) деп аталатын, көбірек жалпылама шеңбердің ерекше жағдайы екені көрсетілді. RU IRL кездейсоқ пайдалылық теориясы мен Марков шешімдер процестеріне негізделген. Бұрынғы IRL тәсілдері байқалатын агенттің көрінетін кездейсоқ мінез-құлқы кездейсоқ саясатты ұстануына байланысты деп есептесе, RU IRL байқалатын агенттің детерминистік саясатты ұстануына, бірақ байқалатын мінез-құлқындағы кездейсоқтықтың себебі байқаушының агенттің шешім қабылдауда қолданатын белгілеріне толық қол жеткізбеуімен байланысты деп қарастырады. Пайдалылық функциясы байқаушының агенттің пайдалылық функциясында нақты қандай белгілерді ескеретіні туралы білімінің жетіспеуін ескеру үшін кездейсоқ айнымалы ретінде модельделеді.

Қауіпсіз сабақ беру

Қауіпсіз күшейту оқыту (SRL) – оқыту және/немесе қолдану процестерінде жүйенің қалыпты жұмысын қамтамасыз ету және/немесе қауіпсіздік талаптарын сақтау маңызды мәселелерде күтілетін сыйақыны барынша арттыруға бағытталған саясатты оқыту процесі ретінде анықталады.