Кіріспе
Психологиядағы машиналық оқыту саласы. Күшейту оқыту (RL) – машиналық оқыту мен оптималды басқарудың салааралық саласы, ол жинақталған сыйақыны барынша арттыру үшін интеллектуалды агенттің динамикалық ортада қалай әрекет ету керектігін қарастырады. Күшейту оқыту – бақыланатын және бақыланбайтын оқытумен қатар машиналық оқытудың үш негізгі парадигмасының бірі. Күшейту оқыту, бақыланатын оқытудан айырмашылығы, белгіленген кіріс/шығыс жұптарын ұсыну қажеттілігі болмайды және суб-оптималды әрекеттерді нақты түзету қажеттілігі де жоқ. Оның орнына, назар ұзақ мерзімді сыйақыны барынша арттыру мақсатымен, зерттеу (жаңа аймақтарды тану) мен пайдалану (қазіргі білімді қолдану) арасындағы тепе-теңдікті табуға бағытталған, ал кері байланыс толық емес немесе кешіктірілуі мүмкін. Орта әдетте Марков шешім қабылдау процесі (MDP) түрінде сипатталады, себебі осы контексттегі көптеген күшейту оқыту алгоритмдері динамикалық бағдарламалау техникаларын қолданады. Классикалық динамикалық бағдарламалау әдістері мен күшейту оқыту алгоритмдерінің арасындағы басты айырмашылық – соңғылары Марков шешім қабылдау процесінің нақты математикалық моделін білмейді және нақты әдістерді қолдану мүмкін емес үлкен Марков шешім қабылдау процестерін мезгейді.
reinforcement learning in psychology
Reinforcement learning (RL) is an interdisciplinary area of machine learning and optimal control concerned with how an intelligent agent ought to take actions in a dynamic environment in order to maximize the cumulative reward. Reinforcement learning is one of three basic machine learning paradigms, alongside supervised learning and unsupervised learning. Reinforcement learning differs from supervised learning in not needing labelled input/output pairs to be presented, and in not needing sub optimal actions to be explicitly corrected. Instead the focus is on finding a balance between exploration (of uncharted territory) and exploitation (of current knowledge) with the goal of maximizing the long term reward, whose feedback might be incomplete or delayed. The environment is typically stated in the form of a Markov decision process (MDP), because many reinforcement learning algorithms for this context use dynamic programming techniques. The main difference between the classical dynamic programming methods and reinforcement learning algorithms is that the latter do not assume knowledge of an exact mathematical model of the Markov decision process and they target large Markov decision processes where exact methods become infeasible.
Кіріспе
Оның жалпылығына байланысты, күшейту оқыту көптеген салаларда зерттеледі, мысалы, ойын теориясы, басқару теориясы, операциялық зерттеулер, ақпарат теориясы, симуляцияға негізделген оңтайландыру, көп агентті жүйелер, ұжымдық интеллект және статистика. Операциялық зерттеулер мен басқару әдебиетінде күшейту оқыту шамамен динамикалық бағдарламалау немесе нейродинамикалық бағдарламалау деп аталады. Күшейту оқытудағы қызығушылық тудыратын мәселелер оптималды басқару теориясында да зерттелді, ол көбінесе оптималды шешімдердің болуы мен сипаттамасына және оларды дәл есептеу алгоритмдеріне қатысты, ал оқу немесе шамалаумен, әсіресе қоршаған ортаның математикалық моделі болмаған жағдайда, азаматтық көңіл бөлмейді. Негізгі күшейту оқыту Марков шешім қабылдау процесі ретінде модельделеді: қоршаған орта мен агент күйлерінің жиынтығы, ; агенттің іс-әрекеттер жиынтығы, ; уақыттағы күйден күйге өту ықтималдығы ( ), әрекеттен кейін күйге өтуден кейінгі дереу сыйақы. Күшейту оқытудың мақсаты – агенттің "сыйақы функциясын" немесе пайдаланушы ұсынған, дереу сыйақылардан жинақталатын оңтайлы немесе жақын оңтайлы саясатты үйренуі. Бұл жануарлар психологиясында кездесетін процестерге ұқсас. Мысалы, биологиялық ми ауырсыну мен аштық сияқты сигналдарды теріс күшейту ретінде, ал ләззат пен тамақ қабылдауды оң күшейту ретінде қабылдауға бейімделген. Кейбір жағдайларда жануарлар осы сыйақыларды оңтайландыруға бағытталған мінез-құлықтарға үйрене алады. Бұл жануарлар күшейту оқытуға қабілетті екенін көрсетеді. Негізгі күшейту оқыту агенті – АИ дискретті уақыт қадамдарында қоршаған ортамен өзара әрекеттеседі. Әрбір t уақытында агент ағымдағы күйді және сыйақыны алады, содан кейін ол қолжетімді іс-әрекеттер жиынтығынан іс-әрекетті таңдайды, ол кейіннен қоршаған ортаға жіберіледі. Қоршаған орта жаңа күйге өтеді және ауысумен байланысты сыйақы анықталады. Күшейту оқыту агентінің мақсаты – күтілетін жиынтық сыйақыны барынша арттыратын саясатты үйрену. Мәселені Марков шешім процесі ретінде тұжырымдау агенттің ағымдағы қоршаған ортаның күйін тікелей бақылайтынын болжайды; бұл жағдайда мәселенің толық байқалуы бар деп айтылады. Егер агент күйлердің тек бір бөлігіне ғана қолжеткізе алса немесе байқалатын күйлер шумен бұзылса, агенттің ішінара байқалуы бар деп айтылады және мәселе ресми түрде ішінара байқалатын Марков шешім процесі ретінде тұжырымдалуы керек. Екі жағдайда да агенттің қолжетімді іс-әрекеттер жиынтығы шектелуі мүмкін. Мысалы, шоттың қалдығының күйі оң болуы мүмкін; егер күйдің ағымдағы мәні 3 болса және күйдің ауысуы мәнді 4-ке төмендетуге тырысса, онда ауысуға рұқсат етілмейді. Агенттің өнімділігін оңтайлы әрекет ететін агенттің өнімділігімен салыстырғанда, өнімділіктің айырмашылығы өкініш ұғымын тудырады. Оңтайлы түрде әрекет ету үшін агент өзінің іс-әрекеттерінің ұзақ мерзімді салдары туралы ойлануы керек (яғни болашақ табысты максималдау), бірақ осыған байланысты дереу сыйақы теріс болуы мүмкін. Осылайша, күшейту оқыту ұзақ мерзімді және қысқа мерзімді сыйақының арасындағы тепе-теңдікті қамтитын мәселелерге өте жақсы сәйкес келеді. Ол әртүрлі мәселелерге сәтті қолданылды, соның ішінде энергия сақтау операцияларына, роботты басқаруға, фотоэлектр генераторларын жөнелтуге, арқанға, шашкаға, Го (AlphaGo) және автономды жүргізу жүйелеріне. Күшейту оқытуды қуатты ететін екі элемент бар: өнімділікті оңтайландыру үшін үлгілерді пайдалану және үлкен ортамен жұмыс істеу үшін функциялық шамалауды пайдалану. Осы екі негізгі компоненттің арқасында күшейту оқытуды мынадай жағдайларда үлкен ортада қолдануға болады: қоршаған ортаның моделі белгілі, бірақ талдамалық шешім жоқ; қоршаған ортаның тек симуляциялық моделі берілген (симуляцияға негізделген оңтайландыру тақырыбы); қоршаған орта туралы ақпаратты жинаудың жалғыз жолы онымен өзара әрекеттесу. Осы мәселелердің алғашқы екеуін жоспарлау мәселелері деп қарастыруға болады (негізінде модельдің қандай да бір түрі бар), ал соңғысын нағыз оқу мәселесі деп қарастыруға болады. Алайда, күшейту оқыту екі жоспарлау мәселесін де машиналық оқыту мәселесіне айналдырады.
a set of environment and agent states, ;
a set of actions, , of the agent;
, the probability of transition (at time ) from state to state under action , the immediate reward after transition from to with action
The purpose of reinforcement learning is for the agent to learn an optimal, or nearly optimal, policy that maximizes the "reward function" or other user provided reinforcement signal that accumulates from the immediate rewards. This is similar to processes that appear to occur in animal psychology. For example, biological brains are hardwired to interpret signals such as pain and hunger as negative reinforcements, and interpret pleasure and food intake as positive reinforcements. In some circumstances, animals can learn to engage in behaviors that optimize these rewards. This suggests that animals are capable of reinforcement learning. A basic reinforcement learning agent AI interacts with its environment in discrete time steps. At each time t, the agent receives the current state and reward It then chooses an action from the set of available actions, which is subsequently sent to the environment. The environment moves to a new state and the reward associated with the transition is determined. The goal of a reinforcement learning agent is to learn a policy: , that maximizes the expected cumulative reward. Formulating the problem as an Markov decision process assumes the agent directly observes the current environmental state; in this case the problem is said to have full observability. If the agent only has access to a subset of states, or if the observed states are corrupted by noise, the agent is said to have partial observability, and formally the problem must be formulated as a Partially observable Markov decision process. In both cases, the set of actions available to the agent can be restricted. For example, the state of an account balance could be restricted to be positive; if the current value of the state is 3 and the state transition attempts to reduce the value by 4, the transition will not be allowed. When the agent's performance is compared to that of an agent that acts optimally, the difference in performance gives rise to the notion of regret. In order to act near optimally, the agent must reason about the long term consequences of its actions (i. e., maximize future income), although the immediate reward associated with this might be negative. Thus, reinforcement learning is particularly well suited to problems that include a long term versus short term reward trade off. It has been applied successfully to various problems, including energy storage operation, robot control, photovoltaic generators dispatch, backgammon, checkers, Go (AlphaGo), and autonomous driving systems. Two elements make reinforcement learning powerful: the use of samples to optimize performance and the use of function approximation to deal with large environments. Thanks to these two key components, reinforcement learning can be used in large environments in the following situations:
A model of the environment is known, but an analytic solution is not available;
Only a simulation model of the environment is given (the subject of simulation based optimization);
The only way to collect information about the environment is to interact with it. The first two of these problems could be considered planning problems (since some form of model is available), while the last one could be considered to be a genuine learning problem. However, reinforcement learning converts both planning problems to machine learning problems.
Барлау
Барлау мен пайдалану арасындағы айырмашылық ең көп зерттелгені көп қарулы қарақшы мәселесі және Burnetas пен Katehakis (1997) еңбегіндегі шекті күй кеңістігі үшін Марков шешімдер процесі арқылы жүзеге асты. Күшейту оқытуы (Reinforcement learning) епті барлау механизмдерін қажет етеді; бағаланған ықтималдық таралымына сілтеме жасамай, кездейсоқ әрекеттер таңдау нашар нәтижелерге әкеледі. (Шағын) шекті Марков шешімдер процесі жақсы түсінілген. Дегенмен, күйлер санымен жақсы масштабталатын алгоритмдердің болмауына байланысты (немесе шексіз күй кеңістіктеріндегі мәселелерге масштабталуы), қарапайым барлау әдістері ең тиімді болып табылады. Мұндай әдістердің бірі – ашкөздік (greedy), онда параметр барлау мен пайдалану арақатынасын бақылайды. Ықтималдықпен , пайдалану таңдалады, ал агент ұзақ мерзімді әсері ең жақсы деп санайтын әрекетті таңдайды (әрекеттер арасындағы теңдік кездейсоқ түрде бұзылады). Басқаша айтқанда, ықтималдықпен , барлау таңдалады, ал әрекет кездейсоқ түрде біркелкі таңдалады. әдетте тұрақты параметр болып табылады, бірақ оны кесте бойынша (агенттің барлауын бірте-бірте азайту) немесе эвристикалық принциптерге сүйене отырып өзгертуге болады.
Басқаруды үйрену алгоритмдері
Тексеру мәселесін ескермегеннің өзінде, тіпті жағдай байқалатын болса (кейін қабылданады), бұрынғы тәжірибеге сүйене отырып, қай әрекеттердің жиынтық сыйақыны арттыратынын анықтау мәселесі шешілмейді.
Мемлекеттік-бағалы функция
Мемлекеттік құндылық функциясы күтілетін дисконтталған кіріс ретінде анықталады, белгілі бір күйден басталып, яғни , және одан кейін саясат бойынша қадамдар жасалады. Осылайша, құндылық функциясы шамамен, белгілі бір күйде болудың "қаншалықты жақсы" екенін бағалайды. TD әдістеріндегі есептеулер инкременттік (әр өтуден кейін жад өзгеріп, өту дерегі жойылатын) немесе топтық (өту деректері жиналып, бағалаулар жиын негізінде бір рет есептелетін) болуы мүмкін. Топтық әдістер, мысалы, ең кіші квадраттар уақытша айырмасы әдісі, үлгілердегі ақпаратты тиімдірек пайдалана алады, ал инкременттік әдістер жоғары есептеу немесе жад күрделілігіне байланысты топтық әдістерді қолдану мүмкін болмаған жағдайда ғана қолданылады. Кейбір әдістер екі тәсілді біріктіруге тырысады. Уақытша айырмаға негізделген әдістер төртінші мәселені де шешеді. TD-ге тән тағы бір мәселе – олардың рекурсивті Беллман теңдеуіне тәуелділігі. Көптеген TD әдістері Беллман теңдеулеріне тәуелді емес Монте-Карло әдістері мен Беллман теңдеулеріне толыққанды сүйенетін негізгі TD әдістері арасында үздіксіз интерполяциялайтын параметрді қамтиды. Бұл мәселенің әсерін азайтуға көмектеседі.
Функцияны шамалау әдістері
Бесінші мәселені шешу үшін функцияларды жуықтау әдістері қолданылады. Сызықтық функцияларды жуықтау әрбір күй-әрекет жұбына шекті өлшемді векторды тағайындайтын бейнелеуден басталады. Содан кейін, күй-әрекет жұбының мәні кейбір салмақтармен компоненттерді сызықтық комбинациялау арқылы алынады: Алгоритмдер жеке күй-әрекет жұптарымен байланысты мәндерді түзетудің орнына салмақтарды түзетуге көшеді. Параметриялық емес статистикалық идеяларға негізделген әдістер (өздерінің ерекшеліктерін құрастыра алатындары байқалады) зерттелді. Құндылық итерациясын бастапқы нүкте ретінде де пайдалануға болады, бұл Q-оқу алгоритміне және оның көптеген түрлеріне әкеледі. Q-ны көрсету үшін нейрондық желі қолданылғанда, оның ішінде терең Q-оқу әдістері, стохастикалық іздеу мәселелерінде түрлі қолданыстарға ие. Іс-әрекет мәндерін пайдаланудағы қиындық – олар бәсекелес іс-әрекет мәндерінің жоғары дәлдіктегі бағалауларын қажет етуі мүмкін, оларды қайтарымдардың шулы болуы кезінде алу қиын болуы мүмкін, бірақ бұл мәселе уақытша айырмашылық әдістерімен белгілі бір деңгейде азайтылады. «Сәйкес» функцияларды жуықтау әдісін қолдану жалпылық пен тиімділіктен айырылуға әкеледі.
The algorithms then adjust the weights, instead of adjusting the values associated with the individual state action pairs. Methods based on ideas from nonparametric statistics (which can be seen to construct their own features) have been explored. Value iteration can also be used as a starting point, giving rise to the Q learning algorithm and its many variants. Including Deep Q learning methods when a neural network is used to represent Q, with various applications in stochastic search problems. The problem with using action values is that they may need highly precise estimates of the competing action values that can be hard to obtain when the returns are noisy, though this problem is mitigated to some extent by temporal difference methods. Using the so called compatible function approximation method compromises generality and efficiency.
Тікелей саясат іздеу
Балама әдіс – саясат кеңістігінде (немесе оның бір бөлігінде) тікелей іздеу, онда мәселе стохастикалық оптимизацияға айналады. Қолданылатын екі тәсіл бар: градиентке негізделген және градиентсіз әдістер. Градиентке негізделген әдістер (саясат градиенті әдістері) шекті өлшемді (параметрлік) кеңістіктен саясат кеңістігіне бейнелеуден басталады: параметрлік вектор берілген болса, оған сәйкес саясатты білдірсін. Өнімділік функциясын анықтау арқылы, белгілі бір шарттарда бұл функция параметрлік вектордың функциясы ретінде дифференциалданады. Егер градиент белгілі болса, градиенттік өрлеуді қолдануға болады. Бірақ градиенттің аналитикалық түрі болмағандықтан, тек қана шулы шамалау қол жетімді. Мұндай шамалауды әртүрлі жолдармен жасауға болады, мысалы, Уильямстың REINFORCE әдісі (модельдеуге негізделген оптимизация әдебиетінде ықтималдық қатынасы әдісі ретінде белгілі) сияқты алгоритмдерге алып келеді. Әдістердің үлкен тобы градиенттік ақпаратқа тәуелділіктен аулақ болады. Оларға симуляцияланған қайнату, кросс-энтропиялық іздеу немесе эволюциялық есептеу әдістері жатады. Көптеген градиентсіз әдістер (теориялық тұрғыдан және лимитте) жаһандық оптимумға жете алады. Саясатты іздеу әдістері шулы деректер болғанда баяу конвергенцияға ие болуы мүмкін. Мысалы, бұл эпизодтық мәселелерде траекториялар ұзақ болғанда және табыстардың дисперсиясы жоғары болғанда орын алады. Мұндай жағдайда уақытша айырмашылықтарға негізделген құндылық функцияларына негізделген әдістер көмектеседі. Соңғы жылдары актер-критик әдістері ұсынылып, түрлі мәселелерде жақсы нәтижелер көрсетті. Саясатты іздеу әдістері робототехника саласында қолданылған. Көптеген саясатты іздеу әдістері жергілікті оптимумдарда тұрып қалуы мүмкін (өйткені олар жергілікті іздеуге негізделген).
Модельге негізделген алгоритмдер
Ақырында, жоғарыда аталған әдістердің бәрін алдымен Марков шешім қабылдау процесінің моделін – қолданыстағы күйден жасалған әрекеттің нәтижесінде келесі күйдің қандай ықтималдықпен болатынын анықтайтын алгоритмдермен үйлестіруге болады. Мысалы, Dyna алгоритмі тәжірибеден модельді үйреніп, оны құндылық функциясын жақсарту үшін нақты ауысулармен қатар, модельденген ауысуларды да пайдаланады. Мұндай әдістер кейде параметрлік емес модельдерді қолдану арқылы кеңейтілуі мүмкін, мысалы, ауысулар жай ғана сақталып, оқу алгоритміне қайтадан беріледі. Модельге негізделген әдістер, модельге негізделмеген әдістерге қарағанда есептеулерді көп қажет етеді, ал олардың тиімділігі Марков шешім қабылдау процесін қаншалықты дәл үйренуге болатынына байланысты шектелуі мүмкін. Модельдерді құндылық функциясын жаңартудан өзге де жолдармен қолдануға болады. Мысалы, модельдік болжамды басқаруда модель мінез-құлықты тікелей өзгерту үшін қолданылады.
Қауымдастықты нығайту арқылы оқыту
Ассоциативтік нығайту оқу тапсырмалары стохастикалық оқу автоматтарының және қадағалаумен оқудың үлгілерді жіктеу тапсырмаларының ерекшеліктерін біріктіреді. Ассоциативтік нығайту оқу тапсырмаларында оқу жүйесі өзінің ортасымен жабық цикл бойынша өзара әрекеттеседі.
Терең нығайту арқылы оқыту
Бұл тәсіл терең нейрондық желіні қолдану арқылы күшейту оқытуды кеңейтеді және күй кеңістігін қатаң жобалау қажеттілігін жояды. Google DeepMind-тің ATARI ойындарын оқыту жұмысы терең күшейту оқытуына немесе тікелей күшейту оқытуына қызығушылықты арттырды.
Қарсылық терең нығайтуды үйрену
Қарсыластық терең нығайту арқылы оқыту – нығайту арқылы оқытудағы белсенді зерттеу саласы, ол үйренген саясаттардың осалдығына назар аударады. Осы зерттеу саласындағы кейбір жұмыстар бастапқыда нығайту арқылы оқыту саясаттарының көзге көрінбейтін қарсыластық манипуляцияларға ұшырайтынын көрсетті. Бұл осалдықтарды жоюға бағытталған әдістер ұсынылғанмен, соңғы зерттеулер көрсеткендей, бұл ұсынылған шешімдер терең нығайту арқылы оқыту саясаттарының қазіргі осалдықтарын толыққанды бейнелеуден қашық.
Қалыстырмалы үйрену
Қосалқы оқытуға бұлыңғыр логиканы енгізу арқылы, үздіксіз кеңістікте мемлекеттік-әрекеттік құндылық функциясын бұлыңғыр ережелермен жуықтау мүмкін болады. Бұлыңғыр ережелердің ЕГЕР-СОН (IF-THEN) форматы осы тәсілді нәтижелерді табиғи тілге жақын түрінде беруге ыңғайлы етеді. FRL-ді Бұлыңғыр Ереже Интерполяциясымен (Fuzzy Rule Interpolation) кеңейту, ең маңызды мемлекеттік-әрекеттік құндылықтарды (кардиналдық ережелерді) көрсету үшін қысқартылған, сирек бұлыңғыр ережелер жиынын пайдалануға мүмкіндік береді.
Кері күшейту арқылы оқыту
Кері күшейту арқылы оқытуда (IRL) ешқандай сыйақы функциясы берілмейді. Оның орнына, сарапшының байқалған мінез-құлқы негізінде сыйақы функциясы анықталады. Мақсаты – көбінесе оңтайлы немесе оңтайлыға жақын болатын байқалған мінез-құлықты еліктеу. Танымал IRL парадигмаларының бірі – максималды энтропиялық кері күшейту оқыту (MaxEnt IRL). MaxEnt IRL сыйақы функциясының сызықтық моделінің параметрлерін күтілетін белгілер санына сәйкес келетін шектеулерді ескере отырып, байқалатын траекториялардың ықтималдық таралуының энтропиясын максималдау арқылы бағалайды. Жақында MaxEnt IRL кездейсоқ пайдалылық кері күшейту оқыту (RU IRL) деп аталатын, көбірек жалпылама шеңбердің ерекше жағдайы екені көрсетілді. RU IRL кездейсоқ пайдалылық теориясы мен Марков шешімдер процестеріне негізделген. Бұрынғы IRL тәсілдері байқалатын агенттің көрінетін кездейсоқ мінез-құлқы кездейсоқ саясатты ұстануына байланысты деп есептесе, RU IRL байқалатын агенттің детерминистік саясатты ұстануына, бірақ байқалатын мінез-құлқындағы кездейсоқтықтың себебі байқаушының агенттің шешім қабылдауда қолданатын белгілеріне толық қол жеткізбеуімен байланысты деп қарастырады. Пайдалылық функциясы байқаушының агенттің пайдалылық функциясында нақты қандай белгілерді ескеретіні туралы білімінің жетіспеуін ескеру үшін кездейсоқ айнымалы ретінде модельделеді.
Қауіпсіз сабақ беру
Қауіпсіз күшейту оқыту (SRL) – оқыту және/немесе қолдану процестерінде жүйенің қалыпты жұмысын қамтамасыз ету және/немесе қауіпсіздік талаптарын сақтау маңызды мәселелерде күтілетін сыйақыны барынша арттыруға бағытталған саясатты оқыту процесі ретінде анықталады.