Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Үлгісіз күшейту оқыту алгоритмі
Model free reinforcement learning algorithm
Q оқыту – белгілі бір күйдегі әрекеттің құнын анықтауға арналған үлгісіз күшейту оқыту алгоритмі. Ол ортаның моделін қажет етпейді (сондықтан "үлгісіз" деп аталады) және бейімделуді қажет етпей, стохастикалық өтулер мен сыйақылармен байланысты мәселелерді шеше алады. Кез келген шекті Марков шешім процесі үшін Q оқыту, ағымдағы күйден басталатын барлық кезекті қадамдар бойынша жалпы сыйақының күтілетін мәнін барынша арттыру тұрғысынан оңтайлы саясатты анықтайды. Q оқыту, шексіз зерттеу уақыты және жартылай кездейсоқ саясат болған жағдайда, кез келген шекті Марков шешім процесі үшін оңтайлы әрекет таңдау саясатын анықтай алады.
Q learning is a model free reinforcement learning algorithm to learn the value of an action in a particular state. It does not require a model of the environment (hence "model free"), and it can handle problems with stochastic transitions and rewards without requiring adaptations. For any finite Markov decision process, Q learning finds an optimal policy in the sense of maximizing the expected value of the total reward over any and all successive steps, starting from the current state. Q learning can identify an optimal action selection policy for any given finite Markov decision process, given infinite exploration time and a partly random policy.
Оқу деңгейі
Оқу жылдамдығы немесе қадам мөлшері жаңа алынған ақпараттың ескі ақпаратты қаншалықты жоғарлатынын анықтайды. 0 коэффициенті агенттің ештеңе үйренбеуіне (тек бұрынғы білімін пайдалануына) алып келеді, ал 1 коэффициенті агенттің тек соңғы ақпаратты қарастыруына (мүмкіндіктерді зерттеу үшін бұрынғы білімін назарға алмауына) алып келеді. Толыққанды детерминистік ортада оқу жылдамдығы оптималды болады. Егер мәселе стохастикалық болса, алгоритм кейбір техникалық шарттар бойынша оқу жылдамдығына қарай жинақталады, ол нөлге дейін төмендеуді талап етеді. Іс жүзінде көбінесе тұрақты оқу жылдамдығы қолданылады, мысалы, барлық мәндер үшін .
The learning rate or step size determines to what extent newly acquired information overrides old information. A factor of 0 makes the agent learn nothing (exclusively exploiting prior knowledge), while a factor of 1 makes the agent consider only the most recent information (ignoring prior knowledge to explore possibilities). In fully deterministic environments, a learning rate of is optimal. When the problem is stochastic, the algorithm converges under some technical conditions on the learning rate that require it to decrease to zero. In practice, often a constant learning rate is used, such as for all .
Дисконттық коэффициент
Гамма-дисконттау факторы болашақ сыйақылардың маңыздылығын анықтайды. 0-ке тең фактор агентті тек қазіргі сыйақыларды қарастыратын, яғни "алысқа көре алмайтын" (немесе көзқарасы қысқа) етеді (жоғарыда көрсетілген жаңарту ережесінде), ал 1-ге жақындағанда агент ұзақ мерзімді жоғары сыйақыға ұмтылады. Егер дисконттау факторы 1-ге тең немесе одан жоғары болса, әрекеттердің құндылықтары айырмашылыққа түсуі мүмкін. Түпкілікті күйі жоқ немесе агент ешқашан оған жете алмайтын жағдайда, барлық орта тарихы шексіз ұзаққа созылады, ал қосымша, дисконтталмаған сыйақылары бар пайдалылықтар әдетте шексіз болады. Тіпті 1-ден аздап төмен дисконттау факторымен Q-функцияны оқыту, құндылық функциясы жасанды нейрондық желі арқылы жуықталғанда қателердің таралуына және тұрақсыздыққа әкеледі. Мұндай жағдайда, дисконттау факторын төменгі мәннен бастап, оны соңғы құнына қарай арттыру оқу процесін жеделдетеді.
The discount factor \gamma determines the importance of future rewards. A factor of 0 will make the agent "myopic" (or short sighted) by only considering current rewards, i. e. (in the update rule above), while a factor approaching 1 will make it strive for a long term high reward. If the discount factor meets or exceeds 1, the action values may diverge. For , without a terminal state, or if the agent never reaches one, all environment histories become infinitely long, and utilities with additive, undiscounted rewards generally become infinite. Even with a discount factor only slightly lower than 1, Q function learning leads to propagation of errors and instabilities when the value function is approximated with an artificial neural network. In that case, starting with a lower discount factor and increasing it towards its final value accelerates learning.
Бастапқы шарттар (Q0)
Q-оқу итеративті алгоритм болғандықтан, ол бірінші жаңартудан бұрын бастапқы шарттарды автоматты түрде қарастырады. Жоғары бастапқы мәндер, сондай-ақ "оптимистік бастапқы жағдайлар" деп аталатындар, зерттеуге ынталандыруы мүмкін: қандай әрекет таңдалса да, жаңарту ережесі оның басқа баламаларға қарағанда төмен мәнге ие болуына себеп болады, осылайша оларды таңдау ықтималдығын арттырады. Алғашқы сыйақы бастапқы шарттарды қайта орнату үшін қолданылуы мүмкін. Осы идеяға сәйкес, әрекет бірінші рет жасалғанда сыйақы оның мәнін анықтайды. Бұл тұрақты, детерминистік сыйақылар болған жағдайда дереу оқуға мүмкіндік береді. Бастапқы шарттарды қайта орнатуды (RIC) қамтитын модель, кез келген кездейсоқ бастапқы шартты (AIC) қабылдайтын модельге қарағанда қатысушылардың мінез-құлқын жақсы болжайды деп күтілуде. Бұл алгоритмді кең проблемаларға қолдануға мүмкіндік береді, тіпті күй кеңістігі үздіксіз болған кезде де. Бір шешім – функцияларды жуықтау үшін (беделделген) жасанды нейрондық желілерді пайдалану. Тағы бір мүмкіндік – Fuzzy Rule Interpolation (FRI) интеграциясы және дискретті Q кестелері немесе ЖСЖ орнына сирек fuzzy ережелер базасын пайдалану, бұл адам оқи алатын білімді ұсыну форматының артықшылығын береді. Функцияларды жуықтау шекті проблемаларда оқуды жылдамдатуы мүмкін, себебі алгоритм бұрынғы тәжірибелерді бұрын кездеспеген күйлерге жалпылай алады.
Since Q learning is an iterative algorithm, it implicitly assumes an initial condition before the first update occurs. High initial values, also known as "optimistic initial conditions", can encourage exploration: no matter what action is selected, the update rule will cause it to have lower values than the other alternative, thus increasing their choice probability. The first reward can be used to reset the initial conditions. According to this idea, the first time an action is taken the reward is used to set the value of This allows immediate learning in case of fixed deterministic rewards. A model that incorporates reset of initial conditions (RIC) is expected to predict participants' behavior better than a model that assumes any arbitrary initial condition (AIC). This makes it possible to apply the algorithm to larger problems, even when the state space is continuous. One solution is to use an (adapted) artificial neural network as a function approximator. Another possibility is to integrate Fuzzy Rule Interpolation (FRI) and use sparse fuzzy rule bases instead of discrete Q tables or ANNs, which has the advantage of being a human readable knowledge representation form. Function approximation may speed up learning in finite problems, due to the fact that the algorithm can generalize earlier experiences to previously unseen states.
Кванттық есептеу
Мемлекет/әрекет кеңістігін азайтудың тағы бір тәсілі – мүмкін мәндерді кванттау. Мысалы, бір таяқты саусаққа тіктеп, теңестіруді үйренуді қарастырайық. Белгілі бір уақыт мезетіндегі жағдайды сипаттау үшін саусақтың кеңістіктегі орны, оның жылдамдығы, таяқтың бұрышы және таяқтың бұрыштық жылдамдығы қажет. Бұл бір жағдайды сипаттайтын төрт элементтен тұратын векторды құрайды, яғни бір жағдайдың төрт мәнге кодталған сәтін көрсетеді. Мәселе мынада – мүмкін жағдайлардың саны шексіз. Жарамды әрекеттердің мүмкін кеңістігін тарылту үшін бірнеше мәнді бір топқа біріктіруге болады. Саусақтың бастапқы орнынан нақты қашықтығы (шексізден шексізге дейін) белгісіз, бірақ ол жақын ма, әлде алыс па деген мәселе маңызды (Жақын, Алыс).
Another technique to decrease the state/action space quantizes possible values. Consider the example of learning to balance a stick on a finger. To describe a state at a certain point in time involves the position of the finger in space, its velocity, the angle of the stick and the angular velocity of the stick. This yields a four element vector that describes one state, i. e. a snapshot of one state encoded into four values. The problem is that infinitely many possible states are present. To shrink the possible space of valid actions multiple values can be assigned to a bucket. The exact distance of the finger from its starting position ( Infinity to Infinity) is not known, but rather whether it is far away or not (Near, Far).
Терең Q-оқу
DeepMind жүйесі терең конволюциялық нейрондық желіні пайдаланды, рецептивті өрістердің әсерін имитациялайтын плиткаланған конволюциялық сүзгілердің қабаттарымен. Q-ны бейнелеу үшін нейрондық желі сияқты сызықтық емес функциялық жуықтаушы қолданылғанда, күшейту арқылы оқыту тұрақсыз немесе айырылып кетеді. Бұл тұрақсыздық байқаулар тізбегіндегі корреляциялардан, Q-ға жасалған шағын өзгерістер агенттің саясатын және дерек үлестірілімін айтарлықтай өзгерте алатындығынан, сондай-ақ Q мен мақсаттық мәндер арасындағы корреляциялардан туындайды. Бұл әдіс әртүрлі салалар мен қолданбаларда стохастикалық іздеу үшін қолданылуы мүмкін. Техника тәжірибе қайталауды қолданды, бұл биологиялық шабыттанған механизм, ол соңғы әрекеттің орнына бұрынғы әрекеттердің кездейсоқ үлгісін пайдаланады.
The DeepMind system used a deep convolutional neural network, with layers of tiled convolutional filters to mimic the effects of receptive fields. Reinforcement learning is unstable or divergent when a nonlinear function approximator such as a neural network is used to represent Q. This instability comes from the correlations present in the sequence of observations, the fact that small updates to Q may significantly change the policy of the agent and the data distribution, and the correlations between Q and the target values. The method can be used for stochastic search in various domains and applications. The technique used experience replay, a biologically inspired mechanism that uses a random sample of prior actions instead of the most recent action to proceed.
Басқалар
Кейінгі Q оқыту – онлайн Q оқыту алгоритмінің баламалы түрі, шамамен дұрыс (PAC) оқытумен. Greedy GQ – (сызықтық) функциялық жуықтауды қолданумен бірге пайдалануға арналған Q оқытудың нұсқасы. Greedy GQ-ның артықшылығы – әрекеттердің мәнін бағалау үшін функциялық жуықтау қолданылған жағдайда да, сәйкестік кепілдігі бар. Таралымдық Q оқыту – әрбір әрекеттің күтілетін нәтижесін емес, нәтижелердің таралымын модельдеуге тырысатын Q оқытудың нұсқасы. Ол терең нейрондық желілермен бағалауды жеңілдетеді және тәуекелге сезімтал басқару сияқты баламалы басқару әдістерін қолдануға мүмкіндік береді.
Delayed Q learning is an alternative implementation of the online Q learning algorithm, with probably approximately correct (PAC) learning. Greedy GQ is a variant of Q learning to use in combination with (linear) function approximation. The advantage of Greedy GQ is that convergence is guaranteed even when function approximation is used to estimate the action values. Distributional Q learning is a variant of Q learning which seeks to model the distribution of returns rather than the expected return of each action. It has been observed to facilitate estimate by deep neural networks and can enable alternative control methods, such as risk sensitive control.
Көп агенттік оқыту
Q оқыту көп агенттік ортада ұсынылған (4.1.2-бөлімді қараңыз). Бір жол – ортаны бейтарап деп есептеу. Литтман minimax Q оқыту алгоритмін ұсынады.
Q learning has been proposed in the multi agent setting (see Section 4.1.2 in ). One approach consists in pretending the environment is passive. Littman proposes the minimax Q learning algorithm.
Шектеулер
Стандартты Q оқу алгоритмі (кесте қолданып) дискретті әрекеттер және күй кеңістіктері үшін ғана қолданылады. Осы мәндерді дискреттеу, көбінесе өлшемділік афетіне байланысты, тиімсіз оқытуға алып келеді. Дегенмен, бұл мәселені шешуге бағытталған Q оқудың түрлендірілімдері бар, мысалы, сымдық нейрондық желілік Q оқу.
The standard Q learning algorithm (using a table) applies only to discrete action and state spaces. Discretization of these values leads to inefficient learning, largely due to the curse of dimensionality. However, there are adaptations of Q learning that attempt to solve this problem such as Wire fitted Neural Network Q Learning.