Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Компьютерлік бағдарламалау ұғымы
Computer programming concept
Уақытша айырмашылықты (TD) оқыту – бұл модельдік тәуелсіз нығайту оқыту әдістерінің класы, олар құндылық функциясының ағымдағы шамасынан бастау арқылы үйренеді. Бұл әдістер Монте-Карло әдістері сияқты ортадан үлгі алады және динамикалық бағдарламалау әдістері сияқты ағымдағы шамаларға негізделген жаңартуларды жүргізеді. Монте-Карло әдістері соңғы нәтиже белгілі болғаннан кейін ғана өз шамаларын түзетсе, TD әдістері соңғы нәтиже белгілі болғанға дейін болашаққа қатысты кейінірек, дәлірек болжамдарға сәйкес болжамдарын түзетіп отырады. Бұл ботстраптың бір түрі, мысалы:
Temporal difference (TD) learning refers to a class of model free reinforcement learning methods which learn by bootstrapping from the current estimate of the value function. These methods sample from the environment, like Monte Carlo methods, and perform updates based on current estimates, like dynamic programming methods. While Monte Carlo methods only adjust their estimates once the final outcome is known, TD methods adjust predictions to match later, more accurate, predictions about the future before the final outcome is known. This is a form of bootstrapping, as illustrated with the following example:
<blockquote>Сіз сенбі күнінің ауа райын болжағыңыз келді дейік, және сізде аптаның әр күнінің ауа райын ескере отырып, сенбі күнінің ауа райын болжайтын модель бар. Әдеттегі жағдайда сіз сенбі күніне дейін күтіп, барлық модельдеріңізді түзетуіңіз керек. Бірақ, мысалы, жұма күні болса, сенбіде ауа райы қандай болатынын білуіңіз мүмкін – сондықтан сенбі күні жетпей тұрып, сенбі күніне арналған модельді өзгерте аласыз.</blockquote>
<blockquote>Suppose you wish to predict the weather for Saturday, and you have some model that predicts Saturday's weather, given the weather of each day in the week. In the standard case, you would wait until Saturday and then adjust all your models. However, when it is, for example, Friday, you should have a pretty good idea of what the weather would be on Saturday – and thus be able to change, say, Saturday's model before Saturday arrives.
TD-Lambda
TD Lambda – Ричард С. Саттонның Артур Сэмюэлдің уақытша айырмашылықтарды оқыту жөніндегі бұрынғы жұмысына негізделген оқу алгоритмі. Бұл алгоритмді Джеральд Тезауро TD Gammon бағдарламасын жасау үшін қолданды, ол бақжаз ойынын сарапшы ойыншылар деңгейінде ойнауды үйренді. Ламбда параметрі – іздің жойылу параметрін көрсетеді, жоғары мәндер ұзаққа созылатын іздерге алып келеді; яғни, сыйақыдан алынған үлкен үлес, мәні жоғары болғанда, алыс жағдайлар мен әрекеттерге берілуі мүмкін, ал 1 мәні Монте-Карло RL алгоритмдерімен салыстырылатын оқытуды қамтамасыз етеді.
TD Lambda is a learning algorithm invented by Richard S. Sutton based on earlier work on temporal difference learning by Arthur Samuel. This algorithm was famously applied by Gerald Tesauro to create TD Gammon, a program that learned to play the game of backgammon at the level of expert human players. The lambda parameter refers to the trace decay parameter, with Higher settings lead to longer lasting traces; that is, a larger proportion of credit from a reward can be given to more distant states and actions when is higher, with producing parallel learning to Monte Carlo RL algorithms.
Нейробиологиялық ғылымда
TD алгоритмі нейробиологиялық ғылым саласында да назар аударды. Зерттеушілер дофамин нейрондарының күйбең тегментальді аймақта (VTA) және қара затта (SNc) ату жылдамдығы алгоритмдегі қате функциясын еліктейтінін анықтады. Бастапқыда маймыл сусын алғанда дофамин жасушаларының ату белсенділігі артты, бұл күтілген және нақты сыйақы арасындағы айырмашылықты көрсетті. Уақыт өте келе, бұл ату белсенділігінің күшеюі сыйақы алуға ең сенімді алғашқы стимулға дейін тарады. Маймыл толыққандай оқытылғаннан кейін, күтілген сыйақы ұсынылғанда ату жылдамдығының артуы байқалмады. Содан кейін, күтілген сыйақы келмегенде, дофамин жасушаларының ату белсенділігі қалыпты деңгейден төмендеді. Бұл TD-дегі қате функциясының күшейту арқылы оқыту үшін қолданылуын жақсы бейнелейді. Модель мен потенциалды неврологиялық функция арасындағы байланыс, мінез-құлықты зерттеулердің көптеген аспектілерін түсіндіру үшін TD қолдануға бағытталған зерттеулерге әкелді. Сондай-ақ, шизофрения сияқты ауруларды немесе дофаминнің фармакологиялық әсерлерінің оқытуға тигізетін салдары зерттеу үшін де пайдаланылды.
The TD algorithm has also received attention in the field of neuroscience. Researchers discovered that the firing rate of dopamine neurons in the ventral tegmental area (VTA) and substantia nigra (SNc) appear to mimic the error function in the algorithm. Initially the dopamine cells increased firing rates when the monkey received juice, indicating a difference in expected and actual rewards. Over time this increase in firing back propagated to the earliest reliable stimulus for the reward. Once the monkey was fully trained, there was no increase in firing rate upon presentation of the predicted reward. Subsequently, the firing rate for the dopamine cells decreased below normal activation when the expected reward was not produced. This mimics closely how the error function in TD is used for reinforcement learning. The relationship between the model and potential neurological function has produced research attempting to use TD to explain many aspects of behavioral research. It has also been used to study conditions such as schizophrenia or the consequences of pharmacological manipulations of dopamine on learning.