Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Концепция компьютерного программирования
Computer programming concept
Обучение с использованием временных различий (TD) относится к классу методов обучения с подкреплением, не требующих построения модели, которые обучаются путем последовательной оценки, опираясь на текущую оценку функции ценности. Эти методы используют выборки из среды, как и методы Монте-Карло, и выполняют обновления на основе текущих оценок, подобно методам динамического программирования. В то время как методы Монте-Карло корректируют свои оценки только после получения окончательного результата, TD-методы корректируют прогнозы, чтобы они соответствовали более поздним и точным прогнозам о будущем, еще до того, как окончательный результат станет известен. Это является формой последовательной оценки, что иллюстрируется следующим примером:
Temporal difference (TD) learning refers to a class of model free reinforcement learning methods which learn by bootstrapping from the current estimate of the value function. These methods sample from the environment, like Monte Carlo methods, and perform updates based on current estimates, like dynamic programming methods. While Monte Carlo methods only adjust their estimates once the final outcome is known, TD methods adjust predictions to match later, more accurate, predictions about the future before the final outcome is known. This is a form of bootstrapping, as illustrated with the following example:
Предположим, вы хотите предсказать погоду на субботу и у вас есть модель, которая предсказывает погоду в субботу, основываясь на погоде в каждый день недели. В обычном случае вы бы дождались субботы и затем скорректировали все свои модели. Однако, например, в пятницу у вас уже должно быть достаточно хорошее представление о том, какой будет погода в субботу, и, следовательно, вы сможете изменить, скажем, модель прогноза погоды на субботу еще до ее наступления.
<blockquote>Suppose you wish to predict the weather for Saturday, and you have some model that predicts Saturday's weather, given the weather of each day in the week. In the standard case, you would wait until Saturday and then adjust all your models. However, when it is, for example, Friday, you should have a pretty good idea of what the weather would be on Saturday – and thus be able to change, say, Saturday's model before Saturday arrives.
TD-Lambda
TD Lambda — алгоритм обучения с подкреплением, изобретенный Ричардом С. Саттоном на основе более ранних работ Артура Сэмюэля по обучению с использованием временных различий. Этот алгоритм получил известность благодаря Джеральду Тесауро, который применил его для создания TD Gammon — программы, научившейся играть в нарды на уровне опытных игроков. Параметр лямбда (λ) определяет скорость затухания следа: более высокие значения приводят к более длительным следам, то есть большая часть вознаграждения может быть отнесена к более отдаленным состояниям и действиям при большем значении λ, а λ=0 соответствует обучению, аналогичному алгоритмам Monte Carlo RL.
TD Lambda is a learning algorithm invented by Richard S. Sutton based on earlier work on temporal difference learning by Arthur Samuel. This algorithm was famously applied by Gerald Tesauro to create TD Gammon, a program that learned to play the game of backgammon at the level of expert human players. The lambda parameter refers to the trace decay parameter, with Higher settings lead to longer lasting traces; that is, a larger proportion of credit from a reward can be given to more distant states and actions when is higher, with producing parallel learning to Monte Carlo RL algorithms.
В нейробиологии
Алгоритм TD также привлек внимание в области нейробиологии. Исследователи обнаружили, что частота активации дофаминовых нейронов в вентральной тегментальной области (ВТА) и черной субстанции (SNc) по-видимому, соответствует функции ошибки в этом алгоритме. Изначально дофаминовые клетки увеличивали частоту активации, когда обезьяне давали сок, что указывало на расхождение между ожидаемой и фактической наградой. Со временем это увеличение активации распространилось на самый ранний надежный стимул, предвещающий награду. После полной выучки обезьяной, при предъявлении предсказанной награды увеличение частоты активации не наблюдалось. Впоследствии, когда ожидаемая награда не поступала, частота активации дофаминовых клеток снижалась ниже нормального уровня. Это тесно соответствует тому, как функция ошибки в TD используется в обучении с подкреплением. Связь между моделью и потенциальной неврологической функцией привела к исследованиям, пытающимся использовать TD для объяснения многих аспектов поведенческих исследований. Также она применялась для изучения таких состояний, как шизофрения, или последствий фармакологического воздействия на дофаминовую систему в процессе обучения.
The TD algorithm has also received attention in the field of neuroscience. Researchers discovered that the firing rate of dopamine neurons in the ventral tegmental area (VTA) and substantia nigra (SNc) appear to mimic the error function in the algorithm. Initially the dopamine cells increased firing rates when the monkey received juice, indicating a difference in expected and actual rewards. Over time this increase in firing back propagated to the earliest reliable stimulus for the reward. Once the monkey was fully trained, there was no increase in firing rate upon presentation of the predicted reward. Subsequently, the firing rate for the dopamine cells decreased below normal activation when the expected reward was not produced. This mimics closely how the error function in TD is used for reinforcement learning. The relationship between the model and potential neurological function has produced research attempting to use TD to explain many aspects of behavioral research. It has also been used to study conditions such as schizophrenia or the consequences of pharmacological manipulations of dopamine on learning.