Введение

Концепция компьютерного программирования

Обучение с использованием временных различий (TD) относится к классу методов обучения с подкреплением, не требующих построения модели, которые обучаются путем последовательной оценки, опираясь на текущую оценку функции ценности. Эти методы используют выборки из среды, как и методы Монте-Карло, и выполняют обновления на основе текущих оценок, подобно методам динамического программирования. В то время как методы Монте-Карло корректируют свои оценки только после получения окончательного результата, TD-методы корректируют прогнозы, чтобы они соответствовали более поздним и точным прогнозам о будущем, еще до того, как окончательный результат станет известен. Это является формой последовательной оценки, что иллюстрируется следующим примером:

Предположим, вы хотите предсказать погоду на субботу и у вас есть модель, которая предсказывает погоду в субботу, основываясь на погоде в каждый день недели. В обычном случае вы бы дождались субботы и затем скорректировали все свои модели. Однако, например, в пятницу у вас уже должно быть достаточно хорошее представление о том, какой будет погода в субботу, и, следовательно, вы сможете изменить, скажем, модель прогноза погоды на субботу еще до ее наступления.

TD-Lambda

TD Lambda — алгоритм обучения с подкреплением, изобретенный Ричардом С. Саттоном на основе более ранних работ Артура Сэмюэля по обучению с использованием временных различий. Этот алгоритм получил известность благодаря Джеральду Тесауро, который применил его для создания TD Gammon — программы, научившейся играть в нарды на уровне опытных игроков. Параметр лямбда (λ) определяет скорость затухания следа: более высокие значения приводят к более длительным следам, то есть большая часть вознаграждения может быть отнесена к более отдаленным состояниям и действиям при большем значении λ, а λ=0 соответствует обучению, аналогичному алгоритмам Monte Carlo RL.

В нейробиологии

Алгоритм TD также привлек внимание в области нейробиологии. Исследователи обнаружили, что частота активации дофаминовых нейронов в вентральной тегментальной области (ВТА) и черной субстанции (SNc) по-видимому, соответствует функции ошибки в этом алгоритме. Изначально дофаминовые клетки увеличивали частоту активации, когда обезьяне давали сок, что указывало на расхождение между ожидаемой и фактической наградой. Со временем это увеличение активации распространилось на самый ранний надежный стимул, предвещающий награду. После полной выучки обезьяной, при предъявлении предсказанной награды увеличение частоты активации не наблюдалось. Впоследствии, когда ожидаемая награда не поступала, частота активации дофаминовых клеток снижалась ниже нормального уровня. Это тесно соответствует тому, как функция ошибки в TD используется в обучении с подкреплением. Связь между моделью и потенциальной неврологической функцией привела к исследованиям, пытающимся использовать TD для объяснения многих аспектов поведенческих исследований. Также она применялась для изучения таких состояний, как шизофрения, или последствий фармакологического воздействия на дофаминовую систему в процессе обучения.