Кіріспе

Компьютерлік бағдарламалау ұғымы

Уақытша айырмашылықты (TD) оқыту – бұл модельдік тәуелсіз нығайту оқыту әдістерінің класы, олар құндылық функциясының ағымдағы шамасынан бастау арқылы үйренеді. Бұл әдістер Монте-Карло әдістері сияқты ортадан үлгі алады және динамикалық бағдарламалау әдістері сияқты ағымдағы шамаларға негізделген жаңартуларды жүргізеді. Монте-Карло әдістері соңғы нәтиже белгілі болғаннан кейін ғана өз шамаларын түзетсе, TD әдістері соңғы нәтиже белгілі болғанға дейін болашаққа қатысты кейінірек, дәлірек болжамдарға сәйкес болжамдарын түзетіп отырады. Бұл ботстраптың бір түрі, мысалы:

<blockquote>Сіз сенбі күнінің ауа райын болжағыңыз келді дейік, және сізде аптаның әр күнінің ауа райын ескере отырып, сенбі күнінің ауа райын болжайтын модель бар. Әдеттегі жағдайда сіз сенбі күніне дейін күтіп, барлық модельдеріңізді түзетуіңіз керек. Бірақ, мысалы, жұма күні болса, сенбіде ауа райы қандай болатынын білуіңіз мүмкін – сондықтан сенбі күні жетпей тұрып, сенбі күніне арналған модельді өзгерте аласыз.</blockquote>

TD-Lambda

TD Lambda – Ричард С. Саттонның Артур Сэмюэлдің уақытша айырмашылықтарды оқыту жөніндегі бұрынғы жұмысына негізделген оқу алгоритмі. Бұл алгоритмді Джеральд Тезауро TD Gammon бағдарламасын жасау үшін қолданды, ол бақжаз ойынын сарапшы ойыншылар деңгейінде ойнауды үйренді. Ламбда параметрі – іздің жойылу параметрін көрсетеді, жоғары мәндер ұзаққа созылатын іздерге алып келеді; яғни, сыйақыдан алынған үлкен үлес, мәні жоғары болғанда, алыс жағдайлар мен әрекеттерге берілуі мүмкін, ал 1 мәні Монте-Карло RL алгоритмдерімен салыстырылатын оқытуды қамтамасыз етеді.

Нейробиологиялық ғылымда

TD алгоритмі нейробиологиялық ғылым саласында да назар аударды. Зерттеушілер дофамин нейрондарының күйбең тегментальді аймақта (VTA) және қара затта (SNc) ату жылдамдығы алгоритмдегі қате функциясын еліктейтінін анықтады. Бастапқыда маймыл сусын алғанда дофамин жасушаларының ату белсенділігі артты, бұл күтілген және нақты сыйақы арасындағы айырмашылықты көрсетті. Уақыт өте келе, бұл ату белсенділігінің күшеюі сыйақы алуға ең сенімді алғашқы стимулға дейін тарады. Маймыл толыққандай оқытылғаннан кейін, күтілген сыйақы ұсынылғанда ату жылдамдығының артуы байқалмады. Содан кейін, күтілген сыйақы келмегенде, дофамин жасушаларының ату белсенділігі қалыпты деңгейден төмендеді. Бұл TD-дегі қате функциясының күшейту арқылы оқыту үшін қолданылуын жақсы бейнелейді. Модель мен потенциалды неврологиялық функция арасындағы байланыс, мінез-құлықты зерттеулердің көптеген аспектілерін түсіндіру үшін TD қолдануға бағытталған зерттеулерге әкелді. Сондай-ақ, шизофрения сияқты ауруларды немесе дофаминнің фармакологиялық әсерлерінің оқытуға тигізетін салдары зерттеу үшін де пайдаланылды.