Кіріспе

Үлгісіз күшейту оқыту алгоритмі

Q оқыту – белгілі бір күйдегі әрекеттің құнын анықтауға арналған үлгісіз күшейту оқыту алгоритмі. Ол ортаның моделін қажет етпейді (сондықтан "үлгісіз" деп аталады) және бейімделуді қажет етпей, стохастикалық өтулер мен сыйақылармен байланысты мәселелерді шеше алады. Кез келген шекті Марков шешім процесі үшін Q оқыту, ағымдағы күйден басталатын барлық кезекті қадамдар бойынша жалпы сыйақының күтілетін мәнін барынша арттыру тұрғысынан оңтайлы саясатты анықтайды. Q оқыту, шексіз зерттеу уақыты және жартылай кездейсоқ саясат болған жағдайда, кез келген шекті Марков шешім процесі үшін оңтайлы әрекет таңдау саясатын анықтай алады.

Оқу деңгейі

Оқу жылдамдығы немесе қадам мөлшері жаңа алынған ақпараттың ескі ақпаратты қаншалықты жоғарлатынын анықтайды. 0 коэффициенті агенттің ештеңе үйренбеуіне (тек бұрынғы білімін пайдалануына) алып келеді, ал 1 коэффициенті агенттің тек соңғы ақпаратты қарастыруына (мүмкіндіктерді зерттеу үшін бұрынғы білімін назарға алмауына) алып келеді. Толыққанды детерминистік ортада оқу жылдамдығы оптималды болады. Егер мәселе стохастикалық болса, алгоритм кейбір техникалық шарттар бойынша оқу жылдамдығына қарай жинақталады, ол нөлге дейін төмендеуді талап етеді. Іс жүзінде көбінесе тұрақты оқу жылдамдығы қолданылады, мысалы, барлық мәндер үшін .

Дисконттық коэффициент

Гамма-дисконттау факторы болашақ сыйақылардың маңыздылығын анықтайды. 0-ке тең фактор агентті тек қазіргі сыйақыларды қарастыратын, яғни "алысқа көре алмайтын" (немесе көзқарасы қысқа) етеді (жоғарыда көрсетілген жаңарту ережесінде), ал 1-ге жақындағанда агент ұзақ мерзімді жоғары сыйақыға ұмтылады. Егер дисконттау факторы 1-ге тең немесе одан жоғары болса, әрекеттердің құндылықтары айырмашылыққа түсуі мүмкін. Түпкілікті күйі жоқ немесе агент ешқашан оған жете алмайтын жағдайда, барлық орта тарихы шексіз ұзаққа созылады, ал қосымша, дисконтталмаған сыйақылары бар пайдалылықтар әдетте шексіз болады. Тіпті 1-ден аздап төмен дисконттау факторымен Q-функцияны оқыту, құндылық функциясы жасанды нейрондық желі арқылы жуықталғанда қателердің таралуына және тұрақсыздыққа әкеледі. Мұндай жағдайда, дисконттау факторын төменгі мәннен бастап, оны соңғы құнына қарай арттыру оқу процесін жеделдетеді.

Бастапқы шарттар (Q0)

Q-оқу итеративті алгоритм болғандықтан, ол бірінші жаңартудан бұрын бастапқы шарттарды автоматты түрде қарастырады. Жоғары бастапқы мәндер, сондай-ақ "оптимистік бастапқы жағдайлар" деп аталатындар, зерттеуге ынталандыруы мүмкін: қандай әрекет таңдалса да, жаңарту ережесі оның басқа баламаларға қарағанда төмен мәнге ие болуына себеп болады, осылайша оларды таңдау ықтималдығын арттырады. Алғашқы сыйақы бастапқы шарттарды қайта орнату үшін қолданылуы мүмкін. Осы идеяға сәйкес, әрекет бірінші рет жасалғанда сыйақы оның мәнін анықтайды. Бұл тұрақты, детерминистік сыйақылар болған жағдайда дереу оқуға мүмкіндік береді. Бастапқы шарттарды қайта орнатуды (RIC) қамтитын модель, кез келген кездейсоқ бастапқы шартты (AIC) қабылдайтын модельге қарағанда қатысушылардың мінез-құлқын жақсы болжайды деп күтілуде. Бұл алгоритмді кең проблемаларға қолдануға мүмкіндік береді, тіпті күй кеңістігі үздіксіз болған кезде де. Бір шешім – функцияларды жуықтау үшін (беделделген) жасанды нейрондық желілерді пайдалану. Тағы бір мүмкіндік – Fuzzy Rule Interpolation (FRI) интеграциясы және дискретті Q кестелері немесе ЖСЖ орнына сирек fuzzy ережелер базасын пайдалану, бұл адам оқи алатын білімді ұсыну форматының артықшылығын береді. Функцияларды жуықтау шекті проблемаларда оқуды жылдамдатуы мүмкін, себебі алгоритм бұрынғы тәжірибелерді бұрын кездеспеген күйлерге жалпылай алады.

Кванттық есептеу

Мемлекет/әрекет кеңістігін азайтудың тағы бір тәсілі – мүмкін мәндерді кванттау. Мысалы, бір таяқты саусаққа тіктеп, теңестіруді үйренуді қарастырайық. Белгілі бір уақыт мезетіндегі жағдайды сипаттау үшін саусақтың кеңістіктегі орны, оның жылдамдығы, таяқтың бұрышы және таяқтың бұрыштық жылдамдығы қажет. Бұл бір жағдайды сипаттайтын төрт элементтен тұратын векторды құрайды, яғни бір жағдайдың төрт мәнге кодталған сәтін көрсетеді. Мәселе мынада – мүмкін жағдайлардың саны шексіз. Жарамды әрекеттердің мүмкін кеңістігін тарылту үшін бірнеше мәнді бір топқа біріктіруге болады. Саусақтың бастапқы орнынан нақты қашықтығы (шексізден шексізге дейін) белгісіз, бірақ ол жақын ма, әлде алыс па деген мәселе маңызды (Жақын, Алыс).

Терең Q-оқу

DeepMind жүйесі терең конволюциялық нейрондық желіні пайдаланды, рецептивті өрістердің әсерін имитациялайтын плиткаланған конволюциялық сүзгілердің қабаттарымен. Q-ны бейнелеу үшін нейрондық желі сияқты сызықтық емес функциялық жуықтаушы қолданылғанда, күшейту арқылы оқыту тұрақсыз немесе айырылып кетеді. Бұл тұрақсыздық байқаулар тізбегіндегі корреляциялардан, Q-ға жасалған шағын өзгерістер агенттің саясатын және дерек үлестірілімін айтарлықтай өзгерте алатындығынан, сондай-ақ Q мен мақсаттық мәндер арасындағы корреляциялардан туындайды. Бұл әдіс әртүрлі салалар мен қолданбаларда стохастикалық іздеу үшін қолданылуы мүмкін. Техника тәжірибе қайталауды қолданды, бұл биологиялық шабыттанған механизм, ол соңғы әрекеттің орнына бұрынғы әрекеттердің кездейсоқ үлгісін пайдаланады.

Басқалар

Кейінгі Q оқыту – онлайн Q оқыту алгоритмінің баламалы түрі, шамамен дұрыс (PAC) оқытумен. Greedy GQ – (сызықтық) функциялық жуықтауды қолданумен бірге пайдалануға арналған Q оқытудың нұсқасы. Greedy GQ-ның артықшылығы – әрекеттердің мәнін бағалау үшін функциялық жуықтау қолданылған жағдайда да, сәйкестік кепілдігі бар. Таралымдық Q оқыту – әрбір әрекеттің күтілетін нәтижесін емес, нәтижелердің таралымын модельдеуге тырысатын Q оқытудың нұсқасы. Ол терең нейрондық желілермен бағалауды жеңілдетеді және тәуекелге сезімтал басқару сияқты баламалы басқару әдістерін қолдануға мүмкіндік береді.

Көп агенттік оқыту

Q оқыту көп агенттік ортада ұсынылған (4.1.2-бөлімді қараңыз). Бір жол – ортаны бейтарап деп есептеу. Литтман minimax Q оқыту алгоритмін ұсынады.

Шектеулер

Стандартты Q оқу алгоритмі (кесте қолданып) дискретті әрекеттер және күй кеңістіктері үшін ғана қолданылады. Осы мәндерді дискреттеу, көбінесе өлшемділік афетіне байланысты, тиімсіз оқытуға алып келеді. Дегенмен, бұл мәселені шешуге бағытталған Q оқудың түрлендірілімдері бар, мысалы, сымдық нейрондық желілік Q оқу.