Кіріспе
Марковтық шешім қабылдау процесінің жалпылауы
Ішінара байқалатын Марковтық шешім қабылдау процесі (POMDP) – Марковтық шешім қабылдау процесінің (MDP) жалпылауы болып табылады. POMDP агенттің шешім қабылдау процесін модельдейді, онда жүйе динамикасы MDP арқылы анықталады деп есептеледі, бірақ агент нақты жағдайды тікелей байқай алмайды. Оның орнына, ол сенсорлық модельді (нақты жағдай берілгенде әртүрлі байқаулардың ықтималдық таралуын) және негізгі MDP-ны сақтауы тиіс. MDP-дағы жағдайды әрекеттерге бейімдейтін саясат функциясынан өзгеше, POMDP саясаты – бақылаулар тарихынан (немесе сенімді жағдайлардан) әрекеттерге бейімдеу болып табылады. POMDP аясы нақты әлемдегі әртүрлі реттік шешім қабылдау процестерін модельдеуге жеткілікті. Оған роботтарды бағыттау мәселелері, машиналарды күтіп ұстау және жалпы белгісіздік аясында жоспарлау сияқты қолданыстар жатады. Марковтық шешім қабылдау процестерінің жалпы аясын 1965 жылы Карл Йохан Астрем дискретті жағдай кеңістігінде сипаттады, және ол операциялық зерттеулер қауымдастығында одан әрі зерттелді, сол жерде POMDP аббревиатурасы пайда болды. Кейін Лесли П. Каелблинг және Майкл Л. Литтман оны жасанды интеллект және автоматтандырылған жоспарлау мәселелеріне бейімдеді. POMDP-тің нақты шешімі әлемдегі әрбір мүмкін сенім үшін оңтайлы әрекетті береді. Оңтайлы әрекет күтілетін сыйақыны максималдайды (немесе шығынды азайтады) агенттің ықтимал шексіз горизонтта. Оңтайлы әрекеттер тізбегі агенттің ортамен өзара әрекеттесуінің оңтайлы саясаты деп аталады.
A partially observable Markov decision process (POMDP) is a generalization of a Markov decision process (MDP). A POMDP models an agent decision process in which it is assumed that the system dynamics are determined by an MDP, but the agent cannot directly observe the underlying state. Instead, it must maintain a sensor model (the probability distribution of different observations given the underlying state) and the underlying MDP. Unlike the policy function in MDP which maps the underlying states to the actions, POMDP's policy is a mapping from the history of observations (or belief states) to the actions. The POMDP framework is general enough to model a variety of real world sequential decision processes. Applications include robot navigation problems, machine maintenance, and planning under uncertainty in general. The general framework of Markov decision processes with imperfect information was described by Karl Johan Åström in 1965 in the case of a discrete state space, and it was further studied in the operations research community where the acronym POMDP was coined. It was later adapted for problems in artificial intelligence and automated planning by Leslie P. Kaelbling and Michael L. Littman. An exact solution to a POMDP yields the optimal action for each possible belief over the world states. The optimal action maximizes the expected reward (or minimizes the cost) of the agent over a possibly infinite horizon. The sequence of optimal actions is known as the optimal policy of the agent for interacting with its environment.
Талқылау
Агент қоршаған ортаның жай-күйін тікелей байқамағандықтан, нақты орта жай-күйінің белгісіздігімен шешім қабылдауға мәжбүр. Дегенмен, ортамен өзара әрекеттесу және бақылаулар алу арқылы агент ағымдағы жай-күйдің ықтималдық таралымын жаңарту арқылы нақты жай-күйге сенімділігін жаңарта алады. Бұл қасиеттің салдары ретінде, ең тиімді мінез-құлыққа көбінесе (ақпарат жинау) әрекеттері кіруі мүмкін, себебі олар агенттің ағымдағы жағдайды бағалауын жақсартады, соның арқасында болашақта дұрыс шешімдер қабылдауға мүмкіндік туады. Жоғарыдағы анықтаманы Марков шешім қабылдау процесінің анықтамасымен салыстыру пайдалы. Марков процесі бақылау жиынтығын қамтымайды, өйткені агент ортаның ағымдағы жай-күйін әрқашан нақты біледі. Балама ретінде, Марков процесін POMDP ретінде қайта құруға болады, бақылау жиынтығын жай-күйлер жиынтығымен теңдестіріп, және нақты жай-күйге сәйкес бақылауды детерминистік түрде таңдау үшін бақылаудың шартты ықтималдықтарын анықтау арқылы.
Сананы жаңарту
Іс-әрекет жасап, байқағаннан кейін агент қоршаған ортаның қандай күйде болуы мүмкін екендігіне (немесе болмауы мүмкін екендігіне) сенуін жаңартуы керек. Күйдегі Марков қасиетіне ие болғандықтан (шарт бойынша), күйлерге қатысты сенімді сақтау үшін тек алдыңғы сенім күйі, жасалған іс-әрекет және қазіргі байқау туралы білу жеткілікті. Бұл операция төмендегідей белгіленеді. Сенімді жаңартуды есептеу әдісі осы төменде сипатталған. Алынғаннан кейін агент ықтималдықпен бақылайды , мұнда – күй кеңістігіндегі ықтималдық тарату, ол қоршаған ортаның күйінде болу ықтималдығын көрсетеді. берілген жағдайда, іс-әрекетін жасап, байқағаннан кейін, мұндағы – нормалау тұрақтысы, және .
where is a normalizing constant with .
Сенімнің МДҚ
Марковтық сенім күйі ПОМДБ-ны әрбір сенім күйінің күй болып табылатын Марковтық шешім процесі ретінде формулирлеуге мүмкіндік береді. Соның нәтижесінде пайда болатын сенім МДБ үздіксіз күй кеңістігінде анықталады (егер « бастапқы » ПОМДБ-да күйлердің шекті саны болса да: күйлер бойынша ықтималдық таратудың шексіз саны болғандықтан (ішінде) шексіз сенім күйлері бар). Оны векторлардың шекті жиынтығы ретінде көрсетуге болады. Шексіз горизонт формулировкасында, шекті векторлар жиыны кез келген дәлдікпен жақындастыра алады, оның пішіні дөңес болып қалады. Құндылық итерациясы құндылықты оңтайлы құндылық функциясына жуықсағанша біртіндеп жақсарту үшін динамикалық бағдарламалау жаңартуын қолданады және оның бөліктік сызықтығы мен дөңестігін сақтайды. Құндылықты жақсарту арқылы саясат та жақсарылады. Тағы бір динамикалық бағдарламалау әдісі – саясатты итерациялау, ол саясатты тікелей көрсетеді және жақсартады.
POMDP-тің шамамен алынған шешімдері
Іс жүзінде POMDP-ді дәл шешу көбінесе есептеу жағынан қиынға соғады. Бұл қиындық көбінесе өлшемділіктің қарғысы немесе тарихтың қарғысы (оптималды стратегиялар іс-әрекеттер мен байқаулардың толық тарихына байланысты болуы мүмкін) салдарынан туындайды. Осы мәселелерді шешу үшін компьютерлік ғалымдар POMDP-ге жуықтап шешімдер табуға мүмкіндік беретін әдістерді әзірледі. Бұл шешімдер әдетте проблеманы немесе шешімді шектеулі параметрлер санымен жуықтауға, сенім кеңістігінің кішкентай бөлігінде ғана жоспарлауға немесе іс-әрекеттер мен байқаулар тарихын ықшамдап қорытындылауға тырысады. Торға негізделген алгоритмдер – бұл жуықтап шешім табудың бір әдісі. Бұл тәсілде құндылық функциясы сенім кеңістігіндегі белгілі бір нүктелер үшін есептеледі, ал интерполяция арқылы тордағы нүктелерге кірмейтін басқа сенім күйлері үшін оңтайлы іс-әрекет анықталады. Жақындағы зерттеулер үлгілеу әдістерін, жалпылау әдістерін және проблеманың құрылымын пайдалануды қолданады, сондай-ақ миллиондаған күйлерге ие үлкен домендерде POMDP-ді шешуді кеңейтті. Мысалы, бейімделген торлар мен нүктелік әдістер сенім кеңістігіндегі маңызды аймақтарда жоспарлауды шектеу үшін кездейсоқ қолжетімді сенім нүктелерін таңдайды. PCA қолдану арқылы өлшемді азайту да зерттелді. Онлайн жоспарлау алгоритмдері үлкен POMDP-лерді жаңа байқаулар түскен сайын ағымдағы сенім үшін жаңа стратегия құру арқылы шешеді. Мұндай стратегияда тек ағымдағы сенімнен қолжетімді болашақ сенімдерді қарастыру қажет, бұл көбінесе сенім кеңістігінің өте кішкентай бөлігін құрайды. Бұл топқа Монте-Карло ағаштарын іздеу және эвристикалық іздеудің түрлері кіреді. MDP-лерге ұқсас, кез келген деңгейде оңтайлы стратегияны табуға және күйлер мен байқаулар кеңістігінің мөлшеріне тікелей есептеу күрделілігіне тәуелді емес онлайн алгоритмдерді құруға болады. POMDP-ді шешуге арналған жуықтап шешімдердің тағы бір әдісі ағымдағы уақытқа дейінгі алдыңғы байқаулардың, іс-әрекеттердің және сыйақылардың тарихын (немесе оның бір бөлігін) псевдо-күй ретінде пайдалану болып табылады. Осы псевдо-күйлерге негізделген MDP-ді шешудің стандартты әдістерін қолдануға болады (мысалы, Q-оқу). Идеалды жағдайда псевдо-күйлерде бүкіл тарихтан ең маңызды ақпарат болуы керек (жағдайды азайту үшін), сонымен бірге мүмкіндігінше ықшамдалуы керек (құбылудан сақтану үшін).