Кіріспе
Оптималды басқару теориясындағы оптималдық шарт – Гамильтон-Жакоби-Беллман (HJB) теңдеуі, жоғалту функциясына қатысты басқарудың оптималдығы үшін қажетті және жеткілікті шарттарды қамтамасыз ететін сызықтық емес бөлшектік дифференциалдық теңдеу. Оның шешімі – оптималды басқару мәселесінің мән функциясы, ол белгілі болғаннан кейін HJB теңдеуіне қатысты Гамильтонианның максимизаторын (немесе минимизаторын) таңдау арқылы оптималды басқаруды алуға болады. Бұл теңдеу 1950 жылдары Ричард Беллман және оның әріптестері жасаған динамикалық бағдарламалау теориясының нәтижесі. Классикалық физикадағы Гамильтон-Жакоби теңдеуімен байланысы алғаш рет Рудольф Кальманмен көрсетілген. Дискретті уақыт мәселелерінде ұқсас айырмашылық теңдеуі көбінесе Беллман теңдеуі деп аталады. Гамильтон-Жакоби-Беллман теңдеуін қолдану арқылы брахистохрондық мәселе сияқты классикалық вариациялық мәселелерді шешуге болады, сонымен қатар бұл әдіс мәселелердің кең ауқымына қолданылады. Одан әрі, оны стохастикалық жүйелерге жалпылауға болады, мұндай жағдайда HJB теңдеуі екінші реттік эллиптикалық бөлшектік дифференциалдық теңдеу болып табылады. Дегенмен, HJB теңдеуінің маңызды кемшілігі – оның классикалық шешімдері тек жеткілікті тегіс мән функциясы үшін ғана мүмкін, бірақ мұндай жағдай көптеген кезде кепілдендірілмейді. Оның орнына, тұтқырлық шешімі туралы түсінік қажет, онда дәстүрлі туындылар (мәнді жиынмен) субтуындылармен алмастырылады.
The Hamilton Jacobi Bellman (HJB) equation is a nonlinear partial differential equation that provides necessary and sufficient conditions for optimality of a control with respect to a loss function. Its solution is the value function of the optimal control problem which, once known, can be used to obtain the optimal control by taking the maximizer (or minimizer) of the Hamiltonian involved in the HJB equation. The equation is a result of the theory of dynamic programming which was pioneered in the 1950s by Richard Bellman and coworkers. The connection to the Hamilton–Jacobi equation from classical physics was first drawn by Rudolf Kálmán. In discrete time problems, the analogous difference equation is usually referred to as the Bellman equation. While classical variational problems, such as the brachistochrone problem, can be solved using the Hamilton–Jacobi–Bellman equation, the method can be applied to a broader spectrum of problems. Further it can be generalized to stochastic systems, in which case the HJB equation is a second order elliptic partial differential equation. A major drawback, however, is that the HJB equation admits classical solutions only for a sufficiently smooth value function, which is not guaranteed in most situations. Instead, the notion of a viscosity solution is required, in which conventional derivatives are replaced by (set valued) subderivatives.
Теңдеуді шешу
HJB теңдеуі әдетте уақыт бойынша кері шешіледі, басталып, аяқталады. Егер күй кеңістігінің барлық аймағында шешілсе және үздіксіз дифференциалдалатын болса, HJB теңдеуі соңғы күйге шектеу қойылмаған жағдайда оптималдық үшін қажетті және жеткілікті шарт болып табылады. Егер біз -ты таба алсақ, онда ең төменгі құнға жетуге мүмкіндік беретін басқаруды анықтай аламыз. Жалпы жағдайда HJB теңдеуінің классикалық (тегіс) шешімі жоқ. Мұндай жағдайларды қамту үшін бірнеше жалпыланған шешімдер ұсынылды, олардың ішінде тұтқырлық шешімі (Пьер Луи Лайонс және Майкл Крандалл), минимакс шешімі (Андрей Измайлович Субботин [ru]) және басқалары бар. Д. П. Берцекас және Ж. Н. Цициклис динамикалық бағдарламалауды жасанды нейрондық желілерді (көп қабатты перцептрон) қолдана отырып, Беллман функциясын шамалау үшін енгізді. Бұл – бүкіл кеңістіктік домен үшін функцияның толық картасын жаттаудың орнына, тек нейрондық желінің параметрлерін жаттау арқылы өлшемділіктің әсерін азайтудың тиімді тәсілі. Атап айтқанда, үздіксіз уақыт жүйелері үшін нейрондық желілермен саясат итерацияларын біріктіретін шамамен динамикалық бағдарламалау әдісі ұсынылды. Дискретті уақытта HJB теңдеуін шешу үшін құндылық итерациялары мен нейрондық желілерді біріктіретін тәсіл енгізілді. Сонымен қатар, квадраттардың қосындысын оңтайландыру Гамильтон–Жакоби–Беллман теңдеуіне қатысты нормаға шамамен көпмүшелік шешім бере алатыны көрсетілді.
When solved over the whole of state space and is continuously differentiable, the HJB equation is a necessary and sufficient condition for an optimum when the terminal state is unconstrained. If we can solve for then we can find from it a control that achieves the minimum cost. In general case, the HJB equation does not have a classical (smooth) solution. Several notions of generalized solutions have been developed to cover such situations, including viscosity solution (Pierre Louis Lions and Michael Crandall), minimax solution (Andrei Izmailovich Subbotin [ru]), and others. Approximate dynamic programming has been introduced by D. P. Bertsekas and J. N. Tsitsiklis with the use of artificial neural networks (multilayer perceptrons) for approximating the Bellman function in general. This is an effective mitigation strategy for reducing the impact of dimensionality by replacing the memorization of the complete function mapping for the whole space domain with the memorization of the sole neural network parameters. In particular, for continuous time systems, an approximate dynamic programming approach that combines both policy iterations with neural networks was introduced. In discrete time, an approach to solve the HJB equation combining value iterations and neural networks was introduced. Alternatively, it has been shown that sum of squares optimization can yield an approximate polynomial solution to the Hamilton–Jacobi–Bellman equation arbitrarily well with respect to the norm.