Введение
Условие оптимальности в теории оптимального управления. Уравнение Гамильтона — Якоби — Беллмана (HJB) — это нелинейное частное дифференциальное уравнение, предоставляющее необходимые и достаточные условия оптимальности управления относительно функции потерь. Его решение является функцией ценности задачи оптимального управления, которая, будучи известной, может быть использована для получения оптимального управления путем выбора максимизатора (или минимизатора) гамильтониана, входящего в уравнение HJB. Уравнение является результатом теории динамического программирования, разработанной в 1950-х годах Ричардом Беллманом и его коллегами. Связь с уравнением Гамильтона — Якоби из классической физики впервые установил Рудольф Кальман. В задачах с дискретным временем аналогичное разностное уравнение обычно называют уравнением Беллмана. Хотя классические вариационные задачи, такие как задача о брахистохроне, могут быть решены с помощью уравнения Гамильтона — Якоби — Беллмана, метод применим к более широкому кругу задач. Кроме того, его можно обобщить на стохастические системы, в этом случае уравнение HJB представляет собой эллиптическое частное дифференциальное уравнение второго порядка. Однако существенным недостатком является то, что уравнение HJB имеет классические решения только для достаточно гладкой функции ценности, что не гарантируется в большинстве случаев. Вместо этого требуется понятие вязкого решения, в котором обычные производные заменяются субдифференциалами (множественнозначными).
The Hamilton Jacobi Bellman (HJB) equation is a nonlinear partial differential equation that provides necessary and sufficient conditions for optimality of a control with respect to a loss function. Its solution is the value function of the optimal control problem which, once known, can be used to obtain the optimal control by taking the maximizer (or minimizer) of the Hamiltonian involved in the HJB equation. The equation is a result of the theory of dynamic programming which was pioneered in the 1950s by Richard Bellman and coworkers. The connection to the Hamilton–Jacobi equation from classical physics was first drawn by Rudolf Kálmán. In discrete time problems, the analogous difference equation is usually referred to as the Bellman equation. While classical variational problems, such as the brachistochrone problem, can be solved using the Hamilton–Jacobi–Bellman equation, the method can be applied to a broader spectrum of problems. Further it can be generalized to stochastic systems, in which case the HJB equation is a second order elliptic partial differential equation. A major drawback, however, is that the HJB equation admits classical solutions only for a sufficiently smooth value function, which is not guaranteed in most situations. Instead, the notion of a viscosity solution is required, in which conventional derivatives are replaced by (set valued) subderivatives.
Решение уравнения
Уравнение HJB обычно решается в обратном времени, начиная с и заканчивая на . Когда уравнение решено на всем пространстве состояний и непрерывно дифференцируемо, оно является необходимым и достаточным условием оптимальности при неограниченном конечном состоянии. Если удается найти решение для , то из него можно определить управление, обеспечивающее минимальную стоимость. В общем случае уравнение HJB не имеет классического (гладкого) решения. Для таких ситуаций разработаны различные понятия обобщенных решений, включая решение вязкости (Пьер Луи Лайонс и Майкл Крандалл), решение минимакса (Андрей Измайлович Субботин) и другие. Приблизительное динамическое программирование, предложенное Д. П. Берцекасом и Дж. Н. Цициклисом, использует искусственные нейронные сети (многослойные перцептроны) для аппроксимации функции Беллмана. Это эффективный способ снизить влияние размерности, заменяя запоминание полного функционального отображения для всей области пространства запоминанием параметров единственной нейронной сети. В частности, для систем с непрерывным временем был разработан приближенный метод динамического программирования, сочетающий итерации по политике с нейронными сетями. Для систем с дискретным временем предложен подход к решению уравнения HJB, объединяющий итерации по значению и нейронные сети. Кроме того, показано, что оптимизация суммы квадратов позволяет получить приближенное полиномиальное решение уравнения Гамильтона — Якоби — Беллмана с произвольной точностью относительно нормы.
When solved over the whole of state space and is continuously differentiable, the HJB equation is a necessary and sufficient condition for an optimum when the terminal state is unconstrained. If we can solve for then we can find from it a control that achieves the minimum cost. In general case, the HJB equation does not have a classical (smooth) solution. Several notions of generalized solutions have been developed to cover such situations, including viscosity solution (Pierre Louis Lions and Michael Crandall), minimax solution (Andrei Izmailovich Subbotin [ru]), and others. Approximate dynamic programming has been introduced by D. P. Bertsekas and J. N. Tsitsiklis with the use of artificial neural networks (multilayer perceptrons) for approximating the Bellman function in general. This is an effective mitigation strategy for reducing the impact of dimensionality by replacing the memorization of the complete function mapping for the whole space domain with the memorization of the sole neural network parameters. In particular, for continuous time systems, an approximate dynamic programming approach that combines both policy iterations with neural networks was introduced. In discrete time, an approach to solve the HJB equation combining value iterations and neural networks was introduced. Alternatively, it has been shown that sum of squares optimization can yield an approximate polynomial solution to the Hamilton–Jacobi–Bellman equation arbitrarily well with respect to the norm.