Введение

Условие оптимальности в теории оптимального управления. Уравнение Гамильтона — Якоби — Беллмана (HJB) — это нелинейное частное дифференциальное уравнение, предоставляющее необходимые и достаточные условия оптимальности управления относительно функции потерь. Его решение является функцией ценности задачи оптимального управления, которая, будучи известной, может быть использована для получения оптимального управления путем выбора максимизатора (или минимизатора) гамильтониана, входящего в уравнение HJB. Уравнение является результатом теории динамического программирования, разработанной в 1950-х годах Ричардом Беллманом и его коллегами. Связь с уравнением Гамильтона — Якоби из классической физики впервые установил Рудольф Кальман. В задачах с дискретным временем аналогичное разностное уравнение обычно называют уравнением Беллмана. Хотя классические вариационные задачи, такие как задача о брахистохроне, могут быть решены с помощью уравнения Гамильтона — Якоби — Беллмана, метод применим к более широкому кругу задач. Кроме того, его можно обобщить на стохастические системы, в этом случае уравнение HJB представляет собой эллиптическое частное дифференциальное уравнение второго порядка. Однако существенным недостатком является то, что уравнение HJB имеет классические решения только для достаточно гладкой функции ценности, что не гарантируется в большинстве случаев. Вместо этого требуется понятие вязкого решения, в котором обычные производные заменяются субдифференциалами (множественнозначными).

Решение уравнения

Уравнение HJB обычно решается в обратном времени, начиная с и заканчивая на . Когда уравнение решено на всем пространстве состояний и непрерывно дифференцируемо, оно является необходимым и достаточным условием оптимальности при неограниченном конечном состоянии. Если удается найти решение для , то из него можно определить управление, обеспечивающее минимальную стоимость. В общем случае уравнение HJB не имеет классического (гладкого) решения. Для таких ситуаций разработаны различные понятия обобщенных решений, включая решение вязкости (Пьер Луи Лайонс и Майкл Крандалл), решение минимакса (Андрей Измайлович Субботин) и другие. Приблизительное динамическое программирование, предложенное Д. П. Берцекасом и Дж. Н. Цициклисом, использует искусственные нейронные сети (многослойные перцептроны) для аппроксимации функции Беллмана. Это эффективный способ снизить влияние размерности, заменяя запоминание полного функционального отображения для всей области пространства запоминанием параметров единственной нейронной сети. В частности, для систем с непрерывным временем был разработан приближенный метод динамического программирования, сочетающий итерации по политике с нейронными сетями. Для систем с дискретным временем предложен подход к решению уравнения HJB, объединяющий итерации по значению и нейронные сети. Кроме того, показано, что оптимизация суммы квадратов позволяет получить приближенное полиномиальное решение уравнения Гамильтона — Якоби — Беллмана с произвольной точностью относительно нормы.