Введение

Математический способ достижения желаемого результата в динамической системе.

Теория оптимального управления — это раздел теории управления, который занимается поиском управления для динамической системы в течение определенного периода времени таким образом, чтобы была оптимизирована целевая функция. Она имеет многочисленные применения в науке, технике и операционных исследованиях. Например, динамической системой может быть космический аппарат с органами управления, соответствующими ракетным двигателям, а целью — достижение Луны с минимальными затратами топлива. Или динамической системой может быть экономика страны, с целью минимизации безработицы; в этом случае органами управления могут быть фискальная и денежно-кредитная политика. Динамическая система также может быть введена для включения задач операционных исследований в структуру теории оптимального управления. Оптимальное управление является расширением вариационного исчисления и представляет собой математический метод оптимизации для вывода управляющих стратегий. Метод во многом основан на работах Льва Понтрягина и Ричарда Беллмана в 1950-х годах, после вклада Эдварда Дж. МакШейна в вариационное исчисление. Оптимальное управление можно рассматривать как стратегию управления в теории управления или путем решения уравнения Гамильтона — Якоби — Беллмана (достаточное условие). Начнем с простого примера. Рассмотрим автомобиль, движущийся по прямой на холмистой дороге. Вопрос в том, как водителю следует нажимать на педаль акселератора, чтобы минимизировать общее время в пути? В этом примере термин «закон управления» относится конкретно к тому, как водитель нажимает на акселератор и переключает передачи. Система состоит как из автомобиля, так и из дороги, а критерием оптимальности является минимизация общего времени поездки. Задачи управления обычно включают дополнительные ограничения. Например, количество доступного топлива может быть ограничено, педаль акселератора нельзя вдавить в пол автомобиля, существуют ограничения скорости и т. д. Соответствующая функция стоимости будет математическим выражением, определяющим время в пути как функцию скорости, геометрических соображений и начальных условий системы. Ограничения часто взаимозаменяемы с функцией стоимости. Другая связанная задача оптимального управления может заключаться в поиске способа управления автомобилем таким образом, чтобы минимизировать расход топлива, при условии, что он должен пройти заданный маршрут за время, не превышающее определенного значения. Еще одна связанная задача управления может заключаться в минимизации общей денежной стоимости завершения поездки, исходя из предполагаемых денежных цен на время и топливо. Более абстрактная структура выглядит следующим образом.

Оптимальный контроль дискретного времени

Примеры, приведенные до сих пор, демонстрировали системы непрерывного времени и решения в области управления. Однако, поскольку оптимальные решения управления сейчас часто реализуются цифровым способом, современная теория управления в основном посвящена дискретным системам времени и решениям. Теория согласованных приближений предоставляет условия, при которых решения последовательности все более точных дискретизированных задач оптимального управления сходятся к решению исходной задачи в непрерывном времени. Не все методы дискретизации обладают этим свойством, даже те, что кажутся очевидными. Например, использование процедуры с переменным шагом для интегрирования динамических уравнений задачи может привести к появлению градиента, который не стремится к нулю (или не указывает в правильном направлении) при приближении к решению. Прямой метод RIOTS основан на теории согласованных приближений.

Примеры

Общая стратегия решения многих задач оптимального управления заключается в нахождении косостоящего (иногда называемого теневой ценой). Косостоящее суммирует в одном числе предельное значение увеличения или уменьшения переменной состояния на следующем шаге. Это предельное значение включает не только выигрыш, который будет получен на следующем шаге, но и связан с продолжительностью всей программы. Удобно, когда косостоящее можно найти аналитически, но чаще всего удается лишь достаточно хорошо его описать, чтобы интуитивно понять характер решения, а численное уравнение можно решить для определения значений. Получив косостоящее, оптимальное значение управления на шаге t обычно можно найти как дифференциальное уравнение, при условии знания косостоящего. Однако, особенно в задачах с непрерывным временем, редко удается получить явное выражение для значения управления или состояния. Обычно стратегия заключается в определении порогов и областей, характеризующих оптимальное управление, и использовании численного решателя для определения фактических значений управления в каждый момент времени.

Определенное время

Рассмотрим проблему владельца рудника, который должен решить, с какой скоростью извлекать руду из своей шахты. Он владеет правами на руду с даты t₁ до даты t₂. На момент времени t₁ в земле находится Q₀ руды, и количество руды, оставшейся в земле, уменьшается со временем по мере того, как владелец шахты её добывает со скоростью q(t). Владелец шахты извлекает руду с затратами C(q(t)) (где стоимость извлечения возрастает с квадратом скорости извлечения и обратно пропорциональна количеству оставшейся руды) и продает руду по постоянной цене p. Любая руда, оставшаяся в земле к моменту времени t₂, не может быть продана и не имеет ценности (отсутствует "остаточная стоимость"). Владелец выбирает скорость извлечения, изменяющуюся во времени q(t), чтобы максимизировать прибыль за период владения без учета временной стоимости денег.