Введение

Область машинного обучения: обучение с подкреплением в психологии

Обучение с подкреплением (RL) – это междисциплинарная область машинного обучения и оптимального управления, изучающая, каким образом разумный агент должен действовать в динамической среде для максимизации совокупной награды. Обучение с подкреплением является одной из трех основных парадигм машинного обучения, наряду с обучением с учителем и обучением без учителя. В отличие от обучения с учителем, обучение с подкреплением не требует предоставления размеченных пар входных и выходных данных и не нуждается в явной коррекции субоптимальных действий. Вместо этого, основной акцент делается на поиске баланса между исследованием (неизведанных областей) и использованием (имеющихся знаний) с целью максимизации долгосрочной награды, обратная связь по которой может быть неполной или отложенной. Среда обычно описывается в виде марковского процесса принятия решений (MDP), поскольку многие алгоритмы обучения с подкреплением в этом контексте используют методы динамического программирования. Главное отличие между классическими методами динамического программирования и алгоритмами обучения с подкреплением заключается в том, что последние не предполагают знания точной математической модели марковского процесса принятия решений и ориентированы на большие марковские процессы принятия решений, где точные методы становятся невыполнимыми.

Введение

Из-за своей общности, обучение с подкреплением изучается во многих дисциплинах, таких как теория игр, теория управления, исследования операций, теория информации, оптимизация на основе моделирования, многоагентные системы, роевой интеллект и статистика. В литературе по исследованиям операций и теории управления обучение с подкреплением называется приближённым динамическим программированием или нейродинамическим программированием. Проблемы, представляющие интерес для обучения с подкреплением, также изучались в теории оптимального управления, которая в основном связана с существованием и характеристикой оптимальных решений, и алгоритмами их точного вычисления, а не с обучением или приближением, особенно при отсутствии математической модели среды. Базовое обучение с подкреплением моделируется как процесс принятия решений Маркова:

множество состояний среды и агента, ;
множество действий, , агента;
, вероятность перехода (в момент времени ) из состояния в состояние под действием , немедленное вознаграждение после перехода из в при действии .
Цель обучения с подкреплением — чтобы агент выучил оптимальную или почти оптимальную политику, которая максимизирует "функцию вознаграждения" или другой сигнал подкрепления, предоставленный пользователем, накапливающийся из немедленных вознаграждений. Это аналогично процессам, которые, по-видимому, происходят в психологии животных. Например, биологические мозги запрограммированы интерпретировать такие сигналы, как боль и голод, как отрицательное подкрепление, а удовольствие и потребление пищи — как положительное подкрепление. В некоторых обстоятельствах животные могут научиться выполнять действия, оптимизирующие эти вознаграждения. Это говорит о том, что животные способны к обучению с подкреплением. Базовый агент обучения с подкреплением взаимодействует со своей средой в дискретные моменты времени. В каждый момент времени t агент получает текущее состояние и вознаграждение. Затем он выбирает действие из множества доступных действий, которое отправляется в среду. Среда переходит в новое состояние , и определяется вознаграждение, связанное с переходом . Цель агента обучения с подкреплением — выучить политику, , которая максимизирует ожидаемое кумулятивное вознаграждение. Формулирование проблемы как процесса принятия решений Маркова предполагает, что агент непосредственно наблюдает текущее состояние среды; в этом случае говорят, что проблема обладает полной наблюдаемостью. Если агент имеет доступ только к подмножеству состояний или если наблюдаемые состояния искажены шумом, агент обладает частичной наблюдаемостью, и формально задача должна быть сформулирована как частично наблюдаемый процесс принятия решений Маркова. В обоих случаях множество действий, доступных агенту, может быть ограничено. Например, состояние баланса счёта может быть ограничено положительным значением; если текущее значение состояния равно 3, а переход в состояние пытается уменьшить значение на 4, переход не будет разрешён. Когда производительность агента сравнивается с производительностью агента, действующего оптимально, разница в производительности порождает понятие сожаления. Чтобы действовать почти оптимально, агент должен рассуждать о долгосрочных последствиях своих действий (т. е. максимизировать будущий доход), хотя немедленное вознаграждение, связанное с этим, может быть отрицательным. Таким образом, обучение с подкреплением особенно хорошо подходит для задач, включающих компромисс между долгосрочным и краткосрочным вознаграждением. Оно успешно применяется к различным задачам, включая управление энергохранилищем, управление роботами, диспетчеризацию фотоэлектрических генераторов, нарды, шашки, Го (AlphaGo) и системы автономного вождения. Два элемента делают обучение с подкреплением мощным: использование выборок для оптимизации производительности и использование аппроксимации функций для работы с большими средами. Благодаря этим двум ключевым компонентам обучение с подкреплением может использоваться в больших средах в следующих ситуациях:
модель среды известна, но аналитическое решение недоступно;
предоставлена только модель симуляции среды (предмет оптимизации на основе моделирования);
единственный способ сбора информации об окружающей среде — взаимодействие с ней. Первые две из этих проблем можно рассматривать как задачи планирования (поскольку доступна некоторая форма модели), в то время как последняя может рассматриваться как настоящая задача обучения. Однако обучение с подкреплением преобразует обе задачи планирования в задачи машинного обучения.

Разведка

Компромисс между исследованием и эксплуатацией был наиболее тщательно изучен в рамках задачи о многоруком бандите и для процессов принятия решений Маркова с конечным числом состояний в работе Burnetas и Katehakis (1997). Обучение с подкреплением требует продуманных механизмов исследования; случайный выбор действий, без учета оценочного распределения вероятностей, демонстрирует низкую эффективность. Случай (небольших) конечных процессов принятия решений Маркова относительно хорошо понятен. Однако, из-за отсутствия алгоритмов, хорошо масштабируемых с количеством состояний (или масштабируемых к задачам с бесконечным числом состояний), простые методы исследования являются наиболее практичными. Один из таких методов – жадный, где ε – параметр, контролирующий баланс между исследованием и эксплуатацией. С вероятностью ε выбирается эксплуатация, и агент выбирает действие, которое, по его мнению, имеет наилучший долгосрочный эффект (при равенстве между действиями выбор производится равномерно случайным образом). В противном случае, с вероятностью 1-ε, выбирается исследование, и действие выбирается равномерно случайным образом. ε обычно является фиксированным параметром, но может быть скорректирован либо по расписанию (уменьшая степень исследования со временем), либо адаптивно на основе эвристик.

Алгоритмы обучения управления

Даже если вопрос исследования не рассматривается, и даже если состояние было наблюдаемым (будем считать это так в дальнейшем), остаётся проблема использования прошлого опыта для определения, какие действия приводят к большей суммарной награде.

Функция состояния-ценности

Функция ценности состояния определяется как ожидаемый дисконтированный возврат, начиная с состояния , то есть , и последовательно следуя политике. Таким образом, грубо говоря, функция ценности оценивает, насколько выгодно находиться в данном состоянии. Вычисления в TD-методах могут быть инкрементными (когда после каждого перехода память изменяется, а переход отбрасывается) или пакетными (когда переходы группируются, и оценки вычисляются один раз на основе пакета). Пакетные методы, такие как метод временных различий наименьших квадратов, могут лучше использовать информацию из выборок, в то время как инкрементные методы являются единственным выбором, когда пакетные методы невозможны из-за их высокой вычислительной сложности или требований к памяти. Некоторые методы пытаются объединить оба подхода. Методы, основанные на временных различиях, также решают четвертую проблему. Другая проблема, специфичная для TD, возникает из-за их зависимости от рекурсивного уравнения Беллмана. Большинство TD-методов имеют так называемый параметр, который может непрерывно интерполировать между методами Монте-Карло, которые не используют уравнения Беллмана, и базовыми TD-методами, которые полностью полагаются на уравнения Беллмана. Это может быть эффективно для смягчения этой проблемы.

Методы приближения функций

Для решения пятой проблемы используются методы аппроксимации функций. Линейная аппроксимация функций начинается с отображения, которое сопоставляет каждой паре «состояние-действие» вектор конечной размерности. Затем значения действия для пары «состояние-действие» получаются путем линейной комбинации компонентов этого вектора с некоторыми весами: алгоритмы затем корректируют эти веса, а не значения, связанные с отдельными парами «состояние-действие». Исследовались методы, основанные на идеях из непараметрической статистики (которые можно рассматривать как конструирующие собственные признаки). Итерация значений также может служить отправной точкой, приводя к алгоритму Q-обучения и его многочисленным вариантам, включая методы глубокого Q-обучения, когда для представления Q используется нейронная сеть, с различными применениями в стохастических задачах поиска. Проблема использования значений действий заключается в том, что для них могут потребоваться высокоточные оценки конкурирующих значений действий, которые бывает трудно получить при зашумленных вознаграждениях, хотя эта проблема в некоторой степени смягчается методами временных различий. Использование так называемого метода аппроксимации совместимой функцией снижает общность и эффективность.

Прямые поиски политики

Альтернативный метод – поиск непосредственно в (некоторых подмножествах) пространства политик, в этом случае проблема сводится к задаче стохастической оптимизации. Существуют два подхода: методы, основанные на градиенте, и методы, не использующие градиент. Методы, основанные на градиенте (методы градиента политики), начинаются с отображения из пространства конечных измерений (параметров) в пространство политик: задан вектор параметров , обозначим через политику, соответствующую этому вектору. Определим функцию производительности как . При определенных условиях эта функция будет дифференцируема как функция вектора параметров. Если бы градиент был известен, можно было бы использовать метод градиентного подъема. Поскольку аналитического выражения для градиента нет, доступна лишь зашумленная оценка. Такую оценку можно построить различными способами, что приводит к алгоритмам, таким как метод REINFORCE Уильямса (известный как метод отношения правдоподобия в литературе по оптимизации на основе моделирования). Большой класс методов избегает использования информации о градиенте. К ним относятся имитация отжига, перекрестный поиск энтропии или методы эволюционных вычислений. Многие методы, не использующие градиент, могут (в теории и в пределе) достичь глобального оптимума. Методы поиска политики могут сходиться медленно при наличии зашумленных данных. Например, это происходит в эпизодических задачах, когда траектории длинные и дисперсия вознаграждений велика. Методы, основанные на функциях ценности и использующие временные различия, могут помочь в этом случае. В последние годы были предложены и успешно применены методы «актер-критик» для решения различных задач. Методы поиска политики использовались в робототехнике. Многие методы поиска политики могут застревать в локальных оптимумах (поскольку они основаны на локальном поиске).

Модельные алгоритмы

Наконец, все вышеперечисленные методы могут быть объединены с алгоритмами, которые сначала изучают модель процесса принятия решений Маркова – вероятность каждого следующего состояния при выполнении действия из текущего состояния. Например, алгоритм Dyna изучает модель на основе опыта и использует её для предоставления дополнительных смоделированных переходов при обучении функции ценности, помимо реальных переходов. Такие методы иногда можно расширить, используя непараметрические модели, например, когда переходы просто сохраняются и затем "воспроизводятся" для алгоритма обучения. Методы, основанные на моделях, могут быть более ресурсоемкими, чем методы, не использующие модель, и их эффективность может быть ограничена точностью, с которой удается изучить процесс принятия решений Маркова. Существуют и другие способы применения моделей, помимо обновления функции ценности. Например, в управлении на основе модели модель используется для непосредственного обновления стратегии поведения.

Ассоциативное обучение с подкреплением

Задачи обучения с подкреплением по ассоциациям объединяют элементы задач стохастических обучающих автоматов и задач классификации образов с обучением под контролем. В задачах обучения с подкреплением по ассоциациям обучающая система взаимодействует со своей средой в замкнутом контуре.

Глубокое обучение с подкреплением

Этот подход расширяет обучение с подкреплением, используя глубокую нейронную сеть и обходясь без явного определения пространства состояний. Работа Google DeepMind по обучению играм ATARI привлекла повышенное внимание к глубокому обучению с подкреплением, или обучению с подкреплением "от конца до конца".

Противоположное глубокое обучение с подкреплением

Противодействующее глубокое обучение с подкреплением — это активно развивающаяся область исследований в обучении с подкреплением, посвященная уязвимостям обученных стратегий. В этой области некоторые работы изначально показали, что стратегии обучения с подкреплением восприимчивы к едва заметным враждебным воздействиям. Хотя были предложены методы для смягчения этих уязвимостей, в недавних исследованиях было продемонстрировано, что эти предлагаемые решения не дают точной картины современных уязвимостей стратегий глубокого обучения с подкреплением.

Нечеткое обучение с подкреплением

Внедряя нечеткий вывод в обучение с подкреплением, становится возможным аппроксимировать функцию ценности состояния-действия с помощью нечетких правил в непрерывном пространстве. Форма нечетких правил "ЕСЛИ - ТО" делает этот подход удобным для представления результатов в форме, близкой к естественному языку. Расширение FRL с использованием интерполяции нечетких правил позволяет использовать компактные разреженные базы нечетких правил для выделения кардинальных правил (наиболее важных значений действия состояния).

Обучение по обратной подкреплению

В обратном обучении с подкреплением (IRL) функция вознаграждения не задается. Вместо этого функция вознаграждения выводится на основе наблюдаемого поведения эксперта. Цель состоит в том, чтобы имитировать наблюдаемое поведение, которое часто является оптимальным или близким к оптимальному. Одной из популярных парадигм IRL является обратное обучение с подкреплением на основе максимизации энтропии (MaxEnt IRL). MaxEnt IRL оценивает параметры линейной модели функции вознаграждения, максимизируя энтропию распределения вероятностей наблюдаемых траекторий при ограничениях, связанных с соответствием ожидаемым значениям признаков. Недавно было показано, что MaxEnt IRL является частным случаем более общей структуры, называемой обратным обучением с подкреплением на основе случайной полезности (RU IRL). RU IRL базируется на теории случайной полезности и марковских процессах принятия решений. В то время как предыдущие подходы к IRL предполагают, что кажущееся случайное поведение наблюдаемого агента обусловлено следованием случайной стратегии, RU IRL предполагает, что наблюдаемый агент следует детерминированной стратегии, а случайность в наблюдаемом поведении возникает из-за того, что наблюдатель имеет лишь частичный доступ к признакам, которые агент использует при принятии решений. Функция полезности моделируется как случайная величина, чтобы учесть незнание наблюдателя относительно тех признаков, которые агент фактически учитывает в своей функции полезности.

Безопасный подкрепленный процесс обучения

Безопасное обучение с подкреплением (SRL) можно определить как процесс обучения стратегий, максимизирующих ожидаемое вознаграждение в задачах, где важно обеспечивать приемлемую производительность системы и/или соблюдать ограничения безопасности в ходе процессов обучения и/или развертывания.