Введение
Алгоритм обучения с подкреплением без модели
Q-обучение — это алгоритм обучения с подкреплением без модели, предназначенный для определения ценности действия в определенном состоянии. Он не требует модели среды (отсюда и термин "без модели") и способен решать задачи со стохастическими переходами и вознаграждениями без каких-либо адаптаций. Для любого конечного марковского процесса принятия решений Q-обучение находит оптимальную политику в смысле максимизации ожидаемого значения совокупной награды на любом и всех последующих шагах, начиная с текущего состояния. Q-обучение может определить оптимальную политику выбора действий для любого заданного конечного марковского процесса принятия решений при бесконечном времени исследования и частично случайной политике.
Уровень обучения
Скорость обучения или размер шага определяет, насколько новая информация переопределяет старую. Фактор 0 не позволяет агенту обучаться (используя исключительно предыдущие знания), а фактор 1 заставляет агента учитывать только самую свежую информацию (игнорируя предыдущие знания для исследования возможностей). В полностью детерминированных средах оптимальной является скорость обучения . Когда задача стохастична, алгоритм сходится при определенных технических условиях, требующих уменьшения скорости обучения до нуля. На практике часто используется постоянная скорость обучения, например, для всех .
Дисконтный коэффициент
Фактор дисконтирования γ определяет значимость будущих вознаграждений. Фактор, равный 0, сделает агента "близоруким" (или миопическим), заставляя его учитывать только текущие вознаграждения, то есть (в вышеуказанном правиле обновления), в то время как фактор, приближающийся к 1, будет побуждать его стремиться к высокой долгосрочной награде. Если фактор дисконтирования равен или превышает 1, значения действий могут расходиться. В случае отсутствия терминального состояния, или если агент никогда его не достигает, все истории взаимодействия с окружающей средой становятся бесконечно длинными, а полезности с аддитивными, недисконтированными вознаграждениями обычно стремятся к бесконечности. Даже при факторе дисконтирования, лишь незначительно меньшем 1, обучение Q-функции приводит к распространению ошибок и нестабильности при аппроксимации функции ценности искусственной нейронной сетью. В этом случае, начало обучения с более низким фактором дисконтирования и его постепенное увеличение до целевого значения ускоряет процесс обучения.
Начальные условия (Q0)
Поскольку Q-обучение является итеративным алгоритмом, оно неявно предполагает начальное условие перед первым обновлением. Высокие начальные значения, также известные как "оптимистические начальные условия", могут стимулировать исследование: независимо от выбранного действия, правило обновления приведет к тому, что его значение будет ниже, чем у других альтернатив, тем самым повышая вероятность их выбора. Первое полученное вознаграждение можно использовать для сброса начальных условий. Согласно этой идее, при первом выполнении действия вознаграждение используется для установки его значения. Это позволяет немедленно обучаться в случае фиксированных детерминированных вознаграждений. Модель, включающая сброс начальных условий (RIC), должна лучше предсказывать поведение испытуемых, чем модель, предполагающая любое произвольное начальное условие (AIC). Это позволяет применять алгоритм к более сложным задачам, даже когда пространство состояний непрерывно. Одним из решений является использование (адаптированной) искусственной нейронной сети в качестве аппроксиматора функции. Другая возможность – интегрировать интерполяцию нечетких правил (FRI) и использовать разреженные базы нечетких правил вместо дискретных Q-таблиц или ИНС, что имеет преимущество в виде удобочитаемого человеком формата представления знаний. Аппроксимация функций может ускорить обучение в конечных задачах, поскольку алгоритм способен обобщать предыдущий опыт на ранее не встречавшиеся состояния.
Квантование
Другой метод уменьшения пространства состояний/действий — квантование возможных значений. Рассмотрим пример обучения удержанию палки на пальце. Описание состояния в определенный момент времени включает положение пальца в пространстве, его скорость, угол наклона палки и угловую скорость палки. Это дает четырехкомпонентный вектор, описывающий одно состояние, то есть моментальный снимок состояния, закодированный в четыре значения. Проблема в том, что существует бесконечное количество возможных состояний. Чтобы сократить пространство допустимых действий, несколько значений можно объединить в одну категорию. Точное расстояние пальца от его начальной позиции (от минус бесконечности до плюс бесконечности) неизвестно, но важно лишь то, находится ли он далеко или нет (близко, далеко).
Глубокое обучение Q
Система DeepMind использовала глубокую свёрточную нейронную сеть со слоями плиточных свёрточных фильтров для имитации эффектов рецептивных полей. Обучение с подкреплением становится нестабильным или расходящимся при использовании нелинейного функционного аппроксиматора, такого как нейронная сеть, для представления Q. Эта нестабильность возникает из-за корреляций в последовательности наблюдений, того факта, что небольшие изменения в Q могут существенно повлиять на политику агента и распределение данных, а также корреляций между Q и целевыми значениями. Метод применим для стохастического поиска в различных областях и приложениях. В данной технике использовался опыт повторного воспроизведения (experience replay) – механизм, вдохновлённый биологией, который использует случайную выборку из предыдущих действий вместо самого последнего для продолжения процесса.
Другие
Задержанное Q-обучение — это альтернативная реализация алгоритма Q-обучения с подкреплением, основанная на обучении с вероятностно приблизительно корректным результатом (PAC). Greedy GQ — это вариант Q-обучения, предназначенный для использования в сочетании с (линейной) аппроксимацией функций. Преимущество Greedy GQ заключается в том, что сходимость гарантируется даже при использовании аппроксимации функций для оценки значений действий. Распределённое Q-обучение — это вариант Q-обучения, который стремится моделировать распределение вознаграждений, а не ожидаемое вознаграждение от каждого действия. Было замечено, что оно облегчает оценку с помощью глубоких нейронных сетей и может позволить использовать альтернативные методы управления, такие как управление, чувствительное к риску.
Многоагентное обучение
Q-обучение было предложено для многоагентной среды (см. раздел 4.1.2 в [название/ссылка]). Один из подходов состоит в том, чтобы рассматривать среду как пассивную. Литтман предложил алгоритм minimax Q-обучения.
Ограничения
Стандартный алгоритм Q-обучения (с использованием таблицы) применим только к дискретным пространствам состояний и действий. Дискретизация этих значений приводит к неэффективному обучению, в значительной степени из-за проклятия размерности. Однако существуют адаптации Q-обучения, которые пытаются решить эту проблему, например, Q-обучение с нейронной сетью, аппроксимирующей функцию ценности (Wire fitted Neural Network Q Learning).