Введение

Метод в машинном обучении
В машинном обучении ранняя остановка — это форма регуляризации, используемая для предотвращения переобучения при обучении модели итеративным методом, таким как градиентный спуск. Такие методы обновляют модель на каждой итерации, чтобы улучшить её соответствие обучающим данным. До определенного момента это повышает производительность модели на данных, отличных от обучающего набора. Однако, после этой точки, улучшение соответствия модели обучающим данным достигается за счет увеличения ошибки обобщения. Правила ранней остановки определяют, сколько итераций можно выполнить, прежде чем модель начнет переобучаться. Правила ранней остановки применялись во многих различных методах машинного обучения, с разной степенью теоретического обоснования.

Предыстория

В этом разделе представлены некоторые базовые концепции машинного обучения, необходимые для описания методов преждевременной остановки.

Переустройство

Алгоритмы машинного обучения обучают модель на основе конечного набора обучающих данных. В процессе обучения модель оценивается по тому, насколько точно она предсказывает наблюдения, содержащиеся в обучающем наборе. Однако, как правило, цель схемы машинного обучения — создать модель, способную к обобщению, то есть предсказывать ранее не встречавшиеся наблюдения. Переобучение возникает, когда модель хорошо соответствует данным в обучающем наборе, но при этом демонстрирует более высокую ошибку обобщения.

Регуляризация

Регуляризация, в контексте машинного обучения, относится к процессу модификации алгоритма обучения для предотвращения переобучения. Обычно это включает в себя наложение некоторого ограничения на гладкость обученной модели. Эта гладкость может быть обеспечена явно, например, путем фиксации количества параметров в модели, или путем добавления члена к функции потерь, как в регуляризации Тихонова. Регуляризация Тихонова, а также регрессия главных компонент и многие другие схемы регуляризации, относятся к спектральной регуляризации, которая характеризуется применением фильтра. Ранняя остановка также входит в этот класс методов.

Методы спуска по градиентам

Методы градиентного спуска — это итеративные методы оптимизации первого порядка. Каждая итерация обновляет приближенное решение задачи оптимизации, совершая шаг в направлении, противоположном градиенту целевой функции. Правильно выбирая длину шага, можно добиться сходимости метода к локальному минимуму целевой функции. В машинном обучении градиентный спуск используется путем определения функции потерь, отражающей ошибку модели на обучающем наборе данных, и последующей минимизации этой функции.

Ранняя остановка в теории статистического обучения

Ранняя остановка может быть использована для регуляризации непараметрических задач регрессии, возникающих в машинном обучении. Для заданного входного пространства, , выходного пространства, , и выборки, полученной из неизвестной меры вероятности, , на , целью таких задач является аппроксимация регрессионной функции, , определяемой как

где – это условное распределение в точке индуцированное . Распространенным выбором для аппроксимации регрессионной функции является использование функций из воспроизводящего ядра пространства Гильберта.

L-усиление

Методы повышения тесно связаны с методами градиентного спуска, описанными выше, и могут рассматриваться как метод повышения, основанный на функции потерь: LBoost. Кросс-валидация является альтернативным подходом, применимым к задачам, не связанным с временными рядами. Кросс-валидация предполагает разделение данных на несколько обучающих и проверочных подмножеств, а не на одно обучающее и проверочное подмножество. Даже эта простая процедура на практике усложняется тем, что ошибка на проверочных данных может колебаться в процессе обучения, приводя к множеству локальных минимумов. Это осложнение привело к разработке множества эмпирических правил для определения момента начала переобучения.