Введение
Техника, позволяющая сделать модель более обобщаемой и переносимой.
В математике, статистике, финансах и информатике, особенно в машинном обучении и обратных задачах, регуляризация – это процесс, который изменяет конечный результат, делая его "более простым". Она часто используется для получения результатов в плохо определенных задачах или для предотвращения переобучения. Хотя процедуры регуляризации можно классифицировать по-разному, следующее разграничение особенно полезно: явная регуляризация – это добавление к задаче оптимизации специального члена. Эти члены могут представлять собой априорные знания, штрафы или ограничения. Явная регуляризация обычно применяется к плохо поставленным задачам оптимизации. Член регуляризации, или штраф, накладывает стоимость на функцию оптимизации, обеспечивая уникальность оптимального решения. Неявная регуляризация включает в себя все остальные формы регуляризации. К ним относятся, например, ранняя остановка, использование устойчивой функции потерь и отбрасывание выбросов. Неявная регуляризация повсеместно используется в современных подходах к машинному обучению, включая стохастический градиентный спуск для обучения глубоких нейронных сетей и ансамблевые методы (такие как случайные леса и деревья градиентного бустинга). При явной регуляризации, независимо от задачи или модели, всегда присутствуют член данных, соответствующий правдоподобию измерения, и член регуляризации, соответствующий априорному распределению. Комбинируя оба члена с помощью байесовской статистики, можно вычислить апостериорное распределение, которое учитывает оба источника информации и, следовательно, стабилизирует процесс оценки. Балансируя между этими двумя целями, можно отдать предпочтение соответствию данным или усилению обобщающей способности (для предотвращения переобучения). Существует целая область исследований, посвященная различным видам регуляризации. На практике обычно пробуют конкретный вид регуляризации, а затем определяют соответствующую плотность вероятности, чтобы обосновать этот выбор. Это также может быть мотивировано физическим смыслом или интуицией. В машинном обучении член данных соответствует обучающим данным, а регуляризация – это либо выбор модели, либо модификации алгоритма. Всегда целью является снижение ошибки обобщения, то есть ошибки обученной модели на оценочном наборе данных, а не на обучающих данных. Одним из первых применений регуляризации является регуляризация Тихонова, связанная с методом наименьших квадратов.
Explicit regularization is regularization whenever one explicitly adds a term to the optimization problem. These terms could be priors, penalties, or constraints. Explicit regularization is commonly employed with ill posed optimization problems. The regularization term, or penalty, imposes a cost on the optimization function to make the optimal solution unique. Implicit regularization is all other forms of regularization. This includes, for example, early stopping, using a robust loss function, and discarding outliers. Implicit regularization is essentially ubiquitous in modern machine learning approaches, including stochastic gradient descent for training deep neural networks, and ensemble methods (such as random forests and gradient boosted trees). In explicit regularization, independent of the problem or model, there is always a data term, that corresponds to a likelihood of the measurement and a regularization term that corresponds to a prior. By combining both using Bayesian statistics, one can compute a posterior, that includes both information sources and therefore stabilizes the estimation process. By trading off both objectives, one chooses to be more addictive to the data or to enforce generalization (to prevent overfitting). There is a whole research branch dealing with all possible regularizations. In practice, one usually tries a specific regularization and then figures out the probability density that corresponds to that regularization to justify the choice. It can also be physically motivated by common sense or intuition. In machine learning, the data term corresponds to the training data and the regularization is either the choice of the model or modifications to the algorithm. It is always intended to reduce the generalization error, i. e. the error score with the trained model on the evaluation set and not the training data. One of the earliest uses of regularization is Tikhonov regularization, related to the method of least squares.
Регуляризация в машинном обучении
В машинном обучении ключевой задачей является обеспечение способности моделей точно предсказывать результаты на новых, ранее не виденных данных, а не только на знакомых данных обучения. Регуляризация играет решающую роль в борьбе с переобучением – ситуацией, когда модель запоминает детали обучающих данных, но не способна обобщать их на новые данные, – и недообучением, когда модель слишком проста для улавливания сложности обучающих данных. Эта концепция аналогична обучению студентов применять полученные знания к новым задачам, а не просто воспроизводить заученные ответы. Цель регуляризации – побудить модели выявлять общие закономерности в данных, а не запоминать их. Методы, такие как ранняя остановка, L1 и L2 регуляризация, и Dropout, разработаны для предотвращения пере- и недообучения, тем самым повышая способность модели адаптироваться к новым данным и эффективно работать с ними, улучшая обобщающую способность модели. Регуляризация может служить различным целям, включая обучение более простым моделям, стимулирование разреженности моделей и введение групповой структуры в задачу обучения. Аналогичная идея возникла во многих областях науки. Простая форма регуляризации, применяемая к интегральным уравнениям (регуляризация Тихонова), по сути, представляет собой компромисс между точностью соответствия данным и уменьшением нормы решения. В последнее время все большую популярность приобретают нелинейные методы регуляризации, включая регуляризацию полной вариации.
Обобщение
Регуляризация может быть обоснована как метод повышения обобщающей способности обученной модели. Цель этой задачи обучения — найти функцию, которая соответствует или предсказывает выходное значение (метку), минимизирующую ожидаемую ошибку по всем возможным входным данным и меткам. Ожидаемая ошибка функции выражается как:
где и — области определения входных данных и соответствующих им меток соответственно. Как правило, в задачах обучения доступно лишь подмножество входных данных и меток, измеренных с некоторым уровнем шума. Следовательно, ожидаемую ошибку невозможно измерить, и наилучшим доступным заменителем является эмпирическая ошибка, рассчитанная на основе доступных выборок:
Без ограничений на сложность пространства функций (формально, воспроизводящего ядра пространства Гильберта), будет найдена модель, достигающая нулевого значения потерь на эмпирической ошибке. Если измерения (например, ) были выполнены с шумом, такая модель может страдать от переобучения и демонстрировать высокую ожидаемую ошибку. Регуляризация вводит штраф за исследование определенных областей пространства функций, используемых для построения модели, что может улучшить обобщающую способность.
Тихонов-регулированные наименьшие квадраты
Проблема обучения с функцией потерь наименьших квадратов и регуляризацией Тихонова может быть решена аналитически. В матричной форме оптимальное решение – это то, для которого градиент функции потерь по отношению к равен 0.
При этом третье утверждение является условием первого порядка. По построению задачи оптимизации, любые другие значения приводят к большим значениям функции потерь. Это можно проверить, исследуя вторую производную. Во время обучения этот алгоритм занимает времени. Эти слагаемые соответствуют инверсии матрицы и вычислению , соответственно. Тестирование занимает времени.
During training, this algorithm takes time. The terms correspond to the matrix inversion and calculating , respectively. Testing takes time.
Ранняя остановка
Ранняя остановка может рассматриваться как регуляризация по времени. Интуитивно, процедура обучения, такая как градиентный спуск, стремится изучать все более сложные функции с увеличением числа итераций. Регуляризуя по времени, можно контролировать сложность модели, что улучшает обобщающую способность. Ранняя остановка реализуется с использованием одного набора данных для обучения, статистически независимого набора данных для валидации и еще одного – для тестирования. Модель обучается до тех пор, пока производительность на валидационном наборе данных не перестанет улучшаться, после чего применяется к тестовому набору.
Регуляторы для полунаблюдаемого обучения
Когда получение меток обходится дороже, чем сбор входных примеров, полуконтролируемое обучение может быть полезным. Регуляризаторы разработаны для направления алгоритмов обучения к моделям, учитывающим структуру неразмеченных обучающих данных. Если задана симметричная матрица весов, можно определить регуляризатор: Если кодирует результат некоторой метрики расстояния между точками и , желательно, чтобы Этот регуляризатор отражает эту интуицию и эквивалентен: где – матрица Лапласа графа, индуцированного . Оптимизационная задача может быть решена аналитически, если ограничение применяется ко всем размеченным примерам. Таким образом, размеченная часть вектора очевидна. Неразмеченная часть определяется следующим образом: Псевдообратную можно взять, поскольку имеет тот же образ, что и .
If encodes the result of some distance metric for points and , it is desirable that This regularizer captures this intuition, and is equivalent to:
where is the Laplacian matrix of the graph induced by
The optimization problem can be solved analytically if the constraint is applied for all supervised samples. The labeled part of the vector is therefore obvious. The unlabeled part of is solved for by:
The pseudo inverse can be taken because has the same range as .
Регуляторы для многозадачного обучения
В случае многозадачного обучения задачи рассматриваются одновременно, будучи связанными между собой. Цель состоит в обучении функциям, которые, в идеале, используют преимущества взаимосвязанности задач для повышения предсказательной способности. Это эквивалентно обучению матрицы .
Регулятор на столбцах
Этот регуляризатор определяет L2-норму для каждого столбца и L1-норму по всем столбцам. Его можно решить с помощью проксимальных методов.
Регуляризация ядерной нормы
где находятся собственные значения в сингулярном разложении матрицы ?
Среднеобъемная регуляризация
Этот регуляризатор ограничивает функции, выученные для каждой задачи, чтобы они были похожи на общую среднюю функцию по всем задачам. Это полезно для отражения априорной информации о том, что каждая задача, как ожидается, имеет общие черты с другими задачами. Например, это может быть полезно при прогнозировании уровня железа в крови, измеряемого в разное время суток, где каждая задача представляет собой отдельного человека.
Кластеризованная регуляризация с ограниченным средним значением
где имеется кластер задач. Этот регуляризатор аналогичен регуляризатору с ограничением по среднему значению, но вместо этого обеспечивает сходство между задачами внутри одного и того же кластера. Это позволяет учитывать более сложную априорную информацию. Эта техника использовалась для предсказания рекомендаций Netflix. Кластер соответствует группе людей со схожими предпочтениями.
Графическое сходство
Более общо, чем описано выше, сходство между задачами может быть определено функцией. Регуляризатор стимулирует модель к обучению схожих функций для похожих задач, при заданной симметричной матрице сходства.