Введение
Для приложений контролируемого обучения в машинном обучении и теории статистического обучения, ошибка обобщения (также известная как ошибка на новых данных или риск) является мерой точности, с которой алгоритм способен предсказывать значения результатов для ранее не встречавшихся данных. Поскольку алгоритмы обучения оцениваются на конечных выборках, оценка алгоритма обучения может быть чувствительна к ошибке выборки. В результате, измерения ошибки предсказания на текущих данных могут не давать достаточной информации о способности к предсказанию на новых данных. Ошибку обобщения можно минимизировать, избегая переобучения в алгоритме обучения. Эффективность алгоритма машинного обучения визуализируется графиками, показывающими значения оценок ошибки обобщения в процессе обучения, которые называются кривыми обучения.
For supervised learning applications in machine learning and statistical learning theory, generalization error (also known as the out of sample error or the risk) is a measure of how accurately an algorithm is able to predict outcome values for previously unseen data. Because learning algorithms are evaluated on finite samples, the evaluation of a learning algorithm may be sensitive to sampling error. As a result, measurements of prediction error on the current data may not provide much information about predictive ability on new data. Generalization error can be minimized by avoiding overfitting in the learning algorithm. The performance of a machine learning algorithm is visualized by plots that show values of estimates of the generalization error through the learning process, which are called learning curves.
Алгоритмы с доказанной стабильностью
Было доказано, что ряд алгоритмов устойчивы, и, как следствие, для них установлены границы обобщающей способности. Список этих алгоритмов и работ, в которых доказана их устойчивость, доступен здесь.
Связь с перегрузкой
Понятия ошибки обобщения и переобучения тесно связаны. Переобучение происходит, когда изученная функция становится чувствительной к шуму в выборке. В результате функция будет хорошо работать на обучающем наборе, но плохо на других данных из совместного распределения вероятностей и . Таким образом, чем сильнее переобучение, тем больше ошибка обобщения. Степень переобучения можно оценить с помощью методов кросс-валидации, которые разбивают выборку на имитированные обучающие и тестовые выборки. Затем модель обучается на обучающей выборке и оценивается на тестовой. Тестовая выборка ранее не была доступна алгоритму и, следовательно, представляет собой случайную выборку из совместного распределения вероятностей и . Эта тестовая выборка позволяет нам приблизить ожидаемую ошибку и, как следствие, приблизить определенную форму ошибки обобщения. Существует множество алгоритмов для предотвращения переобучения. Алгоритм минимизации может штрафовать более сложные функции (известные как регуляризация Тихонова), или пространство гипотез может быть ограничено, либо явно в форме функций, либо путем добавления ограничений к функции минимизации (регуляризация Иванова). Поиск функции, которая не переобучается, противоречит цели поиска функции, достаточно сложной для улавливания специфических характеристик данных. Это известно как компромисс между смещением и дисперсией. Поддержание простоты функции для избежания переобучения может привести к смещению в полученных прогнозах, в то время как разрешение ей быть более сложной приводит к переобучению и большей дисперсии в прогнозах. Одновременно минимизировать оба параметра невозможно.