Введение
Предположения для логического вывода в машинном обучении. Индуктивный уклон (также известный как смещение обучения) алгоритма обучения – это набор предположений, которые алгоритм использует для предсказания выходных данных для входных данных, с которыми он ранее не сталкивался. Индуктивный уклон – это любой фактор, который заставляет алгоритм выбирать один шаблон вместо другого (например, ступенчатые функции в деревьях решений вместо непрерывной функции в модели линейной регрессии). Обучение – это процесс приобретения полезных знаний посредством наблюдения и взаимодействия с окружающим миром. Оно включает в себя поиск в пространстве решений решения, которое, как ожидается, обеспечит лучшее объяснение данных или приведет к более высоким результатам. Однако во многих случаях существует несколько равноценных решений. Индуктивный уклон позволяет алгоритму обучения отдавать приоритет одному решению (или интерпретации) над другим, независимо от наблюдаемых данных. В машинном обучении целью является создание алгоритмов, способных научиться предсказывать определенный целевой выход. Для этого алгоритму обучения предоставляются примеры обучения, демонстрирующие предполагаемую зависимость между входными и выходными значениями. Затем алгоритм должен аппроксимировать правильный выход, даже для примеров, которые не были показаны в процессе обучения. Без каких-либо дополнительных предположений эту задачу невозможно решить, поскольку для невидимых ситуаций возможны произвольные выходные значения. Необходимые предположения о природе целевой функции обобщаются понятием индуктивного уклона. Классическим примером индуктивного уклона является принцип бритвы Оккама, который предполагает, что самая простая непротиворечивая гипотеза о целевой функции является наилучшей. Здесь непротиворечивость означает, что гипотеза алгоритма дает правильные выходные данные для всех примеров, предоставленных алгоритму. Подходы к более формальному определению индуктивного уклона основаны на математической логике. В этом случае индуктивный уклон представляет собой логическую формулу, которая вместе с обучающими данными логически влечет за собой гипотезу, сгенерированную алгоритмом. Однако этот строгий формализм не работает во многих практических случаях, когда индуктивный уклон можно задать только в виде приблизительного описания (например, в случае искусственных нейронных сетей) или вообще не может быть задан.
The inductive bias (also known as learning bias) of a learning algorithm is the set of assumptions that the learner uses to predict outputs of given inputs that it has not encountered. Inductive bias is anything which makes the algorithm learn one pattern instead of another pattern (e. g. step functions in decision trees instead of continuous function in a linear regression model). Learning is the process of apprehending useful knowledge by observing and interacting with the world. It involves searching a space of solutions for one expected to provide a better explanation of the data or to achieve higher rewards. But in many cases, there are multiple solutions which are equally good. An inductive bias allows a learning algorithm to prioritize one solution (or interpretation) over another, independent of the observed data. In machine learning, one aims to construct algorithms that are able to learn to predict a certain target output. To achieve this, the learning algorithm is presented some training examples that demonstrate the intended relation of input and output values. Then the learner is supposed to approximate the correct output, even for examples that have not been shown during training. Without any additional assumptions, this problem cannot be solved since unseen situations might have an arbitrary output value. The kind of necessary assumptions about the nature of the target function are subsumed in the phrase inductive bias. A classical example of an inductive bias is Occam's razor, assuming that the simplest consistent hypothesis about the target function is actually the best. Here consistent means that the hypothesis of the learner yields correct outputs for all of the examples that have been given to the algorithm. Approaches to a more formal definition of inductive bias are based on mathematical logic. Here, the inductive bias is a logical formula that, together with the training data, logically entails the hypothesis generated by the learner. However, this strict formalism fails in many practical cases, where the inductive bias can only be given as a rough description (e. g. in the case of artificial neural networks), or not at all.
Типы
Ниже приведен список распространенных индуктивных предубеждений в алгоритмах машинного обучения. Максимальная условная независимость: если гипотеза может быть представлена в байесовском фреймворке, стремитесь максимизировать условную независимость. Это предубеждение используется в классификаторе наивного Байеса. Минимизация ошибки перекрестной проверки: при выборе между гипотезами выбирайте гипотезу с наименьшей ошибкой перекрестной проверки. Хотя перекрестная проверка может казаться непредвзятой, теоремы "нет бесплатного обеда" показывают, что перекрестная проверка должна быть предвзятой, например, предполагая отсутствие информации, закодированной в порядке данных. Максимальный запас (margin): при построении границы между двумя классами стремитесь максимизировать ширину этой границы. Это предубеждение используется в машинах опорных векторов. Предполагается, что различные классы, как правило, разделены широкими границами. Минимальная длина описания: при формировании гипотезы стремитесь минимизировать длину описания гипотезы. Минимальное количество признаков: если нет веских доказательств полезности признака, его следует удалить. Это предположение лежит в основе алгоритмов отбора признаков. Ближайшие соседи: предполагается, что большинство объектов в небольшом окрестности в пространстве признаков принадлежат к одному классу. Для объекта, класс которого неизвестен, предполагайте, что он принадлежит к тому же классу, что и большинство в его ближайшей окрестности. Это предубеждение используется в алгоритме k ближайших соседей. Предполагается, что объекты, находящиеся рядом друг с другом, как правило, принадлежат к одному классу.
Сдвиг смещения
Хотя большинство алгоритмов обучения обладают фиксированной предвзятостью, некоторые алгоритмы разработаны так, чтобы изменять свою предвзятость по мере накопления данных. Это, однако, не устраняет предвзятость, поскольку сам процесс изменения предвзятости должен быть основан на некоторой предвзятости.