Введение
Задача выбора статистической модели из набора кандидатов в модели
Выбор модели – это задача выбора одной модели из нескольких кандидатов на основе критерия оценки, чтобы выбрать наилучшую. В контексте машинного обучения и, в более общем смысле, статистического анализа, это может быть выбор статистической модели из набора кандидатов, учитывая имеющиеся данные. В простейших случаях рассматривается заранее существующий набор данных. Однако задача может также включать в себя проектирование экспериментов таким образом, чтобы собранные данные наилучшим образом подходили для решения проблемы выбора модели. Если у кандидатов-моделей схожая прогностическая или объясняющая способность, то наиболее простая модель, скорее всего, будет оптимальным выбором (принцип бритвы Оккама). Утверждается, что "большинство задач статистического вывода можно рассматривать как задачи, связанные со статистическим моделированием". В этой связи отмечается, что "то, как осуществляется перевод из предметной области в статистическую модель, зачастую является наиболее критичной частью анализа". Выбор модели может также относиться к задаче выбора нескольких репрезентативных моделей из большого набора вычислительных моделей для принятия решений или оптимизации в условиях неопределенности. В машинном обучении алгоритмические подходы к выбору модели включают отбор признаков, оптимизацию гиперпараметров и теорию статистического обучения.
Введение
В своих самых основных формах выбор моделей является одной из фундаментальных задач научного исследования. Определение принципа, объясняющего ряд наблюдений, часто напрямую связано с математической моделью, предсказывающей эти наблюдения. Например, когда Галилей проводил свои эксперименты с наклонной плоскостью, он продемонстрировал, что движение шаров соответствовало параболе, предсказанной его моделью. Из бесчисленного множества возможных механизмов и процессов, которые могли бы породить данные, как вообще можно приступить к выбору наилучшей модели? Обычно используемый математический подход позволяет выбрать из набора моделей-кандидатов; этот набор должен быть выбран исследователем. Часто, по крайней мере, на начальном этапе, используются простые модели, такие как полиномы. Авторы последовательно подчеркивают в своей книге важность выбора моделей, основанных на обоснованных научных принципах, таких как понимание феноменологических процессов или механизмов (например, химических реакций), лежащих в основе данных. После выбора набора моделей-кандидатов статистический анализ позволяет выбрать лучшую из них. Что подразумевается под "лучшей" – вопрос спорный. Хорошая методика выбора модели будет балансировать между качеством соответствия и простотой. Более сложные модели смогут лучше подстраивать свою форму под данные (например, полином пятой степени может точно соответствовать шести точкам), но дополнительные параметры могут не представлять никакой полезной информации. (Возможно, эти шесть точек на самом деле просто случайно распределены вокруг прямой.) Качество соответствия обычно определяется с использованием подхода отношения правдоподобия или его приближения, что приводит к хи-квадрат тесту. Сложность обычно измеряется подсчетом количества параметров в модели. Методы выбора модели можно рассматривать как оценщики некоторой физической величины, например, вероятности того, что модель породит данные. Смещение и дисперсия являются важными показателями качества этого оценщика; эффективность также часто учитывается. Стандартным примером выбора модели является подгонка кривой, когда, имея набор точек и другие фоновые знания (например, точки являются результатом независимых и одинаково распределенных выборок), необходимо выбрать кривую, описывающую функцию, которая сгенерировала эти точки.
Of the countless number of possible mechanisms and processes that could have produced the data, how can one even begin to choose the best model? The mathematical approach commonly taken decides among a set of candidate models; this set must be chosen by the researcher. Often simple models such as polynomials are used, at least initially emphasize throughout their book the importance of choosing models based on sound scientific principles, such as understanding of the phenomenological processes or mechanisms (e. g., chemical reactions) underlying the data. Once the set of candidate models has been chosen, the statistical analysis allows us to select the best of these models. What is meant by best is controversial. A good model selection technique will balance goodness of fit with simplicity. More complex models will be better able to adapt their shape to fit the data (for example, a fifth order polynomial can exactly fit six points), but the additional parameters may not represent anything useful. (Perhaps those six points are really just randomly distributed about a straight line.) Goodness of fit is generally determined using a likelihood ratio approach, or an approximation of this, leading to a chi squared test. The complexity is generally measured by counting the number of parameters in the model. Model selection techniques can be considered as estimators of some physical quantity, such as the probability of the model producing the given data. The bias and variance are both important measures of the quality of this estimator; efficiency is also often considered. A standard example of model selection is that of curve fitting, where, given a set of points and other background knowledge (e. g. points are a result of i. i. d. samples), we must select a curve that describes the function that generated the points.
Два направления выбора модели
Существуют две основные цели при анализе и обучении на данных. Одна из них – научное открытие, также известное как статистический вывод, понимание лежащего в основе механизма генерации данных и интерпретация природы этих данных. Другая цель обучения на данных – предсказание будущих или неизвестных наблюдений, также называемое статистическим прогнозированием. Во второй цели специалист по данным не обязательно стремится к точному вероятностному описанию данных. Разумеется, может быть интерес и к обоим направлениям. В соответствии с этими двумя различными целями, выбор модели также может быть направлен двумя способами: выбор модели для вывода и выбор модели для прогнозирования. Первое направление – определить наилучшую модель для данных, которая, желательно, обеспечит надежную характеристику источников неопределенности для научной интерпретации. Для достижения этой цели особенно важно, чтобы выбранная модель не была чрезмерно чувствительна к объему выборки. Соответственно, подходящим критерием оценки выбора модели является согласованность выбора, то есть наиболее устойчивый кандидат будет последовательно выбираться при достаточно большом количестве данных. Второе направление – выбрать модель, которая обеспечит отличную прогностическую способность. Однако в этом случае выбранная модель может оказаться лишь счастливым победителем среди нескольких близких конкурентов, при этом прогностическая способность все равно может быть максимально возможной. Если это так, то выбор модели вполне оправдан для второй цели (прогнозирования), но использование выбранной модели для получения новых знаний и интерпретации может быть крайне ненадежным и вводить в заблуждение.