Введение
Оценочный показатель качества статистической модели
Информационный критерий Акаике (AIC) является оценочным показателем ошибки прогнозирования и, следовательно, относительного качества статистических моделей для заданного набора данных. При наличии нескольких моделей для данных, AIC оценивает качество каждой модели по сравнению с остальными. Таким образом, AIC предоставляет средство для выбора модели. AIC основан на теории информации. Когда статистическая модель используется для представления процесса, сгенерировавшего данные, это представление почти никогда не бывает точным; поэтому при использовании модели для представления процесса неизбежно теряется часть информации. AIC оценивает относительный объем потерянной информации для данной модели: чем меньше информации теряется, тем выше качество модели. При оценке объема потерянной информации, AIC учитывает компромисс между точностью подгонки модели и её простотой. Иными словами, AIC учитывает как риск переобучения, так и риск недообучения. Информационный критерий Акаике назван в честь японского статистика Хиротсугу Акаике, который его сформулировал. В настоящее время он является основой парадигмы в основаниях статистики и широко используется для статистического вывода.
The Akaike information criterion (AIC) is an estimator of prediction error and thereby relative quality of statistical models for a given set of data. Given a collection of models for the data, AIC estimates the quality of each model, relative to each of the other models. Thus, AIC provides a means for model selection. AIC is founded on information theory. When a statistical model is used to represent the process that generated the data, the representation will almost never be exact; so some information will be lost by using the model to represent the process. AIC estimates the relative amount of information lost by a given model: the less information a model loses, the higher the quality of that model. In estimating the amount of information lost by a model, AIC deals with the trade off between the goodness of fit of the model and the simplicity of the model. In other words, AIC deals with both the risk of overfitting and the risk of underfitting. The Akaike information criterion is named after the Japanese statistician Hirotsugu Akaike, who formulated it. It now forms the basis of a paradigm for the foundations of statistics and is also widely used for statistical inference.
Определение
Предположим, что у нас есть статистическая модель для каких-либо данных. Пусть k – количество оцениваемых параметров в модели. Пусть – максимальное значение функции правдоподобия для модели. Тогда значение AIC для модели определяется следующим образом. В качестве примера предположим, что есть три модели-кандидата со значениями AIC равными 100, 102 и 110. Тогда вторая модель в раз вероятнее первой модели в плане минимизации потери информации. Аналогично, третья модель в раз вероятнее первой модели в плане минимизации потери информации. В этом примере мы исключим третью модель из дальнейшего рассмотрения. У нас есть три варианта: (1) собрать больше данных, в надежде, что это позволит чётко различить первые две модели; (2) просто заключить, что данных недостаточно для выбора одной модели из первых двух; (3) взять взвешенное среднее первых двух моделей, с весами, пропорциональными 1 и 0,368 соответственно, и затем проводить статистический анализ на основе этой взвешенной мультимодели. Величина exp((AICmin − AICi)/2) известна как относительное правдоподобие модели i. Она тесно связана с отношением правдоподобия, используемым в тесте отношения правдоподобия. Действительно, если все модели в наборе кандидатов имеют одинаковое количество параметров, то использование AIC может на первый взгляд показаться очень похожим на использование теста отношения правдоподобия. Однако существуют важные различия. В частности, тест отношения правдоподобия валиден только для вложенных моделей, в то время как AIC (и AICc) не имеет таких ограничений.
Испытание гипотезы
Каждый статистический гипотетический тест может быть сформулирован как сравнение статистических моделей. Следовательно, каждый статистический гипотетический тест может быть воспроизведен с помощью AIC. Два примера кратко описаны в следующих подразделах. Подробности этих примеров, а также множество других примеров, приведены в работах и .
Репликация t-теста студента
В качестве примера теста гипотезы рассмотрим t-тест для сравнения средних значений двух нормально распределенных популяций. Входные данные для t-теста включают случайную выборку из каждой из двух популяций. Чтобы сформулировать тест как сравнение моделей, мы строим две различные модели. Первая модель рассматривает две популяции как имеющие потенциально разные средние значения и стандартные отклонения. Функция правдоподобия для первой модели, таким образом, является произведением правдоподобий для двух различных нормальных распределений; следовательно, она имеет четыре параметра: μ1, σ1, μ2, σ2. Для ясности, функция правдоподобия выглядит следующим образом (обозначая размеры выборок как n1 и n2). Вторая модель рассматривает две популяции как имеющие одинаковые средние значения, но потенциально разные стандартные отклонения. Функция правдоподобия для второй модели, таким образом, устанавливает в вышеуказанном уравнении; следовательно, она имеет три параметра. Затем мы максимизируем функции правдоподобия для обеих моделей (на практике мы максимизируем логарифмы функций правдоподобия); после этого легко вычислить значения AIC для моделей. Далее мы вычисляем относительное правдоподобие. Например, если вторая модель была в 0,01 раза менее вероятна, чем первая модель, то мы исключим вторую модель из дальнейшего рассмотрения: таким образом, мы придем к выводу, что две популяции имеют разные средние значения. t-тест предполагает, что две популяции имеют идентичные стандартные отклонения; тест становится ненадежным, если это предположение неверно и размеры двух выборок сильно различаются (в этом случае лучше использовать t-тест Уэлча). Сравнение средних значений популяций с помощью AIC, как в приведенном выше примере, имеет преимущество, поскольку не опирается на подобные предположения.
Сравнение категорических наборов данных
Для другого примера проверки гипотезы, предположим, что у нас есть две популяции, и каждый член каждой популяции относится к одной из двух категорий – категории #1 или категории #2. Каждая популяция имеет биномиальное распределение. Мы хотим узнать, одинаковы ли распределения этих двух популяций. Нам дана случайная выборка из каждой из двух популяций. Пусть *m* – размер выборки из первой популяции. Пусть *m₁* – количество наблюдений (в выборке) в категории #1; тогда количество наблюдений в категории #2 равно *m – m₁*. Аналогично, пусть *n* – размер выборки из второй популяции. Пусть *n₁* – количество наблюдений (в выборке) в категории #1. Пусть *p* – вероятность того, что случайно выбранный член первой популяции находится в категории #1. Следовательно, вероятность того, что случайно выбранный член первой популяции находится в категории #2, равна 1 – *p*. Обратите внимание, что распределение первой популяции имеет один параметр. Пусть *q* – вероятность того, что случайно выбранный член второй популяции находится в категории #1. Обратите внимание, что распределение второй популяции также имеет один параметр. Для сравнения распределений двух популяций мы строим две различные модели. Первая модель рассматривает две популяции как имеющие потенциально различные распределения. Функция правдоподобия для первой модели, таким образом, является произведением функций правдоподобия для двух различных биномиальных распределений; следовательно, она имеет два параметра: *p*, *q*. Для ясности, функция правдоподобия выглядит следующим образом. Вторая модель рассматривает две популяции как имеющие одинаковое распределение. Функция правдоподобия для второй модели, таким образом, устанавливает [значение] в приведенном выше уравнении; следовательно, вторая модель имеет один параметр. Затем мы максимизируем функции правдоподобия для двух моделей (на практике мы максимизируем логарифмы функций правдоподобия); после этого легко вычислить значения AIC для моделей. Далее мы вычисляем относительную вероятность. Например, если вторая модель была в 0,01 раза вероятнее первой модели, то мы исключим вторую модель из дальнейшего рассмотрения: таким образом, мы сделаем вывод, что две популяции имеют разные распределения.
Основы статистики
Статистический вывод обычно рассматривается как включающий проверку гипотез и оценивание. Проверка гипотез может быть выполнена с помощью AIC, как обсуждалось выше. Что касается оценивания, то существуют два типа: точечное оценивание и интервальное оценивание. Точечное оценивание может быть выполнено в рамках парадигмы AIC: оно обеспечивается методом максимального правдоподобия. Интервальное оценивание также может быть выполнено в рамках парадигмы AIC: оно предоставляется интервалами правдоподобия. Следовательно, статистический вывод в целом может быть выполнен в парадигме AIC. Наиболее часто используемыми парадигмами статистического вывода являются частотный вывод и байесовский вывод. Однако AIC может быть использован для статистического вывода, не опираясь ни на частотную парадигму, ни на байесовскую парадигму: поскольку AIC может быть интерпретирован без использования уровней значимости или априорных байесовских распределений. Иными словами, AIC может быть использован для создания основы статистики, отличной как от частотного подхода, так и от байесовского.
Изменение для небольшого размера выборки
Если размер выборки мал, существует существенная вероятность того, что AIC выберет модели с избыточным количеством параметров, то есть AIC допустит переобучение. Для решения этой потенциальной проблемы был разработан AICc: AICc представляет собой AIC с поправкой на малые размеры выборки. Формула для AICc зависит от статистической модели. Предполагая, что модель является унивариантной, линейной по своим параметрам и имеет нормально распределенные остатки (при условии регрессоров), формула для AICc имеет следующий вид. — где n обозначает размер выборки, а k — количество параметров. Таким образом, AICc по сути является AIC с дополнительным штрафом за количество параметров. Обратите внимание, что при n → ∞ дополнительный штраф сходится к 0, и, следовательно, AICc сходится к AIC. Если предположение о том, что модель является унивариантной и линейной с нормальными остатками, не выполняется, то формула для AICc обычно будет отличаться от приведенной выше. Для некоторых моделей формулу может быть сложно определить. Однако для каждой модели, для которой доступен AICc, формула для AICc задается как AIC плюс слагаемые, включающие как k, так и k². В отличие от этого, формула для AIC включает k, но не k². Другими словами, AIC является оценкой первого порядка (потери информации), в то время как AICc — оценкой второго порядка. Дальнейшее обсуждение формулы, с примерами других предположений, приводится в работах и . В частности, при других предположениях часто возможна оценка формулы методом бутстрэп. Подводя итог, можно сказать, что AICc имеет преимущество в том, что, как правило, более точен, чем AIC (особенно для малых выборок), но AICc также имеет недостаток: его вычисление иногда может быть значительно сложнее, чем вычисление AIC. Следует отметить, что если все модели-кандидаты имеют одинаковое k и одинаковую формулу для AICc, то AICc и AIC дадут идентичные (относительные) оценки; следовательно, использование AIC вместо AICc не будет невыгодным. Кроме того, если n во много раз больше k², то дополнительный штраф будет пренебрежимо мал; следовательно, недостаток использования AIC вместо AICc также будет пренебрежимо мал.
История
Критерий информации Акайке был сформулирован статистиком Хиротсугу Акайке. Первоначально он назывался «информационным критерием». Однако публикация 1973 года была лишь неофициальным изложением концепций. Первой формальной публикацией стала статья 1974 года, написанная Акайке, которая, по состоянию на lc=y, получила более 35 100 цитат в базе данных Web of Science и более 64 000 согласно Google Scholar. AIC стал настолько распространенным, что его часто используют, не ссылаясь на статью Акайке 1974 года; действительно, по состоянию на lc=y, существует около 289 000 научных статей и книг, использующих AIC (по оценкам Google Scholar). Первоначальный вывод AIC опирался на ряд сильных предположений. показал, что эти предположения можно существенно ослабить. Однако работа Такеучи была написана на японском языке и долгое время оставалась малоизвестной за пределами Японии. (Переведена в)
AICc был первоначально предложен для линейной регрессии (только) в That послужил началом работы в , и нескольких последующих публикаций тех же авторов, которые расширили области применения AICc. Первым общим изложением информационно-теоретического подхода стала книга, опубликованная в 1995 году. Она включает в себя англоязычное представление работы Такеучи. Эта книга привела к более широкому использованию AIC, и сейчас она насчитывает более 64 000 цитат в Google Scholar. Акаике назвал свой подход «принципом максимизации энтропии», поскольку он основан на концепции энтропии в теории информации. Действительно, минимизация AIC в статистической модели фактически эквивалентна максимизации энтропии в термодинамической системе; другими словами, информационно-теоретический подход в статистике по сути представляет собой применение второго закона термодинамики. Таким образом, AIC имеет корни в работах Людвига Больцмана по энтропии. Более подробную информацию об этих вопросах можно найти в и .
Преобразование данных
Все значения AIC для рассматриваемых моделей должны быть вычислены на одном и том же наборе данных. Однако, иногда может возникнуть необходимость сравнить модель зависимой переменной y с моделью логарифма зависимой переменной, log(y). В более общем случае, мы можем захотеть сравнить модель исходных данных с моделью преобразованных данных. Далее приводится пример того, как работать с преобразованиями данных (адаптировано из: "Исследователи должны убедиться, что все гипотезы моделируются с использованием одной и той же зависимой переменной"). Предположим, мы хотим сравнить две модели: одну с нормальным распределением для y и другую с нормальным распределением для log(y). Не следует напрямую сравнивать значения AIC этих двух моделей. Вместо этого, необходимо преобразовать нормальную кумулятивную функцию распределения, применив логарифм к y. Для этого требуется выполнить соответствующее интегрирование заменой переменной: таким образом, необходимо умножить на производную функции натурального логарифма, которая равна 1/y. Следовательно, преобразованное распределение имеет следующую функцию плотности вероятности:
— что является функцией плотности вероятности для логнормального распределения. Затем мы сравниваем значение AIC нормальной модели со значением AIC логнормальной модели. Для моделей с неправильной спецификацией, критерий информации Такеути (TIC) может оказаться более подходящим. Однако TIC часто страдает от нестабильности, вызванной ошибками оценки.
Сравнение с другими методами выбора модели
Критическое различие между AIC и BIC (и их вариантами) заключается в их асимптотических свойствах при правильно и неправильно специфицированных классах моделей. Их фундаментальные различия хорошо изучены в задачах выбора переменных в регрессии и выбора порядка авторегрессии. В общем случае, если цель – прогнозирование, предпочтительны AIC и кросс-валидация методом "оставь один". Если цель – выбор модели, статистический вывод или интерпретация, предпочтительны BIC или кросс-валидация с исключением нескольких объектов. Всесторонний обзор AIC и других популярных методов выбора моделей представлен в работе Ding et al. (2018).
Сравнение с перекрестной проверкой
Перекрестная проверка по методу "оставь один" асимптотически эквивалентна AIC для обычных моделей линейной регрессии. Асимптотическая эквивалентность AIC также справедлива для моделей со смешанными эффектами.
Сравнение с Cp Маллоуса
Cp Маллоуса эквивалентен AIC в случае (гауссовой) линейной регрессии.