Введение

Тип математической модели

Статистическая модель — это математическая модель, воплощающая набор статистических предположений относительно процесса генерации выборочных данных (и аналогичных данных из генеральной совокупности). Статистическая модель представляет, часто в значительной степени идеализированным образом, процесс, порождающий данные. Применительно к вероятностям, соответствующим термином является вероятностная модель. Все статистические проверки гипотез и все статистические оценки выводятся на основе статистических моделей. В более широком смысле, статистические модели составляют основу статистического вывода. Статистическая модель обычно задается как математическая зависимость между одной или несколькими случайными переменными и другими детерминированными переменными. Таким образом, статистическая модель является «формальным представлением теории» (Герман Адер, цитирующий Кеннета Боллена).

Введение

Неформально, статистическая модель может рассматриваться как статистическое предположение (или набор статистических предположений), обладающее определенным свойством: это предположение позволяет нам вычислить вероятность любого события. В качестве примера рассмотрим пару обычных шестигранных игральных костей. Мы изучим два различных статистических предположения относительно этих костей. Первое статистическое предположение состоит в следующем: для каждой из костей вероятность выпадения любой грани (1, 2, 3, 4, 5 и 6) одинакова. Исходя из этого предположения, мы можем вычислить вероятность того, что на обеих костях выпадет 5. В более общем случае, мы можем вычислить вероятность любого события, например, (1 и 2), (3 и 3) или (5 и 6). Альтернативное статистическое предположение таково: для каждой из костей вероятность выпадения грани 5 равна (поскольку кости несбалансированы). Исходя из этого предположения, мы можем вычислить вероятность того, что на обеих костях выпадет 5. Однако мы не можем вычислить вероятность какого-либо другого нетривиального события, поскольку вероятности выпадения других граней неизвестны. Первое статистическое предположение является статистической моделью, поскольку, располагая только этим предположением, мы можем вычислить вероятность любого события. Альтернативное статистическое предположение не является статистической моделью, поскольку, располагая только этим предположением, мы не можем вычислить вероятность каждого события. В приведенном выше примере, с первым предположением, вычисление вероятности события легко. Однако в некоторых других случаях вычисление может быть сложным или даже непрактичным (например, для этого могут потребоваться миллионы лет вычислений). Для того чтобы предположение являлось статистической моделью, такая сложность допустима: выполнение вычисления не обязательно должно быть практически осуществимым, достаточно, чтобы оно было теоретически возможным.

Размер модели

Предположим, что у нас есть статистическая модель с обозначением In, мы запишем, что где k – положительное целое число (обозначает действительные числа; в принципе могут использоваться другие множества). Здесь k называется размерностью модели. Модель называется параметрической, если она имеет конечную размерность. В качестве примера, если мы предположим, что данные возникают из одномерного гауссовского распределения, то мы предполагаем, что в этом примере размерность k равна 2. В качестве другого примера предположим, что данные состоят из точек (x, y), которые, как мы предполагаем, распределены по прямой с независимыми и одинаково распределенными (i.i.d.) гауссовскими остатками (с нулевым средним): это приводит к той же статистической модели, что и в примере с ростом детей. Размерность статистической модели равна 3: пересечение прямой, наклон прямой и дисперсия распределения остатков. (Обратите внимание, что множество всех возможных прямых имеет размерность 2, хотя геометрически прямая имеет размерность 1.) Хотя формально это один параметр, имеющий размерность k, иногда его рассматривают как состоящий из k отдельных параметров. Например, при одномерном гауссовском распределении это формально один параметр с размерностью 2, но часто рассматривается как состоящий из 2 отдельных параметров – среднего значения и стандартного отклонения. Статистическая модель является непараметрической, если множество параметров имеет бесконечную размерность. Статистическая модель является полупараметрической, если она имеет как параметры конечной, так и бесконечной размерности. Формально, если k – размерность и n – количество наблюдений, то полупараметрические и непараметрические модели имеют как , так и . Если при , то модель полупараметрическая; в противном случае модель непараметрическая. Параметрические модели являются наиболее часто используемыми статистическими моделями. Что касается полупараметрических и непараметрических моделей, сэр Дэвид Кокс сказал: "Они обычно включают меньше предположений о структуре и форме распределения, но обычно содержат сильные предположения о независимости".

Сравнительные модели

Сравнение статистических моделей является фундаментальным для значительной части статистического вывода. Можно утверждать: "Большинство задач статистического вывода можно рассматривать как задачи, связанные со статистическим моделированием. Как правило, они формулируются как сравнение нескольких статистических моделей". Распространенные критерии для сравнения моделей включают: R², фактор Байеса, информационный критерий Акаике и тест отношения правдоподобия вместе с его обобщением – относительное правдоподобие. Альтернативным способом сравнения двух статистических моделей является понятие дефицита, предложенное Люсьеном Ле Камом.