Введение

Класс статистических моделей

В статистике обобщенная линейная модель (GLM) представляет собой гибкое обобщение обычной линейной регрессии. GLM обобщает линейную регрессию, позволяя связать линейную модель с переменной отклика посредством линко-функции и позволяя величине дисперсии каждого измерения зависеть от его предсказанного значения. Обобщенные линейные модели были сформулированы Джоном Нельдером и Робертом Уэддерберном как способ унификации различных других статистических моделей, включая линейную регрессию, логистическую регрессию и регрессию Пуассона. Они предложили метод наименьших квадратов с итеративным перевесом для оценки максимального правдоподобия (MLE) параметров модели. MLE остается популярным и является методом по умолчанию во многих статистических вычислительных пакетах. Были разработаны и другие подходы, включая байесовскую регрессию и метод наименьших квадратов для стабилизированных по дисперсии откликов.

Интуиция

Обычная линейная регрессия предсказывает ожидаемое значение данной неизвестной величины (переменной отклика, случайной переменной) как линейную комбинацию набора наблюдаемых значений (предикторов). Это означает, что постоянное изменение предиктора приводит к постоянному изменению переменной отклика (т. е. линейной модели отклика). Это уместно, когда переменная отклика может изменяться, с хорошим приближением, неограниченно в любом направлении, или, в более общем смысле, для любой величины, которая изменяется лишь относительно незначительно по сравнению с изменением предикторных переменных, например, человеческого роста. Однако эти предположения не подходят для некоторых типов переменных отклика. Например, в случаях, когда переменная отклика, как ожидается, всегда будет положительной и изменяться в широком диапазоне, постоянные изменения входных данных приводят к геометрически (т. е. экспоненциально) изменяющимся, а не постоянно изменяющимся изменениям выходных данных. В качестве примера, предположим, линейная модель прогнозирования обучается на некоторых данных (возможно, полученных преимущественно с больших пляжей), что снижение температуры на 10 градусов приведет к уменьшению числа посетителей пляжа на 1000 человек. Эта модель вряд ли будет хорошо обобщаться на пляжи разных размеров. Более конкретно, проблема в том, что если использовать эту модель для прогнозирования новой посещаемости при снижении температуры на 10 градусов для пляжа, который обычно принимает 50 посетителей, то будет предсказано невозможное значение посещаемости –950. Логичнее, что более реалистичная модель вместо этого предскажет постоянный темп увеличения посещаемости пляжа (например, увеличение на 10 градусов приводит к удвоению посещаемости пляжа, а снижение на 10 градусов – к уменьшению вдвое). Такая модель называется экспоненциальной моделью отклика (или логарифмически линейной моделью, поскольку логарифм отклика, как предполагается, изменяется линейно). Аналогично, модель, которая предсказывает вероятность выбора "да" или "нет" (переменная Бернулли), еще менее подходит в качестве модели линейного отклика, поскольку вероятности ограничены с обеих сторон (они должны быть между 0 и 1). Представьте, например, модель, которая предсказывает вероятность того, что конкретный человек пойдет на пляж, в зависимости от температуры. Разумная модель может предсказать, например, что изменение температуры на 10 градусов делает человека в два раза более или менее склонным пойти на пляж. Но что означает "в два раза более вероятно" с точки зрения вероятности? Это не может буквально означать удвоение значения вероятности (например, 50% становится 100%, 75% становится 150% и т. д.). Скорее, удваиваются шансы: от шансов 2:1 до шансов 4:1, затем до шансов 8:1 и так далее. Такая модель является моделью логарифма шансов или логистической моделью. Обобщенные линейные модели охватывают все эти ситуации, позволяя использовать переменные отклика с произвольным распределением (а не только нормальным распределением) и произвольную функцию переменной отклика (функцию связи), которая изменяется линейно с предикторами (а не предполагая, что сам отклик должен изменяться линейно). Например, вышеупомянутый случай с прогнозируемым числом посетителей пляжа обычно моделируется с использованием распределения Пуассона и логарифмической связи, в то время как случай с прогнозируемой вероятностью посещения пляжа обычно моделируется с использованием распределения Бернулли (или биномиального распределения, в зависимости от конкретной формулировки задачи) и функции логарифма шансов (или логит) связи.

Линейный предсказатель

Линейный предиктор – это величина, которая включает в модель информацию о независимых переменных. Символ η (греческая "эта") обозначает линейный предиктор. Он связан с математическим ожиданием данных посредством связующей функции. η выражается в виде линейных комбинаций (отсюда и название "линейный") неизвестных параметров β. Коэффициенты в этой линейной комбинации представлены матрицей независимых переменных X. Таким образом, η можно выразить как:

Функция ссылки

Функция связи обеспечивает связь между линейным предиктором и математическим ожиданием функции распределения. Существует множество часто используемых функций связи, и их выбор определяется несколькими соображениями. Всегда существует чётко определённая каноническая функция связи, которая выводится из экспоненты плотности вероятности отклика. Однако в некоторых случаях имеет смысл попытаться сопоставить область определения функции связи с областью значений математического ожидания функции распределения или использовать неканоническую функцию связи в алгоритмических целях, например, в байесовской пробит-регрессии. При использовании функции распределения с каноническим параметром каноническая функция связи – это функция, выражающая через , то есть . Для наиболее распространённых распределений математическое ожидание является одним из параметров в стандартной форме плотности вероятности распределения, а затем функция, как определено выше, отображает функцию плотности в её каноническую форму. При использовании канонической функции связи, что позволяет быть достаточной статистикой для .

Ниже приведена таблица нескольких распределений из экспоненциального семейства, которые часто используются, а также данные, для которых они обычно применяются, наряду с каноническими функциями связи и их обратными (иногда называемыми функциями математического ожидания, как это сделано здесь). + Распространённые распределения с типичными областями применения и каноническими функциями связи

| Распределение | Область определения распределения | Типичные области применения | Название функции связи | Функция связи, | Функция математического ожидания |
|---|---|---|---|---|---|
| Нормальное | Действительные числа: | Линейные данные отклика | Функция идентичности | | |
| Экспоненциальное | Действительные числа: | Экспоненциальные данные отклика, параметры масштаба | Отрицательная обратная | | |
| Гамма | Действительные числа: | | Обратная гауссова | | |
| Пуассона | Целые числа: | Количество событий за фиксированный промежуток времени/пространства | Логарифмическая | | |
| Бернулли | Целые числа: | Результат единичного события "да/нет" | Логит | | |
| Биномиальное | Целые числа: | Количество событий "да" из N событий "да/нет" | | | |
| Категориальное | Целые числа: | Результат единичного события из K вариантов | | | |
| Мультиномиальное | K-вектор целых чисел: | Количество событий различных типов (1, …, K) из N событий из K вариантов | | | |

В случаях экспоненциального и гамма-распределений область определения канонической функции связи не совпадает с допустимым диапазоном математического ожидания. В частности, линейный предиктор может быть положительным, что приведёт к невозможному отрицательному математическому ожиданию. При максимизации правдоподобия необходимо принимать меры предосторожности, чтобы избежать этого. Альтернативным решением является использование неканонической функции связи. В случаях распределений Бернулли, биномиального, категориального и мультиномиального, область определения распределений не соответствует типу данных прогнозируемого параметра. Во всех этих случаях прогнозируемый параметр представляет собой одну или несколько вероятностей, то есть действительные числа в диапазоне [0, 1]. Полученная модель известна как логистическая регрессия (или многочленная логистическая регрессия в случае прогнозирования K-значных, а не бинарных значений). Для распределений Бернулли и биномиального параметр представляет собой одну вероятность, указывающую на вероятность возникновения единичного события. Распределение Бернулли по-прежнему удовлетворяет основному условию обобщённой линейной модели, поскольку, даже если один исход всегда будет либо 0, либо 1, математическое ожидание всё равно будет представлять собой действительное значение вероятности, то есть вероятность возникновения исхода "да" (или 1). Аналогично, в биномиальном распределении математическое ожидание равно Np, то есть ожидаемая доля исходов "да" будет представлять собой прогнозируемую вероятность. Для категориальных и мультиномиальных распределений параметром, который необходимо спрогнозировать, является K-вектор вероятностей, с дополнительным ограничением, что сумма всех вероятностей должна равняться 1. Каждая вероятность указывает на вероятность возникновения одного из K возможных значений. Для мультиномиального распределения и для векторной формы категориального распределения математические ожидания элементов вектора связаны с прогнозируемыми вероятностями аналогично биномиальному и распределению Бернулли.

Байесовские методы

В общем случае, апостериорное распределение нельзя получить в аналитическом виде и поэтому его необходимо аппроксимировать, как правило, с помощью приближений Лапласа или какого-либо метода Монте-Карло на основе цепей Маркова, например, выборки Гиббса.

Общие линейные модели

Возможный источник путаницы связан с разграничением обобщенных линейных моделей и общих линейных моделей – двух широких классов статистических моделей. Один из создателей, Джон Нельдер, выразил сожаление по поводу использованной терминологии. Общую линейную модель можно рассматривать как частный случай обобщенной линейной модели с идентичной функцией связи и нормально распределенными откликами. Поскольку большинство точных результатов, представляющих интерес, получены только для общей линейной модели, ее историческое развитие было несколько более продолжительным. Результаты для обобщенной линейной модели с функцией связи, отличной от идентичной, являются асимптотическими (то есть хорошо работают при больших объемах выборки).

Линейная регрессия

Простым, очень важным примером обобщенной линейной модели (а также примером общей линейной модели) является линейная регрессия. В линейной регрессии использование метода наименьших квадратов обосновывается теоремой Гаусса — Маркова, которая не требует предположения о нормальности распределения. Однако, с точки зрения обобщенных линейных моделей, полезно считать, что функция распределения является нормальным распределением с постоянной дисперсией, а функция связи — тождественной, которая является канонической связью, если дисперсия известна. При этих предположениях метод наименьших квадратов получается как оценка максимального правдоподобия. Для нормального распределения обобщенная линейная модель имеет аналитическое выражение для оценок максимального правдоподобия, что является удобным. Большинство других обобщенных линейных моделей не имеют аналитических оценок.

Бинарные данные

Когда данные отклика, Y, являются бинарными (принимая только значения 0 и 1), функция распределения обычно выбирается распределением Бернулли, и в этом случае μi интерпретируется как вероятность p того, что Yi примет значение 1. Существует несколько популярных связующих функций для биномиальных распределений.

Функция пробит-ссылки как популярный выбор обратной кумулятивной функции распределения

В качестве альтернативы, для связи можно использовать обратную любую непрерывную кумулятивную функцию распределения (CDF), поскольку диапазон CDF совпадает с диапазоном среднего биномиального распределения. Нормальная CDF – популярный выбор, приводящий к модели пробита. Причина использования модели пробита заключается в том, что постоянное масштабирование входной переменной для нормальной CDF (которое можно учесть эквивалентным масштабированием всех параметров) дает функцию, практически идентичную функции логита, однако модели пробита в некоторых ситуациях проще в обработке, чем модели логита. (В байесовском подходе, где на параметры накладываются априорные нормальные распределения, связь между этими априорными нормальными распределениями и функцией связи на основе нормальной CDF означает, что модель пробита можно вычислить с помощью выборки Гиббса, в то время как для модели логита это, как правило, невозможно.)

Ссылка на идентификацию

Идентическая функция связи g(p) = p также иногда используется для биномиальных данных, что приводит к линейной модели вероятности. Однако идентическая функция связи может предсказывать бессмысленные "вероятности", меньшие нуля или большие единицы. Этого можно избежать, используя преобразование, такое как cloglog, probit или logit (или любую обратную кумулятивную функцию распределения). Главное достоинство идентической функции связи заключается в том, что она может быть оценена с помощью линейных методов, а другие стандартные функции связи являются приблизительно линейными в окрестности p = 0,5, совпадая с идентической функцией связи.

Многочленная регрессия

Биномиальный случай можно легко расширить для работы с многочленной распределением в качестве отклика (а также как обобщенная линейная модель для счетных данных с фиксированной общей суммой). Обычно это делается двумя способами:

Коррелированные или кластеризованные данные

Стандартная GLM предполагает, что наблюдения некоррелированы. Были разработаны расширения, позволяющие учитывать корреляцию между наблюдениями, как, например, в лонгитюдных исследованиях и кластерных дизайнах: обобщенные уравнения оценки (GEE) позволяют учитывать корреляцию между наблюдениями без использования явной вероятностной модели для объяснения происхождения корреляций, поэтому явная функция правдоподобия не требуется. Они подходят, когда случайные эффекты и их дисперсии не представляют непосредственного интереса, поскольку они позволяют учесть корреляцию, не объясняя ее источник. Основное внимание уделяется оценке среднего отклика в популяции («эффекты, усредненные по популяции»), а не регрессионным параметрам, которые позволили бы предсказать эффект изменения одного или нескольких компонентов X для конкретного индивида. ГЭЭ обычно используются в сочетании со стандартными ошибками Хабера-Уайта. Обобщенные линейные смешанные модели (GLMM) являются расширением GLM, включающим случайные эффекты в линейный предиктор, что дает явную вероятностную модель, объясняющую происхождение корреляций. Получаемые оценки параметров, «специфичные для субъекта», подходят, когда основное внимание уделяется оценке эффекта изменения одного или нескольких компонентов X для конкретного индивида. GLMM также называют многоуровневыми моделями и смешанными моделями. В целом, подгонка GLMM более сложна и требует больших вычислительных ресурсов, чем подгонка ГЭЭ.