Введение
Класс статистических моделей
В статистике обобщенная линейная модель (GLM) представляет собой гибкое обобщение обычной линейной регрессии. GLM обобщает линейную регрессию, позволяя связать линейную модель с переменной отклика посредством линко-функции и позволяя величине дисперсии каждого измерения зависеть от его предсказанного значения. Обобщенные линейные модели были сформулированы Джоном Нельдером и Робертом Уэддерберном как способ унификации различных других статистических моделей, включая линейную регрессию, логистическую регрессию и регрессию Пуассона. Они предложили метод наименьших квадратов с итеративным перевесом для оценки максимального правдоподобия (MLE) параметров модели. MLE остается популярным и является методом по умолчанию во многих статистических вычислительных пакетах. Были разработаны и другие подходы, включая байесовскую регрессию и метод наименьших квадратов для стабилизированных по дисперсии откликов.
Интуиция
Обычная линейная регрессия предсказывает ожидаемое значение данной неизвестной величины (переменной отклика, случайной переменной) как линейную комбинацию набора наблюдаемых значений (предикторов). Это означает, что постоянное изменение предиктора приводит к постоянному изменению переменной отклика (т. е. линейной модели отклика). Это уместно, когда переменная отклика может изменяться, с хорошим приближением, неограниченно в любом направлении, или, в более общем смысле, для любой величины, которая изменяется лишь относительно незначительно по сравнению с изменением предикторных переменных, например, человеческого роста. Однако эти предположения не подходят для некоторых типов переменных отклика. Например, в случаях, когда переменная отклика, как ожидается, всегда будет положительной и изменяться в широком диапазоне, постоянные изменения входных данных приводят к геометрически (т. е. экспоненциально) изменяющимся, а не постоянно изменяющимся изменениям выходных данных. В качестве примера, предположим, линейная модель прогнозирования обучается на некоторых данных (возможно, полученных преимущественно с больших пляжей), что снижение температуры на 10 градусов приведет к уменьшению числа посетителей пляжа на 1000 человек. Эта модель вряд ли будет хорошо обобщаться на пляжи разных размеров. Более конкретно, проблема в том, что если использовать эту модель для прогнозирования новой посещаемости при снижении температуры на 10 градусов для пляжа, который обычно принимает 50 посетителей, то будет предсказано невозможное значение посещаемости –950. Логичнее, что более реалистичная модель вместо этого предскажет постоянный темп увеличения посещаемости пляжа (например, увеличение на 10 градусов приводит к удвоению посещаемости пляжа, а снижение на 10 градусов – к уменьшению вдвое). Такая модель называется экспоненциальной моделью отклика (или логарифмически линейной моделью, поскольку логарифм отклика, как предполагается, изменяется линейно). Аналогично, модель, которая предсказывает вероятность выбора "да" или "нет" (переменная Бернулли), еще менее подходит в качестве модели линейного отклика, поскольку вероятности ограничены с обеих сторон (они должны быть между 0 и 1). Представьте, например, модель, которая предсказывает вероятность того, что конкретный человек пойдет на пляж, в зависимости от температуры. Разумная модель может предсказать, например, что изменение температуры на 10 градусов делает человека в два раза более или менее склонным пойти на пляж. Но что означает "в два раза более вероятно" с точки зрения вероятности? Это не может буквально означать удвоение значения вероятности (например, 50% становится 100%, 75% становится 150% и т. д.). Скорее, удваиваются шансы: от шансов 2:1 до шансов 4:1, затем до шансов 8:1 и так далее. Такая модель является моделью логарифма шансов или логистической моделью. Обобщенные линейные модели охватывают все эти ситуации, позволяя использовать переменные отклика с произвольным распределением (а не только нормальным распределением) и произвольную функцию переменной отклика (функцию связи), которая изменяется линейно с предикторами (а не предполагая, что сам отклик должен изменяться линейно). Например, вышеупомянутый случай с прогнозируемым числом посетителей пляжа обычно моделируется с использованием распределения Пуассона и логарифмической связи, в то время как случай с прогнозируемой вероятностью посещения пляжа обычно моделируется с использованием распределения Бернулли (или биномиального распределения, в зависимости от конкретной формулировки задачи) и функции логарифма шансов (или логит) связи.
Линейный предсказатель
Линейный предиктор – это величина, которая включает в модель информацию о независимых переменных. Символ η (греческая "эта") обозначает линейный предиктор. Он связан с математическим ожиданием данных посредством связующей функции. η выражается в виде линейных комбинаций (отсюда и название "линейный") неизвестных параметров β. Коэффициенты в этой линейной комбинации представлены матрицей независимых переменных X. Таким образом, η можно выразить как:
Функция ссылки
Функция связи обеспечивает связь между линейным предиктором и математическим ожиданием функции распределения. Существует множество часто используемых функций связи, и их выбор определяется несколькими соображениями. Всегда существует чётко определённая каноническая функция связи, которая выводится из экспоненты плотности вероятности отклика. Однако в некоторых случаях имеет смысл попытаться сопоставить область определения функции связи с областью значений математического ожидания функции распределения или использовать неканоническую функцию связи в алгоритмических целях, например, в байесовской пробит-регрессии. При использовании функции распределения с каноническим параметром каноническая функция связи – это функция, выражающая через , то есть . Для наиболее распространённых распределений математическое ожидание является одним из параметров в стандартной форме плотности вероятности распределения, а затем функция, как определено выше, отображает функцию плотности в её каноническую форму. При использовании канонической функции связи, что позволяет быть достаточной статистикой для .
Following is a table of several exponential family distributions in common use and the data they are typically used for, along with the canonical link functions and their inverses (sometimes referred to as the mean function, as done here). + Common distributions with typical uses and canonical link functions Distribution Support of distribution Typical uses Link name Link function, Mean function Normal real: Linear response data Identity Exponential real: Exponential response data, scale parameters Negative inverse Gamma Inverse Gaussian real: Inverse squared Poisson integer: count of occurrences in fixed amount of time/space Log Bernoulli integer: outcome of single yes/no occurrence Logit Binomial integer: count of # of "yes" occurrences out of N yes/no occurrences Categorical integer: outcome of single K way occurrence K vector of integer: , where exactly one element in the vector has the value 1 Multinomial K vector of integer: count of occurrences of different types (1, , K) out of N total K way occurrences
In the cases of the exponential and gamma distributions, the domain of the canonical link function is not the same as the permitted range of the mean. In particular, the linear predictor may be positive, which would give an impossible negative mean. When maximizing the likelihood, precautions must be taken to avoid this. An alternative is to use a noncanonical link function. In the case of the Bernoulli, binomial, categorical and multinomial distributions, the support of the distributions is not the same type of data as the parameter being predicted. In all of these cases, the predicted parameter is one or more probabilities, i. e. real numbers in the range The resulting model is known as logistic regression (or multinomial logistic regression in the case that K way rather than binary values are being predicted). For the Bernoulli and binomial distributions, the parameter is a single probability, indicating the likelihood of occurrence of a single event. The Bernoulli still satisfies the basic condition of the generalized linear model in that, even though a single outcome will always be either 0 or 1, the expected value will nonetheless be a real valued probability, i. e. the probability of occurrence of a "yes" (or 1) outcome. Similarly, in a binomial distribution, the expected value is Np, i. e. the expected proportion of "yes" outcomes will be the probability to be predicted. For categorical and multinomial distributions, the parameter to be predicted is a K vector of probabilities, with the further restriction that all probabilities must add up to 1. Each probability indicates the likelihood of occurrence of one of the K possible values. For the multinomial distribution, and for the vector form of the categorical distribution, the expected values of the elements of the vector can be related to the predicted probabilities similarly to the binomial and Bernoulli distributions.
Ниже приведена таблица нескольких распределений из экспоненциального семейства, которые часто используются, а также данные, для которых они обычно применяются, наряду с каноническими функциями связи и их обратными (иногда называемыми функциями математического ожидания, как это сделано здесь). + Распространённые распределения с типичными областями применения и каноническими функциями связи
Following is a table of several exponential family distributions in common use and the data they are typically used for, along with the canonical link functions and their inverses (sometimes referred to as the mean function, as done here). + Common distributions with typical uses and canonical link functions Distribution Support of distribution Typical uses Link name Link function, Mean function Normal real: Linear response data Identity Exponential real: Exponential response data, scale parameters Negative inverse Gamma Inverse Gaussian real: Inverse squared Poisson integer: count of occurrences in fixed amount of time/space Log Bernoulli integer: outcome of single yes/no occurrence Logit Binomial integer: count of # of "yes" occurrences out of N yes/no occurrences Categorical integer: outcome of single K way occurrence K vector of integer: , where exactly one element in the vector has the value 1 Multinomial K vector of integer: count of occurrences of different types (1, , K) out of N total K way occurrences
In the cases of the exponential and gamma distributions, the domain of the canonical link function is not the same as the permitted range of the mean. In particular, the linear predictor may be positive, which would give an impossible negative mean. When maximizing the likelihood, precautions must be taken to avoid this. An alternative is to use a noncanonical link function. In the case of the Bernoulli, binomial, categorical and multinomial distributions, the support of the distributions is not the same type of data as the parameter being predicted. In all of these cases, the predicted parameter is one or more probabilities, i. e. real numbers in the range The resulting model is known as logistic regression (or multinomial logistic regression in the case that K way rather than binary values are being predicted). For the Bernoulli and binomial distributions, the parameter is a single probability, indicating the likelihood of occurrence of a single event. The Bernoulli still satisfies the basic condition of the generalized linear model in that, even though a single outcome will always be either 0 or 1, the expected value will nonetheless be a real valued probability, i. e. the probability of occurrence of a "yes" (or 1) outcome. Similarly, in a binomial distribution, the expected value is Np, i. e. the expected proportion of "yes" outcomes will be the probability to be predicted. For categorical and multinomial distributions, the parameter to be predicted is a K vector of probabilities, with the further restriction that all probabilities must add up to 1. Each probability indicates the likelihood of occurrence of one of the K possible values. For the multinomial distribution, and for the vector form of the categorical distribution, the expected values of the elements of the vector can be related to the predicted probabilities similarly to the binomial and Bernoulli distributions.
| Распределение | Область определения распределения | Типичные области применения | Название функции связи | Функция связи, | Функция математического ожидания |
|---|---|---|---|---|---|
| Нормальное | Действительные числа: | Линейные данные отклика | Функция идентичности | | |
| Экспоненциальное | Действительные числа: | Экспоненциальные данные отклика, параметры масштаба | Отрицательная обратная | | |
| Гамма | Действительные числа: | | Обратная гауссова | | |
| Пуассона | Целые числа: | Количество событий за фиксированный промежуток времени/пространства | Логарифмическая | | |
| Бернулли | Целые числа: | Результат единичного события "да/нет" | Логит | | |
| Биномиальное | Целые числа: | Количество событий "да" из N событий "да/нет" | | | |
| Категориальное | Целые числа: | Результат единичного события из K вариантов | | | |
| Мультиномиальное | K-вектор целых чисел: | Количество событий различных типов (1, …, K) из N событий из K вариантов | | | |
Following is a table of several exponential family distributions in common use and the data they are typically used for, along with the canonical link functions and their inverses (sometimes referred to as the mean function, as done here). + Common distributions with typical uses and canonical link functions Distribution Support of distribution Typical uses Link name Link function, Mean function Normal real: Linear response data Identity Exponential real: Exponential response data, scale parameters Negative inverse Gamma Inverse Gaussian real: Inverse squared Poisson integer: count of occurrences in fixed amount of time/space Log Bernoulli integer: outcome of single yes/no occurrence Logit Binomial integer: count of # of "yes" occurrences out of N yes/no occurrences Categorical integer: outcome of single K way occurrence K vector of integer: , where exactly one element in the vector has the value 1 Multinomial K vector of integer: count of occurrences of different types (1, , K) out of N total K way occurrences
In the cases of the exponential and gamma distributions, the domain of the canonical link function is not the same as the permitted range of the mean. In particular, the linear predictor may be positive, which would give an impossible negative mean. When maximizing the likelihood, precautions must be taken to avoid this. An alternative is to use a noncanonical link function. In the case of the Bernoulli, binomial, categorical and multinomial distributions, the support of the distributions is not the same type of data as the parameter being predicted. In all of these cases, the predicted parameter is one or more probabilities, i. e. real numbers in the range The resulting model is known as logistic regression (or multinomial logistic regression in the case that K way rather than binary values are being predicted). For the Bernoulli and binomial distributions, the parameter is a single probability, indicating the likelihood of occurrence of a single event. The Bernoulli still satisfies the basic condition of the generalized linear model in that, even though a single outcome will always be either 0 or 1, the expected value will nonetheless be a real valued probability, i. e. the probability of occurrence of a "yes" (or 1) outcome. Similarly, in a binomial distribution, the expected value is Np, i. e. the expected proportion of "yes" outcomes will be the probability to be predicted. For categorical and multinomial distributions, the parameter to be predicted is a K vector of probabilities, with the further restriction that all probabilities must add up to 1. Each probability indicates the likelihood of occurrence of one of the K possible values. For the multinomial distribution, and for the vector form of the categorical distribution, the expected values of the elements of the vector can be related to the predicted probabilities similarly to the binomial and Bernoulli distributions.
В случаях экспоненциального и гамма-распределений область определения канонической функции связи не совпадает с допустимым диапазоном математического ожидания. В частности, линейный предиктор может быть положительным, что приведёт к невозможному отрицательному математическому ожиданию. При максимизации правдоподобия необходимо принимать меры предосторожности, чтобы избежать этого. Альтернативным решением является использование неканонической функции связи. В случаях распределений Бернулли, биномиального, категориального и мультиномиального, область определения распределений не соответствует типу данных прогнозируемого параметра. Во всех этих случаях прогнозируемый параметр представляет собой одну или несколько вероятностей, то есть действительные числа в диапазоне [0, 1]. Полученная модель известна как логистическая регрессия (или многочленная логистическая регрессия в случае прогнозирования K-значных, а не бинарных значений). Для распределений Бернулли и биномиального параметр представляет собой одну вероятность, указывающую на вероятность возникновения единичного события. Распределение Бернулли по-прежнему удовлетворяет основному условию обобщённой линейной модели, поскольку, даже если один исход всегда будет либо 0, либо 1, математическое ожидание всё равно будет представлять собой действительное значение вероятности, то есть вероятность возникновения исхода "да" (или 1). Аналогично, в биномиальном распределении математическое ожидание равно Np, то есть ожидаемая доля исходов "да" будет представлять собой прогнозируемую вероятность. Для категориальных и мультиномиальных распределений параметром, который необходимо спрогнозировать, является K-вектор вероятностей, с дополнительным ограничением, что сумма всех вероятностей должна равняться 1. Каждая вероятность указывает на вероятность возникновения одного из K возможных значений. Для мультиномиального распределения и для векторной формы категориального распределения математические ожидания элементов вектора связаны с прогнозируемыми вероятностями аналогично биномиальному и распределению Бернулли.
Following is a table of several exponential family distributions in common use and the data they are typically used for, along with the canonical link functions and their inverses (sometimes referred to as the mean function, as done here). + Common distributions with typical uses and canonical link functions Distribution Support of distribution Typical uses Link name Link function, Mean function Normal real: Linear response data Identity Exponential real: Exponential response data, scale parameters Negative inverse Gamma Inverse Gaussian real: Inverse squared Poisson integer: count of occurrences in fixed amount of time/space Log Bernoulli integer: outcome of single yes/no occurrence Logit Binomial integer: count of # of "yes" occurrences out of N yes/no occurrences Categorical integer: outcome of single K way occurrence K vector of integer: , where exactly one element in the vector has the value 1 Multinomial K vector of integer: count of occurrences of different types (1, , K) out of N total K way occurrences
In the cases of the exponential and gamma distributions, the domain of the canonical link function is not the same as the permitted range of the mean. In particular, the linear predictor may be positive, which would give an impossible negative mean. When maximizing the likelihood, precautions must be taken to avoid this. An alternative is to use a noncanonical link function. In the case of the Bernoulli, binomial, categorical and multinomial distributions, the support of the distributions is not the same type of data as the parameter being predicted. In all of these cases, the predicted parameter is one or more probabilities, i. e. real numbers in the range The resulting model is known as logistic regression (or multinomial logistic regression in the case that K way rather than binary values are being predicted). For the Bernoulli and binomial distributions, the parameter is a single probability, indicating the likelihood of occurrence of a single event. The Bernoulli still satisfies the basic condition of the generalized linear model in that, even though a single outcome will always be either 0 or 1, the expected value will nonetheless be a real valued probability, i. e. the probability of occurrence of a "yes" (or 1) outcome. Similarly, in a binomial distribution, the expected value is Np, i. e. the expected proportion of "yes" outcomes will be the probability to be predicted. For categorical and multinomial distributions, the parameter to be predicted is a K vector of probabilities, with the further restriction that all probabilities must add up to 1. Each probability indicates the likelihood of occurrence of one of the K possible values. For the multinomial distribution, and for the vector form of the categorical distribution, the expected values of the elements of the vector can be related to the predicted probabilities similarly to the binomial and Bernoulli distributions.
Байесовские методы
В общем случае, апостериорное распределение нельзя получить в аналитическом виде и поэтому его необходимо аппроксимировать, как правило, с помощью приближений Лапласа или какого-либо метода Монте-Карло на основе цепей Маркова, например, выборки Гиббса.
Общие линейные модели
Возможный источник путаницы связан с разграничением обобщенных линейных моделей и общих линейных моделей – двух широких классов статистических моделей. Один из создателей, Джон Нельдер, выразил сожаление по поводу использованной терминологии. Общую линейную модель можно рассматривать как частный случай обобщенной линейной модели с идентичной функцией связи и нормально распределенными откликами. Поскольку большинство точных результатов, представляющих интерес, получены только для общей линейной модели, ее историческое развитие было несколько более продолжительным. Результаты для обобщенной линейной модели с функцией связи, отличной от идентичной, являются асимптотическими (то есть хорошо работают при больших объемах выборки).
Линейная регрессия
Простым, очень важным примером обобщенной линейной модели (а также примером общей линейной модели) является линейная регрессия. В линейной регрессии использование метода наименьших квадратов обосновывается теоремой Гаусса — Маркова, которая не требует предположения о нормальности распределения. Однако, с точки зрения обобщенных линейных моделей, полезно считать, что функция распределения является нормальным распределением с постоянной дисперсией, а функция связи — тождественной, которая является канонической связью, если дисперсия известна. При этих предположениях метод наименьших квадратов получается как оценка максимального правдоподобия. Для нормального распределения обобщенная линейная модель имеет аналитическое выражение для оценок максимального правдоподобия, что является удобным. Большинство других обобщенных линейных моделей не имеют аналитических оценок.
Бинарные данные
Когда данные отклика, Y, являются бинарными (принимая только значения 0 и 1), функция распределения обычно выбирается распределением Бернулли, и в этом случае μi интерпретируется как вероятность p того, что Yi примет значение 1. Существует несколько популярных связующих функций для биномиальных распределений.
Функция пробит-ссылки как популярный выбор обратной кумулятивной функции распределения
В качестве альтернативы, для связи можно использовать обратную любую непрерывную кумулятивную функцию распределения (CDF), поскольку диапазон CDF совпадает с диапазоном среднего биномиального распределения. Нормальная CDF – популярный выбор, приводящий к модели пробита. Причина использования модели пробита заключается в том, что постоянное масштабирование входной переменной для нормальной CDF (которое можно учесть эквивалентным масштабированием всех параметров) дает функцию, практически идентичную функции логита, однако модели пробита в некоторых ситуациях проще в обработке, чем модели логита. (В байесовском подходе, где на параметры накладываются априорные нормальные распределения, связь между этими априорными нормальными распределениями и функцией связи на основе нормальной CDF означает, что модель пробита можно вычислить с помощью выборки Гиббса, в то время как для модели логита это, как правило, невозможно.)
The reason for the use of the probit model is that a constant scaling of the input variable to a normal CDF (which can be absorbed through equivalent scaling of all of the parameters) yields a function that is practically identical to the logit function, but probit models are more tractable in some situations than logit models. (In a Bayesian setting in which normally distributed prior distributions are placed on the parameters, the relationship between the normal priors and the normal CDF link function means that a probit model can be computed using Gibbs sampling, while a logit model generally cannot.)
Ссылка на идентификацию
Идентическая функция связи g(p) = p также иногда используется для биномиальных данных, что приводит к линейной модели вероятности. Однако идентическая функция связи может предсказывать бессмысленные "вероятности", меньшие нуля или большие единицы. Этого можно избежать, используя преобразование, такое как cloglog, probit или logit (или любую обратную кумулятивную функцию распределения). Главное достоинство идентической функции связи заключается в том, что она может быть оценена с помощью линейных методов, а другие стандартные функции связи являются приблизительно линейными в окрестности p = 0,5, совпадая с идентической функцией связи.
Многочленная регрессия
Биномиальный случай можно легко расширить для работы с многочленной распределением в качестве отклика (а также как обобщенная линейная модель для счетных данных с фиксированной общей суммой). Обычно это делается двумя способами:
Коррелированные или кластеризованные данные
Стандартная GLM предполагает, что наблюдения некоррелированы. Были разработаны расширения, позволяющие учитывать корреляцию между наблюдениями, как, например, в лонгитюдных исследованиях и кластерных дизайнах: обобщенные уравнения оценки (GEE) позволяют учитывать корреляцию между наблюдениями без использования явной вероятностной модели для объяснения происхождения корреляций, поэтому явная функция правдоподобия не требуется. Они подходят, когда случайные эффекты и их дисперсии не представляют непосредственного интереса, поскольку они позволяют учесть корреляцию, не объясняя ее источник. Основное внимание уделяется оценке среднего отклика в популяции («эффекты, усредненные по популяции»), а не регрессионным параметрам, которые позволили бы предсказать эффект изменения одного или нескольких компонентов X для конкретного индивида. ГЭЭ обычно используются в сочетании со стандартными ошибками Хабера-Уайта. Обобщенные линейные смешанные модели (GLMM) являются расширением GLM, включающим случайные эффекты в линейный предиктор, что дает явную вероятностную модель, объясняющую происхождение корреляций. Получаемые оценки параметров, «специфичные для субъекта», подходят, когда основное внимание уделяется оценке эффекта изменения одного или нескольких компонентов X для конкретного индивида. GLMM также называют многоуровневыми моделями и смешанными моделями. В целом, подгонка GLMM более сложна и требует больших вычислительных ресурсов, чем подгонка ГЭЭ.
Generalized estimating equations (GEEs) allow for the correlation between observations without the use of an explicit probability model for the origin of the correlations, so there is no explicit likelihood. They are suitable when the random effects and their variances are not of inherent interest, as they allow for the correlation without explaining its origin. The focus is on estimating the average response over the population ("population averaged" effects) rather than the regression parameters that would enable prediction of the effect of changing one or more components of X on a given individual. GEEs are usually used in conjunction with Huber–White standard errors. Generalized linear mixed models (GLMMs) are an extension to GLMs that includes random effects in the linear predictor, giving an explicit probability model that explains the origin of the correlations. The resulting "subject specific" parameter estimates are suitable when the focus is on estimating the effect of changing one or more components of X on a given individual. GLMMs are also referred to as multilevel models and as mixed model. In general, fitting GLMMs is more computationally complex and intensive than fitting GEEs.