Введение
Техника регрессионного анализа В статистике биномиальная регрессия - это метод регрессионного анализа, в котором ответ (часто называемый Y) имеет биномиальное распределение: это количество успехов в серии n независимых испытаний Бернулли, где каждое испытание имеет вероятность успеха p. Подробности были следующими. Наблюдаемая исходная переменная заключалась в том, произошел ли сбой в промышленном процессе. Были две объяснительные переменные: первая была простой двух-факторный фактор, представляющий, была ли использована модифицированная версия процесса, а вторая была обычной количественной переменной, измеряющей чистоту материала, поставляемого для процесса.
In statistics, binomial regression is a regression analysis technique in which the response (often referred to as Y) has a binomial distribution: it is the number of successes in a series of n independent Bernoulli trials, where each trial has probability of success p. the details were as follows. The observed outcome variable was whether or not a fault occurred in an industrial process. There were two explanatory variables: the first was a simple two case factor representing whether or not a modified version of the process was used and the second was an ordinary quantitative variable measuring the purity of the material being supplied for the process.
Спецификация модели
Предполагается, что переменная ответа Y имеет биномиальное распределение, зависящее от объяснительных переменных X. Известно количество испытаний n, и вероятность успеха для каждого испытания p указывается как функция θ ((X). Это означает, что условные ожидания и условная дисперсия наблюдаемой доли успехов, Y/n, являются Целью биномиальной регрессии является оценка функции θ(X). Обычно статистик принимает , для известной функции m и оценивает β. Общие варианты для m включают логистическую функцию. Данные часто используются в виде обобщенной линейной модели, где предсказанные значения μ - это вероятности того, что любое отдельное событие приведет к успеху. Вероятность предсказаний затем определяется где 1A - индикаторная функция, которая принимает значение один, когда происходит событие A, и ноль в противном случае: в этой формулировке для любого данного наблюдения yi только один из двух терминов внутри продукта вносит свой вклад, в зависимости от того, yi = 0 или 1. Функция вероятности более полно определяется путем определения формальных параметров μi как параметризированных функций объяснительных переменных: это определяет вероятность с точки зрения значительно уменьшенного числа параметров. Устройство модели обычно достигается с использованием метода максимальной вероятности для определения этих параметров. На практике использование формулировки в качестве обобщенной линейной модели позволяет использовать определенные алгоритмические идеи, которые применимы ко всему классу более общих моделей, но которые не применимы ко всем проблемам максимальной вероятности. Модели, используемые в биномиальной регрессии, часто могут быть расширены до мультимономиальных данных. Существует множество методов получения значений μ систематическим образом, позволяющих интерпретировать модель; они обсуждаются ниже.
The goal of binomial regression is to estimate the function θ(X). Typically the statistician assumes , for a known function m, and estimates β. Common choices for m include the logistic function. The data are often fitted as a generalised linear model where the predicted values μ are the probabilities that any individual event will result in a success. The likelihood of the predictions is then given by
where 1A is the indicator function which takes on the value one when the event A occurs, and zero otherwise: in this formulation, for any given observation yi, only one of the two terms inside the product contributes, according to whether yi=0 or 1. The likelihood function is more fully specified by defining the formal parameters μi as parameterised functions of the explanatory variables: this defines the likelihood in terms of a much reduced number of parameters. Fitting of the model is usually achieved by employing the method of maximum likelihood to determine these parameters. In practice, the use of a formulation as a generalised linear model allows advantage to be taken of certain algorithmic ideas which are applicable across the whole class of more general models but which do not apply to all maximum likelihood problems. Models used in binomial regression can often be extended to multinomial data. There are many methods of generating the values of μ in systematic ways that allow for interpretation of the model; they are discussed below.
Функции связи
Существует требование, что моделирование, связывающее вероятности μ с объяснительными переменными, должно быть такого типа, которое дает только значения в диапазоне от 0 до 1. Многие модели могут быть вставлены в форму Здесь η является промежуточной переменной, представляющей линейную комбинацию, содержащую параметры регрессии, объяснительных переменных. Функция g - это кумулятивная функция распределения (cdf) некоторого распределения вероятности. Обычно это распределение вероятностей имеет поддержку от минус бесконечности до плюс бесконечности, так что любое конечное значение η преобразуется функцией g в значение в диапазоне от 0 до 1. В случае логистической регрессии, функция связи является логарифмом коэффициента шансов или логистической функцией. В случае с пробитом, связь является cdf нормального распределения. Линейная вероятностная модель не является правильной спецификацией биномиальной регрессии, потому что предсказания не должны быть в диапазоне от нуля до одного; иногда она используется для этого типа данных, когда интерпретация происходит в пространстве вероятности или когда аналитик не обладает достаточной сложностью, чтобы подходить или рассчитывать приблизительную линеаризацию вероятности для интерпретации.
Here η is an intermediate variable representing a linear combination, containing the regression parameters, of the explanatory variables. The function
g is the cumulative distribution function (cdf) of some probability distribution. Usually this probability distribution has a support from minus infinity to plus infinity so that any finite value of η is transformed by the function g to a value inside the range 0 to 1. In the case of logistic regression, the link function is the log of the odds ratio or logistic function. In the case of probit, the link is the cdf of the normal distribution. The linear probability model is not a proper binomial regression specification because predictions need not be in the range of zero to one; it is sometimes used for this type of data when the probability space is where interpretation occurs or when the analyst lacks sufficient sophistication to fit or calculate approximate linearizations of probabilities for interpretation.
Сравнение с бинарной регрессией
Биномиальная регрессия тесно связана с бинарной регрессией. Если ответ является двоичной переменной (две возможные исходы), то эти альтернативы могут быть закодированы как 0 или 1, рассматривая один из результатов как "успех", а другой как "неудача" и рассматривая их как данные подсчета: "успех" - это 1 успех из 1 испытания, в то время как "неудача" - это 0 успехов из 1 испытания. Это теперь можно считать биномиальным распределением с пробным, поэтому бинарная регрессия является особым случаем биномиальной регрессии. Если эти данные сгруппированы (посредством добавления счетов), они больше не являются бинарными данными, а являются данными счета для каждой группы и все еще могут быть смоделированы биномиальной регрессией; отдельные бинарные результаты затем называются "негруппированными данными". Преимущество работы с группированными данными заключается в том, что можно проверить соответствие модели; например, группированные данные могут проявлять чрезмерную дисперсию относительно дисперсии, оцененной из негруппированных данных.