Введение
Статистическая регрессия, при которой зависимая переменная может принимать только два значения В статистике, пробитная модель - это тип регрессии, при которой зависимая переменная может принимать только два значения, например, женатый или неженатый. Слово это сочетание слов вероятность + единица. Цель модели - оценить вероятность того, что наблюдение с определенными характеристиками будет попадать в определенную категорию; кроме того, классификация наблюдений на основе их прогнозируемых вероятностей является типом бинарной модели классификации. Пробит-модель - популярная спецификация для модели бинарного ответа. Таким образом, он рассматривает тот же набор проблем, что и логистическая регрессия, используя аналогичные методы. При рассмотрении в обобщенной линейной модели, пробитная модель использует функцию пробитных ссылок. Чаще всего она оценивается с использованием процедуры максимальной вероятности, такая оценка называется регрессией пробита.
In statistics, a probit model is a type of regression where the dependent variable can take only two values, for example married or not married. The word is a portmanteau, coming from probability + unit. The purpose of the model is to estimate the probability that an observation with particular characteristics will fall into a specific one of the categories; moreover, classifying observations based on their predicted probabilities is a type of binary classification model. A probit model is a popular specification for a binary response model. As such it treats the same set of problems as does logistic regression using similar techniques. When viewed in the generalized linear model framework, the probit model employs a probit link function. It is most often estimated using the maximum likelihood procedure, such an estimation being called a probit regression.
Оценка модели
Подходящее значение оценочной бинарной модели может быть оценено путем подсчета числа истинных наблюдений, равных 1, и числа, равного нулю, для которых модель присваивает правильную предсказанную классификацию, рассматривая любую оцененную вероятность выше 1/2 (или ниже 1/2), как назначение прогноза 1 (или 0). Подробности см.
Производительность при неправильной спецификации
Рассмотрим формулировку модели скрытой переменной модели пробита. Когда дисперсия условности на не постоянна, но зависит от , тогда возникает проблема гетероскедастичности. Например, предположим, что и где является непрерывной положительной объяснительной переменной. При гетероскедастичности, оценщик пробита для обычно несовместим, и большинство тестов о коэффициентах недействительны. Что еще более важно, оценщик для становится непоследовательным, тоже. Чтобы решить эту проблему, первоначальную модель необходимо преобразовать в гомоскедастическую. Например, в том же примере, может быть переписано как , где Therefore, и запускается probit on генерирует последовательный оценщик для условной вероятности Когда предположение, которое обычно распределяется не удерживается, то возникает проблема функциональной формы ошибочного указания: если модель все еще оценивается как модель пробита, оценщики коэффициентов несовместимы. Например, если в истинной модели следует логистическое распределение, но модель оценивается пробитом, оценки будут, как правило, меньше истинного значения. Однако несоответствие оценок коэффициентов практически не имеет значения, поскольку оценки частичных эффектов, , будут близки к оценкам, данным истинной логитной моделью. Чтобы избежать ошибочного определения распределения, можно принять общее предположение о распределении для термина ошибки, таким образом, что в модель можно включить множество различных типов распределения. Стоимость - это более тяжелые вычисления и более низкая точность для увеличения количества параметров. В большинстве случаев, когда форма распределения неправильно определена, оценщики коэффициентов не соответствуют друг другу, но оценщики условной вероятности и частичных эффектов все еще очень хороши. Можно также использовать полупараметрические или непараметрические подходы, например, с помощью методов локальной вероятности или непараметрических квази вероятности, которые избегают допущений о параметрической форме для индексной функции и надежны для выбора функции связи (например, пробит или логит).
When the assumption that is normally distributed fails to hold, then a functional form misspecification issue arises: if the model is still estimated as a probit model, the estimators of the coefficients are inconsistent. For instance, if follows a logistic distribution in the true model, but the model is estimated by probit, the estimates will be generally smaller than the true value. However, the inconsistency of the coefficient estimates is practically irrelevant because the estimates for the partial effects, , will be close to the estimates given by the true logit model. To avoid the issue of distribution misspecification, one may adopt a general distribution assumption for the error term, such that many different types of distribution can be included in the model. The cost is heavier computation and lower accuracy for the increase of the number of parameter. In most of the cases in practice where the distribution form is misspecified, the estimators for the coefficients are inconsistent, but estimators for the conditional probability and the partial effects are still very good. One can also take semi parametric or non parametric approaches, e. g., via local likelihood or nonparametric quasi likelihood methods, which avoid assumptions on a parametric form for the index function and is robust to the choice of the link function (e. g., probit or logit).
История
Модель пробита обычно приписывается Честеру Блиссу, который ввел термин "пробит" в 1934 году, и Джону Гаддуму (1933), который систематизировал более раннюю работу. Однако основная модель восходит к закону Вебера-Фехнера Густава Фехнера, опубликованному в 1935 году, и неоднократно переименовывалась до 1930-х годов; см. и Быстрый метод вычисления максимальных оценок вероятности для пробит-модели был предложен Рональдом Фишером в качестве приложения к работе Блисса в 1935 году.
A fast method for computing maximum likelihood estimates for the probit model was proposed by Ronald Fisher as an appendix to Bliss' work in 1935.