Введение
Статистическая модель для цензурированных зависимых переменных
В статистике тобитная модель – это любой из классов регрессионных моделей, в которых наблюдаемый диапазон зависимой переменной подвергается цензурированию. Термин был введен Артуром Голдбергером в связи с Джеймсом Тобином, который разработал эту модель в 1958 году для решения проблемы избыточного количества нулей в данных о расходах домохозяйств на товары длительного пользования. Поскольку метод Тобина легко обобщается на усеченные и другие неслучайно отобранные выборки, некоторые авторы используют более широкое определение тобитной модели, включающее и эти случаи. Идея Тобина заключалась в модификации функции правдоподобия таким образом, чтобы она отражала неравную вероятность выборки для каждого наблюдения в зависимости от того, находится ли скрытая зависимая переменная выше или ниже заданного порога. Для выборки, которая, как в оригинальном случае Тобина, цензурирована снизу нулем, вероятность выборки для каждого наблюдения, не являющегося пороговым, равна высоте соответствующей функции плотности. Для любого порогового наблюдения она равна кумулятивной функции распределения, то есть интегралу функции плотности ниже нуля. Таким образом, функция правдоподобия тобитной модели представляет собой смесь функций плотности и кумулятивных функций распределения.
In statistics, a tobit model is any of a class of regression models in which the observed range of the dependent variable is censored in some way. The term was coined by Arthur Goldberger in reference to James Tobin, who developed the model in 1958 to mitigate the problem of zero inflated data for observations of household expenditure on durable goods. Because Tobin's method can be easily extended to handle truncated and other non randomly selected samples, some authors adopt a broader definition of the tobit model that includes these cases. Tobin's idea was to modify the likelihood function so that it reflects the unequal sampling probability for each observation depending on whether the latent dependent variable fell above or below the determined threshold. For a sample that, as in Tobin's original case, was censored from below at zero, the sampling probability for each non limit observation is simply the height of the appropriate density function. For any limit observation, it is the cumulative distribution, i. e. the integral below zero of the appropriate density function. The tobit likelihood function is thus a mixture of densities and cumulative distribution functions.
Репараметризация
Логарифмическая функция правдоподобия, как указано выше, не является глобально вогнутой, что затрудняет оценку максимального правдоподобия. Олсен предложил простую перепараметризацию и , что приводит к преобразованной логарифмической функции правдоподобия,
которая глобально вогнута относительно преобразованных параметров. Для усеченной (tobit II) модели Орме показал, что, хотя логарифмическая функция правдоподобия не является глобально вогнутой, она вогнута в любой стационарной точке при указанном преобразовании.
Последовательность
Если параметр связи оценивается регрессией наблюдаемого на , то получаемый оценщик методом наименьших квадратов будет несостоятельным. Он приведет к заниженной оценке коэффициента наклона и завышенной оценке пересечения. Такэси Амемия (1973) доказал, что максимальный оценщик правдоподобия, предложенный Тобином для данной модели, является состоятельным.
Вариации модели тобита
Вариации модели тобита могут быть получены путем изменения момента и условий возникновения цензурирования. Они классифицируются на пять категорий (тобит типа I – тобит типа V), где тобит типа I соответствует первой модели, описанной выше. Schnedler (2005) предлагает общую формулу для получения состоятельных оценок максимального правдоподобия для этих и других вариаций модели тобита.
Тип I
Модель Тобита является частным случаем модели цензурированной регрессии, поскольку латентная переменная не всегда может быть наблюдаема, в то время как независимая переменная наблюдаема. Распространенным вариантом модели Тобита является цензурирование на уровне, отличном от нуля:
Другой пример – цензурирование значений выше .
Еще одна модель возникает, когда переменная цензурируется одновременно сверху и снизу. Остальные модели будут представлены как ограниченные снизу нулем, хотя это можно обобщить, как это было сделано для типа I.
Тип II
Модели тобита типа II вводят вторую латентную переменную. В модели тобита типа I латентная переменная объединяет в себе как процесс участия, так и интересующий нас результат. Модель тобита типа II позволяет процессу участия (отбора) и интересующему нас результату быть независимыми при условии наблюдаемых данных. Модель отбора Хекмана относится к тобитам типа II, которую иногда называют Хеккитом в честь Джеймса Хекмана.
Тип III
Тип III предполагает использование второй наблюдаемой зависимой переменной. Модель Хекмана относится к этому типу.
Тип IV
Тип IV вводит третью наблюдаемую зависимую переменную и третью латентную переменную.
Тип V
Как и в типе II, в типе V наблюдается только знак «+».
Приложения
Например, модели Тобита использовались для оценки факторов, влияющих на получение грантов, включая финансовые трансферты, распределяемые правительствам субнациональных образований, которые могут подавать заявки на эти гранты. В таких случаях получатели грантов не могут получить отрицательную сумму, и данные, таким образом, подвергаются левой цензуре. Например, Dahlberg и Johansson (2002) проанализировали выборку из 115 муниципалитетов (42 из которых получили грант). Dubois и Fattore (2011) использовали модель Тобита для изучения роли различных факторов в получении средств Европейского Союза польскими субнациональными правительствами. Однако данные могут быть подвергнуты левой цензуре в точке, превышающей ноль, что чревато неправильной спецификацией. В обоих исследованиях для проверки устойчивости результатов применялись модели Probit и другие модели. Модели Тобита также применяются в анализе спроса для учета наблюдений с нулевыми расходами на отдельные товары. В смежной области применения моделей Тобита система нелинейных тобитных регрессий использовалась для совместной оценки системы спроса на бренд с гомоскедастическими, гетероскедастическими и обобщенно гетероскедастическими вариантами.