Введение

Техника регрессионного анализа В статистике биномиальная регрессия - это метод регрессионного анализа, в котором ответ (часто называемый Y) имеет биномиальное распределение: это количество успехов в серии n независимых испытаний Бернулли, где каждое испытание имеет вероятность успеха p. Подробности были следующими. Наблюдаемая исходная переменная заключалась в том, произошел ли сбой в промышленном процессе. Были две объяснительные переменные: первая была простой двух-факторный фактор, представляющий, была ли использована модифицированная версия процесса, а вторая была обычной количественной переменной, измеряющей чистоту материала, поставляемого для процесса.

Спецификация модели

Предполагается, что переменная ответа Y имеет биномиальное распределение, зависящее от объяснительных переменных X. Известно количество испытаний n, и вероятность успеха для каждого испытания p указывается как функция θ ((X). Это означает, что условные ожидания и условная дисперсия наблюдаемой доли успехов, Y/n, являются Целью биномиальной регрессии является оценка функции θ(X). Обычно статистик принимает , для известной функции m и оценивает β. Общие варианты для m включают логистическую функцию. Данные часто используются в виде обобщенной линейной модели, где предсказанные значения μ - это вероятности того, что любое отдельное событие приведет к успеху. Вероятность предсказаний затем определяется где 1A - индикаторная функция, которая принимает значение один, когда происходит событие A, и ноль в противном случае: в этой формулировке для любого данного наблюдения yi только один из двух терминов внутри продукта вносит свой вклад, в зависимости от того, yi = 0 или 1. Функция вероятности более полно определяется путем определения формальных параметров μi как параметризированных функций объяснительных переменных: это определяет вероятность с точки зрения значительно уменьшенного числа параметров. Устройство модели обычно достигается с использованием метода максимальной вероятности для определения этих параметров. На практике использование формулировки в качестве обобщенной линейной модели позволяет использовать определенные алгоритмические идеи, которые применимы ко всему классу более общих моделей, но которые не применимы ко всем проблемам максимальной вероятности. Модели, используемые в биномиальной регрессии, часто могут быть расширены до мультимономиальных данных. Существует множество методов получения значений μ систематическим образом, позволяющих интерпретировать модель; они обсуждаются ниже.

Функции связи

Существует требование, что моделирование, связывающее вероятности μ с объяснительными переменными, должно быть такого типа, которое дает только значения в диапазоне от 0 до 1. Многие модели могут быть вставлены в форму Здесь η является промежуточной переменной, представляющей линейную комбинацию, содержащую параметры регрессии, объяснительных переменных. Функция g - это кумулятивная функция распределения (cdf) некоторого распределения вероятности. Обычно это распределение вероятностей имеет поддержку от минус бесконечности до плюс бесконечности, так что любое конечное значение η преобразуется функцией g в значение в диапазоне от 0 до 1. В случае логистической регрессии, функция связи является логарифмом коэффициента шансов или логистической функцией. В случае с пробитом, связь является cdf нормального распределения. Линейная вероятностная модель не является правильной спецификацией биномиальной регрессии, потому что предсказания не должны быть в диапазоне от нуля до одного; иногда она используется для этого типа данных, когда интерпретация происходит в пространстве вероятности или когда аналитик не обладает достаточной сложностью, чтобы подходить или рассчитывать приблизительную линеаризацию вероятности для интерпретации.

Сравнение с бинарной регрессией

Биномиальная регрессия тесно связана с бинарной регрессией. Если ответ является двоичной переменной (две возможные исходы), то эти альтернативы могут быть закодированы как 0 или 1, рассматривая один из результатов как "успех", а другой как "неудача" и рассматривая их как данные подсчета: "успех" - это 1 успех из 1 испытания, в то время как "неудача" - это 0 успехов из 1 испытания. Это теперь можно считать биномиальным распределением с пробным, поэтому бинарная регрессия является особым случаем биномиальной регрессии. Если эти данные сгруппированы (посредством добавления счетов), они больше не являются бинарными данными, а являются данными счета для каждой группы и все еще могут быть смоделированы биномиальной регрессией; отдельные бинарные результаты затем называются "негруппированными данными". Преимущество работы с группированными данными заключается в том, что можно проверить соответствие модели; например, группированные данные могут проявлять чрезмерную дисперсию относительно дисперсии, оцененной из негруппированных данных.