Введение
Статистическая модель для двоичной зависимой переменной
В статистике логистическая модель (или логит-модель) – это статистическая модель, которая моделирует лог-отношение шансов события как линейную комбинацию одной или нескольких независимых переменных. В регрессионном анализе логистическая регрессия (или регрессия логита) – это оценка параметров логистической модели (коэффициентов в линейной комбинации). Формально, в бинарной логистической регрессии используется одна двоичная зависимая переменная, кодируемая индикаторной переменной, где два значения обозначаются "0" и "1", в то время как независимые переменные могут быть двоичными (два класса, кодируемые индикаторной переменной) или непрерывными (любое действительное значение). Соответствующая вероятность значения, обозначенного "1", может изменяться от 0 (определенно значение "0") до 1 (определенно значение "1"), отсюда и обозначение. Многие другие медицинские шкалы, используемые для оценки тяжести состояния пациента, были разработаны с использованием логистической регрессии. Логистическая регрессия может использоваться для прогнозирования риска развития определенного заболевания (например, диабета, ишемической болезни сердца) на основе наблюдаемых характеристик пациента (возраст, пол, индекс массы тела, результаты различных анализов крови и т. д.). Другой пример – предсказание того, за какую партию будет голосовать избиратель в Непале: Непальский конгресс, Коммунистическую партию Непала или другую партию, основываясь на возрасте, доходе, поле, расе, месте проживания, результатах предыдущих выборов и т. д. Она также применяется в маркетинге, например, для прогнозирования склонности клиента к покупке продукта или отказу от подписки. В экономике она может использоваться для прогнозирования вероятности того, что человек будет трудоустроен, а в бизнесе – для прогнозирования вероятности невыплаты ипотеки домовладельцем. Условные случайные поля, являющиеся расширением логистической регрессии для последовательных данных, используются в обработке естественного языка. Специалисты по планированию действий при стихийных бедствиях и инженеры используют эти модели для прогнозирования решений, принимаемых жильцами домов или зданий при эвакуации в малом и большом масштабах, например, при пожарах в зданиях, лесных пожарах, ураганах и других чрезвычайных ситуациях. Эти модели помогают разрабатывать надежные планы управления при стихийных бедствиях и создавать более безопасные проекты для застроенной среды.
Направленное машинное обучение
Логистическая регрессия — это алгоритм машинного обучения с учителем, широко используемый для задач бинарной классификации, таких как определение, является ли электронное письмо спамом, или диагностика заболеваний путем оценки наличия или отсутствия определенных признаков на основе результатов анализов пациентов. Этот подход использует логистическую (или сигмоидную) функцию для преобразования линейной комбинации входных признаков в значение вероятности в диапазоне от 0 до 1. Эта вероятность указывает на степень уверенности в том, что данный входной пример относится к одной из двух предопределенных категорий. Ключевой механизм логистической регрессии основан на способности логистической функции точно моделировать вероятность двоичных исходов. Благодаря своей характерной S-образной кривой, логистическая функция эффективно отображает любое действительное число в значение между 0 и 1. Эта особенность делает ее особенно подходящей для задач бинарной классификации, например, для сортировки электронных писем на "спам" и "не спам". Рассчитывая вероятность отнесения зависимой переменной к определенной группе, логистическая регрессия предоставляет вероятностную основу для принятия обоснованных решений.
Прогнозы
Коэффициенты \beta 0 и \beta 1 могут быть подставлены в уравнение логистической регрессии для оценки вероятности сдачи экзамена. Например, для студента, который занимается 2 часа, подстановка значения в уравнение дает оценку вероятности сдачи экзамена в 0,25:
Аналогично, для студента, который занимается 4 часа, оценка вероятности сдачи экзамена составляет 0,87:
Эта таблица показывает оцененную вероятность сдачи экзамена для различных значений количества часов занятий. Часы занятий (x) Сдача экзамена Логарифм отношения шансов (t) Отношение шансов (et) Вероятность (p) 1 −2.57 0,076 ≈ 1:13.1 0.07 2 −1.07 0.34 ≈ 1:2.91 0.26 3 0.44 1.55 0.61 4 1.94 6.96 0.87 5 3.45 31.4 0.97
Оценка модели
Логистический регрессионный анализ дает следующий результат. Коэффициент Стандартная ошибка z-значение p-значение (Wald) Перехват (β0) −4.1 1.8 −2.3 0.021 Часы (β1) 1.5 0.6 2.4 0.017
Согласно тесту Уолда, результат показывает, что количество часов учебы значительно связано с вероятностью успешной сдачи экзамена. Вместо метода Уолда, для вычисления p-значения в логистической регрессии рекомендуется использовать тест отношения правдоподобия (LRT), который для этих данных дает (см. ниже).
Обобщения
Эта простая модель является примером бинарной логистической регрессии и имеет одну объясняющую переменную и бинарную категориальную переменную, которая может принимать одно из двух возможных категориальных значений. Многочленная логистическая регрессия — это обобщение бинарной логистической регрессии для случая любого числа объясняющих переменных и любого числа категорий.
Определение логистической функции
Объяснение логистической регрессии можно начать с объяснения стандартной логистической функции. Логистическая функция — это сигмоидальная функция, которая принимает любое вещественное число в качестве входных данных и выдает значение между нулем и единицей. Для бинарной независимой переменной отношение шансов определяется как, где a, b, c и d — элементы таблицы сопряженности 2x2.
Интерпретации
Существуют различные эквивалентные спецификации и интерпретации логистической регрессии, которые являются частными случаями более общих моделей и допускают различные обобщения.
Максимальная оценка вероятности (MLE)
Коэффициенты регрессии обычно оцениваются методом максимального правдоподобия. В отличие от линейной регрессии с нормально распределенными остатками, невозможно получить аналитическое выражение для значений коэффициентов, максимизирующих функцию правдоподобия, поэтому вместо этого используется итеративный процесс, например, метод Ньютона. Этот процесс начинается с начального приближения, незначительно изменяет его, чтобы проверить возможность улучшения, и повторяет эту корректировку до тех пор, пока дальнейшее улучшение невозможно, после чего считается, что процесс сошелся.
Байесовский
В контексте байесовской статистики, априорные распределения обычно задаются для коэффициентов регрессии, например, в виде нормальных (гауссовских) распределений. Для логистической регрессии не существует сопряженного априорного распределения функции правдоподобия. Когда байесовский вывод выполнялся аналитически, это затрудняло вычисление апостериорного распределения, за исключением случаев очень малых размерностей. Однако сейчас автоматическое программное обеспечение, такое как OpenBUGS, JAGS, PyMC3, Stan или Turing.jl, позволяет вычислять эти апостериорные распределения с помощью моделирования, поэтому отсутствие сопряженности не представляет собой проблемы. Тем не менее, при большом размере выборки или количестве параметров полное байесовское моделирование может быть медленным, и часто используются приближенные методы, такие как вариационные байесовские методы и распространение ожиданий.
"Правило десяти"
Широко используемое эмпирическое правило, известное как "правило одного из десяти", гласит, что логистические регрессионные модели обеспечивают стабильные значения для объясняющих переменных при наличии минимум примерно 10 событий на объясняющую переменную (EPV); при этом "событием" обозначаются случаи, относящиеся к менее часто встречающейся категории зависимой переменной. Таким образом, исследование, планирующее использовать объясняющие переменные для события (например, инфаркта миокарда), которое, как ожидается, произойдет у определенной доли участников исследования, потребует в общей сложности участников. Однако надежность этого правила вызывает значительные споры, поскольку оно основано на результатах моделирования и не имеет прочной теоретической базы. По мнению некоторых авторов, правило является излишне консервативным в определенных ситуациях, и они утверждают: "Если мы (в некоторой степени субъективно) считаем проблемными охват доверительного интервала менее 93%, вероятность ошибки первого рода более 7% или относительную смещенность более 15%, наши результаты показывают, что проблемы довольно часто возникают при 2–4 EPV, встречаются редко при 5–9 EPV и все еще наблюдаются при 10–16 EPV. Наихудшие проявления каждой проблемы не были серьезными при 5–9 EPV и обычно сопоставимы с теми, что наблюдаются при 10–16 EPV". Другие исследователи получили результаты, не согласующиеся с вышеизложенным, используя различные критерии. Полезным критерием является то, будет ли подобранная модель демонстрировать такую же прогностическую дискриминацию в новой выборке, как и в выборке, использованной для ее разработки. Для этого критерия может потребоваться 20 событий на одну переменную-кандидат. Вместо этого можно использовать следующие.
Тест Хосмера Лемешоу
Тест Хосмера-Лемешоу использует тестовую статистику, которая асимптотически следует χ²-распределению, для оценки соответствия наблюдаемых частот событий ожидаемым частотам событий в подгруппах модельной популяции. Некоторые статистики считают этот тест устаревшим из-за его зависимости от произвольного разбиения на интервалы предсказанных вероятностей и относительно низкой мощности.
Значение коэффициента
После построения модели исследователи, вероятно, захотят оценить вклад каждого отдельного предиктора. Для этого им потребуется изучить коэффициенты регрессии. В линейной регрессии коэффициенты регрессии показывают, на сколько изменится критерий при изменении предиктора на единицу.
Статистика Валда
В качестве альтернативы, при оценке вклада отдельных предикторов в данной модели можно изучить значимость статистики Вальда. Статистика Вальда, аналогичная t-критерию в линейной регрессии, используется для оценки значимости коэффициентов. Статистика Вальда представляет собой отношение квадрата коэффициента регрессии к квадрату стандартной ошибки коэффициента и асимптотически распределена по распределению хи-квадрат. Логистическая регрессия уникальна тем, что ее можно оценивать на несбалансированных данных, а не на случайно отобранных, и при этом получать корректные оценки коэффициентов, отражающие влияние каждой независимой переменной на результат. Иными словами, если мы построим логистическую модель на таких данных, и модель верна для генеральной совокупности, то все параметры будут верными, за исключением. Мы можем скорректировать, если известна истинная распространенность, следующим образом: Это частный случай общего свойства: экспоненциальное семейство распределений максимизирует энтропию при заданном математическом ожидании. В случае логистической модели логистическая функция является естественным параметром распределения Бернулли (она находится в "канонической форме", а логистическая функция – каноническая связующая функция), в то время как другие сигмоидные функции являются неканоническими связующими функциями; это обуславливает ее математическую элегантность и простоту оптимизации. Подробности см. в.
Сравнение с линейной регрессией
Логистическую регрессию можно рассматривать как частный случай обобщенной линейной модели и, следовательно, она аналогична линейной регрессии. Однако модель логистической регрессии основана на принципиально иных предположениях (относительно взаимосвязи между зависимой и независимыми переменными), чем модель линейной регрессии. В частности, ключевые различия между этими двумя моделями проявляются в следующих двух особенностях логистической регрессии. Во-первых, условное распределение имеет распределение Бернулли, а не нормальное (Гаусса), поскольку зависимая переменная является бинарной. Во-вторых, прогнозируемые значения представляют собой вероятности и, следовательно, ограничены интервалом (0, 1) благодаря логистической функции распределения, поскольку логистическая регрессия предсказывает вероятность наступления определенных событий, а не сами события.
Альтернативы
Общей альтернативой логистической модели (модель логита) является модель пробита, как следует из соответствующих названий. С точки зрения обобщенных линейных моделей, они различаются выбором связующей функции: логистическая модель использует функцию логита (обратная логистическая функция), а модель пробита – функцию пробита (обратная функция нормального распределения). Эквивалентно, в интерпретациях скрытых переменных этих двух методов, первая предполагает стандартное логистическое распределение ошибок, а вторая – стандартное нормальное распределение ошибок. Вместо этого могут использоваться другие сигмоидные функции или распределения ошибок. Логистическая регрессия является альтернативой методу Фишера 1936 года – линейному дискриминантному анализу. Если предположения линейного дискриминантного анализа выполняются, условное распределение можно обратить, чтобы получить логистическую регрессию. Однако обратное неверно, поскольку логистическая регрессия не требует предположения о многомерном нормальном распределении, характерного для дискриминантного анализа. Предположение о линейном влиянии предикторов можно легко ослабить, используя такие методы, как сплайн-функции. В своей более подробной работе (1845) Верхульст определил три параметра модели, заставив кривую проходить через три наблюдаемые точки, что привело к плохим прогнозам. Логистическая функция была независимо разработана в химии как модель автокатализа (Вильгельм Оствальд, 1883). Автокаталитическая реакция – это реакция, в которой один из продуктов сам является катализатором этой реакции, при этом запас одного из реагентов фиксирован. Это естественным образом приводит к логистическому уравнению по той же причине, что и рост популяции: реакция самоподдерживающаяся, но ограниченная. Логистическая функция была независимо повторно открыта как модель роста популяции в 1920 году Раймондом Пирлом и Лоуэллом Ридом, опубликованная в , что привело к ее использованию в современной статистике. Они изначально не знали о работе Верхульста и, предположительно, узнали о ней от Л. Гюстава дю Паскье, но не придали ей большого значения и не приняли его терминологию. Приоритет Верхульста был признан, а термин "логистический" возрожден Удни Юлом в 1925 году и используется с тех пор. Пирл и Рид впервые применили модель к населению Соединенных Штатов и также первоначально подогнали кривую, заставив ее проходить через три точки; как и в случае с Верхульстом, это снова дало плохие результаты. В 1930-х годах модель пробита была разработана и систематизирована Честером Иттнером Блиссом, который ввел термин "пробит" в , и Джоном Гаддумом в , а соответствие модели оценивалось методом максимального правдоподобия Рональдом А. Фишером в , как дополнение к работе Блисса. Модель пробита в основном использовалась в биоанализе и была предварена более ранними работами, датируемыми 1860 годом; см. Модель пробита повлияла на последующее развитие модели логита, и эти модели конкурировали друг с другом. Логистическая модель, вероятно, впервые использовалась как альтернатива модели пробита в биоанализе Эдвином Бидуэллом Уилсоном и его ученицей Джейн Ворчестер в 1949 году. Однако развитие логистической модели как общей альтернативы модели пробита было в основном связано с работой Джозефа Берксона на протяжении многих десятилетий, начиная с 1949 года, когда он ввел термин "логит" по аналогии с "пробитом", и продолжая в последующие годы. Модель логита изначально считалась уступающей модели пробита, но "постепенно достигла равного положения с пробитом", особенно в период с 1960 по 1970 год. К 1970 году модель логита достигла паритета с моделью пробита в использовании в статистических журналах и впоследствии превзошла ее. Эта относительная популярность была обусловлена принятием логита за пределами биоанализа, а не вытеснением пробита в биоанализе, и его неформальным использованием на практике; популярность логита объясняется вычислительной простотой модели логита, ее математическими свойствами и общностью, позволяющей использовать ее в различных областях. В течение этого времени были внесены различные усовершенствования, в частности, Дэвидом Коксом, как в . Многочленная логит-модель была независимо введена в и , что значительно расширило область применения и популярность модели логита. В 1973 году Дэниел МакФадден связал многочленную логит-модель с теорией дискретного выбора, в частности, с аксиомой выбора Люса, показав, что многочленная логит-модель вытекает из предположения о независимости нерелевантных альтернатив и интерпретируя отношения шансов альтернатив как относительные предпочтения; это дало теоретическую основу для логистической регрессии.
The multinomial logit model was introduced independently in and , which greatly increased the scope of application and the popularity of the logit model. In 1973 Daniel McFadden linked the multinomial logit to the theory of discrete choice, specifically Luce's choice axiom, showing that the multinomial logit followed from the assumption of independence of irrelevant alternatives and interpreting odds of alternatives as relative preferences; this gave a theoretical foundation for the logistic regression.