Введение

Набор статистических процессов для оценки взаимосвязей между переменными.

В статистическом моделировании регрессионный анализ представляет собой набор статистических процессов для оценки взаимосвязей между зависимой переменной (часто называемой переменной «результата» или «отклика», или «меткой» в терминологии машинного обучения) и одной или несколькими независимыми переменными (часто называемыми «предикторами», «ковариатами», «объясняющими переменными» или «признаками»). Наиболее распространенной формой регрессионного анализа является линейная регрессия, в которой находится линия (или более сложная линейная комбинация), наиболее точно соответствующая данным согласно определенному математическому критерию. Например, метод наименьших квадратов вычисляет уникальную линию (или гиперплоскость), которая минимизирует сумму квадратов отклонений между фактическими данными и этой линией (или гиперплоскостью). По определенным математическим причинам (см. линейная регрессия), это позволяет исследователю оценить условное математическое ожидание (или среднее значение генеральной совокупности) зависимой переменной при заданном наборе значений независимых переменных. Менее распространенные формы регрессии используют несколько иные процедуры для оценки альтернативных параметров расположения (например, квантильная регрессия или анализ необходимых условий) или для оценки условного математического ожидания в более широком наборе нелинейных моделей (например, непараметрическая регрессия). Регрессионный анализ используется главным образом для двух концептуально различных целей. Во-первых, регрессионный анализ широко применяется для прогнозирования и предсказания, где его использование существенно пересекается с областью машинного обучения. Во-вторых, в некоторых случаях регрессионный анализ может быть использован для вывода причинно-следственных связей между независимыми и зависимыми переменными. Важно отметить, что сами по себе регрессии лишь выявляют взаимосвязи между зависимой переменной и набором независимых переменных в фиксированном наборе данных. Чтобы использовать регрессии для прогнозирования или для вывода причинно-следственных связей, соответственно, исследователю необходимо тщательно обосновать, почему существующие взаимосвязи обладают предсказательной силой в новом контексте или почему взаимосвязь между двумя переменными имеет причинную интерпретацию. Последнее особенно важно, когда исследователи стремятся оценить причинно-следственные связи, используя наблюдательные данные.

История

Самая ранняя форма регрессии — это метод наименьших квадратов, который был опубликован Лежандром в 1805 году, а Гауссом в 1809 году. Лежандр и Гаусс применили этот метод к задаче определения орбит тел вокруг Солнца по астрономическим наблюдениям (в основном комет, но позже и вновь открытых малых планет). Гаусс опубликовал дальнейшее развитие теории наименьших квадратов в 1821 году, включая вариант теоремы Гаусса — Маркова. Термин «регрессия» был введен Фрэнсисом Гальтоном в XIX веке для описания биологического явления. Суть явления заключалась в том, что рост потомков высоких предков, как правило, стремится к нормальному среднему значению (явление, также известное как регрессия к среднему). Для Гальтона регрессия имела исключительно биологическое значение, но впоследствии его работа была расширена Удни Юлом и Карлом Пирсоном и получила более широкое статистическое применение. В работах Юла и Пирсона предполагалось, что совместное распределение зависимой и объясняющих переменных является гауссовским. Это предположение было ослаблено Р. А. Фишером в его работах 1922 и 1925 годов. Фишер предположил, что условное распределение зависимой переменной является гауссовским, но совместное распределение необязательно. В этом отношении предположение Фишера ближе к формулировке Гаусса 1821 года. В 1950-х и 1960-х годах экономисты использовали электромеханические настольные калькуляторы для вычисления регрессий. До 1970 года получение результата для одной регрессии иногда занимало до 24 часов. Методы регрессии продолжают оставаться активной областью исследований. В последние десятилетия были разработаны новые методы для робастной регрессии, регрессии с коррелированными зависимыми переменными, такими как временные ряды и кривые роста, регрессии, в которой предикторы (независимые переменные) или зависимые переменные являются кривыми, изображениями, графиками или другими сложными объектами данных, методы регрессии, учитывающие различные типы пропущенных данных, непараметрическая регрессия, байесовские методы регрессии, регрессия, в которой предикторы измеряются с ошибками, регрессия с большим количеством предикторов, чем наблюдений, и причинно-следственный анализ с использованием регрессии.

Диагностика

После построения регрессионной модели может быть важно подтвердить качество её соответствия данным и статистическую значимость оцененных параметров. К общепринятым проверкам качества соответствия относятся R-квадрат, анализ закономерностей в остатках и проверка гипотез. Статистическую значимость проверяют с помощью F-теста для оценки общей адекватности модели, за которым следуют t-тесты для отдельных параметров. Интерпретация этих диагностических тестов во многом зависит от предположений, лежащих в основе модели. Хотя анализ остатков может помочь признать модель несостоятельной, результаты t-теста или F-теста иногда сложнее интерпретировать при нарушении предположений модели. Например, если ошибка не имеет нормального распределения, в небольших выборках оценки параметров не будут подчиняться нормальному распределению, что затруднит статистический вывод. Однако при достаточно больших выборках можно применить центральную предельную теорему, позволяющую проводить проверку гипотез с использованием асимптотических приближений.

Ограниченные зависимые переменные

Ограниченные зависимые переменные, представляющие собой переменные отклика, которые являются категориальными или ограничены определенным диапазоном значений, часто встречаются в эконометрике. Переменная отклика может быть не непрерывной ("ограниченной" областью определения на подмножестве вещественной прямой). Для бинарных (принимающих значения 0 или 1) переменных, если анализ проводится с использованием линейной регрессии методом наименьших квадратов, модель называется линейной моделью вероятности. Нелинейные модели для бинарных зависимых переменных включают пробит- и логит-модели. Мультивариантная пробит-модель является стандартным методом оценки совместной связи между несколькими бинарными зависимыми переменными и некоторыми независимыми переменными. Для категориальных переменных с более чем двумя значениями существует мультиномиальная логит-модель. Для порядковых переменных с более чем двумя значениями используются модели упорядоченного логита и упорядоченного пробита. Цензурированные регрессионные модели применяются, когда зависимая переменная наблюдается лишь частично, а модели типа коррекции Хекмана – когда выборка не является случайной из интересующей генеральной совокупности. Альтернативой таким процедурам является линейная регрессия, основанная на полихорической (или полисерийной) корреляции между категориальными переменными. Эти процедуры различаются по предположениям относительно распределения переменных в генеральной совокупности. Если переменная положительна, принимает небольшие значения и отражает частоту наступления события, то могут быть использованы модели подсчета, такие как регрессия Пуассона или отрицательное биномиальное распределение.

Нелинейная регрессия

Когда функция модели нелинейна по параметрам, сумма квадратов должна быть минимизирована итеративным методом. Это вносит множество осложнений, которые обобщены в разделе «Различия между линейным и нелинейным методом наименьших квадратов».

Прогноз (интерполяция и экстраполяция)

Регрессионные модели предсказывают значение переменной Y при известных значениях переменных X. Прогноз в пределах диапазона значений в наборе данных, используемом для построения модели, неформально известен как интерполяция. Прогноз за пределами этого диапазона данных известен как экстраполяция. Экстраполяция в значительной степени опирается на регрессионные предположения. Чем дальше экстраполяция выходит за пределы данных, тем больше вероятность, что модель даст сбой из-за расхождений между предположениями и данными выборки или истинными значениями. Точечный прогноз может сопровождаться интервалом прогноза, отражающим неопределенность. Такие интервалы, как правило, быстро расширяются по мере удаления значений независимой(ых) переменной(ых) от диапазона, охватываемого наблюдаемыми данными. По этим и другим причинам некоторые считают, что экстраполяция может быть неразумной. Однако это не охватывает весь спектр возможных ошибок моделирования, в частности, предположение об определенной форме связи между Y и X. Правильно проведенный регрессионный анализ включает оценку соответствия предполагаемой формы наблюдаемым данным, но это возможно только в пределах диапазона фактически доступных значений независимых переменных. Это означает, что любая экстраполяция особенно чувствительна к предположениям о структурной форме регрессионной зависимости. Если известно, что зависимая переменная не может выходить за определенные пределы, это можно учитывать при выборе модели, даже если в наблюдаемом наборе данных нет значений, близких к этим границам. Последствия выбора подходящей функциональной формы для регрессии могут быть значительными при экстраполяции. По крайней мере, это может гарантировать, что любая экстраполяция, полученная из построенной модели, будет "реалистичной" (или соответствовать имеющимся знаниям).

Расчеты мощности и размера выборки

Не существует общепринятых методов для установления связи между количеством наблюдений и числом независимых переменных в модели. Один из методов, предложенный Гудом и Хардином, выглядит следующим образом: , где – размер выборки, – число независимых переменных, а – количество наблюдений, необходимое для достижения желаемой точности, если бы модель имела только одну независимую переменную. Например, исследователь строит линейную регрессионную модель, используя набор данных, содержащий 1000 пациентов. Если исследователь решает, что для точного определения прямой линии требуется пять наблюдений, то максимальное количество независимых переменных, которое может поддерживать модель, равно 4, поскольку .

Программное обеспечение

Все основные пакеты статистического программного обеспечения выполняют регрессионный анализ методом наименьших квадратов и последующий статистический вывод. Простую линейную регрессию и множественную регрессию с использованием метода наименьших квадратов можно выполнить в некоторых табличных процессорах и на некоторых калькуляторах. В то время как многие статистические пакеты программного обеспечения способны выполнять различные типы непараметрической и устойчивой регрессии, эти методы менее стандартизированы. Разные пакеты программного обеспечения реализуют различные методы, и один и тот же метод может быть реализован по-разному в разных пакетах. Специализированное программное обеспечение для регрессионного анализа разработано для использования в таких областях, как анализ опросов общественного мнения и нейровизуализация.