Введение
Специализированная форма регрессионного анализа в статистике.
В устойчивой статистике устойчивая регрессия направлена на преодоление некоторых ограничений традиционного регрессионного анализа. Регрессионный анализ моделирует взаимосвязь между одной или несколькими независимыми переменными и зависимой переменной. Стандартные типы регрессии, такие как метод наименьших квадратов, обладают благоприятными свойствами, если выполняются их базовые предположения, но в противном случае могут давать вводящие в заблуждение результаты (то есть не являются устойчивыми к нарушениям предположений). Методы устойчивой регрессии разработаны для ограничения влияния нарушений предположений, обусловленных процессом генерации данных, на оценки регрессии. Например, оценки методом наименьших квадратов для регрессионных моделей крайне чувствительны к выбросам: выброс с величиной ошибки в два раза больше, чем у типичного наблюдения, вносит в четыре раза (два в квадрате) больший вклад в функцию потерь, основанную на квадрате ошибки, и, следовательно, оказывает большее влияние на оценки регрессии. Функция потерь Хьюбера является устойчивой альтернативой стандартной функции потерь, основанной на квадрате ошибки, которая уменьшает вклад выбросов в функцию потерь, тем самым ограничивая их влияние на оценки регрессии.
Гетеросекастические ошибки
Один из случаев, когда следует рассмотреть робастную оценку, – это когда существует сильное подозрение на гетероскедастичность. В гомоскедастической модели предполагается, что дисперсия случайной ошибки постоянна для всех значений x. Гетероскедастичность допускает зависимость дисперсии от x, что более точно отражает многие реальные ситуации. Например, разброс расходов часто больше у людей с высоким доходом, чем у людей с низким доходом. Программные пакеты обычно по умолчанию используют гомоскедастическую модель, хотя она может быть менее точной, чем гетероскедастическая. Один из простых подходов (Tofallis, 2008) – применять метод наименьших квадратов к процентным ошибкам, поскольку это снижает влияние больших значений зависимой переменной по сравнению с обычным методом наименьших квадратов.
Наличие отклонений
Другая распространенная ситуация, в которой применяется робастная оценка, возникает при наличии выбросов в данных. В присутствии выбросов, не соответствующих тому же процессу генерации данных, что и основная часть данных, оценка методом наименьших квадратов становится неэффективной и может быть смещенной. Поскольку прогнозы, полученные методом наименьших квадратов, притягиваются к выбросам, а дисперсия оценок искусственно завышается, это приводит к тому, что выбросы могут быть скрыты. (Во многих ситуациях, в том числе в некоторых областях геостатистики и медицинской статистики, именно выбросы представляют наибольший интерес.) Хотя иногда утверждается, что метод наименьших квадратов (или классические статистические методы в целом) являются робастными, они робастны лишь в том смысле, что вероятность ошибки первого рода не возрастает при отклонениях от модели. Фактически, вероятность ошибки первого рода, как правило, ниже номинального уровня при наличии выбросов, и часто наблюдается резкое увеличение вероятности ошибки второго рода. Снижение вероятности ошибки первого рода получило название консервативности классических методов.
История и непопулярность надежной регрессии
Несмотря на превосходную производительность по сравнению с методом наименьших квадратов во многих ситуациях, робастные методы регрессии все еще не получили широкого распространения. Существует несколько причин, объясняющих их непопулярность (Hampel et al. 1986, 2005). Одной из них является наличие множества конкурирующих методов и большое количество неудачных начинаний в этой области. Кроме того, вычисление робастных оценок требует значительно больших вычислительных ресурсов, чем метод наименьших квадратов; однако в последние годы это возражение стало менее значимым благодаря резкому увеличению вычислительной мощности. Другой причиной может быть то, что некоторые популярные статистические пакеты программного обеспечения не реализовали эти методы (Stromberg, 2004). Вероятно, наиболее важной причиной непопулярности робастных методов регрессии является то, что при большой или неопределенной дисперсии ошибок любая оценка коэффициентов регрессии – робастная или нет – для заданного набора данных, скорее всего, окажется практически бесполезной, если размер выборки недостаточно велик. Хотя внедрение робастных методов происходит медленно, современные учебники по статистике часто содержат обсуждение этих методов (например, для общего описания эволюции различных робастных методов регрессии см.). Кроме того, современные статистические пакеты, такие как R, Statsmodels, Stata и S PLUS, предоставляют широкие возможности для робастной оценки (см., например, ).
Альтернативы наименьших квадратов
Самый простой метод оценки параметров в регрессионной модели, менее чувствительный к выбросам, чем оценки методом наименьших квадратов, – использование наименьших абсолютных отклонений. Даже в этом случае грубые выбросы все еще могут существенно влиять на модель, что стимулирует исследования еще более устойчивых подходов. В 1964 году Хубер предложил M-оценку для регрессии. Буква M в M-оценке означает "максимальное правдоподобие (типа)". Метод устойчив к выбросам в зависимой переменной, но оказался не устойчивым к выбросам в объясняющих переменных (точки влияния). Фактически, при наличии выбросов в объясняющих переменных метод не имеет преимуществ перед методом наименьших квадратов. В 1980-х годах было предложено несколько альтернатив M-оценке в попытках преодолеть недостаток устойчивости. См. для очень практичного обзора. Оценка наименьших усеченных квадратов (LTS) является жизнеспособной альтернативой и в настоящее время (2007 год) является предпочтительным выбором Руссева и Райана (1997, 2008). Оценщик Theil–Sen имеет более низкую точку пробоя, чем LTS, но является статистически эффективным и популярным. Другим предложенным решением была S-оценка. Этот метод находит линию (плоскость или гиперплоскость), которая минимизирует устойчивую оценку масштаба (от которого метод и получил букву S в своем названии) остатков. Этот метод обладает высокой устойчивостью к точкам влияния и устойчив к выбросам в зависимой переменной. Однако этот метод также оказался неэффективным. MM-оценка пытается сохранить устойчивость и устойчивость S-оценки, одновременно достигая эффективности M-оценки. Метод заключается в поиске высокоустойчивой и устойчивой S-оценки, которая минимизирует M-оценку масштаба остатков (первая M в названии метода). Затем оцениваемый масштаб остается постоянным, пока не будет найдена близлежащая M-оценка параметров (вторая M).
Параметрические альтернативы
Другой подход к надежной оценке регрессионных моделей заключается в замене нормального распределения на распределение с тяжелыми хвостами. t-распределение с 4–6 степенями свободы было признано хорошим выбором в различных практических ситуациях. Байесовская устойчивая регрессия, будучи полностью параметрической, в значительной степени опирается на такие распределения. При предположении о t-распределенных остатках, распределение является семейством местоположения и масштаба. То есть, степени свободы t-распределения иногда называют параметром куртоза. Lange, Little и Taylor (1989) подробно рассматривают эту модель с небайесовской точки зрения. Байесовский анализ представлен в Gelman et al. (2003). Альтернативный параметрический подход заключается в предположении, что остатки следуют смеси нормальных распределений (Daemi et al. 2019); в частности, загрязненному нормальному распределению, в котором большинство наблюдений происходит из заданного нормального распределения, но небольшая доля – из нормального распределения с гораздо большей дисперсией. То есть, остатки имеют вероятность происхождения из нормального распределения с дисперсией , где мало, и вероятность происхождения из нормального распределения с дисперсией для некоторого :
Обычно, это иногда называют моделью загрязнения. Параметрические подходы имеют преимущество в том, что теория правдоподобия предоставляет готовый подход к выводам (хотя для смешанных моделей, таких как модель загрязнения, обычные условия регулярности могут быть неприменимы), и можно строить моделирование на основе результатов подгонки. Однако такие параметрические модели все еще предполагают, что лежащая в основе модель буквально верна. Следовательно, они не учитывают асимметричные распределения остатков или конечную точность наблюдений.
Единичные веса
Другой надежный метод — использование единичных весов (Wainer & Thissen, 1976), метод, который можно применять при наличии нескольких предикторов одного исхода. Эрнест Берджесс (1928) использовал единичные веса для прогнозирования успеха при условно-досрочном освобождении. Он оценил 21 положительный фактор как присутствующий (например, «отсутствие предыдущих арестов» = 1) или отсутствующий («наличие предыдущих арестов» = 0), затем просуммировал полученные значения, чтобы получить прогностическую оценку, которая оказалась полезным предиктором успеха условно-досрочного освобождения. Сэмюэль С. Уилкс (1938) показал, что почти все наборы регрессионных весов приводят к композитам, которые очень сильно коррелируют друг с другом, включая единичные веса; этот результат известен как теорема Уилкса (Ree, Carretta, & Earles, 1998). Робин Доус (1979) исследовал процесс принятия решений в практических ситуациях и показал, что простые модели с единичными весами часто превосходят человеческих экспертов. Бобко, Рот и Бастер (2007) проанализировали литературу, посвященную единичным весам, и пришли к выводу, что десятилетия эмпирических исследований демонстрируют, что единичные веса показывают результаты, сопоставимые с обычными регрессионными весами при кросс-валидации.
Пример: данные о печени BUPA
Данные о печени BUPA изучались различными авторами, включая Breiman (2001). Эти данные можно найти на странице классических наборов данных, а в статье, посвященной преобразованию Бокса-Кокса, содержится соответствующее обсуждение. Ниже представлен график логарифмов АЛТ в зависимости от логарифмов γGT. Две регрессионные линии построены с использованием метода наименьших квадратов (OLS) и робастной MM-оценки. Анализ был выполнен в R с использованием программного обеспечения, разработанного Venables и Ripley (2002). Обе регрессионные линии выглядят очень похожими (что не является необычным для набора данных такого размера). Однако преимущество робастного подхода проявляется при рассмотрении оценок масштаба остатков. Для метода наименьших квадратов оценка масштаба составляет 0,420, в то время как для робастного метода – 0,373. Таким образом, относительная эффективность метода наименьших квадратов по сравнению с MM-оценкой в данном примере равна 1,266. Эта неэффективность приводит к снижению мощности при проверке гипотез и к излишне широким доверительным интервалам для оцениваемых параметров.
Обнаружение отклонений
Еще одним следствием неэффективности метода наименьших квадратов является то, что некоторые выбросы остаются незамеченными, поскольку оценка масштаба остатков завышена; масштабированные остатки оказываются ближе к нулю, чем при использовании более адекватной оценки масштаба. Ниже представлены графики масштабированных остатков для двух моделей. Переменная на оси X – это просто номер наблюдения в исходном наборе данных. Rousseeuw и Leroy (1986) приводят множество подобных графиков. Горизонтальные контрольные линии расположены на уровнях 2 и -2, так что любой наблюдаемый масштабированный остаток за пределами этих границ можно считать выбросом. Очевидно, что метод наименьших квадратов приводит к тому, что многие значимые наблюдения маскируются. В то время как в одном или двух измерениях обнаружение выбросов классическими методами можно выполнять вручную, при работе с большими объемами данных и в многомерном пространстве проблема маскировки может сделать выявление многих выбросов невозможным. Робастные методы автоматически обнаруживают такие наблюдения, что дает существенное преимущество перед классическими методами в случае наличия выбросов.