Введение

Метод регуляризации для плохо обусловленных задач

Ридж-регрессия — это метод оценки коэффициентов множественных моделей регрессии в ситуациях, когда независимые переменные сильно коррелированы. Он нашел применение во многих областях, включая эконометрику, химию и инженерию. В целом, метод обеспечивает повышение эффективности оценки параметров в обмен на допустимый уровень смещения (см. компромисс между смещением и дисперсией). Теория была впервые представлена Хоерлом и Кеннардом в 1970 году в их статьях для Technometrics «Ридж-регрессия: смещенная оценка неортогональных задач» и «Ридж-регрессия: применение к неортогональным задачам». Ридж-регрессия была разработана как возможное решение проблемы неточности оценок методом наименьших квадратов, когда в моделях линейной регрессии присутствуют мультиколлинеарные (сильно коррелированные) независимые переменные, путем создания оценщика ридж-регрессии (RR). Это обеспечивает более точную оценку параметров ридж-регрессии, поскольку ее дисперсия и среднеквадратичная ошибка часто меньше, чем у ранее полученных оценок методом наименьших квадратов.

Обзор

В самом простом случае проблема почти сингулярной матрицы моментов смягчается добавлением положительных элементов к диагоналям, что уменьшает её обусловленность. Аналогично обычному оценщику методом наименьших квадратов, простой гребневой оценщик задается следующим образом:

где – зависимая переменная, – матрица регрессоров, – единичная матрица, а гребневой параметр – константа, сдвигающая диагонали матрицы моментов. Можно показать, что этот оценщик является решением задачи наименьших квадратов при условии , которое можно выразить в виде лагранжиана:

что показывает, что является множителем Лагранжа для данного ограничения. Как правило, выбирается по эвристическому критерию, чтобы ограничение не выполнялось точно. В частности, в случае , когда ограничение не является активным, гребневой оценщик сводится к обычному методу наименьших квадратов. Более общий подход к регуляризации Тихонова обсуждается ниже.

История

Тихоновская регуляризация была изобретена независимо в различных областях. Широкую известность она получила благодаря применению к интегральным уравнениям в работах Андрея Тихонова и Дэвида Л. Филлипса. Некоторые авторы используют термин Тихонов–Филлипсовская регуляризация. Конечномерный случай был подробно рассмотрен Артуром Э. Хоерлом, который использовал статистический подход, и Манусом Фостером, который интерпретировал этот метод как фильтр Винера–Колмогорова (Кригинг). Вслед за Хоерлом в статистической литературе она известна как гребневая регрессия, названная в честь гребневого анализа ("гребень" относится к траектории ограниченного максимума).

Регуляризация в пространстве Гильберта

Обычно дискретные линейные плохо обусловленные задачи возникают в результате дискретизации интегральных уравнений, и Тихоновскую регуляризацию можно сформулировать в исходном бесконечномерном контексте. В вышесказанном можно интерпретировать как компактный оператор в гильбертовых пространствах, а и как элементы области определения и области значений оператора. Оператор является самосопряжённым, ограниченным и обратимым.

Отношение к вероятностной формулировке

Вероятностная формулировка обратной задачи вводит (при условии, что все неопределенности имеют гауссовское распределение) матрицу ковариации, представляющую априорные неопределенности параметров модели, и матрицу ковариации, представляющую неопределенности наблюдаемых параметров. В частном случае, когда эти две матрицы диагональные и изотропные, и , и в этом случае уравнения обратной теории упрощаются до вышеприведенных уравнений, с .

Байесовская интерпретация

Хотя на первый взгляд выбор решения этой регуляризованной задачи может показаться искусственным, и матрица действительно выглядит довольно произвольной, этот процесс можно обосновать с байесовской точки зрения. Следует отметить, что для некорректно поставленной задачи необходимо вводить дополнительные предположения, чтобы получить единственное решение. В статистике априорное распределение вероятностей часто принимается за многомерное нормальное распределение. Для упрощения здесь делаются следующие допущения: средние значения равны нулю, их компоненты независимы, а компоненты имеют одинаковое стандартное отклонение. Данные также подвержены ошибкам, и предполагается, что ошибки в также независимы, имеют нулевое среднее и стандартное отклонение. При этих допущениях решение Тихонова, полученное методом регуляризации, является наиболее вероятным решением, учитывая данные и априорное распределение, согласно теореме Байеса. Если предположение о нормальности заменить допущениями о гомоскедастичности и некоррелированности ошибок, и при этом сохранить допущение о нулевом среднем, то теорема Гаусса — Маркова подразумевает, что решение является минимальным несмещенным линейным оценщиком.