Регуляризация гребнем для плохо обусловленных задач
Ridge regression
Регуляризация Ridge: улучшение оценки коэффициентов регрессии при высокой корреляции переменных. Снижает влияние мультиколлинеарности, повышает точность.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Метод регуляризации для плохо обусловленных задач
Regularization technique for ill posed problems
Ридж-регрессия — это метод оценки коэффициентов множественных моделей регрессии в ситуациях, когда независимые переменные сильно коррелированы. Он нашел применение во многих областях, включая эконометрику, химию и инженерию. В целом, метод обеспечивает повышение эффективности оценки параметров в обмен на допустимый уровень смещения (см. компромисс между смещением и дисперсией). Теория была впервые представлена Хоерлом и Кеннардом в 1970 году в их статьях для Technometrics «Ридж-регрессия: смещенная оценка неортогональных задач» и «Ридж-регрессия: применение к неортогональным задачам». Ридж-регрессия была разработана как возможное решение проблемы неточности оценок методом наименьших квадратов, когда в моделях линейной регрессии присутствуют мультиколлинеарные (сильно коррелированные) независимые переменные, путем создания оценщика ридж-регрессии (RR). Это обеспечивает более точную оценку параметров ридж-регрессии, поскольку ее дисперсия и среднеквадратичная ошибка часто меньше, чем у ранее полученных оценок методом наименьших квадратов.
Ridge regression is a method of estimating the coefficients of multiple regression models in scenarios where the independent variables are highly correlated. It has been used in many fields including econometrics, chemistry, and engineering. In general, the method provides improved efficiency in parameter estimation problems in exchange for a tolerable amount of bias (see bias–variance tradeoff). The theory was first introduced by Hoerl and Kennard in 1970 in their Technometrics papers "Ridge regressions: biased estimation of nonorthogonal problems" and "Ridge regressions: applications in nonorthogonal problems". Ridge regression was developed as a possible solution to the imprecision of least square estimators when linear regression models have some multicollinear (highly correlated) independent variables—by creating a ridge regression estimator (RR). This provides a more precise ridge parameters estimate, as its variance and mean square estimator are often smaller than the least square estimators previously derived.
Обзор
В самом простом случае проблема почти сингулярной матрицы моментов смягчается добавлением положительных элементов к диагоналям, что уменьшает её обусловленность. Аналогично обычному оценщику методом наименьших квадратов, простой гребневой оценщик задается следующим образом:
In the simplest case, the problem of a near singular moment matrix is alleviated by adding positive elements to the diagonals, thereby decreasing its condition number. Analogous to the ordinary least squares estimator, the simple ridge estimator is then given by
где – зависимая переменная, – матрица регрессоров, – единичная матрица, а гребневой параметр – константа, сдвигающая диагонали матрицы моментов. Можно показать, что этот оценщик является решением задачи наименьших квадратов при условии , которое можно выразить в виде лагранжиана:
where is the regressand, is the design matrix, is the identity matrix, and the ridge parameter serves as the constant shifting the diagonals of the moment matrix. It can be shown that this estimator is the solution to the least squares problem subject to the constraint , which can be expressed as a Lagrangian:
что показывает, что является множителем Лагранжа для данного ограничения. Как правило, выбирается по эвристическому критерию, чтобы ограничение не выполнялось точно. В частности, в случае , когда ограничение не является активным, гребневой оценщик сводится к обычному методу наименьших квадратов. Более общий подход к регуляризации Тихонова обсуждается ниже.
which shows that is nothing but the Lagrange multiplier of the constraint. Typically, is chosen according to a heuristic criterion, so that the constraint will not be satisfied exactly. Specifically in the case of , in which the constraint is non binding, the ridge estimator reduces to ordinary least squares. A more general approach to Tikhonov regularization is discussed below.
История
Тихоновская регуляризация была изобретена независимо в различных областях. Широкую известность она получила благодаря применению к интегральным уравнениям в работах Андрея Тихонова и Дэвида Л. Филлипса. Некоторые авторы используют термин Тихонов–Филлипсовская регуляризация. Конечномерный случай был подробно рассмотрен Артуром Э. Хоерлом, который использовал статистический подход, и Манусом Фостером, который интерпретировал этот метод как фильтр Винера–Колмогорова (Кригинг). Вслед за Хоерлом в статистической литературе она известна как гребневая регрессия, названная в честь гребневого анализа ("гребень" относится к траектории ограниченного максимума).
Tikhonov regularization was invented independently in many different contexts. It became widely known through its application to integral equations in the works of Andrey Tikhonov and David L. Phillips. Some authors use the term Tikhonov–Phillips regularization. The finite dimensional case was expounded by Arthur E. Hoerl, who took a statistical approach, and by Manus Foster, who interpreted this method as a Wiener–Kolmogorov (Kriging) filter. Following Hoerl, it is known in the statistical literature as ridge regression, named after ridge analysis ("ridge" refers to the path from the constrained maximum).
Регуляризация в пространстве Гильберта
Обычно дискретные линейные плохо обусловленные задачи возникают в результате дискретизации интегральных уравнений, и Тихоновскую регуляризацию можно сформулировать в исходном бесконечномерном контексте. В вышесказанном можно интерпретировать как компактный оператор в гильбертовых пространствах, а и как элементы области определения и области значений оператора. Оператор является самосопряжённым, ограниченным и обратимым.
Typically discrete linear ill conditioned problems result from discretization of integral equations, and one can formulate a Tikhonov regularization in the original infinite dimensional context. In the above we can interpret as a compact operator on Hilbert spaces, and and as elements in the domain and range of The operator is then a self adjoint bounded invertible operator.
Отношение к вероятностной формулировке
Вероятностная формулировка обратной задачи вводит (при условии, что все неопределенности имеют гауссовское распределение) матрицу ковариации, представляющую априорные неопределенности параметров модели, и матрицу ковариации, представляющую неопределенности наблюдаемых параметров. В частном случае, когда эти две матрицы диагональные и изотропные, и , и в этом случае уравнения обратной теории упрощаются до вышеприведенных уравнений, с .
The probabilistic formulation of an inverse problem introduces (when all uncertainties are Gaussian) a covariance matrix representing the a priori uncertainties on the model parameters, and a covariance matrix representing the uncertainties on the observed parameters. In the special case when these two matrices are diagonal and isotropic, and , and, in this case, the equations of inverse theory reduce to the equations above, with .
Байесовская интерпретация
Хотя на первый взгляд выбор решения этой регуляризованной задачи может показаться искусственным, и матрица действительно выглядит довольно произвольной, этот процесс можно обосновать с байесовской точки зрения. Следует отметить, что для некорректно поставленной задачи необходимо вводить дополнительные предположения, чтобы получить единственное решение. В статистике априорное распределение вероятностей часто принимается за многомерное нормальное распределение. Для упрощения здесь делаются следующие допущения: средние значения равны нулю, их компоненты независимы, а компоненты имеют одинаковое стандартное отклонение. Данные также подвержены ошибкам, и предполагается, что ошибки в также независимы, имеют нулевое среднее и стандартное отклонение. При этих допущениях решение Тихонова, полученное методом регуляризации, является наиболее вероятным решением, учитывая данные и априорное распределение, согласно теореме Байеса. Если предположение о нормальности заменить допущениями о гомоскедастичности и некоррелированности ошибок, и при этом сохранить допущение о нулевом среднем, то теорема Гаусса — Маркова подразумевает, что решение является минимальным несмещенным линейным оценщиком.
Although at first the choice of the solution to this regularized problem may look artificial, and indeed the matrix seems rather arbitrary, the process can be justified from a Bayesian point of view. Note that for an ill posed problem one must necessarily introduce some additional assumptions in order to get a unique solution. Statistically, the prior probability distribution of is sometimes taken to be a multivariate normal distribution. For simplicity here, the following assumptions are made: the means are zero; their components are independent; the components have the same standard deviation The data are also subject to errors, and the errors in are also assumed to be independent with zero mean and standard deviation Under these assumptions the Tikhonov regularized solution is the most probable solution given the data and the a priori distribution of , according to Bayes' theorem. If the assumption of normality is replaced by assumptions of homoscedasticity and uncorrelatedness of errors, and if one still assumes zero mean, then the Gauss–Markov theorem entails that the solution is the minimal unbiased linear estimator.