Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Дұрыс емес қойылған мәселелер үшін реттеу техникасы
Regularization technique for ill posed problems
Ридж регрессиясы – тәуелсіз айнымалылардың жоғары корреляцияланған жағдайларда көптік регрессиялық модельдердің коэффициенттерін бағалау әдісі. Ол экономиметрия, химия және инженерия сияқты көптеген салаларда қолданылған. Жалпы алғанда, бұл әдіс параметрлерді бағалау мәселелерінде тиімділікті арттырады, бірақ оның орнына белгілі бір деңгейде бұрмалауға келісуді қажет етеді (біржалық-дисперсиялық арақатынасқа қараңыз). Бұл теория алғаш рет 1970 жылы Хоерл мен Кеннардтың «Технометрика» журналындағы «Ридж регрессиясы: ортогоналды емес мәселелердің бұрмаланған бағалауы» және «Ридж регрессиясы: ортогоналды емес мәселелерде қолданылуы» атты мақалаларында ұсынылды. Ридж регрессиясы сызықтық регрессиялық модельдерде көптүсті (жоғары корреляцияланған) тәуелсіз айнымалылар болған кезде ең кіші квадраттар бағалаушыларының дәлсіздігіне ұсынылған шешім ретінде әзірленді. Бұл ридж параметрлерін бағалаудың дәлдігін арттырады, өйткені оның дисперсиясы және орташа квадраттық қатесі бұрын алынған ең кіші квадраттар бағалаушыларынан көбінесе төмен болады.
Ridge regression is a method of estimating the coefficients of multiple regression models in scenarios where the independent variables are highly correlated. It has been used in many fields including econometrics, chemistry, and engineering. In general, the method provides improved efficiency in parameter estimation problems in exchange for a tolerable amount of bias (see bias–variance tradeoff). The theory was first introduced by Hoerl and Kennard in 1970 in their Technometrics papers "Ridge regressions: biased estimation of nonorthogonal problems" and "Ridge regressions: applications in nonorthogonal problems". Ridge regression was developed as a possible solution to the imprecision of least square estimators when linear regression models have some multicollinear (highly correlated) independent variables—by creating a ridge regression estimator (RR). This provides a more precise ridge parameters estimate, as its variance and mean square estimator are often smaller than the least square estimators previously derived.
Шолу
Ең қарапайым жағдайда, дерлік сингүляр момент матрицасының мәселесі диагональдарға оң элементтер қосу арқылы жеңілдетіледі, соның нәтижесінде оның шартты саны төмендейді. Ең кіші квадраттар бағалауынша, қарапайым қырқалық бағалаушы былай беріледі:
In the simplest case, the problem of a near singular moment matrix is alleviated by adding positive elements to the diagonals, thereby decreasing its condition number. Analogous to the ordinary least squares estimator, the simple ridge estimator is then given by
мұнда – регрессияланатын айнымалы, – жобалау матрицасы, – бірлік матрицасы, ал қырқалық параметр – момент матрицасының диагональдарын тұрақты түрде жылдырушы параметр. Бұл бағалаушының шектеуге байланысты ең кіші квадраттар мәселесінің шешімі екенін көрсетуге болады, оны Лагранж функциясы арқылы көрсетуге болады:
where is the regressand, is the design matrix, is the identity matrix, and the ridge parameter serves as the constant shifting the diagonals of the moment matrix. It can be shown that this estimator is the solution to the least squares problem subject to the constraint , which can be expressed as a Lagrangian:
Бұл шектеудің Лагранж көбейткіші екенін көрсетеді. Әдетте, қырқалық параметр эвристикалық критерий бойынша таңдалады, сондықтан шектеу дәл орындалмайды. Атап айтқанда, егер шектеу орындалмаса, қырқалық бағалаушы ең кіші квадраттар бағалаушысына дейін тосып қалады. Тихонов реттеуіне қатысты көбірек жалпы тәсіл төменде талқыланады.
which shows that is nothing but the Lagrange multiplier of the constraint. Typically, is chosen according to a heuristic criterion, so that the constraint will not be satisfied exactly. Specifically in the case of , in which the constraint is non binding, the ridge estimator reduces to ordinary least squares. A more general approach to Tikhonov regularization is discussed below.
Тарих
Тихоновтың реттелуі көптеген түрлі контексттерде тәуелсіз түрде ойлап табылды. Ол Андрей Тихонов пен Дэвид Л. Филлипстің еңбектерінде интегралдық теңдеулерге қолданылуы арқылы кеңінен танымал болды. Кейбір авторлар Тихонов-Филипс реттелуі терминін қолданады. Шектелген өлшемді жағдайды Артур Э. Хоерл статистикалық тәсілмен, ал Манус Фостер бұл әдісті Винер-Колмогоров (Кригинг) сүзгісі ретінде түсіндірді. Хоерлден кейін ол статистикалық әдебиетте "қырқалық регрессия" деп белгілі, бұл атау "қырқалық" талдауынан (қырқалық – шектелген максимумға апаратын жол) шыққан.
Tikhonov regularization was invented independently in many different contexts. It became widely known through its application to integral equations in the works of Andrey Tikhonov and David L. Phillips. Some authors use the term Tikhonov–Phillips regularization. The finite dimensional case was expounded by Arthur E. Hoerl, who took a statistical approach, and by Manus Foster, who interpreted this method as a Wiener–Kolmogorov (Kriging) filter. Following Hoerl, it is known in the statistical literature as ridge regression, named after ridge analysis ("ridge" refers to the path from the constrained maximum).
Гилберт кеңістігіндегі реттеу
Әдетте дискретті сызықтық нашар шарты бар проблемалар интегралдық теңдеулерді дискреттеуден туындайды, және бастапқы шексіз өлшемдік контексте Тихонов регуляризациясын құруға болады. Жоғарыда айтылғандарды Гильберт кеңістіктеріндегі компакт оператор ретінде, ал және элементтері оператордың домені мен мәндік кеңістігіндегі элементтер ретінде қарастыруға болады. Оператор – өзін-өзі қосатын, шектелген, кері айналатын оператор.
Typically discrete linear ill conditioned problems result from discretization of integral equations, and one can formulate a Tikhonov regularization in the original infinite dimensional context. In the above we can interpret as a compact operator on Hilbert spaces, and and as elements in the domain and range of The operator is then a self adjoint bounded invertible operator.
Ықтималдық формуламен байланысы
Кері проблеманың ықтималдық тұжырымы (барлық белгісіздіктер Гаусс екендігі шартты) модель параметрлеріндегі алдын ала белгісіздіктерді көрсететін ковариациялық матрицаны және байқалған параметрлердегі белгісіздіктерді көрсететін ковариациялық матрицаны енгізеді. Егер бұл екі матрица диагональды және изотроптық болса, және , және осы жағдайда кері теория теңдеулері жоғарыда келтірілген теңдеулерге дейін тосылады, .
The probabilistic formulation of an inverse problem introduces (when all uncertainties are Gaussian) a covariance matrix representing the a priori uncertainties on the model parameters, and a covariance matrix representing the uncertainties on the observed parameters. In the special case when these two matrices are diagonal and isotropic, and , and, in this case, the equations of inverse theory reduce to the equations above, with .
Бейес интерпретациясы
Алғашында осы реттелген мәселенің шешімін таңдау жасанды көрінуі мүмкін, және шын мәнінде матрица өте кездейсоқ сияқты болса да, бұл процесті Байес тұрғысынан негіздеуге болады. Есте сақтаңыз, нашар қойылған мәселеде бірегей шешім алу үшін міндетті түрде қосымша шарттар енгізу қажет. Статистикалық тұрғыдан алғанда, жиі кездесетін жағдайда -ның алдын ала ықтималдық таралуы көпөлшемді қалыпты таралым ретінде қарастырылады. Қарапайымдық үшін мынадай шарттар қабылданады: орташа мәндері нөлге тең; олардың компоненттері тәуелсіз; компоненттерінің стандартты қатеуі бірдей. Деректер де қателіктерге ұшырайды, және -дағы қателіктер де нөлдік орташа және стандартты қатеумен тәуелсіз деп есептеледі. Осы шарттар бойынша, Тихоновтың реттелген шешімі – Байес теоремасына сәйкес, деректер мен -ның априорлық таралымы берілгендегі ең мүмкін шешім болып табылады. Егер қалыптылық туралы шарттар, қателіктердің гомоскедастикалық және корреляциясыздық шарттарымен ауыстырылса, және орташа мәні нөл деп қабылданса, онда Гаусс-Марков теоремасы шешімнің ең төменгі қиыссыз сызықтық бағалаушы екенін көрсетеді.
Although at first the choice of the solution to this regularized problem may look artificial, and indeed the matrix seems rather arbitrary, the process can be justified from a Bayesian point of view. Note that for an ill posed problem one must necessarily introduce some additional assumptions in order to get a unique solution. Statistically, the prior probability distribution of is sometimes taken to be a multivariate normal distribution. For simplicity here, the following assumptions are made: the means are zero; their components are independent; the components have the same standard deviation The data are also subject to errors, and the errors in are also assumed to be independent with zero mean and standard deviation Under these assumptions the Tikhonov regularized solution is the most probable solution given the data and the a priori distribution of , according to Bayes' theorem. If the assumption of normality is replaced by assumptions of homoscedasticity and uncorrelatedness of errors, and if one still assumes zero mean, then the Gauss–Markov theorem entails that the solution is the minimal unbiased linear estimator.