Кіріспе
Жылжымалы орташа және полиномиялық регрессия әдісі деректерді тегістеу үшін қолданылады. Жергілікті регрессия немесе жергілікті полиномиялық регрессия, сондай-ақ жылжымалы регрессия деп аталатын бұл әдіс, жылжымалы орташа және полиномиялық регрессияның жалпылау түрі болып табылады. Оның ең көп таралған әдістері, бастапқыда шашыраңқы сызбаларды тегістеу үшін әзірленген, LOESS (жергілікті бағаланған шашыраңқы сызбаларды тегістеу) және LOWESS (жергілікті салмақталған шашыраңқы сызбаларды тегістеу) болып табылады, екеуі де "/l/oʊ/ɛ/s/ LOHess" деп айтылады. Бұл екі әдіс бір-бірімен тығыз байланысты, параметрлік емес регрессия әдістері болып табылады және k жақын көршіге негізделген мета-модельде бірнеше регрессия модельдерін біріктіреді. Кейбір салаларда LOESS белгілі және көбінесе Savitzky–Golay сүзгісі деп аталады (LOESS-тен 15 жыл бұрын ұсынылған). Осылайша, LOESS және LOWESS сызықтық және сызықтық емес ең кіші квадраттардың регрессиясы сияқты «классикалық» әдістерге негізделген. Олар классикалық процедуралардың тиімді жұмыс істемейтін немесе артық еңбексіздіксіз қолданыла алмайтын жағдайларын шешеді. LOESS сызықтық ең кіші квадраттар регрессиясының қарапайымдылығын және сызықтық емес регрессияның икемділігін біріктіреді. Ол деректердің локальды бөліктеріне қарапайым модельдерді орнату арқылы деректердегі өзгерістің детерминистік бөлігін сипаттайтын функцияны құрады. Бұл әдістің басты артықшылығы – деректерді талдаушыдан модельге сәйкес келтіру үшін кез келген нысандағы жаһандық функцияны көрсетуді талап етпейді, тек деректердің сегменттерін сәйкес келтіру қажет. Бұл мүмкіндіктердің айырбасы – есептеулердің күрделілігінің артуы. Өте есептеуге талапты болғандықтан, LOESS ең кіші квадраттар регрессиясы дамыған кезеңде қолдануға іс жүзінде мүмкін болмас еді. Процестерді модельдеудің көптеген басқа да қазіргі заманғы әдістері осы жағынан LOESS-ке ұқсас. Бұл әдістер қазіргі есептеу мүмкіндіктерін толыққанды пайдалану және дәстүрлі тәсілдермен оңай қол жеткізе алмайтын мақсаттарға жету үшін саналы түрде жасалған. Осы статистикалық әдіспен алынған деректер жиынтығының тегіс қисығы loess қисығы деп аталады, әсіресе әрбір тегістелген мән y осьтің шашыраңқы диаграммасының өлшемдік айнымалысының мәндерінің аралығында салмақталған квадраттық ең кіші квадраттардың регрессиясымен берілген жағдайда. Егер әрбір тегістелген мән аралықта салмақталған сызықтық ең кіші квадраттардың регрессиясымен берілсе, онда ол lowess қисығы деп аталады; алайда, кейбір мамандар lowess және loess терминдерін синонимдер ретінде қарастырады. k дәрежелі полиномиалға сәйкес келу үшін кем дегенде k + 1 нүкте қажет болғандықтан, тегістеу параметрі 0-ден 1-ге дейін болуы керек, мұндағы жергілікті полиномиалдың дәрежесін білдіреді. Тегістеу параметрі деп аталатын бұл параметр LOESS регрессия функциясының икемділігін анықтайды. Үлкен мәндер деректердің ауытқуларына жауап ретінде ең аз қозғалатын ең тегіс функцияларды тудырады. Параметрдің мәні кішірек болса, регрессия функциясы деректерге соғұрлым жақын болады. Тегістеу параметрінің тым кішкентай мәнін пайдалану ұсынылмайды, өйткені регрессия функциясы деректердегі кездейсоқ қателерді ұстап ала бастайды.
Local regression or local polynomial regression, also known as moving regression, is a generalization of the moving average and polynomial regression. Its most common methods, initially developed for scatterplot smoothing, are LOESS (locally estimated scatterplot smoothing) and LOWESS (locally weighted scatterplot smoothing), both pronounced '/l//oʊ//ɛ//s/ LOHess. They are two strongly related non parametric regression methods that combine multiple regression models in a k nearest neighbor based meta model. In some fields, LOESS is known and commonly referred to as Savitzky–Golay filter (proposed 15 years before LOESS). LOESS and LOWESS thus build on "classical" methods, such as linear and nonlinear least squares regression. They address situations in which the classical procedures do not perform well or cannot be effectively applied without undue labor. LOESS combines much of the simplicity of linear least squares regression with the flexibility of nonlinear regression. It does this by fitting simple models to localized subsets of the data to build up a function that describes the deterministic part of the variation in the data, point by point. In fact, one of the chief attractions of this method is that the data analyst is not required to specify a global function of any form to fit a model to the data, only to fit segments of the data. The trade off for these features is increased computation. Because it is so computationally intensive, LOESS would have been practically impossible to use in the era when least squares regression was being developed. Most other modern methods for process modeling are similar to LOESS in this respect. These methods have been consciously designed to use our current computational ability to the fullest possible advantage to achieve goals not easily achieved by traditional approaches. A smooth curve through a set of data points obtained with this statistical technique is called a loess curve, particularly when each smoothed value is given by a weighted quadratic least squares regression over the span of values of the y axis scattergram criterion variable. When each smoothed value is given by a weighted linear least squares regression over the span, this is known as a lowess curve; however, some authorities treat lowess and loess as synonyms. Since a polynomial of degree k requires at least k + 1 points for a fit, the smoothing parameter must be between and 1, with denoting the degree of the local polynomial. is called the smoothing parameter because it controls the flexibility of the LOESS regression function. Large values of produce the smoothest functions that wiggle the least in response to fluctuations in the data. The smaller is, the closer the regression function will conform to the data. Using too small a value of the smoothing parameter is not desirable, however, since the regression function will eventually start to capture the random error in the data.
Жергілікті көптік сандардың дәрежесі
Жергілікті полиномиалдар деректердің әрбір кіші жиынтығына сәйкес келеді және көбінесе бірінші немесе екінші дәрежелі болады; яғни, жергілікті түрде сызықтық (тура сызық түрінде) немесе жергілікті түрде квадраттық. 0 дәрежелі полиномиалды қолдану LOESS-ті салмақты жылжымалы орташаға айналдырады. Жоғары дәрежелі полиномиалдар теориялық тұрғыдан жұмыс істейді, бірақ LOESS-тің мақсатына сай келмейтін модельдерді тудырады. LOESS кез келген функцияны шағын ауданда төмен дәрежелі полиномиалмен жақсы жуықтауға болады және қарапайым модельдерді деректерге оңай бейімдеуге болады деген идеяға негізделген. Жоғары дәрежелі полиномиалдар әрбір кіші жиынтықта деректерді шамадан тыс бейімдеуге бейім және сандық тұрақсыздыққа ұшырайды, бұл дәл есептеулерді қиындатады.
Артықшылықтар
Жоғарыда талқыланғандай, LOESS-тің көптеген басқа әдістерден басты артықшылығы – модельді нақты деректерге бейімдеу процесі функцияны анықтаудан басталмайды. Оның орнына, сарапшы тек тегістеу параметрінің мәнін және жергілікті полиномның дәрежесін көрсетуі керек. Бұған қоса, LOESS өте икемді, сондықтан теориялық моделі жоқ күрделі процестерді модельдеуге өте ыңғайлы. Осы екі артықшылық, әдістің қарапайымдылығымен қосылғанда, LOESS-ті ең кіші квадраттар регрессиясының жалпы шеңберіне сәйкес келетін, бірақ күрделі детерминистік құрылымы бар қолданулар үшін қазіргі заманғы регрессия әдістерінің ең тартымдыларының біріне айналдырады. Бұл әдіс сызықтық ең кіші квадраттар регрессиясына байланысты басқа әдістерге қарағанда көзге түспесе де, LOESS осы процедуралардың көптеген пайдаларын да қамтиды. Олардың ең маңыздысы – болжамдар мен калибрлеу үшін қателіктерді есептеу теориясы. Ең кіші квадраттар модельдерін тексеру үшін қолданылатын көптеген басқа сынақтар мен процедураларды LOESS модельдеріне де қолдануға болады.
Кемшіліктер
LOESS басқа ең кіші квадраттар әдістеріне қарағанда деректерді тиімді пайдаланбайды. Жақсы модельдер жасау үшін оған өте үлкен, тығыз үлгіленген деректер жиынтығы қажет. Бұл LOESS жергілікті дерек құрылымына сүйене отырып, жергілікті реттеуді жүзеге асырады. Осылайша, LOESS эксперименттік шығындардың жоғары болуы есебінен деректерді күрделі емес талдауды қамтамасыз етеді. LOESS-тің тағы бір кемшілігі – ол математикалық формуламен оңай бейнеленетін регрессиялық функцияны жасамайды. Бұл талдау нәтижелерін басқа адамдарға жеткізуді қиындатады. Регрессиялық функцияны басқа біреуге беру үшін оларға деректер жиынтығы және LOESS есептеулеріне арналған бағдарламалық құрал қажет болады. Ал сызықтық емес регрессияда белгісіз параметрлер мен олардың шамаланған қателіктерін беру үшін функционалдық түрді ғана жазу жеткілікті. Бұл LOESS-ті пайдаланудың маңызды немесе екіншілік кемшілігі болуы мүмкін, бұл қолданылуына байланысты. Атап айтқанда, LOESS-тің қарапайым түрін механизмдік модельдеу үшін қолдануға болмайды, онда реттелген параметрлер жүйенің нақты физикалық қасиеттерін көрсетеді. Соңында, жоғарыда айтылғандай, LOESS – есептеулерді көп талап ететін әдіс (біркелкі араласқан деректер үшін регрессияны себеп-салдарлық байланысы жоқ шекті импульстік жауап сүзгісі ретінде қарастыруға болады). LOESS, басқа ең кіші квадраттар әдістері сияқты, деректер жиынтығындағы аномальды мәндердің әсеріне де сезімтал. LOESS-тің итеративті, берік нұсқасы бар [Кливленд (1979)], оны LOESS-тің аномальды мәндерге сезімталдығын азайту үшін пайдалануға болады, бірақ тым көп шекті аномальды мәндер тіпті берік әдісті де жеңуі мүмкін.