Кіріспе
Статистикадағы регрессиялық талдаудың ерекше түрі. Қатаң статистикада қатаң регрессия дәстүрлі регрессиялық талдаудың кейбір шектеулерін жоюға бағытталған. Регрессиялық талдау бір немесе бірнеше тәуелсіз айнымалылар мен тәуелді айнымалы арасындағы қатынасты модельдейді. Регрессияның стандартты түрлері, мысалы, ең кіші квадраттар әдісі, негізгі болжамдары орындалса, жақсы қасиеттерге ие, бірақ олар орындалмаған жағдайда қате нәтижелер бере алады (яғни, болжамдар бұзылғанда тұрақты емес). Қатаң регрессия әдістері деректерді құру процесіндегі болжамдардың бұзылуының регрессиялық бағалауларға тигізетін әсерін шектеу үшін жасалған. Мысалы, регрессиялық модельдер үшін ең кіші квадраттар бағалауы сыртқы мәндерге өте сезімтал: әдеттегі бақылаудың қателік мөлшерінен екі есе үлкен қателік, квадраттық қателік жоғалтуына төрт (екінің квадраты) есе көп үлес қосады, демек регрессиялық бағалауларға күштірек әсер етеді. Хьюбер шығын функциясы стандартты квадраттық қате шығынына берік балама болып табылады, ол сыртқы мәндердің квадраттық қателік жоғалтуына қосқан үлесін азайтады, осылайша олардың регрессиялық бағалауларға тигізетін әсерін шектейді.
In robust statistics, robust regression seeks to overcome some limitations of traditional regression analysis. A regression analysis models the relationship between one or more independent variables and a dependent variable. Standard types of regression, such as ordinary least squares, have favourable properties if their underlying assumptions are true, but can give misleading results otherwise (i. e. are not robust to assumption violations). Robust regression methods are designed to limit the effect that violations of assumptions by the underlying data generating process have on regression estimates. For example, least squares estimates for regression models are highly sensitive to outliers: an outlier with twice the error magnitude of a typical observation contributes four (two squared) times as much to the squared error loss, and therefore has more leverage over the regression estimates. The Huber loss function is a robust alternative to standard square error loss that reduces outliers' contributions to the squared error loss, thereby limiting their impact on regression estimates.
Гетероскедастикалық қателер
Қатаң бағалауды қолдану қажет болатын жағдайлардың бірі – гетероскедастичность күдігі туғанда. Гомоскедастичность модельде қателік мүшесінің дисперсиясы x-тің барлық мәндері үшін тұрақты деп қарастырылады. Гетероскедастичность дисперсияның x-ке тәуелді болуына рұқсат береді, бұл көптеген нақты жағдайларда дәлірек болады. Мысалы, жоғары табысқа ие адамдардағы шығындардың дисперсиясы, табысы төмен адамдарға қарағанда көбінесе жоғары болады. Бағдарламалық қамтамасыздандыру пакеттері әдетте гомоскедастичность моделін таңдайды, тіпті мұндай модель гетероскедастичность модельге қарағанда нашар дәлдікке ие болуы мүмкін. Бір қарапайым тәсіл (Tofallis, 2008) – пайыздық қателерге ең кіші квадраттар әдісін қолдану, себебі бұл тәуелді айнымалының үлкен мәндерінің ықпалын азайтады.
Аутсалерлардың болуы
Қатты бағалауды қолданатын тағы бір жиі кездесетін жағдай – деректерде сыртқы мәндердің болуы. Егер деректердің қалған бөлігін тудырған процестен өзгеше процестен пайда болған сыртқы мәндер болса, ең кіші квадраттар әдісі тиімсіз болады және қате нәтиже беруі мүмкін. Ең кіші квадраттардың болжамдары сыртқы мәндерге қарай тартылатындықтан және бағалаулардың дисперсиясы жасанды түрде үлкейтілетіндіктен, сыртқы мәндер жасырынып қалуы мүмкін. (Көптеген жағдайларда, оның ішінде геостатистика мен медициналық статистиканың кейбір салаларында, зерттеушілердің назары осы сыртқы мәндерге ауады.) Кейде ең кіші квадраттар (немесе классикалық статистикалық әдістер жалпы) берік деп айтылғанымен, олардың беріктігі модель талаптары бұзылған жағдайда I типтегі қателік деңгейінің артуын болдырмауында ғана. Шындығында, I типтегі қателік деңгейі номиналды деңгейден төмен болады, ал II типтегі қателік деңгейі көбінесе күрт өседі. I типтегі қателік деңгейін төмендету классикалық әдістердің консервативтілігі деп аталады.
Қатты регрессияның тарихы мен танымалдылығы
Көптеген жағдайларда ең кіші квадраттар бағалауынан артық нәтижелер көрсетсе де, регрессияға арналған берік әдістер әлі де кеңінен қолданылмайды. Олардың танымалдылығын түсіндіруге бірнеше себептер көмектесуі мүмкін (Hampel et al. 1986, 2005 жж.). Мүмкін, бір себеп – бірнеше бәсекелес әдістердің болуы және осы сала көптеген сәтсіз бастамаларға ұшырауы. Сонымен қатар, берік бағалауларды есептеу ең кіші квадраттар бағалауына қарағанда едәуір көп есептеу ресурстарын қажет етеді; алайда, соңғы жылдары бұл қарсылық маңыздылығын жоғалтты, себебі есептеу қуаты күрт артты. Тағы бір себеп – кейбір танымал статистикалық бағдарламалық пакеттердің бұл әдістерді іске асыра алмауы мүмкін (Stromberg, 2004). Шындығында, берік регрессия әдістерінің танымалдылығының ең маңызды себебі – қателік дисперсиясы өте үлкен немесе мүлдем болмаған жағдайда, кез келген деректер жиынтығы үшін регрессия коэффициенттерінің кез келген бағасы, берік болсын, болмасын, үлгінің көлемі өте үлкен болмаса, іс жүзінде пайдасыз болады. Берік әдістерді қабылдау баяу болғанына қарамастан, қазіргі заманғы негізгі статистикалық оқулықтарда осы әдістер талқыланады (мысалы, әртүрлі берік регрессия әдістерінің бір-бірінен қалай дамығаны туралы толық сипаттама үшін қараңыз). Сонымен қатар, R, Statsmodels, Stata және S PLUS сияқты заманауи статистикалық бағдарламалық пакеттер берік бағалау үшін кең мүмкіндіктерді ұсынады (мысалы, қараңыз).
Ең кіші квадраттар
Регрессиялық модельдегі ең аз квадраттар бағалауларына қарағанда ауытқуларға (outliers) аз сезімтал параметрлерді бағалаудың ең қарапайым әдісі – ең аз абсолютті ауытқуларды қолдану. Дегенмен, тіпті сонда да, айқын ауытқулар модельге елеулі әсер етуі мүмкін, бұл одан да мықты тәсілдерді зерттеуге түрткі болады. 1964 жылы Губер регрессия үшін M-бағалауды енгізді. M-бағалаудағы «M» әрпі «максималды ықтималдыққа ұқсас» дегенді білдіреді. Бұл әдіс жауап айнымалындағы ауытқуларға төзімді, бірақ түсіндірме айнымалыларындағы ауытқуларға (жетекші нүктелерге) төзімді емес болып шықты. Шындығында, түсіндірме айнымалыларында ауытқулар болған жағдайда, бұл әдістің ең аз квадраттар бағалауларынан артықшылығы жоқ. 1980 жылдары М-бағалаудың кемшіліктерін жою мақсатында бірнеше балама ұсынылды. Бұл туралы өте практикалық шолуды қараңыз. Ең аз қиылған квадраттар (LTS) тиімді балама болып табылады және қазіргі уақытта (2007) Rousseeuw және Ryan (1997, 2008) ұсынатын балама болып саналады. Theil–Sen бағалаушысы LTS-ке қарағанда төменгі бұзылу нүктесіне ие, бірақ статистикалық тұрғыдан тиімді және танымал. Тағы бір ұсынылған шешім – S-бағалау. Бұл әдіс қалдықтардың масштабының мықты бағалауын (әдіс атауындағы «S» әрпі осыдан шыққан) барынша азайтатын түзу сызықты (жазықтықты немесе гипержазықтықты) анықтайды. Бұл әдіс жетекші нүктелерге өте төзімді және жауап айнымалысындағы ауытқуларға берік. Алайда, бұл әдіс тиімді емес екені де анықталды. MM-бағалау S-бағалаудың беріктігі мен төзімділігін сақтап, M-бағалаудың тиімділігін арттыруға бағытталған. Әдіс қалдықтардың масштабының M-бағалауын барынша азайтатын өте берік және төзімді S-бағалауды табу арқылы жүзеге асырылады (әдіс атауындағы бірінші «M»). Алынған масштаб тұрақты ұсталып, параметрлердің M-ға жақын бағасы анықталады (екінші «M»).
Параметрлік баламалар
Регрессиялық модельдерді сенімді бағалаудың тағы бір тәсілі – қалыпты үлестіруді ауыр құйрықты үлестірумен алмастыру. Әртүрлі практикалық жағдайларда 4–6 еркіндік дәрежесі бар t-үлестірімі жақсы таңдау болып табылады. Толық параметрлік болғандықтан, Бейестік берік регрессия мұндай үлестірілімдерге көп тәуелді. t-үлестірілген қалдықтарды болжамдау бойынша, үлестіру орын-масштабты отбасы болып табылады. Яғни, t-үлестірімінің еркіндік дәрежесі кейде куртоз параметрі деп аталады. Ланге, Литтл және Тейлор (1989) бұл модельді Бейестік емес көзқарас тұрғысынан тереңінен талқылайды. Бейестік талдауы Gelman және авторлар (2003) еңбегінде келтірілген. Балама параметрлік тәсіл – қалдықтар қалыпты үлестірілімдердің қоспасын ұстанады деп есептеу (Daemi et al. 2019); атап айтқанда, ластанған қалыпты үлестіру, онда байқаулардың көпшілігі белгіленген қалыпты үлестіруден, ал шағын бөлігі әлдеқайда жоғары дисперсиясы бар қалыпты үлестіруден алынған. Яғни, қалдықтардың дисперсиясы бар қалыпты үлестіруден пайда болу ықтималдығы , мұнда кішкентай, ал дисперсиясы бар қалыпты үлестіруден пайда болу ықтималдығы :
Көбінесе, бұл ластану моделі деп аталады. Параметриялық тәсілдердің артықшылығы – ықтималдық теориясы тұжырымдамаға дайын шешім ұсынады (дегенмен, ластану моделі сияқты қоспа модельдері үшін әдеттегі реттелу шарттары қолданылмауы мүмкін), сондай-ақ, сәйкестік нәтижелерінен симуляциялық модельдер құруға болады. Алайда, мұндай параметрлік модельдер негізгі модельдің сөзбе-сөз дұрыс екенін болжайды. Осылайша, олар қисық қалдық үлестірулерді немесе бақылаулардың шекті дәлдігін ескермейді.
Бірлік салмағы
Тағы бір сенімді әдіс – бірлік салмақтарды қолдану (Wainer & Thissen, 1976), бұл әдіс бір нәтижеге бірнеше фактор әсер ететін жағдайларда қолданылуы мүмкін. Эрнест Берджес (1928) бірлік салмақтарды шартты түрде босатудың табыстылығын болжау үшін пайдаланды. Ол 21 позитивті факторды қатысты (мысалы, "бұрынғы қамау жоқ" = 1) немесе қатыспаған (мысалы, "бұрынғы қамау бар" = 0) деп бағалады, содан кейін оларды қосып, болжаушы баллды шығарды, бұл шартты түрде босатудың табыстылығын дұрыс болжауда тиімді екені дәлелденді. Сэмюэл С. Уилкс (1938) регрессиялық салмақтардың барлық жиынтығы өте жоғары корреляцияланған композиттерге, оның ішінде бірлік салмақтарға тең болатынын көрсетті, бұл нәтиже Уилкс теоремасы деп аталады (Ree, Carretta, & Earles, 1998). Робин Доуес (1979) қолданбалы салалардағы шешім қабылдауды зерттеді, соның нәтижесінде бірлік салмақтары бар қарапайым модельдердің адам сарапшыларынан көбінесе жақсы нәтижелер көрсеткені анықталды. Bobko, Roth, and Buster (2007) бірлік салмақтары туралы зерттеулерді қарап шығып, ондаған жылдар бойы жүргізілген эмпирикалық зерттеулер бірлік салмақтарының кросс-валидацияда әдеттегі регрессиялық салмақтарымен шамалас нәтижелер беретінін көрсетті деген қорытындыға келді.
Мысалы: BUPA-ның бауыр туралы деректері
BUPA бауыр деректерін әртүрлі авторлар зерттеді, соның ішінде Breiman (2001). Деректерді классикалық деректер жинағы бетінен табуға болады, ал Box-Cox түрлендіру туралы мақалада талқылаулар бар. ALT логарифмінің γGT логарифміне қарсы графигі төменде көрсетілген. Екі регрессия сызығы – әділ ең кіші квадраттар (OLS) және робустты MM бағалау арқылы есептелген. Талдау R бағдарламасында Venables және Ripley (2002) ұсынған бағдарламалық жасақтаманы пайдалану арқылы жүргізілді. Екі регрессия сызығы өте ұқсас көрінеді (мұндай деректер жинағының мөлшері үшін бұл қалыпты жағдай). Дегенмен, қалдық масштабтарының бағалауларын қарастырғанда, робустты тәсілдің артықшылығы байқалады. Әділ ең кіші квадраттар үшін масштабтың бағасы 0,420, ал робустты әдіс үшін 0,373-ке тең. Осы мысалдағы әділ ең кіші квадраттардың MM бағалауға шаққандағы салыстырмалы тиімділігі 1,266 құрайды. Бұл тиімсіздік гипотезаларды тексеруде қуатты жоғалтуға және бағаланған параметрлерге қатысты қажетсіз кең сенімділік интервалдарына алып келеді.
Аутлиерлерді анықтау
Кәдімгі ең кіші квадраттар әдісінің тиімсіздігінің тағы бір салдары – қалдықтар масштабының бағасы үлкейтілгендіктен, бірнеше сыртқы мәндер (аутлиерлер) жасырылып қалады; масштабталған қалдықтар, масштабтың дұрыс бағасы қолданылғандағыға қарағанда, нөлге жақындатылады. Екі модельдің масштабталған қалдықтарының графиктері төменде келтірілген. X осіндегі айнымалы – деректер жиынтығындағы бақылау нөмірі. Rousseeuw және Leroy (1986) осындай көптеген графикті қамтиды. Горизонтальды анықтамалық сызықтар 2 және -2 деңгейінде орналасқан, сондықтан осы шекарадан тыс кез келген байқалған масштабталған қалдық аутлиер деп есептелуі мүмкін. Айықша, ең кіші квадраттар әдісі көптеген қызықты бақылауларды жасыруға алып келеді. Бір немесе екі өлшемде аутлиерлерді анықтау классикалық әдістермен қолмен жасалса, үлкен деректер жиынтықтарында және жоғары өлшемдерде маскалау мәселесі көптеген аутлиерлерді анықтауды мүмкін емес етеді. Беруші (робастты) әдістер осы бақылауларды автоматты түрде анықтайды, аутлиерлердің болуы жағдайында классикалық әдістерге қарағанда маңызды артықшылық ұсынады.