Кіріспе

Статистика модельдері класы. Статистикада жалпыланған аддитивті модель (GAM) – жауап айнымалысы кейбір болжаушы айнымалылардың белгісіз тегіс функцияларына сызықтық түрде тәуелді болатын жалпыланған сызықтық модель, ал назар осы тегіс функциялар туралы қорытынды шығаруға бағытталған. GAM-дерді бастапқыда Тревор Хасти және Роберт Тибширани жалпыланған сызықтық модельдердің қасиеттерін аддитивті модельдермен үйлестіру үшін жасады. Оларды наив Байес генеративтік моделінің дискриминациялық жалпылауы деп қарастыруға болады. Модель біркелкі жауап айнымалысы Y-ді кейбір болжаушы айнымалыларға, xi-ге байланыстырады. Y үшін экспоненциалдық отбасы үлестірілімі (мысалы, қалыпты, биномдық немесе Пуассон үлестірілімдері) және g байланыс функциясы (мысалы, сәйкестік немесе логарифмдік функциялар) Y-нің күтілетін мәнін болжаушы айнымалылармен байланыстырады, мысалы:

Функциялар fi көрсетілген параметрлік формадағы функциялар болуы мүмкін (мысалы, полином немесе айнымалының жазаланбаған регрессиялық сплині) немесе параметрлік емес немесе жартылай параметрлік түрде, жай ғана ‘тегіс функциялар’ ретінде беріліп, параметрлік емес әдістермен бағалануы мүмкін. Сондықтан, әдеттегі GAM f1(x1) үшін жергілікті салмақталған орташа сияқты шашыраңқы график тегістеу функциясын қолданып, содан кейін f2(x2) үшін факторлық модельді қолдануы мүмкін. Жауап пен болжаушы арасындағы нақты қатынас туралы жеңілдетілген болжамдармен параметрлік емес сәйкестіктерге мүмкіндік беретін бұл икемділік, таза параметрлік модельдерге қарағанда деректерге жақсы сәйкес келу потенциалын ұсынады, бірақ түсіндірілуі кейбір қиындықтар тудыруы мүмкін.

ГАМ-ды орнату әдістері

Бастапқы GAM-ді орнату әдісі модельдің тегіс компоненттерін параметрлік емес тегістегіштерді (мысалы, тегістеу сплайндары немесе жергілікті сызықтық регрессия тегістегіштері) пайдаланып, кері орнату алгоритмі арқылы бағалады. Содан кейін тегістілік дәрежесін жалпыланған кросс-тестілеуді пайдаланып, модельді орнатудың бөлігі ретінде немесе шектелген ең жоғары ықтималдық (REML, кейде "GML" деп аталады) арқылы бағалауға болады, ол сплайн тегістегіштер мен Гаусс кездейсоқ әсерлері арасындағы екіұстамалықты пайдаланады. Бұл толық сплайн тәсілі есептеу шығындарын тудырады, мұнда жауап айнымалысының байқау саны , оны орташа көлемді деректер жиынтықтары үшін біршама тиімсіз етеді. Жақындағы әдістер осы есептеу шығындарын тегістеу үшін қолданылатын негіздің мөлшерін алдын ала азайту (рангты азайту) арқылы немесе Марков кездейсоқ өрістерін пайдаланып, тегістеудің сирең бейнелерін табу арқылы шешті, олар есептеу үшін сирең матрицалық әдістерді қолдануға ыңғайлы. Бұл есептеу тиімділігі жоғары әдістер GCV (немесе AIC немесе ұқсас) немесе REML қолданады немесе модель компоненттерінің тегістілігінің дәрежесі туралы қорытынды жасау үшін толық Байес тәсілін қолданады. REML арқылы тегістілік дәрежесін бағалауды эмпирикалық Байес әдісі ретінде қарастыруға болады. Жоғары өлшемді жағдайларда ерекше артықшылықтары бар баламалы тәсіл – күшейтуді пайдалану, бірақ бұл әдетте белгісіздікті сандық бағалау үшін бутстрапты қажет етеді. Бутстраппен және күшейтумен орнатылған GAM-дар, әдетте, сплайн әдістерін қолдана отырып орнатылған GAM-дардан жақсы нәтижелер көрсетеді.

Кемелдікке төмендетілгендер

Көптеген заманауи ГАМ-дар мен олардың кеңейтулері төмендетілген рангтағы тегістеу әдісіне негізделген, себебі ол салыстырмалы түрде шамалы есептеу шығынымен компоненттік тегістеулердің дұрыс негізделген бағалауын қамтамасыз етеді, сондай-ақ басқа әдістермен салыстырғанда күрделірек болатын модельдерді кеңейтуді жүзеге асыруға мүмкіндік береді. Ең қарапайым түсінігі – модельдегі белгісіз тегіс функцияларды базалық кеңейтулермен алмастыру:

мұнда – белгілі базалық функциялар, әдетте жақсы жақындастыру теориялық қасиеттері үшін таңдалады (мысалы, B-сплайндары немесе төмендетілген рангтағы жұқа пластиналық сплайндары), ал – модельге сәйкес келу процесінде бағаланатын коэффициенттер. Базалық өлшем деректерге шамадан тыс сәйкес келуді болдырмау үшін (модельдің артық қарапайымдалуынан туындаған бұрмалауды болдырмау үшін), бірақ есептеу тиімділігін сақтау үшін жеткілікті үлкен болып таңдалады. Егер болса, онда модельді осылай бағалаудың есептеу шығыны болады. Коэффициенттер тек тұрақты мүшеге дейін анықталады (біз -қа кез келген тұрақтыны қосып, оны -дан алып тастауға болады, бұл модельдің болжамдарын өзгертпейді), сондықтан осы екі мәнділікті жою үшін тегіс мүшелерге сәйкестендіру шектеулері қойылуы керек. Коэффициенттер туралы ең нақты қорытындыны алу үшін, әдетте, 0-ге тең қосынды шектеуі қолданылады, яғни, әрбір -ның оның байқалған ковариаталық мәндеріндегі қосындысы 0-ге тең болуы керек. Мұндай сызықтық шектеулерді базалық жиын құрылған кезде қайта параметрлеу арқылы оңай қолдануға болады. Тегістеуге қатысты бұл Байестік көзқарасты түсіну, сондай-ақ тегістеу параметрлерін бағалауға REML және толық Байес тәсілдерін түсінуге көмектеседі. Бір деңгейде тегістеу жазалары қолданылады, өйткені біз тегіс функцияларды қисық функциялардан ықтимал деп санаймыз, және егер бұл дұрыс болса, онда модельдің қисықтығына алдын ала баға беру арқылы бұл тұжырымды формалдауға болады. Өте қарапайым алдын ала баға:

(мұнда – кейін ыңғайлы болу үшін енгізілген GLM шкаласы параметрі), бірақ бұл орташасы және дәлдік матрицасы бар көпөлшемді қалыпты алдын ала баға ретінде бірден танылады. Жазалау кейбір функцияларды жазаламауға мүмкіндік беретіндіктен (мысалға келтірілген жазалар бойынша түзу сызықтар), рангі кем, ал алдын ала баға шын мәнінде дұрыс емес, оның ковариациялық матрицасы -ның Мур-Пенроуз псевдоинверсісімен берілген (дұрыс еместігі тегіс компоненттерге шексіз дисперсия тағайындауға сәйкес келеді). Бұл, негізінен, эмпирикалық Байес әдістері.

Тегістеу параметрін бағалау

Осыған дейін біз тегістеу параметрлерін ескере отырып, бағалау мен қорытындыны қарастырдық, бірақ оларды да бағалау қажет. Бір тәсіл – толық Байес әдісін қолдану, (лог) тегістеу параметрлеріне априорлы үлестірімдер (priors) беру және модель коэффициенттерінің кейінге қарай (posterior) үлестірімі туралы ақпарат алу үшін стохастикалық модельдеу немесе жоғары дәрежелі жуықтау әдістерін қолдану. Соңында біз модель коэффициенттерін интегралдау арқылы алынған шекті ықтималдылықты (REML) максимизациялауды таңдауға болады. , –ның ықтималдығы болғандықтан, мұны априорлы үлестірімнен алынған кездейсоқ сынамалардың орташа ықтималдығын максимизациялау ретінде қарастыруға болады. Бұл интеграл әдетте аналитикалық түрде шешілмейді, бірақ Лаплас әдісін қолдану арқылы жоғары дәлдікпен жуықтауға болады. Қазір бұл R тіліне GAM пакеті ретінде көшірілді. SAS proc GAM да қайта құру GAM-ды ұсынады. R-де GAM-дар үшін ұсынылатын пакет mgcv, яғни аралас GAM есептеу құралы (mixed GAM computational vehicle). Көптеген балама пакеттер бар. Мысалдарға R пакеттері mboost, векторлық GAM-дарды ұсынатын VGAM жатады. INLA бағдарламалық жасақтамасы Markov кездейсоқ өрістерін пайдалана отырып, толық Байес әдісін іске асырады. GAM-дар енгізетін қосымша тексеру – таңдалған бостандық дәрежелерінің (degrees of freedom) орындылығын тексеру қажеттігі. Бұл әсіресе модель компоненттерінің тегістігін автоматты түрде бағалай алмайтын әдістерді қолданғанда маңызды. Автоматты тегістеу параметрлерін таңдау әдістерін қолданғанда, негіздік өлшемнің (basis dimension) тым кішкентай емес екенін тексеру қажет, бірақ егер терминнің тиімді бостандық дәрежесі оның негіздік өлшемінен төмен болса, онда мұндай жағдай тумауы мүмкін. Қандай жағдайда болсын, тексеру қалдықтардың (residuals) үлгісін қарастыруға негізделеді. Бұл , немесе қалдықтардың орналасуын өзгерту арқылы қалдықтардың үлгісін тексеру үшін қолданылуы мүмкін.

Үлгі таңдау

Тегістеу параметрлері модельді орналастыру процесінің бір бөлігі ретінде есептелгенде, дәстүрлі түрде модельді таңдауға жататын көптеген нәрселер орналастыру процесіне сіңіріледі: тегістеу параметрлерін бағалау әртүрлі функционалдық күрделілікке ие модельдердің бай отбасы арасынан таңдау жасайды. Дегенмен, тегістеу параметрін бағалау әдетте модельден тегіс элементті толығымен жоймайды, себебі көптеген жазалау шаралары кейбір функцияларды жазаламауға мүмкіндік береді (мысалы, тік сызықтар жоғарыда келтірілген сплайн туындысы жазалауынан жазаланбайды). Сондықтан, элементтің модельде болуы керек пе деген сұрақ туындайды. Бұл мәселеге қарапайым тәсіл – GAM-дегі әрбір тегіс элементке қосымша жазалау шарасын қосу, ол әдетте жазаланбайтын тегіс элементтерді жазалайды (және тек соларды ғана). Әрбір қосымша жазалау шарасының өзіндік тегістеу параметрі болады, содан кейін бағалау бұрынғысынша жалғасады, бірақ енді элементтер толығымен нөлге дейін жазалану мүмкіндігімен. Жоғары өлшемді жағдайларда, бұл міндетті лассо немесе иілгіш тор реттеуі арқылы орындауға тырысудың мәні болуы мүмкін. Boosting те модельге сәйкес келу процесінің бөлігі ретінде элементтерді автоматты түрде таңдайды. Алайда, осы мәселеге байланысты тиімді еркіндік дәрежесін түзету орынды нәтижелерге қол жеткізуге көмектеседі. Сонымен қатар, бағдарламалық жасақтама көбінесе жазалау деңгейін арттыруға мүмкіндік береді, бұл тегіс сәйкестікті күшейтуге мүмкіндік береді. Тегістеу параметрлерінің өте көп санын бағалау статистикалық тұрғыдан қиын болуы мүмкін, сонымен қатар, болжамдық қателік критерийлерінің (GCV, AIC және т.б.) айқын жетіспеушілікке ұшырауы мүмкін екендігі белгілі, әсіресе орташа үлгі көлемінде, ал REML бұл жағынан аздап тиімді. Тиіс жағдайларда, GLM сияқты қарапайым модельдер GAM-ға қарағанда артық болуы мүмкін, егер GAM-дар нақты қолданыстағы жарамдылық жиынтықтарында болжамдық қабілетті айтарлықтай жақсартпаса.