Кіріспе

Статистикалық модельдер класы

Статистикада жалпыланған сызықтық модель (GLM) – қалыпты сызықтық регрессияның икемді жалпылауы болып табылады. GLM сызықтық регрессияны байланыс функциясы арқылы жауап айнымалысымен сызықтық модельдің байланысын орнатуға және әрбір өлшемнің дисперсиясы оның күтілетін мәнінің функциясы болуына мүмкіндік беру арқылы жалпылайды. Жалпыланған сызықтық модельдерді Джон Нельдер мен Роберт Уэддерберн сызықтық регрессия, логистикалық регрессия және Пуассон регрессиясы сияқты басқа да статистикалық модельдерді біріктіру мақсатымен жасады. Олар модель параметрлерінің максималды ықтималдықпен бағалауы (MLE) үшін итеративті қайта салмақталған ең кіші квадраттар әдісін ұсынды. MLE әлі де кеңінен қолданылады және көптеген статистикалық есептеу пакеттерінде стандартты әдіс болып табылады. Басқа да тәсілдер, соның ішінде Байес регрессиясы және дисперсияны тұрақтандырылған жауаптарға сәйкестендіру арқылы ең кіші квадраттар әдісі әзірленді.

Интуиция

Кәдімгі сызықтық регрессия белгілі бір белгісіз шаманың (жауап айнымалысы, кездейсоқ айнымалы) күтілетін мәнін байқалған мәндер жиынтығының сызықтық комбинациясы ретінде болжайды. Бұл болжаушыдағы тұрақты өзгеріс жауап айнымалысының тұрақты өзгеруіне әкеледі (яғни сызықтық жауап моделі). Бұл жауап айнымалысы жақсы шамамен, белгілі бір бағытта немесе жалпы алғанда, болжау айнымалыларының өзгеруіне қарағанда салыстырмалы түрде аз мөлшерде өзгеріп отыратын кез келген шама үшін шексіз өзгеруі мүмкін болған кезде орынды, мысалы, адам биіктігі. Алайда, бұл болжамдар жауап айнымалысының кейбір түрлері үшін сәйкес келмейді. Мысалы, жауап айнымалысының әрқашан оң және кең ауқымда өзгеріп отыруы күтілетін жағдайларда, тұрақты кіріс өзгерістері геометриялық (яғни экспоненциалды) түрде өзгеретін шығыс өзгерістеріне әкеледі, тұрақты түрде өзгеретін шығыс өзгерістеріне емес. Мысалы, сызықтық болжау моделі кейбір деректерден (әлдебір үлкен жағалаулардан алынған) температураның 10 градусқа төмендеуі жағалауға 1000 адам аз келуіне әкеледі деп үйренеді. Бұл модель әртүрлі мөлшердегі жағажайларда жақсы жұмыс істемейді. Нақтырақ айтсақ, мәселе мынада: егер сіз модельді 50 адамды қабылдайтын жағажай үшін температураның 10 градусқа төмендеуіне байланысты жаңа келушілер санын болжау үшін қолдансаңыз, сіз -950 адамның мүмкін емес санын болжайсыз. Логикалық тұрғыдан алғанда, дұрыс модель жағажайға келушілердің санының тұрақты өсуін болжайды (мысалы, 10 градусқа өсу жағажайға келушілердің санын екі есеге арттырады, ал 10 градусқа төмендеу жағажайға келушілердің санын екі есеге азайтады). Мұндай модель экспоненциалды жауап моделі деп аталады (немесе логарифмдік-сызықтық модель, өйткені жауаптың логарифмі сызықтық түрде өзгереді деп болжанады). Сол сияқты, «иә/жоқ» таңдау жасау ықтималдығын (Бернулли айнымалысы) болжайтын модель сызықтық жауап моделі ретінде одан да қолайсыз, өйткені ықтималдықтар екі жағынан да шектеледі (олар 0 мен 1 арасында болуы керек). Мысалы, температураға байланысты белгілі бір адамның жағажайға бару ықтималдығын болжайтын модельді қарастырыңыз. Ақылға қонымды модель 10 градустың өзгеруі адамды жағажайға баруға екі есе көбірек немесе азырақ ықтимал етеді деп болжауы мүмкін. Бірақ «екі есе ықтимал» дегеніміз ықтималдық тұрғысынан не білдіреді? Бұл ықтималдық мәнін сөзбе-сөз екі еселеуді білдірмейді (мысалы, 50% 100% болады, 75% 150% болады және т.б.). Керісінше, бәс тігу шарттары екі есеге артады: 2:1-ден 4:1-ге, 8:1-ге және т.б. Мұндай модель – лог-бәс тігу немесе логистикалық модель. Жалпыланған сызықтық модельдер бұл жағдайлардың барлығын қамтиды, жауап айнымалыларына кездейсоқ үлестірімдерге ие болуға (қанағаттанарлық үлестірімдерге емес) және жауап айнымалысының кездейсоқ функциясының (байланыс функциясы) болжаушылармен сызықтық түрде өзгеруіне мүмкіндік береді (жауаптың өзі сызықтық түрде өзгеруі керек деп есептемей). Мысалы, жағажайға келушілердің болжамды санының жоғарыдағы жағдайы әдетте Пуассон үлестірімімен және логтік байланыспен модельденеді, ал жағажайға келушілердің болжамды ықтималдығы Бернулли үлестірімімен (немесе биномдық үлестірім, мәселенің қалай қойылғанына байланысты) және лог-бәс тігу (немесе логит) байланыс функциясымен модельденеді.

Сызықтық болжаушы

Сызықтық болжам – тәуелсіз айнымалылар туралы ақпаратты модельге қосатын шама. Символ η (грекше "эта") сызықтық болжамды белгілейді. Ол байланыс функциясы арқылы деректердің күтілетін мәнімен байланысты. η белгісіз параметрлердің сызықтық комбинациясы (сондықтан, "сызықтық") ретінде β арқылы өрнектеледі. Сызықтық комбинацияның коэффициенттері тәуелсіз айнымалылардың матрицасы X ретінде көрсетіледі. Сондықтан η былай өрнектелуі мүмкін:

Байланыс функциясы

Байланыс функциясы сызықтық болжаушы мен үлестіру функциясының орташа мәні арасындағы қатынасты қамтамасыз етеді. Көптеген қолданылатын байланыс функциялары бар, олардың таңдалуы бірнеше факторларға байланысты. Жауаптың тығыздық функциясының экспонентасынан туындайтын жақсы анықталған каноникалық байланыс функциясы әрқашан болады. Дегенмен, кейбір жағдайларда байланыс функциясының доменін үлестіру функциясының орташа мәнінің диапазонымен сәйкестіруге тырысу немесе алгоритмдік мақсаттар үшін каноникалық емес байланыс функциясын қолдану, мысалы, Байестік пробит регрессиясы, мағыналы болуы мүмкін. Каноникалық параметрмен үлестіру функциясын қолданғанда, каноникалық байланыс функциясы функцияны i.e. арқылы білдіретін функция болып табылады. Ең көп таралған үлестірулер үшін орташа мән – үлестірудің тығыздық функциясының стандартты түріндегі параметрлердің бірі, содан кейін тығыздық функциясын каноникалық түріне бейімдейтін жоғарыда анықталған функция. Каноникалық байланыс функциясын қолданғанда, бұл параметр үшін жеткілікті статистика болуына мүмкіндік береді. Төменде жиі қолданылатын бірнеше экспоненциалдық отбасылық үлестірулер мен олардың әдетте қолданылатын деректері, сондай-ақ каноникалық байланыс функциялары мен олардың кері функциялары (кейде орташа функция деп аталады, осы жердегідей) кестесі келтірілген. + Типтік қолданыстары және каноникалық байланыс функциялары бар жалпы үлестірулер Үлестіру Қолдау аймағы Типтік қолданыс Байланыс атауы Байланыс функциясы, Орташа функция Қалыпты нақты: Сызықтық жауап деректері Сәйкестік Экспоненциалдық нақты: Экспоненциалдық жауап деректері, масштаб параметрлері Теріс кері Гамма кері Гаусс нақты: Кері квадраттық Пуассон бүтін сан: Белгілі уақыт/кеңістікте оқиғалар саны Логарифмдік Бернулли бүтін сан: Бір реттік "иә/жоқ" оқиғасының нәтижесі Логит Биномдық бүтін сан: N "иә/жоқ" оқиғасының арасындағы "иә" оқиғаларының саны Категориялық бүтін сан: K-жолды бір реттік оқиғаның нәтижесі K бүтін сан векторы: , мұнда вектордың бір ғана элементе 1 мәніне ие Көпмүшелі K бүтін сан векторы: әртүрлі типтегі оқиғалардың саны (1, ..., K) N жалпы K-жолды оқиғасының арасында Гамма және экспоненциалдық үлестірулер үшін каноникалық байланыс функциясының домені орташа мәннің рұқсат етілген диапазонымен сәйкес келмейді. Атап айтқанда, сызықтық болжаушы оң болуы мүмкін, бұл мүмкін емес теріс орташа мәнге әкеледі. Максималды ықтималдылықты есептегенде, мұны болдырмау үшін сақтық шараларын қабылдау қажет. Балама ретінде каноникалық емес байланыс функциясын қолдануға болады. Бернулли, биномдық, категориялық және көпмүшелі үлестірулер үшін үлестірудің қолдау аймағы болжамды параметрдің деректерімен бірдей типтес емес. Барлық жағдайларда болжамды параметр – бір немесе бірнеше ықтималдықтар, яғни [0, 1] диапазонындағы нақты сандар. Нәтижесінде пайда болған модель логистикалық регрессия деп аталады (немесе K-жолды мәндер емес, екілік мәндер болжанылған жағдайда көпмүшелі логистикалық регрессия). Бернулли және биномдық үлестірулер үшін параметр – бір оқиғаның орын алу ықтималдығын көрсететін жалғыз ықтималдық. Бернулли жалпыланған сызықтық модельдің негізгі шартын қанағаттандырады, өйткені бір нәтиже әрқашан 0 немесе 1 болса да, күтілетін мән нақты бағаланған ықтималдыққа, яғни "иә" (немесе 1) нәтижесінің орын алу ықтималдығына тең болады. Сол сияқты, биномдық үлестіруде күтілетін мән Np, яғни "иә" нәтижелерінің күтілетін үлесі болжауға болатын ықтималдық болады. Категориялық және көпмүшелі үлестірулер үшін болжамды параметр – ықтималдықтардың K векторы, барлық ықтималдықтардың қосындысы 1 болуы керек деген қосымша шектеумен. Әрбір ықтималдық K мүмкін мәннің бірінің орын алу ықтималдығын көрсетеді. Көпмүшелі үлестіру үшін және категориялық үлестірудің векторлық түрі үшін вектор элементтерінің күтілетін мәндері биномдық және Бернулли үлестірулеріне ұқсас болжамдық ықтималдықтармен байланысты болуы мүмкін.

Бейес әдістері

Жалпы, артқы таралымды жабық түрде табу мүмкін емес, сондықтан оны, әдетте, Лаплас жуықтаулары немесе Гиббс сынамасы сияқты Марков тізбегі Монте-Карло әдісінің бір түрін пайдаланып жуықтау қажет.

Жалпы сызықтық модельдер

Мүмкін шатасу тудыруы мүмкін нәрсе – жалпыланған сызықтық модельдер мен жалпы сызықтық модельдердің айырмашылығы, бұл екі кең статистикалық модель. Бұл терминологияның авторының бірі Джон Нельдер осы терминологияға өкініш білдірген. Жалпы сызықтық модельді, сәйкестік функциясы біртенді және жауаптары қалыпты үлестірімге ие болғанда, жалпыланған сызықтық модельдің ерекше жағдайы ретінде қарастыруға болады. Қызығушылық тудыратын нақты нәтижелердің көп бөлігі жалпы сызықтық модель үшін ғана алынатындықтан, оның тарихи дамуы біршама ұзақ болды. Жалпыланған сызықтық модельге қатысты нәтижелер, біртенді емес сәйкестік функциясымен, асимптотикалық сипатқа ие (үлкен көлемдегі сынамалармен жақсы жұмыс істеуге бейім).

Сызықтық регрессия

Жалпыланған сызықтық модельдің қарапайым, өте маңызды мысалы (сонымен қатар жалпы сызықтық модельдің мысалы) — сызықтық регрессия. Сызықтық регрессияда ең кіші квадраттар бағалаушысын қолдану Гаусс-Марков теоремасымен негізделген, ол үлестірудің қалыпты болуын талап етпейді. Дегенмен, жалпыланған сызықтық модельдер тұрғысынан қарағанда, үлестіру функциясы тұрақты дисперсиясы бар қалыпты үлестіру деп қарастыру пайдалы, ал байланыс функциясы — сәйкестік функциясы, дисперсия белгілі болған жағдайда бұл канондық байланыс болып табылады. Осы шарттар бойынша ең кіші квадраттар бағалаушысы максималды ықтималдық параметрінің бағалауы ретінде алынады. Қалыпты үлестіру үшін жалпыланған сызықтық модельде максималды ықтималдық бағалаулары үшін жабық түрдегі формула бар, бұл ыңғайлы. Көптеген басқа GLM-дерде жабық түрдегі бағалаулар жоқ.

Бинарлық деректер

Жауап деректері, Y, екілік болғанда (тек 0 және 1 мәндерін қабылдаса), үлестіру функциясы көбінесе Бернулли үлестірімі ретінде таңдалады, және μi-нің мағынасы – Yi-нің 1 мәнін қабылдау ықтималдығы, p. Биномдық функциялар үшін бірнеше танымал байланыс функциялары бар.

Пробиттік байланыс функциясы - кері жинақталған үлестіру функциясының танымал таңдауы

Сонымен қатар, кез келген үздіксіз жинақталған үлестіру функциясының (CDF) кері функциясын байланыс ретінде қолдануға болады, себебі CDF-тың диапазоны – биномдық орташаның диапазонымен сәйкес келеді. Қалыпты CDF жиі қолданылады және пробит моделін тудырады. Оның байланысы –

Пробит моделін қолдану себебі – кіріс айнымалысының қалыпты CDF-ке тұрақты түрде масштабталуы (мұны барлық параметрлердің эквивалентті масштабталуы арқылы ескеруге болады) логит функциясына өте ұқсас функцияны береді, бірақ кейбір жағдайларда пробит модельдерін логит модельдерінен қарапайым есептеуге болады. (Байес тәсілінде, егер параметрлерге қалыпты үлестірімді алдын ала таралымдар берілсе, қалыпты алдын ала таралымдар мен қалыпты CDF байланыс функциясы арасындағы байланыс пробит моделін Гиббс сынамасы арқылы есептеуге мүмкіндік береді, ал логит моделін әдетте осылай есептеуге болмайды.)

Жеке байланыс

g(p) = p сәйкестік байланысы кейде биномиалдық деректер үшін сызықтық ықтималдық моделін құру үшін қолданылады. Дегенмен, сәйкестік байланысы нөлден кем немесе бірден артық "ықтималдықтарды" болжауы мүмкін. Бұдан ауырсыну үшін cloglog, probit немесе logit (немесе кез келген кері жинақталған тарату функциясы) сияқты түрлендірулерді қолдануға болады. Сәйкестік байланыстың басты артықшылығы – оны сызықтық есептеулер арқылы бағалауға болады, ал басқа стандартты байланыс функциялары p = 0.5 мәніне жақын сәйкестік байланысына шамамен сызықтық жақындық көрсетеді.

Көптеректік регрессия

Биномиалды жағдайды жауап ретінде мультиномиалды үлестіруді қолдануға оңай кеңейтуге болады (сонымен қатар, санау үшін жалпыланған сызықтық модель, шектелген жалпы сомасымен). Мұны әдетте екі тәсілмен жасайды:

Байланысты немесе кластерлі деректер

Стандартты GLM байқаулардың өзара байланысы жоқ деп есептейді. Ұзындығына қарай жүргізілетін зерттеулер мен кластерлік жобалар сияқты, байқаулар арасындағы байланысты ескеруге мүмкіндік беретін кеңейтулер жасалған: Жалпыланған бағалау теңдеулері (GEE) корреляциялардың пайда болуына қатысты нақты ықтималдық моделін қолданбай, байқаулар арасындағы байланысты қабылдайды, сондықтан нақты ықтималдық жоқ. Бұл әдіс кездейсоқ әсерлер мен олардың дисперсиясы тікелей қызығушылық тудырмаған жағдайларда тиімді, себебі байланыстың себебін түсіндірмей, оның болуын ескереді. Назар X-тың бір немесе бірнеше құрауының өзгеруінен туындайтын әсерді жеке адам үшін болжауға мүмкіндік беретін регрессиялық параметрлердің орнына, популяция бойынша орташа жауапты ("популяциялық орташа әсерлерді") бағалауға бағытталған. GEE әдетте Хьюбер-Уайт стандартты қателіктерімен бірге қолданылады. Жалпыланған сызықтық аралас модельдер (GLMM) – бұл GLM-нің сызықтық болжаушыға кездейсоқ әсерлерді қосатын кеңейтілген түрі, бұл байланыстың себебін түсіндіретін нақты ықтималдық моделін ұсынады. Нәтижесінде алынған "жеке тұлғаға тән" параметрлік бағалаулар, егер назар X-тың бір немесе бірнеше құрауының өзгеруінен белгілі бір адамға тиетін әсерді бағалауға бағытталған болса, қолайлы. GLMM көп деңгейлі модельдер және аралас модельдер деп те аталады. Жалпы алғанда, GLMM-ді құру GEE-ді құруға қарағанда есептеу жағынан күрделі және көп ресурстарды қажет етеді.