Кіріспе
Статистикалық модельдер класы
Статистикада жалпыланған сызықтық модель (GLM) – қалыпты сызықтық регрессияның икемді жалпылауы болып табылады. GLM сызықтық регрессияны байланыс функциясы арқылы жауап айнымалысымен сызықтық модельдің байланысын орнатуға және әрбір өлшемнің дисперсиясы оның күтілетін мәнінің функциясы болуына мүмкіндік беру арқылы жалпылайды. Жалпыланған сызықтық модельдерді Джон Нельдер мен Роберт Уэддерберн сызықтық регрессия, логистикалық регрессия және Пуассон регрессиясы сияқты басқа да статистикалық модельдерді біріктіру мақсатымен жасады. Олар модель параметрлерінің максималды ықтималдықпен бағалауы (MLE) үшін итеративті қайта салмақталған ең кіші квадраттар әдісін ұсынды. MLE әлі де кеңінен қолданылады және көптеген статистикалық есептеу пакеттерінде стандартты әдіс болып табылады. Басқа да тәсілдер, соның ішінде Байес регрессиясы және дисперсияны тұрақтандырылған жауаптарға сәйкестендіру арқылы ең кіші квадраттар әдісі әзірленді.
Интуиция
Кәдімгі сызықтық регрессия белгілі бір белгісіз шаманың (жауап айнымалысы, кездейсоқ айнымалы) күтілетін мәнін байқалған мәндер жиынтығының сызықтық комбинациясы ретінде болжайды. Бұл болжаушыдағы тұрақты өзгеріс жауап айнымалысының тұрақты өзгеруіне әкеледі (яғни сызықтық жауап моделі). Бұл жауап айнымалысы жақсы шамамен, белгілі бір бағытта немесе жалпы алғанда, болжау айнымалыларының өзгеруіне қарағанда салыстырмалы түрде аз мөлшерде өзгеріп отыратын кез келген шама үшін шексіз өзгеруі мүмкін болған кезде орынды, мысалы, адам биіктігі. Алайда, бұл болжамдар жауап айнымалысының кейбір түрлері үшін сәйкес келмейді. Мысалы, жауап айнымалысының әрқашан оң және кең ауқымда өзгеріп отыруы күтілетін жағдайларда, тұрақты кіріс өзгерістері геометриялық (яғни экспоненциалды) түрде өзгеретін шығыс өзгерістеріне әкеледі, тұрақты түрде өзгеретін шығыс өзгерістеріне емес. Мысалы, сызықтық болжау моделі кейбір деректерден (әлдебір үлкен жағалаулардан алынған) температураның 10 градусқа төмендеуі жағалауға 1000 адам аз келуіне әкеледі деп үйренеді. Бұл модель әртүрлі мөлшердегі жағажайларда жақсы жұмыс істемейді. Нақтырақ айтсақ, мәселе мынада: егер сіз модельді 50 адамды қабылдайтын жағажай үшін температураның 10 градусқа төмендеуіне байланысты жаңа келушілер санын болжау үшін қолдансаңыз, сіз -950 адамның мүмкін емес санын болжайсыз. Логикалық тұрғыдан алғанда, дұрыс модель жағажайға келушілердің санының тұрақты өсуін болжайды (мысалы, 10 градусқа өсу жағажайға келушілердің санын екі есеге арттырады, ал 10 градусқа төмендеу жағажайға келушілердің санын екі есеге азайтады). Мұндай модель экспоненциалды жауап моделі деп аталады (немесе логарифмдік-сызықтық модель, өйткені жауаптың логарифмі сызықтық түрде өзгереді деп болжанады). Сол сияқты, «иә/жоқ» таңдау жасау ықтималдығын (Бернулли айнымалысы) болжайтын модель сызықтық жауап моделі ретінде одан да қолайсыз, өйткені ықтималдықтар екі жағынан да шектеледі (олар 0 мен 1 арасында болуы керек). Мысалы, температураға байланысты белгілі бір адамның жағажайға бару ықтималдығын болжайтын модельді қарастырыңыз. Ақылға қонымды модель 10 градустың өзгеруі адамды жағажайға баруға екі есе көбірек немесе азырақ ықтимал етеді деп болжауы мүмкін. Бірақ «екі есе ықтимал» дегеніміз ықтималдық тұрғысынан не білдіреді? Бұл ықтималдық мәнін сөзбе-сөз екі еселеуді білдірмейді (мысалы, 50% 100% болады, 75% 150% болады және т.б.). Керісінше, бәс тігу шарттары екі есеге артады: 2:1-ден 4:1-ге, 8:1-ге және т.б. Мұндай модель – лог-бәс тігу немесе логистикалық модель. Жалпыланған сызықтық модельдер бұл жағдайлардың барлығын қамтиды, жауап айнымалыларына кездейсоқ үлестірімдерге ие болуға (қанағаттанарлық үлестірімдерге емес) және жауап айнымалысының кездейсоқ функциясының (байланыс функциясы) болжаушылармен сызықтық түрде өзгеруіне мүмкіндік береді (жауаптың өзі сызықтық түрде өзгеруі керек деп есептемей). Мысалы, жағажайға келушілердің болжамды санының жоғарыдағы жағдайы әдетте Пуассон үлестірімімен және логтік байланыспен модельденеді, ал жағажайға келушілердің болжамды ықтималдығы Бернулли үлестірімімен (немесе биномдық үлестірім, мәселенің қалай қойылғанына байланысты) және лог-бәс тігу (немесе логит) байланыс функциясымен модельденеді.
Сызықтық болжаушы
Сызықтық болжам – тәуелсіз айнымалылар туралы ақпаратты модельге қосатын шама. Символ η (грекше "эта") сызықтық болжамды белгілейді. Ол байланыс функциясы арқылы деректердің күтілетін мәнімен байланысты. η белгісіз параметрлердің сызықтық комбинациясы (сондықтан, "сызықтық") ретінде β арқылы өрнектеледі. Сызықтық комбинацияның коэффициенттері тәуелсіз айнымалылардың матрицасы X ретінде көрсетіледі. Сондықтан η былай өрнектелуі мүмкін:
Байланыс функциясы
Байланыс функциясы сызықтық болжаушы мен үлестіру функциясының орташа мәні арасындағы қатынасты қамтамасыз етеді. Көптеген қолданылатын байланыс функциялары бар, олардың таңдалуы бірнеше факторларға байланысты. Жауаптың тығыздық функциясының экспонентасынан туындайтын жақсы анықталған каноникалық байланыс функциясы әрқашан болады. Дегенмен, кейбір жағдайларда байланыс функциясының доменін үлестіру функциясының орташа мәнінің диапазонымен сәйкестіруге тырысу немесе алгоритмдік мақсаттар үшін каноникалық емес байланыс функциясын қолдану, мысалы, Байестік пробит регрессиясы, мағыналы болуы мүмкін. Каноникалық параметрмен үлестіру функциясын қолданғанда, каноникалық байланыс функциясы функцияны i.e. арқылы білдіретін функция болып табылады. Ең көп таралған үлестірулер үшін орташа мән – үлестірудің тығыздық функциясының стандартты түріндегі параметрлердің бірі, содан кейін тығыздық функциясын каноникалық түріне бейімдейтін жоғарыда анықталған функция. Каноникалық байланыс функциясын қолданғанда, бұл параметр үшін жеткілікті статистика болуына мүмкіндік береді. Төменде жиі қолданылатын бірнеше экспоненциалдық отбасылық үлестірулер мен олардың әдетте қолданылатын деректері, сондай-ақ каноникалық байланыс функциялары мен олардың кері функциялары (кейде орташа функция деп аталады, осы жердегідей) кестесі келтірілген. + Типтік қолданыстары және каноникалық байланыс функциялары бар жалпы үлестірулер Үлестіру Қолдау аймағы Типтік қолданыс Байланыс атауы Байланыс функциясы, Орташа функция Қалыпты нақты: Сызықтық жауап деректері Сәйкестік Экспоненциалдық нақты: Экспоненциалдық жауап деректері, масштаб параметрлері Теріс кері Гамма кері Гаусс нақты: Кері квадраттық Пуассон бүтін сан: Белгілі уақыт/кеңістікте оқиғалар саны Логарифмдік Бернулли бүтін сан: Бір реттік "иә/жоқ" оқиғасының нәтижесі Логит Биномдық бүтін сан: N "иә/жоқ" оқиғасының арасындағы "иә" оқиғаларының саны Категориялық бүтін сан: K-жолды бір реттік оқиғаның нәтижесі K бүтін сан векторы: , мұнда вектордың бір ғана элементе 1 мәніне ие Көпмүшелі K бүтін сан векторы: әртүрлі типтегі оқиғалардың саны (1, ..., K) N жалпы K-жолды оқиғасының арасында Гамма және экспоненциалдық үлестірулер үшін каноникалық байланыс функциясының домені орташа мәннің рұқсат етілген диапазонымен сәйкес келмейді. Атап айтқанда, сызықтық болжаушы оң болуы мүмкін, бұл мүмкін емес теріс орташа мәнге әкеледі. Максималды ықтималдылықты есептегенде, мұны болдырмау үшін сақтық шараларын қабылдау қажет. Балама ретінде каноникалық емес байланыс функциясын қолдануға болады. Бернулли, биномдық, категориялық және көпмүшелі үлестірулер үшін үлестірудің қолдау аймағы болжамды параметрдің деректерімен бірдей типтес емес. Барлық жағдайларда болжамды параметр – бір немесе бірнеше ықтималдықтар, яғни [0, 1] диапазонындағы нақты сандар. Нәтижесінде пайда болған модель логистикалық регрессия деп аталады (немесе K-жолды мәндер емес, екілік мәндер болжанылған жағдайда көпмүшелі логистикалық регрессия). Бернулли және биномдық үлестірулер үшін параметр – бір оқиғаның орын алу ықтималдығын көрсететін жалғыз ықтималдық. Бернулли жалпыланған сызықтық модельдің негізгі шартын қанағаттандырады, өйткені бір нәтиже әрқашан 0 немесе 1 болса да, күтілетін мән нақты бағаланған ықтималдыққа, яғни "иә" (немесе 1) нәтижесінің орын алу ықтималдығына тең болады. Сол сияқты, биномдық үлестіруде күтілетін мән Np, яғни "иә" нәтижелерінің күтілетін үлесі болжауға болатын ықтималдық болады. Категориялық және көпмүшелі үлестірулер үшін болжамды параметр – ықтималдықтардың K векторы, барлық ықтималдықтардың қосындысы 1 болуы керек деген қосымша шектеумен. Әрбір ықтималдық K мүмкін мәннің бірінің орын алу ықтималдығын көрсетеді. Көпмүшелі үлестіру үшін және категориялық үлестірудің векторлық түрі үшін вектор элементтерінің күтілетін мәндері биномдық және Бернулли үлестірулеріне ұқсас болжамдық ықтималдықтармен байланысты болуы мүмкін.
Following is a table of several exponential family distributions in common use and the data they are typically used for, along with the canonical link functions and their inverses (sometimes referred to as the mean function, as done here). + Common distributions with typical uses and canonical link functions Distribution Support of distribution Typical uses Link name Link function, Mean function Normal real: Linear response data Identity Exponential real: Exponential response data, scale parameters Negative inverse Gamma Inverse Gaussian real: Inverse squared Poisson integer: count of occurrences in fixed amount of time/space Log Bernoulli integer: outcome of single yes/no occurrence Logit Binomial integer: count of # of "yes" occurrences out of N yes/no occurrences Categorical integer: outcome of single K way occurrence K vector of integer: , where exactly one element in the vector has the value 1 Multinomial K vector of integer: count of occurrences of different types (1, , K) out of N total K way occurrences
In the cases of the exponential and gamma distributions, the domain of the canonical link function is not the same as the permitted range of the mean. In particular, the linear predictor may be positive, which would give an impossible negative mean. When maximizing the likelihood, precautions must be taken to avoid this. An alternative is to use a noncanonical link function. In the case of the Bernoulli, binomial, categorical and multinomial distributions, the support of the distributions is not the same type of data as the parameter being predicted. In all of these cases, the predicted parameter is one or more probabilities, i. e. real numbers in the range The resulting model is known as logistic regression (or multinomial logistic regression in the case that K way rather than binary values are being predicted). For the Bernoulli and binomial distributions, the parameter is a single probability, indicating the likelihood of occurrence of a single event. The Bernoulli still satisfies the basic condition of the generalized linear model in that, even though a single outcome will always be either 0 or 1, the expected value will nonetheless be a real valued probability, i. e. the probability of occurrence of a "yes" (or 1) outcome. Similarly, in a binomial distribution, the expected value is Np, i. e. the expected proportion of "yes" outcomes will be the probability to be predicted. For categorical and multinomial distributions, the parameter to be predicted is a K vector of probabilities, with the further restriction that all probabilities must add up to 1. Each probability indicates the likelihood of occurrence of one of the K possible values. For the multinomial distribution, and for the vector form of the categorical distribution, the expected values of the elements of the vector can be related to the predicted probabilities similarly to the binomial and Bernoulli distributions.
Бейес әдістері
Жалпы, артқы таралымды жабық түрде табу мүмкін емес, сондықтан оны, әдетте, Лаплас жуықтаулары немесе Гиббс сынамасы сияқты Марков тізбегі Монте-Карло әдісінің бір түрін пайдаланып жуықтау қажет.
Жалпы сызықтық модельдер
Мүмкін шатасу тудыруы мүмкін нәрсе – жалпыланған сызықтық модельдер мен жалпы сызықтық модельдердің айырмашылығы, бұл екі кең статистикалық модель. Бұл терминологияның авторының бірі Джон Нельдер осы терминологияға өкініш білдірген. Жалпы сызықтық модельді, сәйкестік функциясы біртенді және жауаптары қалыпты үлестірімге ие болғанда, жалпыланған сызықтық модельдің ерекше жағдайы ретінде қарастыруға болады. Қызығушылық тудыратын нақты нәтижелердің көп бөлігі жалпы сызықтық модель үшін ғана алынатындықтан, оның тарихи дамуы біршама ұзақ болды. Жалпыланған сызықтық модельге қатысты нәтижелер, біртенді емес сәйкестік функциясымен, асимптотикалық сипатқа ие (үлкен көлемдегі сынамалармен жақсы жұмыс істеуге бейім).
Сызықтық регрессия
Жалпыланған сызықтық модельдің қарапайым, өте маңызды мысалы (сонымен қатар жалпы сызықтық модельдің мысалы) — сызықтық регрессия. Сызықтық регрессияда ең кіші квадраттар бағалаушысын қолдану Гаусс-Марков теоремасымен негізделген, ол үлестірудің қалыпты болуын талап етпейді. Дегенмен, жалпыланған сызықтық модельдер тұрғысынан қарағанда, үлестіру функциясы тұрақты дисперсиясы бар қалыпты үлестіру деп қарастыру пайдалы, ал байланыс функциясы — сәйкестік функциясы, дисперсия белгілі болған жағдайда бұл канондық байланыс болып табылады. Осы шарттар бойынша ең кіші квадраттар бағалаушысы максималды ықтималдық параметрінің бағалауы ретінде алынады. Қалыпты үлестіру үшін жалпыланған сызықтық модельде максималды ықтималдық бағалаулары үшін жабық түрдегі формула бар, бұл ыңғайлы. Көптеген басқа GLM-дерде жабық түрдегі бағалаулар жоқ.
Бинарлық деректер
Жауап деректері, Y, екілік болғанда (тек 0 және 1 мәндерін қабылдаса), үлестіру функциясы көбінесе Бернулли үлестірімі ретінде таңдалады, және μi-нің мағынасы – Yi-нің 1 мәнін қабылдау ықтималдығы, p. Биномдық функциялар үшін бірнеше танымал байланыс функциялары бар.
Пробиттік байланыс функциясы - кері жинақталған үлестіру функциясының танымал таңдауы
Сонымен қатар, кез келген үздіксіз жинақталған үлестіру функциясының (CDF) кері функциясын байланыс ретінде қолдануға болады, себебі CDF-тың диапазоны – биномдық орташаның диапазонымен сәйкес келеді. Қалыпты CDF жиі қолданылады және пробит моделін тудырады. Оның байланысы –
Пробит моделін қолдану себебі – кіріс айнымалысының қалыпты CDF-ке тұрақты түрде масштабталуы (мұны барлық параметрлердің эквивалентті масштабталуы арқылы ескеруге болады) логит функциясына өте ұқсас функцияны береді, бірақ кейбір жағдайларда пробит модельдерін логит модельдерінен қарапайым есептеуге болады. (Байес тәсілінде, егер параметрлерге қалыпты үлестірімді алдын ала таралымдар берілсе, қалыпты алдын ала таралымдар мен қалыпты CDF байланыс функциясы арасындағы байланыс пробит моделін Гиббс сынамасы арқылы есептеуге мүмкіндік береді, ал логит моделін әдетте осылай есептеуге болмайды.)
Жеке байланыс
g(p) = p сәйкестік байланысы кейде биномиалдық деректер үшін сызықтық ықтималдық моделін құру үшін қолданылады. Дегенмен, сәйкестік байланысы нөлден кем немесе бірден артық "ықтималдықтарды" болжауы мүмкін. Бұдан ауырсыну үшін cloglog, probit немесе logit (немесе кез келген кері жинақталған тарату функциясы) сияқты түрлендірулерді қолдануға болады. Сәйкестік байланыстың басты артықшылығы – оны сызықтық есептеулер арқылы бағалауға болады, ал басқа стандартты байланыс функциялары p = 0.5 мәніне жақын сәйкестік байланысына шамамен сызықтық жақындық көрсетеді.
Көптеректік регрессия
Биномиалды жағдайды жауап ретінде мультиномиалды үлестіруді қолдануға оңай кеңейтуге болады (сонымен қатар, санау үшін жалпыланған сызықтық модель, шектелген жалпы сомасымен). Мұны әдетте екі тәсілмен жасайды:
Байланысты немесе кластерлі деректер
Стандартты GLM байқаулардың өзара байланысы жоқ деп есептейді. Ұзындығына қарай жүргізілетін зерттеулер мен кластерлік жобалар сияқты, байқаулар арасындағы байланысты ескеруге мүмкіндік беретін кеңейтулер жасалған: Жалпыланған бағалау теңдеулері (GEE) корреляциялардың пайда болуына қатысты нақты ықтималдық моделін қолданбай, байқаулар арасындағы байланысты қабылдайды, сондықтан нақты ықтималдық жоқ. Бұл әдіс кездейсоқ әсерлер мен олардың дисперсиясы тікелей қызығушылық тудырмаған жағдайларда тиімді, себебі байланыстың себебін түсіндірмей, оның болуын ескереді. Назар X-тың бір немесе бірнеше құрауының өзгеруінен туындайтын әсерді жеке адам үшін болжауға мүмкіндік беретін регрессиялық параметрлердің орнына, популяция бойынша орташа жауапты ("популяциялық орташа әсерлерді") бағалауға бағытталған. GEE әдетте Хьюбер-Уайт стандартты қателіктерімен бірге қолданылады. Жалпыланған сызықтық аралас модельдер (GLMM) – бұл GLM-нің сызықтық болжаушыға кездейсоқ әсерлерді қосатын кеңейтілген түрі, бұл байланыстың себебін түсіндіретін нақты ықтималдық моделін ұсынады. Нәтижесінде алынған "жеке тұлғаға тән" параметрлік бағалаулар, егер назар X-тың бір немесе бірнеше құрауының өзгеруінен белгілі бір адамға тиетін әсерді бағалауға бағытталған болса, қолайлы. GLMM көп деңгейлі модельдер және аралас модельдер деп те аталады. Жалпы алғанда, GLMM-ді құру GEE-ді құруға қарағанда есептеу жағынан күрделі және көп ресурстарды қажет етеді.
Generalized estimating equations (GEEs) allow for the correlation between observations without the use of an explicit probability model for the origin of the correlations, so there is no explicit likelihood. They are suitable when the random effects and their variances are not of inherent interest, as they allow for the correlation without explaining its origin. The focus is on estimating the average response over the population ("population averaged" effects) rather than the regression parameters that would enable prediction of the effect of changing one or more components of X on a given individual. GEEs are usually used in conjunction with Huber–White standard errors. Generalized linear mixed models (GLMMs) are an extension to GLMs that includes random effects in the linear predictor, giving an explicit probability model that explains the origin of the correlations. The resulting "subject specific" parameter estimates are suitable when the focus is on estimating the effect of changing one or more components of X on a given individual. GLMMs are also referred to as multilevel models and as mixed model. In general, fitting GLMMs is more computationally complex and intensive than fitting GEEs.