Кіріспе

Статистикада логистикалық модель (немесе логит моделі) — оқиғаның логарифмдік ықтималдығын бір немесе бірнеше тәуелсіз айнымалылардың сызықтық комбинациясы ретінде модельдейтін статистикалық модель. Регрессиялық талдауда логистикалық регрессия (немесе логиттік регрессия) — логистикалық модельдің параметрлерін (сызықтық комбинациядағы коэффициенттерді) бағалау болып табылады. Формальды түрде, бинарлық логистикалық регрессияда индикаторлы айнымалымен кодталған бір ғана бинарлық тәуелді айнымалы бар, онда екі мән «0» және «1» деп белгіленеді, ал тәуелсіз айнымалылардың әрқайсысы бинарлық айнымалы (екі класс, индикаторлы айнымалымен кодталған) немесе үздіксіз айнымалы (кәдімгі нақты мән) болуы мүмкін. «1» деп белгіленген мәннің сәйкес келетін ықтималдығы 0 (әрине «0» мәні) мен 1 (әрине «1» мәні) арасында өзгеруі мүмкін, сондықтан осылай аталады. Логистикалық регрессияны қолдана отырып, пациенттің жағдайын бағалау үшін қолданылатын көптеген басқа медициналық шкалалар жасалған. Логистикалық регрессия пациенттің байқалатын сипаттамаларына (жасы, жынысы, дене салмағының индексі, түрлі қан сынақтарының нәтижелері және т.б.) негізделген белгілі бір аурудың даму қаупін болжау үшін қолданылуы мүмкін (мысалы, қант диабеті, жүрек ишемиялық ауруы). Тағы бір мысал — непалдық сайлаушының Непал Конгресіне немесе Непал Коммунистік партиясына немесе басқа партияға жас, табыс, жыныс, нәсіл, тұрғылықты жері, бұрынғы сайлаулардағы дауыс беруі және т.б. негізінде дауыс беретінін болжау. Ол сондай-ақ маркетингтік қолданыстарда, мысалы, тұтынушының өнімді сатып алуға немесе жазылымын тоқтатуға бейімділігін болжау үшін де қолданылады. Экономикада, ол адамның еңбек орындарында болу ықтималдығын болжауға қолданылады, ал бизнес қолданысы — үй иесінің ипотекалық несиеден бас тарту ықтималдығын болжау. Реттік деректерге логистикалық регрессияның кеңейтілген түрі — шартты кездейсоқ өрістер табиғи тілді өңдеуде қолданылады. Апаттарды жоспарлаушылар мен инженерлер осы модельдерге үй иелерінің немесе ғимараттардағы адамдардың кішкентай және ірі эвакуацияларда қабылдайтын шешімдерін болжау үшін сенеді, мысалы, ғимараттардағы өрттер, орман өрттері, дауылдар және басқа да жағдайларда. Бұл модельдер апаттарды басқарудың сенімді жоспарларын жасауға және құрылыс ортасын қауіпсіз жобалауға көмектеседі.

Бақыланатын машиналық оқыту

Логистикалық регрессия – қадағалаумен жұмыс істейтін машиналық оқыту алгоритмі, ол екі класты жіктеу міндеттерінде кеңінен қолданылады, мысалы, электрондық хаттың спам екенін анықтау және пациенттің тестілеу нәтижелеріне сүйене отырып, нақты белгілі бір жағдайлардың болуын немесе болмауын бағалау арқылы ауруларды диагностикалау. Бұл тәсіл логистикалық (немесе сигмоидтық) функцияны қолданады, ол кіріс деректерінің сызықтық комбинациясын 0 мен 1 аралығындағы ықтималдық мәніне түрлендіреді. Бұл ықтималдық берілген деректің екі алдын ала анықталған санаттың біріне жататындығын көрсетеді. Логистикалық регрессияның негізгі қағидасы – логистикалық функцияның екі жақты нәтижелердің ықтималдығын дәл модельдеуге қабілеттілігінде жатыр. Ерекше S-тәрізді қисығының арқасында логистикалық функция кез келген нақты санды 0-ден 1-ге дейінгі аралықтағы мәнге тиімді түрлендіреді. Бұл мүмкіндік оны екі класты жіктеу міндеттері үшін, мысалы электрондық хаттарды "спам" немесе "спам емес" деп бөлу үшін өте ыңғайлы етеді. Тәуелді айнымалының нақты бір топқа жату ықтималдығын есептеу арқылы логистикалық регрессия, хабарлы шешімдер қабылдауға көмектесетін ықтималдық аясын ұсынады.

Болжамдар

Емтиханды тапсыру ықтималдығын бағалау үшін логистикалық регрессия теңдеуіне β₀ және β₁ коэффициенттерін енгізуге болады. Мысалы, 2 сағат оқыған студент үшін теңдеуге мәнді енгізу емтиханды тапсырудың шамамен 0,25 ықтималдығын береді:

Сол сияқты, 4 сағат оқыған студент үшін емтиханды тапсырудың шамамен 0,87 ықтималдығы:

Бұл кесте бірнеше сағат оқуға арналған емтиханды тапсырудың шамамен алынған ықтималдығын көрсетеді. Оқу сағаттары (x) Емтиханды тапсыру Логикалық коэффициент (t) Коэффициент (et) Ықтималдық (p) 1 −2,57 0,076 ≈ 1:13,1 0,07 2 −1,07 0,34 ≈ 1:2,91 0,26 3 0,44 1,55 0,61 4 1,94 6,96 0,87 5 3,45 31,4 0,97

Үлгілерді бағалау

Логистикалық регрессиялық талдау келесі нәтижелерді береді. Коэффициент Стандартты қате z мәні p мәні (Валд) Тұрақты мүше (β0) −4.1 1.8 −2.3 0.021 Сағат (β1) 1.5 0.6 2.4 0.017 Валд тестісі бойынша нәтижелер оқуға жұмсаған сағаттардың емтиханды сәтті тапсыру ықтималдығымен маңызды байланысы бар екенін көрсетеді. Валд әдісіне қарағанда, логистикалық регрессия үшін p мәнін есептеуге ұсынылатын әдіс – ықтималдылық қатынасы тестісі (LRT) болып табылады, ол осы деректер үшін келесіні көрсетеді (төменде қараңыз).

Жалпылау

Бұл қарапайым модель бинарлық логистикалық регрессияның мысалы болып табылады, және бір түсіндірмелі айнымалысы мен екі категориялық мәнге ие бола алатын бинарлық категориялық айнымалысы бар. Көпмүшелік логистикалық регрессия – бұл бинарлық логистикалық регрессияның кез келген сандағы түсіндірмелі айнымалыларды және кез келген сандағы санаттарды қамту үшін жасалған жалпылау түрі.

Логистикалық функцияның анықтамасы

Логистикалық регрессияны түсіндіру стандартты логистикалық функцияны түсіндіруден басталуы мүмкін. Логистикалық функция – сигмоид функциясы, ол кез келген нақты санды қабылдап, нөл мен бір аралығындағы мәнді шығарады. Бинарлы тәуелсіз айнымалы үшін мүмкіндіктер арақатынасы a, b, c және d 2x2 контингенциялық кестедегі жасушалар арқылы анықталады.

Түсіндірме

Логистикалық регрессияның әр түрлі эквивалентті спецификациялары мен интерпретациялары бар, олардың бәрі де жалпы модельдердің әртүрлі түрлеріне сәйкес келіп, әртүрлі жалпылауларға жол береді.

Ең жоғарғы ықтималдық бағасы (МВА)

Регрессия коэффициенттері әдетте максималды ықтималдық әдісімен есептеледі. Қалдықтары қалыпты үлестірілген сызықтық регрессиядан өзгеше, ықтималдық функциясын максималдайтын коэффициенттердің мәнін анықтайтын жабық түрдегі формула табу мүмкін емес, сондықтан итеративтік процесс қолданылуы тиіс; мысалы, Ньютон әдісі. Бұл процесс болжамды шешіммен басталады, оны сәл өңдеу арқылы жақсартуға болатынын тексеріп, жақсарту мүмкін болмай қалғанша қайталайды, осы кезде процесс конвергенцияға жеткені айтылады.

Бейестік

Байес статистикасы аясында, алдыңғы үлестірулер регрессия коэффициенттеріне, мысалы, Гаусс үлестірулері түрінде жиі орналастырылады. Логистикалық регрессияда ықтималдық функциясының конъюгат алдынан келетін үлестіруі жоқ. Байес тұжырымдамасы аналитикалық түрде жүргізілгенде, бұл артқы үлестіруді есептеуді өте төмен өлшемдерден басқа жағдайларда қиындатты. Бірақ, қазір OpenBUGS, JAGS, PyMC3, Stan немесе Turing.jl сияқты автоматты бағдарламалық құралдар осы артқы үлестірулерді модельдеу арқылы есептеуге мүмкіндік береді, сондықтан конъюгацияның болмауы маңызды емес. Дегенмен, сынама көлемі немесе параметрлер саны көп болғанда, толық Байес модельдеуі баяу болуы мүмкін, сондықтан адамдар көбінесе вариациялық Байес әдістері және күту таратуы сияқты жуық әдістерді қолданады.

"Ондық ережесі"

Кең таралған "оннан бір ережесі" логистикалық регрессия модельдері түсіндірме айнымалылар үшін тұрақты мәндерді береді, егер олар түсіндірме айнымалыға (EPV) кемінде 10 оқиғаға негізделген болса; мұнда оқиға тәуелді айнымалыдағы сирек кездесетін санатқа жататын жағдайларды білдіреді. Осылайша, зерттеуге қатысушылардың белгілі бір үлесінде болатын оқиғаға (мысалы, миокард инфарктісі) түсіндірмелі айнымалыларды пайдалану үшін жоспарланған зерттеуге қатысушылардың жалпы саны қажет болады. Алайда, бұл ереженің сенімділігі туралы көп пікірталас бар, себебі ол симуляциялық зерттеулерге негізделген және берік теориялық негіздемесі жоқ. Кейбір авторлардың пікірінше, ереже кейбір жағдайларда тым консервативті, авторлар былай дейді: "Егер біз (біршама субъективті) сенімділік интервалының 93 проценттен төмен, I типті қателік 7 проценттен жоғары немесе 15 проценттен жоғары салыстырмалы бұрмалануды проблемалық деп есептесек, нәтижелеріміз 2–4 EPV-мен проблемалардың жиі кездесетінін, 5–9 EPV-мен сирек кездесетінін және 10–16 EPV-мен әлі де байқалатындығын көрсетеді. Әр проблеманың ең нашар жағдайлары 5–9 EPV-де аса ауыр емес және көбінесе 10–16 EPV-дегілермен салыстырмалы". Басқалары әртүрлі критерийлерді қолдану арқылы жоғарыда айтылғандармен сәйкес келмейтін нәтижелерді тапты. Пайдалы критерий – модельдің жаңа үлгіде де модельді әзірлеу үлгісіндегідей болжамдық айырмашылыққа жете алатынына сенімділік. Осы критерий үшін әрбір үміткер айнымалыға 20 оқиға қажет болуы мүмкін. Оның орнына келесілерді қолдануға болады.

Хосмер-Лемешоу сынағы

Хосмер-Лемешоу сынағы модельдік популяцияның кіші топтарындағы байқалатын оқиғалар деңгейі күтілетін оқиғалар деңгейімен сәйкес келе ме екенін бағалау үшін асимптотикалық түрде белгілі бір үлестірімді ұстанатын тест статистикасын қолданады. Кейбір статистиктер бұл сынақты ескірген деп санайды, себебі ол болжамдық ықтималдықтардың кездейсоқ жіктелуіне және салыстырмалы түрде төмен қуатына байланысты.

Коэффициент мәні

Модельді құрудан кейін, зерттеушілер әдетте жеке болжамдардың әсерін бағалауға тырысады. Осы үшін олар регрессия коэффициенттерін қарастырады. Сызықтық регрессияда регрессия коэффициенттері – бұл болжамдағы әрбір бірлік өзгеріске байланысты критерийде болатын өзгерісті көрсетеді.

Валд статистикасы

Сонымен қатар, белгілі бір модельдегі жеке болжаушылардың үлесін бағалау кезінде Уолд статистикасының маңыздылығын қарастыруға болады. Коэффициенттердің маңыздылығын бағалау үшін сызықтық регрессиядағы t-тестке ұқсас Вальд статистикасы қолданылады. Вальд статистикасы – регрессия коэффициентінің квадратының, коэффициенттің стандартты қателігінің квадратына қатынасы және асимптотикалық түрде хи-квадрат үлестіріліміне жатады. Логистикалық регрессияның ерекшелігі – оны кездейсоқ іріктелген деректердің орнына теңгерімсіз деректерде де бағалауға болады, бұл әр тәуелсіз айнымалының нәтижеге тигізетін әсерінің коэффициентін дұрыс анықтауға мүмкіндік береді. Яғни, егер мұндай деректерден логистикалық модель құрсақ, егер модель жалпы популяцияда дұрыс болса, барлық параметрлер дұрыс болады, бірақ нақты таралуын білсек, оны келесідей түзетуге болады: Бұл – жалпы қасиеттің бір мысалы: экспоненциалдық үлестірулер отбасы күтілетін мәнді ескере отырып, энтропияны максималдайды. Логистикалық модельде логистикалық функция Бернулли үлестірілімінің табиғи параметрі болып табылады (ол «канондық формада» және логистикалық функция – канондық байланыс функциясы), ал басқа сигмоидтық функциялар канондық емес байланыс функциялары болып табылады; осының арқасында оның математикалық әсемдігі мен оңтайландырудың қарапайымдығы қамтамасыз етіледі. Толық мәліметтер үшін қараңыз.

Сызықтық регрессиямен салыстыру

Логистикалық регрессияны жалпыланған сызықтық модельдің ерекше жағдайы ретінде қарастыруға болады, демек ол сызықтық регрессияға ұқсас. Дегенмен, логистикалық регрессия моделі сызықтық регрессиядан өзгеше болжамдарға (тәуелді және тәуелсіз айнымалылар арасындағы қатынас туралы) негізделген. Атап айтқанда, осы екі модельдің арасындағы басты айырмашылықтар логистикалық регрессияның екі ерекшелігінде көрінеді. Біріншіден, шартты үлестірім Гаусс үлестірімі орнына Бернулли үлестірімі болып табылады, себебі тәуелді айнымалы екі мәнді. Екіншіден, болжамдалған мәндер – ықтималдықтар, сондықтан логистикалық үлестіру функциясы арқылы (0,1) аралығымен шектеледі, өйткені логистикалық регрессия нәтижелердің өзі емес, нақты нәтижелердің ықтималдығын болжайды.

Баламалар

Логистикалық модельге (логит моделіне) жиі қолданылатын балама – пробит моделі, атауларының өзі көрсетеді. Жалпыланған сызықтық модельдер тұрғысынан, олар сілтеме функциясының таңдауында ғана ерекшеленеді: логистикалық модель логит функциясын (кері логистикалық функция), ал пробит моделі пробит функциясын (кері қателік функциясын) пайдаланады. Осы екі әдістің жасырын айнымалы түсіндірмелерінде біріншісі қателердің стандартты логистикалық үлестірілімін, ал екіншісі – стандартты қалыпты үлестірілімін қабылдайды. Керек болса, басқа сигмоидтық функцияларды немесе қателік үлестірілімдерін де қолдануға болады. Логистикалық регрессия – Фишердің 1936 жылғы әдісіне, яғни сызықтық дискриминантты талдауға балама болып табылады. Егер сызықтық дискриминантты талдаудың шарттары орындалса, логистикалық регрессияны алу үшін кондиционирлеуді кері қайтаруға болады. Дегенмен, керісінше дұрыс емес, себебі логистикалық регрессияға дискриминантты талдаудың көпөлшемді қалыптылық талабы қойылмайды. Сызықтық болжамдық әсерлері туралы шарттарды сплайн функциялары сияқты әдістерді қолдану арқылы оңай жеңілдетуге болады. Верхулст өзінің егжей-тегжейлі мақаласында (1845) қисықты үш байқалатын нүктеден өткізу арқылы модельдің үш параметрін анықтады, бірақ бұл нашар болжамдарға әкелді. Логистикалық функция химияда 1883 жылы Вильгельм Оствальдтың автокатализ моделі ретінде тәуелсіз түрде дамытылды. Автокаталитикалық реакция – өнімдердің бірі сол реакцияның өзінің катализаторы болып табылатын және бір реагенттің мөлшері шектеулі реакция. Бұл халық өсімімен салыстырылатын логистикалық теңдеуге әкеледі: реакция өзін-өзі күшейтеді, бірақ шектеулі. Логистикалық функция 1920 жылы Реймонд Перл мен Лоуэлл Ридтің халық өсімінің моделі ретінде қайта ашылды, бұл қазіргі заманғы статистикада қолданылуына себеп болды. Олар бастапқыда Верхулсттің жұмысын білмеді және оны, әдетте, Л. Густав дю Паскьеден білген болуы мүмкін, бірақ оған көп сенім білдірмеді және оның терминологиясын қабылдамады. Верхулсттің басымдығы 1925 жылы Удни Юлемен мойындалды және одан бері қолданылуда. Перл мен Рид модельді алдымен АҚШ халқына қолданды және қисықты үш нүктеден өткізу арқылы бастапқыда орнатуға тырысты; Верхулст сияқты, бұл да нашар нәтижелерге әкелді. 1930 жылдары Честер Иттнер Блис пробит моделін әзірледі және жүйелендірді, ол 1943 жылы «пробит» терминін енгізді, ал Джон Гаддум және Рональд А. Фишер 1958 жылы Блис жұмысына қосымша ретінде максималды ықтималдық бағалау арқылы модельді орнатуға көмектесті. Пробит моделі негізінен биологиялық сынақтарда қолданылды және оған 1860 жылға дейінгі ерте жұмыстар кірді; қараңыз. Пробит моделі логит моделінің кейінгі дамуына әсер етті және бұл модельдер бір-бірімен бәсекелесті. Логистикалық модельді алғаш рет Эдвин Бидуэлл Уилсон және оның шәкірті Джейн Ворчестер биологиялық сынақтарда пробит моделіне балама ретінде қолданған болуы мүмкін. Алайда, логистикалық модельдің пробит моделіне жалпы балама ретінде дамуына Джозеф Берксонның ондаған жылдар бойы атқарған жұмысы үлкен үлес қосты, ол 1961 жылы «логит» терминін «пробит» терминімен салыстыра отырып енгізді және 1970 жылдар мен одан кейінгі жылдары осы жұмысын жалғастырды. Логит моделі бастапқыда пробит моделіне қарағанда нашар деп есептелді, бірақ «1960 және 1970 жылдар аралығында пробитпен тең дәрежеге жетті». 1970 жылға қарай логит моделі статистикалық журналдарда қолданылатын пробит моделімен теңдесті және одан кейін оны басып өтті. Бұл салыстырмалы танымалдылық биологиялық сынақтан тыс логитті қабылдауға және тәжірибеде бейресми қолданылуына байланысты болды; логиттің танымалдылығы логит моделінің есептеу қарапайымдығына, математикалық қасиеттеріне және жалпылығына байланысты, оның әртүрлі салаларда қолданылуына мүмкіндік берді. Бұл кезеңде, әсіресе Дэвид Кокс, көптеген жетілдірулер жасалды. 1998 және 1999 жылдары көпмүшелік логит моделі тәуелсіз түрде енгізілді, бұл логит моделінің қолданылу аясын және танымалдылығын арттырды. 1973 жылы Дэниел МакФадден көпмүшелік логитті дискретті таңдау теориясымен, атап айтқанда Люс таңдау аксиомасымен байланыстырды, көпмүшелік логит маңызды емес баламалардың тәуелсіздігі туралы болжамнан және баламалардың ықтималдығын салыстырмалы артықшылықтар ретінде түсіндіруден туындағанын көрсетті; бұл логистикалық регрессияның теориялық негізін берді.