Кіріспе

Регрессиялық талдау әдісі Статистикада биномиалдық регрессия - бұл регрессиялық талдау әдісі, онда жауаптың (көбінесе Y деп аталады) биномиалдық үлестірімі бар: бұл n тәуелсіз Бернулли сынақтарының сериясындағы табыстардың саны, мұнда әрбір сынақ табысты болу ықтималдығы p. егжей-тегжейі келесідей болды. Байқалған нәтижелік айнымалы өндірістік процесте ақаудың пайда болуы немесе болмауы болды. Екі түсіндірме айнымалы бар еді: біріншісі - процестің өзгертілген нұсқасы қолданылған-қолданбағанын көрсететін қарапайым екі жағдай факторы, ал екіншісі - процеске жеткізілетін материалдың тазалығын өлшейтін қарапайым сандық айнымалы.

Үлгінің сипаттамасы

Y жауап айнымалысы түсіндірме айнымалылар X шартты түрде биномдық таралған деп есептеледі. n сынақтардың саны белгілі, ал әрбір сынақ үшін табыстылықтың ықтималдығы p функциясы ретінде көрсетілген θ ((X). Бұл байқалатын табыстардың үлесі, Y/n шартты күту және шартты ауытқушылықты білдіреді. Биномиалдық регрессияның мақсаты θ ((X) функциясын бағалау болып табылады. Әдетте статистик белгілі функциясы m үшін , деп болжайды және β-ды бағалайды. m үшін жалпы таңдауға логистикалық функция жатады. Деректер жиі жалпыланған сызықтық модель ретінде орнатылады, онда μ болжамды мәндері кез келген жеке оқиғаның сәттілікке әкелетін ықтималдықтары болып табылады. Болжамдардың ықтималдығы онда берілген, онда 1A - оқиға A пайда болған кезде бір мәнге ие болатын индикатор функциясы, ал басқа жағдайда нөл: осы формулада кез келген бақылау үшін yi, өнімнің ішіндегі екі терминнің біреуі ғана әсер етеді, бұл yi = 0 немесе 1-ге байланысты. Ықтималдық функциясы μi формалды параметрлерін түсіндірмелі айнымалылардың параметрленген функциялары ретінде айқындау арқылы толық анықталады: бұл ықтималдықты параметрлердің санының азаюы бойынша анықтайды. Модельді орнату әдетте осы параметрлерді анықтау үшін ең жоғары ықтималдық әдісін қолдану арқылы жүзеге асырылады. Іс жүзінде формуланы жалпыланған сызықтық модель ретінде пайдалану жалпы модельдердің бүкіл класына қатысты, бірақ барлық ең жоғары ықтималдық проблемаларына қолданылмайтын белгілі бір алгоритмдік идеяларды пайдалануға мүмкіндік береді. Биномиалдық регрессияда қолданылатын модельдерді көбінесе мультиномиалдық деректерге дейін кеңейтуге болады. Модельді түсіндіруге мүмкіндік беретін μ мәндерін жүйелі түрде құрудың көптеген әдістері бар; олар төменде талқыланады.

Байланыс функциялары

μ ықтималдықтарды түсіндірме айнымалылармен байланыстыратын модельдеу 0 мен 1 аралығындағы мәндерді ғана беретін формада болуы тиіс. Көптеген модельдерді мына түрге орналастыруға болады: Мұнда η - түсіндірмелі айнымалылардың регрессия параметрлерін қамтитын сызықтық комбинациясын білдіретін аралық айнымалы. g функциясы - кейбір ықтималдық үлестірілімінің жиынтық үлестірілім функциясы (cdf). Әдетте бұл ықтималдық үлестірімі минус шексізден плюс шексізге дейін қолдау табады, сондықтан η кез келген шекті мәні g функциясы арқылы 0-ден 1-ге дейінгі аралықтағы мәнге айналады. Логистикалық регрессия жағдайында, байланыс функциясы - логарифмдік мөлшерлеменің немесе логистикалық функция. Пробит жағдайында, байланыс қалыпты таралымының cdf-і болып табылады. Сызықтық ықтималдық моделі дұрыс биномиалдық регрессияның ерекшелігі емес, өйткені болжаулардың нөлден бірге дейінгі диапазонда болуы қажет емес; ол кейде осы типті деректер үшін ықтималдық кеңістігі интерпретация болатын жерде немесе талдаушыда интерпретация үшін ықтималдықтардың шамамен сызықтық түрлерін есептеу немесе есептеу үшін жеткілікті күрделілік болмаған кезде қолданылады.

Бинарлық регрессиямен салыстыру

Биномиалдық регрессия бинарлық регрессиямен тығыз байланысты. Егер жауап екілік айнымалы болса (екі мүмкін нәтиже), онда бұл баламалардың біреуін "жетістік", екіншісін "жетіспеушілік" деп санау және оларды санау деректері ретінде қарастыру арқылы 0 немесе 1 деп кодтауға болады: "жетістік" - 1 сынақтан 1 сәттілік, ал "жетіспеушілік" - 1 сынақтан 0 сәттілік. Бұл қазір сынақпен биномдық үлестіру деп қарастырылуы мүмкін, сондықтан бинарлық регрессия - биномдық регрессияның арнайы жағдайы. Егер бұл деректер топтастырылса (саны қосу арқылы), олар енді екілік деректер емес, әр топ үшін санау деректер болып табылады және оларды әлі де биномиалдық регрессия арқылы модельдеуге болады; жеке екілік нәтижелер "топтастырылмаған деректер" деп аталады. Топталған деректермен жұмыс істеудің артықшылығы - модельдің жақсылығын тексеруге болады; мысалы, топталған деректер топталмаған деректерден бағаланған ауытқушылыққа қатысты артық дисперсияны көрсете алады.