Кіріспе
Регрессиялық талдау әдісі Статистикада биномиалдық регрессия - бұл регрессиялық талдау әдісі, онда жауаптың (көбінесе Y деп аталады) биномиалдық үлестірімі бар: бұл n тәуелсіз Бернулли сынақтарының сериясындағы табыстардың саны, мұнда әрбір сынақ табысты болу ықтималдығы p. егжей-тегжейі келесідей болды. Байқалған нәтижелік айнымалы өндірістік процесте ақаудың пайда болуы немесе болмауы болды. Екі түсіндірме айнымалы бар еді: біріншісі - процестің өзгертілген нұсқасы қолданылған-қолданбағанын көрсететін қарапайым екі жағдай факторы, ал екіншісі - процеске жеткізілетін материалдың тазалығын өлшейтін қарапайым сандық айнымалы.
In statistics, binomial regression is a regression analysis technique in which the response (often referred to as Y) has a binomial distribution: it is the number of successes in a series of n independent Bernoulli trials, where each trial has probability of success p. the details were as follows. The observed outcome variable was whether or not a fault occurred in an industrial process. There were two explanatory variables: the first was a simple two case factor representing whether or not a modified version of the process was used and the second was an ordinary quantitative variable measuring the purity of the material being supplied for the process.
Үлгінің сипаттамасы
Y жауап айнымалысы түсіндірме айнымалылар X шартты түрде биномдық таралған деп есептеледі. n сынақтардың саны белгілі, ал әрбір сынақ үшін табыстылықтың ықтималдығы p функциясы ретінде көрсетілген θ ((X). Бұл байқалатын табыстардың үлесі, Y/n шартты күту және шартты ауытқушылықты білдіреді. Биномиалдық регрессияның мақсаты θ ((X) функциясын бағалау болып табылады. Әдетте статистик белгілі функциясы m үшін , деп болжайды және β-ды бағалайды. m үшін жалпы таңдауға логистикалық функция жатады. Деректер жиі жалпыланған сызықтық модель ретінде орнатылады, онда μ болжамды мәндері кез келген жеке оқиғаның сәттілікке әкелетін ықтималдықтары болып табылады. Болжамдардың ықтималдығы онда берілген, онда 1A - оқиға A пайда болған кезде бір мәнге ие болатын индикатор функциясы, ал басқа жағдайда нөл: осы формулада кез келген бақылау үшін yi, өнімнің ішіндегі екі терминнің біреуі ғана әсер етеді, бұл yi = 0 немесе 1-ге байланысты. Ықтималдық функциясы μi формалды параметрлерін түсіндірмелі айнымалылардың параметрленген функциялары ретінде айқындау арқылы толық анықталады: бұл ықтималдықты параметрлердің санының азаюы бойынша анықтайды. Модельді орнату әдетте осы параметрлерді анықтау үшін ең жоғары ықтималдық әдісін қолдану арқылы жүзеге асырылады. Іс жүзінде формуланы жалпыланған сызықтық модель ретінде пайдалану жалпы модельдердің бүкіл класына қатысты, бірақ барлық ең жоғары ықтималдық проблемаларына қолданылмайтын белгілі бір алгоритмдік идеяларды пайдалануға мүмкіндік береді. Биномиалдық регрессияда қолданылатын модельдерді көбінесе мультиномиалдық деректерге дейін кеңейтуге болады. Модельді түсіндіруге мүмкіндік беретін μ мәндерін жүйелі түрде құрудың көптеген әдістері бар; олар төменде талқыланады.
The goal of binomial regression is to estimate the function θ(X). Typically the statistician assumes , for a known function m, and estimates β. Common choices for m include the logistic function. The data are often fitted as a generalised linear model where the predicted values μ are the probabilities that any individual event will result in a success. The likelihood of the predictions is then given by
where 1A is the indicator function which takes on the value one when the event A occurs, and zero otherwise: in this formulation, for any given observation yi, only one of the two terms inside the product contributes, according to whether yi=0 or 1. The likelihood function is more fully specified by defining the formal parameters μi as parameterised functions of the explanatory variables: this defines the likelihood in terms of a much reduced number of parameters. Fitting of the model is usually achieved by employing the method of maximum likelihood to determine these parameters. In practice, the use of a formulation as a generalised linear model allows advantage to be taken of certain algorithmic ideas which are applicable across the whole class of more general models but which do not apply to all maximum likelihood problems. Models used in binomial regression can often be extended to multinomial data. There are many methods of generating the values of μ in systematic ways that allow for interpretation of the model; they are discussed below.
Байланыс функциялары
μ ықтималдықтарды түсіндірме айнымалылармен байланыстыратын модельдеу 0 мен 1 аралығындағы мәндерді ғана беретін формада болуы тиіс. Көптеген модельдерді мына түрге орналастыруға болады: Мұнда η - түсіндірмелі айнымалылардың регрессия параметрлерін қамтитын сызықтық комбинациясын білдіретін аралық айнымалы. g функциясы - кейбір ықтималдық үлестірілімінің жиынтық үлестірілім функциясы (cdf). Әдетте бұл ықтималдық үлестірімі минус шексізден плюс шексізге дейін қолдау табады, сондықтан η кез келген шекті мәні g функциясы арқылы 0-ден 1-ге дейінгі аралықтағы мәнге айналады. Логистикалық регрессия жағдайында, байланыс функциясы - логарифмдік мөлшерлеменің немесе логистикалық функция. Пробит жағдайында, байланыс қалыпты таралымының cdf-і болып табылады. Сызықтық ықтималдық моделі дұрыс биномиалдық регрессияның ерекшелігі емес, өйткені болжаулардың нөлден бірге дейінгі диапазонда болуы қажет емес; ол кейде осы типті деректер үшін ықтималдық кеңістігі интерпретация болатын жерде немесе талдаушыда интерпретация үшін ықтималдықтардың шамамен сызықтық түрлерін есептеу немесе есептеу үшін жеткілікті күрделілік болмаған кезде қолданылады.
Here η is an intermediate variable representing a linear combination, containing the regression parameters, of the explanatory variables. The function
g is the cumulative distribution function (cdf) of some probability distribution. Usually this probability distribution has a support from minus infinity to plus infinity so that any finite value of η is transformed by the function g to a value inside the range 0 to 1. In the case of logistic regression, the link function is the log of the odds ratio or logistic function. In the case of probit, the link is the cdf of the normal distribution. The linear probability model is not a proper binomial regression specification because predictions need not be in the range of zero to one; it is sometimes used for this type of data when the probability space is where interpretation occurs or when the analyst lacks sufficient sophistication to fit or calculate approximate linearizations of probabilities for interpretation.
Бинарлық регрессиямен салыстыру
Биномиалдық регрессия бинарлық регрессиямен тығыз байланысты. Егер жауап екілік айнымалы болса (екі мүмкін нәтиже), онда бұл баламалардың біреуін "жетістік", екіншісін "жетіспеушілік" деп санау және оларды санау деректері ретінде қарастыру арқылы 0 немесе 1 деп кодтауға болады: "жетістік" - 1 сынақтан 1 сәттілік, ал "жетіспеушілік" - 1 сынақтан 0 сәттілік. Бұл қазір сынақпен биномдық үлестіру деп қарастырылуы мүмкін, сондықтан бинарлық регрессия - биномдық регрессияның арнайы жағдайы. Егер бұл деректер топтастырылса (саны қосу арқылы), олар енді екілік деректер емес, әр топ үшін санау деректер болып табылады және оларды әлі де биномиалдық регрессия арқылы модельдеуге болады; жеке екілік нәтижелер "топтастырылмаған деректер" деп аталады. Топталған деректермен жұмыс істеудің артықшылығы - модельдің жақсылығын тексеруге болады; мысалы, топталған деректер топталмаған деректерден бағаланған ауытқушылыққа қатысты артық дисперсияны көрсете алады.