Кіріспе
Математикалық модельдің түрі
Статистикалық модель – үлгілік деректерді (және ірі популяциядан алынған ұқсас деректерді) жасауға қатысты статистикалық болжамдар жиынтығын қамтитын математикалық модель. Статистикалық модель деректерді жасау процесін, көбінесе едәуір идеалданған түрде көрсетеді. Ықтималдықтар туралы сөз болғанда, тиісті термин – ықтималдық модель. Барлық статистикалық гипотезалық тестілеулер мен барлық статистикалық бағалаулар статистикалық модельдер арқылы туындайды. Көбірек айтқанда, статистикалық модельдер статистикалық қорытындының негізін құрайды. Статистикалық модель әдетте бір немесе бірнеше кездейсоқ айнымалылар мен басқа кездейсоқ емес айнымалылар арасындағы математикалық байланыс ретінде беріледі. Осылайша, статистикалық модель – "теорияның формалды бейнелеуі" (Герман Адер Кеннет Болленнің сөзін келтіре).
Кіріспе
Бейресми түрде статистикалық модельді белгілі бір қасиетке ие статистикалық болжам (немесе статистикалық болжамдар жиынтығы) ретінде қарастыруға болады: бұл болжам кез келген оқиғаның ықтималдығын есептеуге мүмкіндік береді. Мысал ретінде, қарапайым алты жақты екі ойыншық текшесін қарастырайық. Біз осы текшелерге қатысты екі түрлі статистикалық болжамды зерттейміз. Бірінші статистикалық болжам мынадай: әр текшеде әр бетінің (1, 2, 3, 4, 5 және 6) шығу ықтималдығы тең. Осы болжамнан біз екі текшенің де 5 шығу ықтималдығын есептей аламыз. Көбірек мысал келтесек, кез келген оқиғаның ықтималдығын есептей аламыз: мысалы (1 және 2) немесе (3 және 3) немесе (5 және 6). Екінші статистикалық болжам мынадай: әр текшеде 5-ші бетінің шығу ықтималдығы жоғары (өйткені текшелер салмақталған). Осы болжам бойынша біз екі текшенің де 5 шығу ықтималдығын есептей аламыз. Алайда, басқа кез келген маңызды оқиғаның ықтималдығын есептей алмаймыз, өйткені қалған беттердің ықтималдығы белгісіз. Бірінші статистикалық болжам статистикалық модельді құрайды: себебі тек осы болжамның өзімен-ақ кез келген оқиғаның ықтималдығын есептеуге болады. Ал екінші статистикалық болжам статистикалық модельді құрамайды: себебі тек осы болжамның өзімен-ақ барлық оқиғаның ықтималдығын есептеуге болмайды. Жоғарыдағы мысалда, бірінші болжам бойынша оқиғаның ықтималдығын есептеу оңай. Бірақ кейбір басқа мысалдарда есептеу қиын немесе тіпті іс жүзінде мүмкін болмайды (мысалы, миллиондаған жылдар есептеуді қажет етуі мүмкін). Бір болжамның статистикалық модельді құруы үшін мұндай қиындықтар қабылданады: есептеуді жүзеге асыру практикалық болуы міндетті емес, тек теориялық тұрғыдан мүмкін болуы жеткілікті.
Үлгінің өлшемдері
Егер бізде статистикалық модель болса, онда k оң бүтін сан (нақты сандарды білдіреді, принципте басқа жиынтықтарды да қолдануға болады) деп жазамыз. Мұнда k модельдің өлшемі деп аталады. Егер модельдің өлшемі шекті болса, онда ол параметрлік модель деп аталады. Мысалы, егер деректер біртекті Гаусс үлестірілімінен туындады деп есептесек, онда біз осы мысалда k өлшемінің 2-ге тең екенін болжаймыз. Тағы бір мысал ретінде, деректер (x, y) нүктелерінен тұрады дейік, олар i.i.d. Гаусс қалдықтарымен (нөлдік орташа мәнімен) тура сызық бойынша таратылған: бұл балалардың бойы туралы мысалда қолданылған статистикалық модельге әкеледі. Статистикалық модельдің өлшемі 3-ке тең: сызықтың қиылысу нүктесі, сызықтың еңісі және қалдықтардың таралуының дисперсиясы. (Барлық мүмкін сызықтар жиынының өлшемі 2 екеніне назар аударыңыз, тіпті геометриялық тұрғыдан сызықтың өлшемі 1 болғанына қарамастан.) Формальды түрде , k өлшемді бір параметр болғанымен, кейде ол k жеке параметрден тұрады деп қарастырылады. Мысалы, біртекті Гаусс үлестірілімі формальды түрде 2 өлшемді бір параметр болып табылады, бірақ ол көбінесе 2 жеке параметрден – орташа мән мен стандарттық ауытқудан тұрады деп қарастырылады. Егер параметрлер жиынтығы шексіз өлшемді болса, статистикалық модель параметрлік емес модель болып табылады. Егер модельде шекті және шексіз өлшемді параметрлердің екеуі де болса, онда ол жартылай параметрлік модель болып табылады. Формальды түрде, егер k модельдің өлшемі болса және n – сынамалар саны болса, жартылай параметрлік және параметрлік емес модельдер үшін , n-ге тең болмайды. Егер , n-ге қарай теңелсе, онда модель жартылай параметрлік болады; әйтпесе, модель параметрлік емес болады. Параметриялық модельдер ең көп қолданылатын статистикалық модельдер болып табылады. Жартылай параметрлік және параметрлік емес модельдерге қатысты сэр Дэвид Кокс: "Олар әдетте құрылым мен үлестірім пішіні туралы аз болжамдарды қамтиды, бірақ әдетте тәуелсіздік туралы күшті болжамдарды қамтиды" деген еді.
In this example, the dimension, k, equals 2. As another example, suppose that the data consists of points (x, y) that we assume are distributed according to a straight line with i. i. d. Gaussian residuals (with zero mean): this leads to the same statistical model as was used in the example with children's heights. The dimension of the statistical model is 3: the intercept of the line, the slope of the line, and the variance of the distribution of the residuals. (Note the set of all possible lines has dimension 2, even though geometrically, a line has dimension 1.) Although formally is a single parameter that has dimension k, it is sometimes regarded as comprising k separate parameters. For example, with the univariate Gaussian distribution, is formally a single parameter with dimension 2, but it is often regarded as comprising 2 separate parameters—the mean and the standard deviation. A statistical model is nonparametric if the parameter set is infinite dimensional. A statistical model is semiparametric if it has both finite dimensional and infinite dimensional parameters. Formally, if k is the dimension of and n is the number of samples, both semiparametric and nonparametric models have as If as , then the model is semiparametric; otherwise, the model is nonparametric. Parametric models are by far the most commonly used statistical models. Regarding semiparametric and nonparametric models, Sir David Cox has said, "These typically involve fewer assumptions of structure and distributional form but usually contain strong assumptions about independencies".
Салыстырмалы модельдер
Статистикалық модельдерді салыстыру статистикалық қорытындылаудың көп бөлігі үшін негізгі болып табылады. "Статистикалық қорытындылаудағы көптеген мәселелерді статистикалық модельдеуге қатысты мәселелер деп қарастыруға болады. Олар көбінесе бірнеше статистикалық модельдерді салыстыру түрінде тұжырымдалады". Модельдерді салыстырудың жалпы критерийлеріне келесілер жатады: R2, Байес факторы, Акайке ақпараттық критерийі және ықтималдық қатынасы тесті, сондай-ақ оның жалпылама түрі – салыстырмалы ықтималдық. Статистикалық модельдерді салыстырудың тағы бір тәсілі – Лусьен Ле Кам енгізген кемшілік ұғымы арқылы.