Кіріспе
Белгісіз шаманың таралуы
Белгісіз шаманың алдын ала ықтималдық таралуы, көбінесе жай ғана алдын ала деп аталады, — бұл кейбір деректер ескерілгенге дейін оның болжамды ықтималдық таралуы. Мысалы, алдын ала болашақ сайлауда белгілі бір саясаткерге дауыс беретін сайлаушылардың салыстырмалы үлесін көрсететін ықтималдық таралуы болуы мүмкін. Белгісіз шама байқалатын айнымалы емес, модельдің параметрі немесе жасырын айнымалы болуы мүмкін. Байес статистикасында Байес ережесі жаңа деректерді ескергенде белгісіз шаманың шартты таралуын беретін кейінгі ықтималдық таралуын алу үшін алдын ала ақпаратты жаңа ақпаратпен қалай жаңартуды анықтайды. Тарихи тұрғыдан алғанда, алдын ала таңдау көбінесе берілген ықтималдық функциясының үйлесімді отбасына шектелген, себебі бұл осы отбасының шешілетін кейінгі ықтималдығына әкелетін. Алайда, Марков тізбегі Монте-Карло әдістерінің кең таралғандығы бұл мәселені азырақ маңызды етті. Алдын ала таратуды құрудың көптеген тәсілдері бар. Кейбір жағдайларда, алдын ала бұрынғы ақпараттан, мысалы, бұрынғы эксперименттерден анықталуы мүмкін. Алдын ала тәжірибелі сарапшының субъективті бағалауынан да алынуы мүмкін. Егер ақпарат болмаса, бейтараптық принципімен негізделген ақпараттық емес алдын ала қабылдануы мүмкін. Қазіргі қолданыстарда, алдын алалар реттеу және белгілерді таңдау сияқты механикалық қасиеттері үшін де жиі таңдалады. Модель параметрлерінің алдын ала таралуы көбінесе өздерінің параметрлеріне байланысты болады. Осы гиперпараметрлер туралы белгісіздік өз кезегінде гиперпріорлық ықтималдық таралулары арқылы білдірілуі мүмкін. Мысалы, егер Бернулли таралымының p параметрінің таралуын модельдеу үшін бета таралымы қолданылса, онда: p — негізгі жүйенің параметрі (Бернулли таралымы), ал α және β — алдын ала таралудың (бета таралымы) параметрлері; демек, гиперпараметрлер. Принцип бойынша, алдын алалар таралудың көптеген шартты деңгейлеріне бөлінуі мүмкін, оларды иерархиялық алдын алалар деп атайды.
p is a parameter of the underlying system (Bernoulli distribution), and
α and β are parameters of the prior distribution (beta distribution); hence hyperparameters. In principle, priors can be decomposed into many conditional levels of distributions, so called hierarchical priors.
Қатты алдыңғы
Қуатты алдыңғы – бұл жаңа ақпарат ескерілгеннен кейін, қазіргі болжам, теория, тұжырымдама немесе идеяның негізі болып табылатын алдыңғы болжам, теория, тұжырымдама немесе идея. Қуатты алдыңғы – бұл ақпаратты алдыңғы таралымдағы ақпараттың, талданып жатқан деректердегі ақпараттан гөрі басым болатын ақпаратты алдыңғы таралымның бір түрі. Байес талдауы алдыңғы таралымдағы ақпаратты деректерден алынған ақпаратпен біріктіріп, кейінгі таралымды құрады, ол "қуатты алдыңғы" жағдайында алдыңғы таралымнан көп өзгешеленбейді.
Ақпараттылығы төмен апириорлар
Ақпараттық жеткіліксіз алдыңғы мәліметтер бір айнымалы туралы ішінара ақпаратты көрсетеді, талдауды нәтижелерді тым шектемей және қалыптан тыс бағалаулардың алдын алып, қолданыстағы біліммен үйлесетін шешімдерге бағыттайды. Мысалы, ертең Сент-Луис қаласында түскідегі температураның алдын ала таралуын белгілегенде, орташа температурасы 50 градус Фаренгейт және стандарттық қатеуі 40 градус болатын қалыпты таралымды қолдануға болады. Бұл температураны шамамен (10 градус, 90 градус) диапазонында ұстайды, сонымен қатар 30 градустан төмен немесе 130 градустан жоғары болу ықтималдығын қамтиды. Ақпараттық жеткіліксіз алдыңғы мәліметтердің мақсаты – реттеу, яғни, қорытындыларды нақты шектеулерде ұстау.
Ақпараттық емес прериорлар
Ақпараттық емес, тегіс немесе тараң прериор айнымалы туралы тұманды немесе жалпы ақпаратты көрсетеді. Мысал ретінде, Джейнс прериордың параметрлер өзгергенде инварианттылығына негізделген аргумент жариялады, ол ықтималдық туралы толық белгісіздікті білдіретін прериордың Холдейн прериоры болуы керек екенін көрсетеді: p−1(1 − p)−1. Джейнс берген мысал – зертханада химиялық затты тауып, оның суда еріп-ерімейтінін қайталап эксперименттер жүргізу арқылы анықтау. Холдейн прериоры ең көп салмақты менге береді, яғни үлгі әрқашан немесе ешқашан ерімейді, бірдей ықтималдықпен. Егер химиялық заттың бір экспериментте еріп, екіншісінде ермегені байқалса, онда бұл прериор [0, 1] аралығында біркелкі таралуға жаңартылады. Бұл жоғарыда көрсетілген прериорды қолданып, бір рет еріген және бір рет ермеген байқаудан тұратын деректер жиынтығына Байес теоремасын қолдану арқылы алынады. Холдейн прериоры – дұрыс емес прериорлық таралым (яғни, оның шексіз массасы бар). Гарольд Джеффрис Бернуллидің кездейсоқ айнымалысы үшін p−1/2(1 − p)−1/2 Джеффрис прериоры сияқты ақпараттық емес прериорларды жобалаудың жүйелі әдісін ойлап тапты. Егер X параметр кеңістігі біздің Байестік білім күйімізді өзгермейтін табиғи топ құрылымын алып жүрсе, Haar өлшеміне пропорционалды прериорлар құруға болады. Мұндай әдістер Соломоновтың индуктивті тұжырым теориясында қолданылады. Объективті прериорларды құру биоинформатикада, әсіресе үлгі көлемі шектеулі және алдын ала білімнің көп мөлшері бар қатерлі ісіктердің жүйелік биологиясында енгізілген. Бұл әдістерде екілік бақылаудағы оқу проблемалары және аралас модельдер проблемалары үшін KL дивергенциясы немесе лог-ықтималдық функциясы сияқты ақпараттық теорияға негізделген критерийлер қолданылады. Ақпараттық емес прериорлармен байланысты философиялық мәселелер тиісті метриканы немесе өлшеу шкаласын таңдаумен байланысты. Мысалы, бізге белгісіз жүгірушінің жүгіру жылдамдығы үшін прериорды анықтағымыз келсін. Біз, мысалы, оның жылдамдығы үшін нормальды таралымды көрсетуіміз мүмкін, бірақ, балама ретінде, 100 метрді аяқтау үшін кететін уақыты үшін нормальды прериорды көрсетуіміз мүмкін, ол бірінші прериордың кері пропорционалды. Бұл екі прериор өте әртүрлі, бірақ қайсысы артық екені белгісіз. Кейбір жағдайларда Джейнстің трансформациялық топтар әдісі осы сұраққа жауап бере алады. Сол сияқты, 0 мен 1 арасындағы белгісіз пропорцияны бағалауды сұрасақ, барлық пропорциялар бірдей ықтимал деп айтуға болады және біркелкі прериорды қолдануға болады. Басқаша айтқанда, пропорцияның барлық шамалары бірдей ықтимал, логарифмдік прериор, пропорцияның логарифміне біркелкі прериор. Джеффрис прериоры бұл мәселені есептеу арқылы шешуге тырысады, ол қолданылған метрикаға қарамастан бірдей сенімді білдіреді. Джеффрис прериоры белгісіз пропорция p үшін p−1/2(1 − p)−1/2, бұл Джейнстің ұсынысынан өзгеше. Алгоритмдік ықтималдық тұжырымдарына негізделген прериорлар индуктивті тұжырымдауда өте жалпы жағдайларда индукцияның негізі ретінде қолданылады. Ақпараттық емес прериорлармен байланысты практикалық мәселелердің бірі – кейіннен таралудың дұрыс болуы талабы. Тұрақты, шексіз айнымалыларға арналған әдеттегі ақпараттық емес прериорлар дұрыс емес. Егер кейіннен таралу дұрыс болса, бұл мәселе болмауы керек. Тағы бір маңызды мәселе – егер ақпараттық емес прериорды жүйелі түрде, яғни көптеген әртүрлі деректер жиынтығымен пайдалану керек болса, онда оның жақсы жиіліктік қасиеттері болуы керек. Әдетте Байес мұндай мәселелерге мән бермейді, бірақ бұл жағдайда маңызды болуы мүмкін. Мысалы, кейіннен таралуға негізделген кез келген шешім ережесі қабылданған шығын функциясы бойынша қабылдануы керек. Өкінішке орай, қабылдануға жарамдылығын тексеру қиын, бірақ кейбір нәтижелер белгілі (мысалы, Berger and Strawderman 1996). Бұл мәселе әсіресе иерархиялық Байес модельдерімен ерекше өзекті; әдеттегі прериорлар (мысалы, Джеффрис прериоры) иерархияның жоғары деңгейлерінде қолданылса, жарамсыз шешім қабылдау ережелерін беруі мүмкін.
Қате істер
Оқиғалар өзара ажыраспалы және толық болсын. Егер Байес теоремасы былай жазылса, онда барлық алдыңғы ықтималдықтар P(Ai) және P(Aj) берілген тұрақтыға көбейтілсе, бірдей нәтиже алынатыны анық; үздіксіз кездейсоқ айнымалы үшін де солай. Егер атаушыдағы жиынтық немесе интеграл конвергенцияланса, алдыңғы мәндердің дұрыс болмауына қарамастан, кейінгі ықтималдықтар әлі де 1-ге қосылады немесе интегралданады, сондықтан priors тек дұрыс пропорцияда берілуі керек. Бұл идеяны одан әрі дамыта отырып, көп жағдайда алдыңғы мәндердің қосындысы немесе интегралы кейінгі ықтималдықтарға ақылға қонымды жауап алу үшін шекті болуы міндетті емес. Мұндай жағдайда, priors «дұрыс емес priors» деп аталады. Дегенмен, priors дұрыс болмаса, кейінгі бөлу дұрыс бөлу болуы шарт емес. Бұл жағдайды қарастырайық, егер оқиға B барлық Aj-ден тәуелсіз болса. Статистиктер кейде дұрыс емес priors-ты ақпараттық емес priors ретінде пайдаланады. Мысалы, егер оларға кездейсоқ айнымалының орташа және дисперсиясы үшін алдын ала бөлу қажет болса, олар p(m, v) ~ 1/v (v > 0 үшін) деп есептеуі мүмкін, бұл орташа мәннің кез келген мәні «бірдей ықтимал» екенін, ал оң дисперсияның мәні оның мәніне кері пропорционалды түрде «кем ықтимал» екенін көрсетеді. Көптеген авторлар (Линдли, 1973; Де Грот, 1937; Касс және Вассерман, 1996) осы priors-ты тым жоғары бағалау қаупі туралы ескертеді, өйткені олар ықтималдық тығыздықтары емес. Олардың маңызы тек тиісті кейінгі бөлуде, егер ол барлық байқаулар үшін дұрыс анықталған болса. (Халдайн priors – бұл қарсы мысалдың классикалық мысалы.) Керісінше, ықтималдық функцияларын интегралдау қажет емес, ал мәні 1-ге тең ықтималдық функциясы деректердің жоқтығына сәйкес келеді (деректер жоқ болғанда барлық модельдер бірдей ықтимал): Байес ережесі priors-ты ықтималдықпен көбейтеді, ал бос көбейтінді – тұрақты ықтималдық 1. Алайда, егер алдын ала ықтималдық бөлуден бастамаса, кейінгі ықтималдық бөлуді алу мүмкін емес, сондықтан күтілетін мәндерді немесе шығындарды интегралдау немесе есептеу мүмкін емес. Толық мәліметтер үшін қараңыз.
then it is clear that the same result would be obtained if all the prior probabilities P(Ai) and P(Aj) were multiplied by a given constant; the same would be true for a continuous random variable. If the summation in the denominator converges, the posterior probabilities will still sum (or integrate) to 1 even if the prior values do not, and so the priors may only need to be specified in the correct proportion. Taking this idea further, in many cases the sum or integral of the prior values may not even need to be finite to get sensible answers for the posterior probabilities. When this is the case, the prior is called an improper prior. However, the posterior distribution need not be a proper distribution if the prior is improper. This is clear from the case where event B is independent of all of the Aj. Statisticians sometimes use improper priors as uninformative priors. For example, if they need a prior distribution for the mean and variance of a random variable, they may assume p(m, v) ~ 1/v (for v > 0) which would suggest that any value for the mean is "equally likely" and that a value for the positive variance becomes "less likely" in inverse proportion to its value. Many authors (Lindley, 1973; De Groot, 1937; Kass and Wasserman, 1996) warn against the danger of over interpreting those priors since they are not probability densities. The only relevance they have is found in the corresponding posterior, as long as it is well defined for all observations. (The Haldane prior is a typical counterexample.) By contrast, likelihood functions do not need to be integrated, and a likelihood function that is uniformly 1 corresponds to the absence of data (all models are equally likely, given no data): Bayes' rule multiplies a prior by the likelihood, and an empty product is just the constant likelihood 1. However, without starting with a prior probability distribution, one does not end up getting a posterior probability distribution, and thus cannot integrate or compute expected values or loss. See for details.
Мысал
Келесі мысал (а) классикалық және (b) кванттық жағдайлардағы алдын ала ықтималдықты (немесе алдын ала салмақты) түсіндіреді.