Кіріспе
Статистикалық модельдің параметрлерін бағалау әдісі, белгілі бір бақылаулар негізінде статистикалық техникалар. Статистикада, ең жоғары ықтималдықпен бағалау (ЖЫББ) – берілген байқалған деректерге сәйкес, қабылданған ықтималдық таралуының параметрлерін бағалау әдісі. Бұл, ықтималдық функциясын максималдау арқылы жүзеге асырылады, осылайша қабылданған статистикалық модель бойынша байқалған деректердің болу ықтималдығы ең жоғары болады. Ықтималдық функциясын максималдайтын параметрлік кеңістіктегі нүкте – ең жоғары ықтималдық бағасы деп аталады. Ең жоғары ықтималдық логикасы интуитивті және икемді, сондықтан бұл әдіс статистикалық қорытындылардың басым құралына айналды. Егер ықтималдық функциясы дифференциалданатын болса, максимумды табу үшін туынды сынағы қолданылуы мүмкін. Кейбір жағдайларда, ықтималдық функциясының бірінші реттік шарттарын аналитикалық түрде шешуге болады; мысалы, сызықтық регрессия моделі үшін ең кіші квадраттардың әдеттегі бағалаушысы, кездейсоқ қателер бірдей дисперсиямен қалыпты таралымға ие деп есептелгенде, ықтималдықты максималдайды. Байестік қорытындылар тұрғысынан алғанда, ЖЫББ әдетте біртекті алдын ала таралымдармен (немесе шексіз стандартты ауытқуы бар қалыпты алдын ала таралыммен) максимум апостериорлы (ЖАББ) бағалауға тең. Фреквентистік қорытындыларда ЖЫББ – экстремум бағалаушының ерекше жағдайы болып табылады, мұнда мақсаттық функция ықтималдық болып табылады.
the statistical techniques
In statistics, maximum likelihood estimation (MLE) is a method of estimating the parameters of an assumed probability distribution, given some observed data. This is achieved by maximizing a likelihood function so that, under the assumed statistical model, the observed data is most probable. The point in the parameter space that maximizes the likelihood function is called the maximum likelihood estimate. The logic of maximum likelihood is both intuitive and flexible, and as such the method has become a dominant means of statistical inference. If the likelihood function is differentiable, the derivative test for finding maxima can be applied. In some cases, the first order conditions of the likelihood function can be solved analytically; for instance, the ordinary least squares estimator for a linear regression model maximizes the likelihood when the random errors are assumed to have normal distributions with the same variance. From the perspective of Bayesian inference, MLE is generally equivalent to maximum a posteriori (MAP) estimation with uniform prior distributions (or a normal prior distribution with a standard deviation of infinity). In frequentist inference, MLE is a special case of an extremum estimator, with the objective function being the likelihood.
Параметриялық емес ең жоғары ықтималдық бағасы
Параметриялық емес максималды ықтималдық бағалау эмпирикалық ықтималдық арқылы жүзеге асырылуы мүмкін.
Қасиеттері
Максималды ықтималдық бағалаушысы – θ функциясы бойынша мақсатты функцияны максимизациялау арқылы алынатын экстремумды бағалаушы. Егер деректер тәуелсіз және бірдей таратылған болса, онда бұл күтілетін логарифмдік ықтималдықтың үлгілік аналогы болып табылады, мұндағы күту нақты тығыздық бойынша есептеледі. Максималды ықтималдық бағалаушылары шекті үлгілер үшін оңтайлы қасиеттерге ие емес, себебі (шекті үлгілерде бағаланғанда) басқа бағалаушылар нақты параметр мәнінің төңірегінде үлкен шоғырлануға ие болуы мүмкін. Дегенмен, басқа бағалау әдістері сияқты, максималды ықтималдық бағалауда да бірқатар тартымды асимптотикалық қасиеттер бар: Үлгі көлемі шексіздікке ұлғайғанда, максималды ықтималдық бағалаушылардың тізбегі мынадай қасиеттерге ие болады: Тұрақтылық: МЛЕ тізбегі ықтималдық бойынша бағаланатын мәнге жақындайды. Инварианттылық: Егер – бағалаушысының максималды ықтималдығы болса, және егер – -ның кез келген түрлендіруі болса, онда -ның максималды ықтималдық бағалаушысы болады. Бұл қасиет функционалдық эквиварианттылық деп те аталады. Инварианттылық қасиеті кез келген түрлендіру үшін қолданылады, бірақ егер бірден-бір түрлендірумен шектелсе, дәлелдеу оңайлайды. Тиімділік, яғни, үлгі көлемі шексіздікке жақындағанда, ол Крамэр-Раоның төменгі шегіне жетеді. Бұл, ешбір тұрақты бағалаушының асимптотикалық орташа квадраттық қатесі MLE-ден (немесе осы шекке жететін басқа бағалаушылардан) төмен болмайды дегенді білдіреді, сонымен қатар MLE асимптотикалық қалыпқа ие екенін көрсетеді. Бұрыстылықты түзетуден кейін екінші реттік тиімділік.
this being the sample analogue of the expected log likelihood , where this expectation is taken with respect to the true density. Maximum likelihood estimators have no optimum properties for finite samples, in the sense that (when evaluated on finite samples) other estimators may have greater concentration around the true parameter value. However, like other estimation methods, maximum likelihood estimation possesses a number of attractive limiting properties: As the sample size increases to infinity, sequences of maximum likelihood estimators have these properties:
Consistency: the sequence of MLEs converges in probability to the value being estimated. Invariance: If is the maximum likelihood estimator for , and if is any transformation of , then the maximum likelihood estimator for is This property is less commonly known as functional equivariance. The invariance property holds for arbitrary transformation , although the proof simplifies if is restricted to one to one transformations. Efficiency, i. e. it achieves the Cramér–Rao lower bound when the sample size tends to infinity. This means that no consistent estimator has lower asymptotic mean squared error than the MLE (or other estimators attaining this bound), which also means that MLE has asymptotic normality. Second order efficiency after correction for bias.
Байестік тұжырыммен байланысы
Максималды ықтималдық бағалаушысы, параметрлер бойынша біртекті алдын ала таралымды ескере отырып, ең ықтимал Байес бағалаушысымен сәйкес келеді. Шындығында, апостериорлық максималды бағалау – бұл Байес теоремасымен берілген деректер бойынша θ параметрінің ықтималдығын максималдайтын θ параметрі:
мұнда θ параметрі үшін алдын ала таралым, ал – барлық параметрлер бойынша орташаланған деректердің ықтималдығы. Атауыш θ-ға тәуелді емес болғандықтан, Байес бағалаушысы θ-ға қатысты максималдау арқылы алынады. Егер алдын ала таралым біртекті таралым болса, Байес бағалауы ықтималдық функциясын максималдау арқылы алынады. Осылайша, Байес бағалауы біртекті алдын ала таралым үшін максималды ықтималдық бағалаушысымен сәйкес келеді.
Куллбек-Лейблер дивергенциясын және қиылысты энтропияны азайтумен байланысы
Ең жоғары ықтималдықты қамтамасыз ететін параметрді табу, Kullback–Leibler дивергенциясы тұрғысынан нақты ықтималдық үлестірімінен (яғни, деректерді тудырған ) ең аз қашықтықта болатын ықтималдық үлестірімін анықтайтын параметрді табуға асимптотикалық түрде тең. Идеал жағдайда P және Q бірдей (және белгісіз нәрсе тек P-ні анықтайтын параметр), бірақ олар бірдей болмаған жағдайда да, тіпті қолданылатын модель дұрыс емес болса да, ең жоғары ықтималдық бағалауы (MLE) нақты үлестірілімге (параметрге байланысты Q моделінің шектеулері ішінде) ең жақын үлестірілімді береді. Дәлелдеу үшін: Жазуды жеңілдету үшін P=Q деп есептейік. Біз бағалауға тырысатын белгілі бір ықтималдықтан тәуелсіз және бірдей үлестірілген n дерек нүсқасы болсын, сонда:
Proof. For simplicity of notation, let's assume that P=Q. Let there be n i. i. d data samples from some probability , that we try to estimate by finding that will maximize the likelihood using , then:
Мұнда h қолдану арқылы біз үлкен сандар заңын қолданып, h(x) орташасынан оның күтілетін мәніне қалай өтетінін көре аламыз (белгісіз статистикалық заң бойынша). Алғашқы бірнеше өзгерістер логарифм заңдарымен байланысты және қандай да бір функцияны максимизациялайтын параметр сол функцияның монотонды түрлендірілімін максимизациялайтын болады (яғни: тұрақтыны қосу/көбейту). Кросс-энтропия Шеннон энтропиясы мен KL дивергенциясының қосындысы болғандықтан және энтропия тұрақты болғандықтан, MLE кросс-энтропияны да асимптотикалық түрде азайтады.
Біркелкі дискретті бөлу
1-ден n-ге дейін нөмірленген n билет қорапқа салынып, біреуі кездейсоқ түрде таңдалады (біркелкі үлестіруді қараңыз); осылайша, үлгінің көлемі 1-ге тең. Егер n белгісіз болса, онда n-нің максималды ықтималдық бағалаушысы – тартылған билеттегі m саны. (Ықтималдық n < m үшін 0-ге тең, ал n ≥ m үшін 1/n-ге тең, және бұл n = m болғанда ең жоғары. n-нің максималды ықтималдық бағалаушысы ықтимал мәндердің төменгі шегінде {m, m + 1, …} пайда болатынын ескеріңіз, ал ықтимал мәндердің «ортасында» болса, бұл үлкен қателікке әкелер еді.) Тартылған билеттегі m санының күтілетін мәні, демек, күтілетін мәні (n + 1) / 2-ге тең. Осының салдарынан, үлгінің көлемі 1 болғанда, n үшін максималды ықтималдық бағалаушысы n-ді жүйелі түрде (n - 1) / 2-ге кем бағалайды.
Дискреттік үлестіру, шекті параметр кеңістігі
Мысалы, біреудің әділ емес монетаның қаншалықты бұрмаланғанын анықтағысы келсін. "Сырт" түсу ықтималдығын p деп атайық. Онда мақсат p-ні анықтау болады. "Құйрық" түсу ықтималдығы 1-p-ге тең (мұнда p – жоғарыдағы θ). Нәтижесі 49 "сырт" және 31 "құйрық" болсын, ал монета үш монетадан тұратын қораптан алынған делік: біреуі p = 1/3 ықтималдығымен "сырт" түсіреді, біреуі p = 1/2 ықтималдығымен "сырт" түсіреді, ал үшіншісі p = 2/3 ықтималдығымен "сырт" түсіреді. Монеталардың белгілері жоғалған, сондықтан қайсысы екенін білмейміз. Ең жоғары ықтималдық бағалауды қолдану арқылы, байқалған деректерді ескере отырып, ең үлкен ықтималдығы бар монетаны табуға болады. 80-ге тең үлгі көлемімен және 49-ға тең сәттілік санымен биномдық үлестірудің ықтималдық массалық функциясын қолдану арқылы, p-нің әртүрлі мәндері үшін ("сәттілік ықтималдығы"), ықтималдық функциясы (төменде анықталған) үш мәннің біреуін қабылдайды: ықтималдық p = 2/3 болғанда максималдыққа жетеді, сондықтан бұл p үшін ең жоғары ықтималдық бағасы болады.
Suppose the coin is tossed 80 times: i. e. the sample might be something like x1 = H, x2 = T, , x80 = T, and the count of the number of heads "H" is observed. The probability of tossing tails is 1 − p (so here p is θ above). Suppose the outcome is 49 heads and 31 tails, and suppose the coin was taken from a box containing three coins: one which gives heads with probability p = 1/3, one which gives heads with probability p = 1/2 and another which gives heads with probability p = 2/3. The coins have lost their labels, so which one it was is unknown. Using maximum likelihood estimation, the coin that has the largest likelihood can be found, given the data that were observed. By using the probability mass function of the binomial distribution with sample size equal to 80, number successes equal to 49 but for different values of p (the "probability of success"), the likelihood function (defined below) takes one of three values:
The likelihood is maximized when p = 2/3, and so this is the maximum likelihood estimate for p.
Квази-Ньютон әдістері
Басқа квази-Ньютон әдістері Гессиан матрицасын жақындату үшін күрделірек секант жаңартуларын пайдаланады.
Фишердің ұпай жинауы
Тағы бір танымал әдіс – Гессианды Фишер ақпараттық матрицасымен алмастыру, осылайша Фишер бағалау алгоритмі пайда болады. Бұл процедура көптеген әдістерді бағалауда стандартты болып табылады, мысалы, жалпыланған сызықтық модельдерде. Көп қолданылатын болса да, квази-Ньютон әдістері тұрақты нүктеге жиналуы мүмкін, бірақ бұл нүкте міндетті түрде жергілікті немесе жаһандық максимум емес, керісінше жергілікті минимум немесе шегініс нүктесі болуы мүмкін. Сондықтан, алынған шешімнің ықтималдық теңдеулеріне сәйкестігін бағалау маңызды, Гессианды шешімде есептегенде, оның теріс анықталған және жақсы шарты бар екенін тексеру арқылы.
Тарих
Максималды ықтималдықты алғаш қолданғандар Карл Фридрих Гаусс, Пьер Симон Лаплас, Торвальд Н. Тиле және Фрэнсис Исидро Эджворт болды. Бірақ, оның кеңінен қолданылуы 1912 және 1922 жылдар аралығында Рональд Фишердің максималды ықтималдықты бағалауды ұсынған, кеңінен танымал еткен және мұқият талдаған кезде (дәлелдеуге жасалған сәтсіз әрекеттермен) артып, дамыды. Максималды ықтималдықты бағалау Сэмюэл С. Уилкс 1938 жылы жариялаған дәлелдемесінде ғана нақты негіздемеге ие болды, бұл қазір Уилкс теоремасы деп аталады. Теорема көрсеткендей, бірнеше тәуелсіз байқаулардың нәтижесінде алынған бағалаулар үшін ықтималдық мәндерінің логарифміндегі қателік асимптотикалық түрде χ² таралым заңына бағынады, бұл параметрлердің кез келген бағалауы үшін сенімділік аймағын анықтауға қолайлы жағдай жасайды. Уилкс дәлелінің ең қиын бөлігі Фишердің ақпараттық матрицасының күтілетін мәніне байланысты, ал осы мән Фишердің дәлелдеген теоремасымен анықталады. Уилкс өмірі бойы теореманың жалпылығын жетілдіріп келді, ал ең жалпы дәлелдемесі 1962 жылы жарияланды. Максималды ықтималдықты бағалаудың даму тарихын көптеген авторлар қарастырған.