Введение
Метод оценки параметров статистической модели на основе наблюдений – статистические методы. В статистике, метод максимального правдоподобия (MLE) – это метод оценки параметров предполагаемого распределения вероятностей, учитывая имеющиеся данные наблюдений. Это достигается путем максимизации функции правдоподобия, так что, при заданном статистическом моделировании, наблюдаемые данные наиболее вероятны. Точка в пространстве параметров, максимизирующая функцию правдоподобия, называется оценкой максимального правдоподобия. Логика максимального правдоподобия интуитивно понятна и обладает гибкостью, благодаря чему метод стал доминирующим способом статистического вывода. Если функция правдоподобия дифференцируема, для нахождения максимумов можно применить тест производной. В некоторых случаях условия первого порядка функции правдоподобия могут быть решены аналитически; например, метод наименьших квадратов для модели линейной регрессии максимизирует правдоподобие, когда предполагается, что случайные ошибки имеют нормальное распределение с одинаковой дисперсией. С точки зрения байесовского вывода, MLE обычно эквивалентен оценке максимального апостериорного правдоподобия (MAP) с использованием равномерных априорных распределений (или нормального априорного распределения с бесконечным стандартным отклонением). В частотном выводе MLE является частным случаем экстремального оценщика, где целевой функцией является функция правдоподобия.
the statistical techniques
In statistics, maximum likelihood estimation (MLE) is a method of estimating the parameters of an assumed probability distribution, given some observed data. This is achieved by maximizing a likelihood function so that, under the assumed statistical model, the observed data is most probable. The point in the parameter space that maximizes the likelihood function is called the maximum likelihood estimate. The logic of maximum likelihood is both intuitive and flexible, and as such the method has become a dominant means of statistical inference. If the likelihood function is differentiable, the derivative test for finding maxima can be applied. In some cases, the first order conditions of the likelihood function can be solved analytically; for instance, the ordinary least squares estimator for a linear regression model maximizes the likelihood when the random errors are assumed to have normal distributions with the same variance. From the perspective of Bayesian inference, MLE is generally equivalent to maximum a posteriori (MAP) estimation with uniform prior distributions (or a normal prior distribution with a standard deviation of infinity). In frequentist inference, MLE is a special case of an extremum estimator, with the objective function being the likelihood.
Максимальная оценка непараметрической вероятности
Непараметрическая оценка максимального правдоподобия может быть выполнена с использованием эмпирического правдоподобия.
Свойства
Оценщик максимального правдоподобия – это экстремальный оценщик, получаемый путем максимизации, как функции θ, целевой функции. Если данные независимы и одинаково распределены, то у нас есть
это, будучи выборочным аналогом математического ожидания логарифмической функции правдоподобия, где математическое ожидание берется относительно истинной плотности распределения. Оценщики максимального правдоподобия не обладают оптимальными свойствами для конечных выборок, в том смысле, что (при оценке на конечных выборках) другие оценщики могут иметь большую концентрацию вокруг истинного значения параметра. Однако, как и другие методы оценки, оценка максимального правдоподобия обладает рядом привлекательных асимптотических свойств: по мере увеличения размера выборки до бесконечности, последовательности оценщиков максимального правдоподобия обладают следующими свойствами: состоятельность: последовательность МП оценивается по вероятности к оцениваемому значению. Инвариантность: если является оценщиком максимального правдоподобия для , и если – любое преобразование , то оценщиком максимального правдоподобия для является . Это свойство реже известно как функциональная эквивариантность. Свойство инвариантности выполняется для произвольных преобразований , хотя доказательство упрощается, если ограничено биективными преобразованиями. Эффективность, то есть достигает нижней границы Крамера — Рао, когда размер выборки стремится к бесконечности. Это означает, что ни один состоятельный оценщик не имеет меньшей асимптотической среднеквадратичной ошибки, чем МП (или другие оценщики, достигающие этой границы), что также означает, что МП имеет асимптотическую нормальность. Эффективность второго порядка после поправки на смещение.
Consistency: the sequence of MLEs converges in probability to the value being estimated. Invariance: If is the maximum likelihood estimator for , and if is any transformation of , then the maximum likelihood estimator for is This property is less commonly known as functional equivariance. The invariance property holds for arbitrary transformation , although the proof simplifies if is restricted to one to one transformations. Efficiency, i. e. it achieves the Cramér–Rao lower bound when the sample size tends to infinity. This means that no consistent estimator has lower asymptotic mean squared error than the MLE (or other estimators attaining this bound), which also means that MLE has asymptotic normality. Second order efficiency after correction for bias.
Связь с байесовским выводом
Оценщик максимального правдоподобия совпадает с наиболее вероятным байесовским оценщиком при условии равномерного априорного распределения по параметрам. Действительно, апостериорная оценка максимума – это параметр θ, который максимизирует вероятность параметра θ при заданных данных, согласно теореме Байеса:
где – априорное распределение для параметра θ, а – вероятность данных, усредненная по всем параметрам. Поскольку знаменатель не зависит от θ, байесовский оценщик получается путем максимизации по θ. Если же предположить, что априорное распределение является равномерным, то байесовский оценщик получается путем максимизации функции правдоподобия. Таким образом, байесовский оценщик совпадает с оценщиком максимального правдоподобия при равномерном априорном распределении.
Связь с минимизацией расхождения Кульбака-Лейблера и кросс-энтропии
Нахождение параметра, максимизирующего правдоподобие, асимптотически эквивалентно нахождению параметра, определяющего распределение вероятностей, которое имеет минимальное расстояние, с точки зрения дивергенции Кульбака — Лейблера, до истинного распределения вероятностей, из которого были сгенерированы наши данные (т.е. сгенерированы ). В идеальном случае P и Q совпадают (и единственное неизвестное – это параметр, определяющий P), но даже если они не совпадают и используемая модель является неверной, оценка максимального правдоподобия (MLE) все равно даст нам "ближайшее" распределение (в рамках ограничений модели Q, зависящей от ) к истинному распределению. Доказательство. Для упрощения обозначений предположим, что P=Q. Пусть имеется n независимо и одинаково распределенных выборок данных из некоторой вероятности , которую мы пытаемся оценить, находя параметр, максимизирующий правдоподобие с использованием , тогда: где Использование h помогает понять, как мы применяем закон больших чисел для перехода от среднего значения h(x) к математическому ожиданию, используя закон бессознательного статистика. Первые несколько преобразований связаны с законами логарифмов и с тем, что параметр, максимизирующий некоторую функцию, также максимизирует любое монотонное преобразование этой функции (т.е. добавление/умножение на константу). Поскольку перекрестная энтропия – это просто энтропия Шеннона плюс дивергенция КЛ, а энтропия является константой, то MLE также асимптотически минимизирует перекрестную энтропию.
Proof. For simplicity of notation, let's assume that P=Q. Let there be n i. i. d data samples from some probability , that we try to estimate by finding that will maximize the likelihood using , then:
Where Using h helps see how we are using the law of large numbers to move from the average of h(x) to the expectancy of it using the law of the unconscious statistician. The first several transitions have to do with laws of logarithm and that finding that maximizes some function will also be the one that maximizes some monotonic transformation of that function (i. e.: adding/multiplying by a constant). Since cross entropy is just Shannon's entropy plus KL divergence, and since the entropy of is constant, then the MLE is also asymptotically minimizing cross entropy.
Дискретное равномерное распределение
Рассмотрим случай, когда n билетов, пронумерованных от 1 до n, помещаются в коробку, и один из них выбирается случайным образом (см. равномерное распределение); таким образом, размер выборки равен 1. Если n неизвестно, то оценкой максимального правдоподобия для n является номер m на выбранном билете. (Функция правдоподобия равна 0 для n < m, 1/n для n ≥ m, и она максимальна при n = m. Обратите внимание, что оценка максимального правдоподобия для n достигается на нижней границе множества возможных значений {m, m + 1, ...}, а не где-то в "середине" диапазона возможных значений, что привело бы к большей смещённости.) Математическое ожидание номера m на выбранном билете, и, следовательно, математическое ожидание оценщика, равно (n + 1) / 2. В результате, при размере выборки, равном 1, оценщик максимального правдоподобия для n будет систематически занижать значение n на (n − 1) / 2.
Дискретное распределение, конечное пространство параметров
Предположим, кто-то хочет определить степень несправедливости нечестной монеты. Обозначим вероятность выпадения "орла" как p. Тогда целью становится определение значения p.
Предположим, монета была подброшена 80 раз: то есть выборка может выглядеть как x1 = H, x2 = T, …, x80 = T, и подсчитывается количество выпавших "орлов" (H). Вероятность выпадения "решки" равна 1 − p (в данном случае p соответствует θ, указанному выше). Предположим, выпало 49 "орлов" и 31 "решка", и предположим, что монета была взята из ящика, содержащего три монеты: одна с вероятностью выпадения "орла" p = 1/3, другая с вероятностью p = 1/2 и третья с вероятностью p = 2/3. Монеты не имеют маркировки, поэтому неизвестно, какая именно монета была выбрана. Используя метод максимального правдоподобия, можно найти монету с наибольшим правдоподобием, учитывая полученные данные. Используя функцию массы вероятности биномиального распределения с размером выборки 80 и числом успехов (выпадений "орла") равным 49, но для различных значений p ("вероятность успеха"), функция правдоподобия (определенная ниже) принимает одно из трех значений:
Правдоподобие максимизируется при p = 2/3, следовательно, это оценка максимального правдоподобия для p.
Квази-Ньютоновские методы
Другие квазиньютоновские методы используют более сложные обновления секущих для получения приближения гессиана.
Фишер забивает.
Другой популярный метод — замена гессиана матрицей информации Фишера, что приводит к алгоритму оценки Фишера. Эта процедура стандартна при оценке параметров многих моделей, таких как обобщённые линейные модели. Несмотря на популярность, квазиньютоновские методы могут сходиться к стационарной точке, которая не обязательно является локальным или глобальным максимумом, а может быть локальным минимумом или седловой точкой. Поэтому важно оценить корректность полученного решения уравнений правдоподобия, проверив, что гессиан, вычисленный в найденной точке, является одновременно отрицательно определённым и хорошо обусловленным.
История
Ранними пользователями метода максимального правдоподобия были Карл Фридрих Гаусс, Пьер Симон Лаплас, Торвальд Н. Тиле и Фрэнсис Исидро Эджворт. Однако широкое распространение метод получил в период с 1912 по 1922 год, когда Рональд Фишер рекомендовал, широко популяризировал и тщательно проанализировал оценку максимального правдоподобия (предпринимая безуспешные попытки доказательства). Оценка максимального правдоподобия окончательно вышла за рамки эвристического обоснования благодаря доказательству, опубликованному Сэмюэлем С. Уилксом в 1938 году, известному как теорема Уилкса. Теорема показывает, что ошибка в логарифме значений правдоподобия для оценок, полученных на основе множества независимых наблюдений, асимптотически распределена по закону хи-квадрат (χ²), что позволяет удобно определять область доверия вокруг любой оценки параметров. Единственная сложная часть доказательства Уилкса опирается на математическое ожидание информационной матрицы Фишера, которое дается теоремой, доказанной Фишером. Уилкс продолжал расширять общность теоремы на протяжении всей своей жизни, а его наиболее общее доказательство было опубликовано в 1962 году. Обзоры развития метода максимального правдоподобия были представлены рядом авторов.