Введение

Метод оценки параметров статистической модели на основе наблюдений – статистические методы. В статистике, метод максимального правдоподобия (MLE) – это метод оценки параметров предполагаемого распределения вероятностей, учитывая имеющиеся данные наблюдений. Это достигается путем максимизации функции правдоподобия, так что, при заданном статистическом моделировании, наблюдаемые данные наиболее вероятны. Точка в пространстве параметров, максимизирующая функцию правдоподобия, называется оценкой максимального правдоподобия. Логика максимального правдоподобия интуитивно понятна и обладает гибкостью, благодаря чему метод стал доминирующим способом статистического вывода. Если функция правдоподобия дифференцируема, для нахождения максимумов можно применить тест производной. В некоторых случаях условия первого порядка функции правдоподобия могут быть решены аналитически; например, метод наименьших квадратов для модели линейной регрессии максимизирует правдоподобие, когда предполагается, что случайные ошибки имеют нормальное распределение с одинаковой дисперсией. С точки зрения байесовского вывода, MLE обычно эквивалентен оценке максимального апостериорного правдоподобия (MAP) с использованием равномерных априорных распределений (или нормального априорного распределения с бесконечным стандартным отклонением). В частотном выводе MLE является частным случаем экстремального оценщика, где целевой функцией является функция правдоподобия.

Максимальная оценка непараметрической вероятности

Непараметрическая оценка максимального правдоподобия может быть выполнена с использованием эмпирического правдоподобия.

Свойства

Оценщик максимального правдоподобия – это экстремальный оценщик, получаемый путем максимизации, как функции θ, целевой функции. Если данные независимы и одинаково распределены, то у нас есть

это, будучи выборочным аналогом математического ожидания логарифмической функции правдоподобия, где математическое ожидание берется относительно истинной плотности распределения. Оценщики максимального правдоподобия не обладают оптимальными свойствами для конечных выборок, в том смысле, что (при оценке на конечных выборках) другие оценщики могут иметь большую концентрацию вокруг истинного значения параметра. Однако, как и другие методы оценки, оценка максимального правдоподобия обладает рядом привлекательных асимптотических свойств: по мере увеличения размера выборки до бесконечности, последовательности оценщиков максимального правдоподобия обладают следующими свойствами: состоятельность: последовательность МП оценивается по вероятности к оцениваемому значению. Инвариантность: если является оценщиком максимального правдоподобия для , и если – любое преобразование , то оценщиком максимального правдоподобия для является . Это свойство реже известно как функциональная эквивариантность. Свойство инвариантности выполняется для произвольных преобразований , хотя доказательство упрощается, если ограничено биективными преобразованиями. Эффективность, то есть достигает нижней границы Крамера — Рао, когда размер выборки стремится к бесконечности. Это означает, что ни один состоятельный оценщик не имеет меньшей асимптотической среднеквадратичной ошибки, чем МП (или другие оценщики, достигающие этой границы), что также означает, что МП имеет асимптотическую нормальность. Эффективность второго порядка после поправки на смещение.

Связь с байесовским выводом

Оценщик максимального правдоподобия совпадает с наиболее вероятным байесовским оценщиком при условии равномерного априорного распределения по параметрам. Действительно, апостериорная оценка максимума – это параметр θ, который максимизирует вероятность параметра θ при заданных данных, согласно теореме Байеса:

где – априорное распределение для параметра θ, а – вероятность данных, усредненная по всем параметрам. Поскольку знаменатель не зависит от θ, байесовский оценщик получается путем максимизации по θ. Если же предположить, что априорное распределение является равномерным, то байесовский оценщик получается путем максимизации функции правдоподобия. Таким образом, байесовский оценщик совпадает с оценщиком максимального правдоподобия при равномерном априорном распределении.

Связь с минимизацией расхождения Кульбака-Лейблера и кросс-энтропии

Нахождение параметра, максимизирующего правдоподобие, асимптотически эквивалентно нахождению параметра, определяющего распределение вероятностей, которое имеет минимальное расстояние, с точки зрения дивергенции Кульбака — Лейблера, до истинного распределения вероятностей, из которого были сгенерированы наши данные (т.е. сгенерированы ). В идеальном случае P и Q совпадают (и единственное неизвестное – это параметр, определяющий P), но даже если они не совпадают и используемая модель является неверной, оценка максимального правдоподобия (MLE) все равно даст нам "ближайшее" распределение (в рамках ограничений модели Q, зависящей от ) к истинному распределению. Доказательство. Для упрощения обозначений предположим, что P=Q. Пусть имеется n независимо и одинаково распределенных выборок данных из некоторой вероятности , которую мы пытаемся оценить, находя параметр, максимизирующий правдоподобие с использованием , тогда: где Использование h помогает понять, как мы применяем закон больших чисел для перехода от среднего значения h(x) к математическому ожиданию, используя закон бессознательного статистика. Первые несколько преобразований связаны с законами логарифмов и с тем, что параметр, максимизирующий некоторую функцию, также максимизирует любое монотонное преобразование этой функции (т.е. добавление/умножение на константу). Поскольку перекрестная энтропия – это просто энтропия Шеннона плюс дивергенция КЛ, а энтропия является константой, то MLE также асимптотически минимизирует перекрестную энтропию.

Дискретное равномерное распределение

Рассмотрим случай, когда n билетов, пронумерованных от 1 до n, помещаются в коробку, и один из них выбирается случайным образом (см. равномерное распределение); таким образом, размер выборки равен 1. Если n неизвестно, то оценкой максимального правдоподобия для n является номер m на выбранном билете. (Функция правдоподобия равна 0 для n < m, 1/n для n ≥ m, и она максимальна при n = m. Обратите внимание, что оценка максимального правдоподобия для n достигается на нижней границе множества возможных значений {m, m + 1, ...}, а не где-то в "середине" диапазона возможных значений, что привело бы к большей смещённости.) Математическое ожидание номера m на выбранном билете, и, следовательно, математическое ожидание оценщика, равно (n + 1) / 2. В результате, при размере выборки, равном 1, оценщик максимального правдоподобия для n будет систематически занижать значение n на (n − 1) / 2.

Дискретное распределение, конечное пространство параметров

Предположим, кто-то хочет определить степень несправедливости нечестной монеты. Обозначим вероятность выпадения "орла" как p. Тогда целью становится определение значения p.

Предположим, монета была подброшена 80 раз: то есть выборка может выглядеть как x1 = H, x2 = T, …, x80 = T, и подсчитывается количество выпавших "орлов" (H). Вероятность выпадения "решки" равна 1 − p (в данном случае p соответствует θ, указанному выше). Предположим, выпало 49 "орлов" и 31 "решка", и предположим, что монета была взята из ящика, содержащего три монеты: одна с вероятностью выпадения "орла" p = 1/3, другая с вероятностью p = 1/2 и третья с вероятностью p = 2/3. Монеты не имеют маркировки, поэтому неизвестно, какая именно монета была выбрана. Используя метод максимального правдоподобия, можно найти монету с наибольшим правдоподобием, учитывая полученные данные. Используя функцию массы вероятности биномиального распределения с размером выборки 80 и числом успехов (выпадений "орла") равным 49, но для различных значений p ("вероятность успеха"), функция правдоподобия (определенная ниже) принимает одно из трех значений:

Правдоподобие максимизируется при p = 2/3, следовательно, это оценка максимального правдоподобия для p.

Квази-Ньютоновские методы

Другие квазиньютоновские методы используют более сложные обновления секущих для получения приближения гессиана.

Фишер забивает.

Другой популярный метод — замена гессиана матрицей информации Фишера, что приводит к алгоритму оценки Фишера. Эта процедура стандартна при оценке параметров многих моделей, таких как обобщённые линейные модели. Несмотря на популярность, квазиньютоновские методы могут сходиться к стационарной точке, которая не обязательно является локальным или глобальным максимумом, а может быть локальным минимумом или седловой точкой. Поэтому важно оценить корректность полученного решения уравнений правдоподобия, проверив, что гессиан, вычисленный в найденной точке, является одновременно отрицательно определённым и хорошо обусловленным.

История

Ранними пользователями метода максимального правдоподобия были Карл Фридрих Гаусс, Пьер Симон Лаплас, Торвальд Н. Тиле и Фрэнсис Исидро Эджворт. Однако широкое распространение метод получил в период с 1912 по 1922 год, когда Рональд Фишер рекомендовал, широко популяризировал и тщательно проанализировал оценку максимального правдоподобия (предпринимая безуспешные попытки доказательства). Оценка максимального правдоподобия окончательно вышла за рамки эвристического обоснования благодаря доказательству, опубликованному Сэмюэлем С. Уилксом в 1938 году, известному как теорема Уилкса. Теорема показывает, что ошибка в логарифме значений правдоподобия для оценок, полученных на основе множества независимых наблюдений, асимптотически распределена по закону хи-квадрат (χ²), что позволяет удобно определять область доверия вокруг любой оценки параметров. Единственная сложная часть доказательства Уилкса опирается на математическое ожидание информационной матрицы Фишера, которое дается теоремой, доказанной Фишером. Уилкс продолжал расширять общность теоремы на протяжении всей своей жизни, а его наиболее общее доказательство было опубликовано в 1962 году. Обзоры развития метода максимального правдоподобия были представлены рядом авторов.