Введение
Функция, связанная со статистикой и теорией вероятности
Функция правдоподобия (часто называемая просто правдоподобием) — это совместная функция вероятности (или плотность вероятности) наблюдаемых данных, рассматриваемая как функция параметров статистической модели. Интуитивно, функция правдоподобия представляет собой вероятность получения наблюдаемых данных при условии, что является истинным значением параметра. В методе максимального правдоподобия arg max (по параметру) функции правдоподобия служит точечной оценкой для , а информация Фишера (часто аппроксимируется гессианом функции правдоподобия) указывает на точность этой оценки. В отличие от этого, в байесовской статистике оценки параметров выводятся из обратной функции правдоподобия, так называемой апостериорной вероятности, которая вычисляется по формуле Байеса.
Дискретное распределение вероятности
Пусть – дискретная случайная величина с функцией массы вероятности , зависящей от параметра . Тогда функция
, рассматриваемая как функция , является функцией правдоподобия, при условии реализации случайной величины . Иногда вероятность "значения при значении параметра " записывается как или . Правдоподобие – это вероятность наблюдения конкретного результата , когда истинное значение параметра равно , что эквивалентно вероятностной массе на ; это не плотность вероятности относительно параметра. Правдоподобие, , не следует путать с , которое является апостериорной вероятностью при заданных данных. При отсутствии события (данных) правдоподобие равно 1; любое нетривиальное событие будет иметь меньшее правдоподобие.
Given no event (no data), the likelihood is 1; any non trivial event will have a lower likelihood.
Непрерывное распределение вероятности
Пусть X – случайная величина, имеющая абсолютно непрерывное распределение вероятностей с функцией плотности вероятности f(x) (функцией x), зависящей от параметра θ. Тогда функция
considered as a function of , is the likelihood function (of , given the outcome ). Again, is not a probability density or mass function over , despite being a function of given the observation .
L(θ|x) = f(x|θ),
considered as a function of , is the likelihood function (of , given the outcome ). Again, is not a probability density or mass function over , despite being a function of given the observation .
рассматриваемая как функция θ, является функцией правдоподобия (относительно θ, при заданном значении x). При этом L(θ|x) не является функцией плотности или массовой функцией вероятности по θ, несмотря на то, что она является функцией от θ при заданном наблюдении x.
considered as a function of , is the likelihood function (of , given the outcome ). Again, is not a probability density or mass function over , despite being a function of given the observation .
В общем
В теории вероятностей, основанной на теории меры, функция плотности определяется как производная Радона — Никодима распределения вероятностей относительно общей доминирующей меры. Функция правдоподобия — это данная плотность, рассматриваемая как функция параметра, а не случайной величины. Таким образом, можно построить функцию правдоподобия для любого распределения, будь то дискретное, непрерывное, смешанное или иное. (Функции правдоподобия сопоставимы, например, для оценки параметров, только если они являются производными Радона — Никодима относительно одной и той же доминирующей меры.) В вышеизложенном обсуждении правдоподобия для дискретных случайных величин используется счетная мера, при которой плотность вероятности любого исхода равна вероятности этого исхода.
Вероятность смешанного непрерывного*дискретного распределения
Вышеизложенное можно легко расширить, чтобы учитывать распределения, содержащие как дискретные, так и непрерывные компоненты. Предположим, что распределение состоит из нескольких дискретных вероятностных масс и плотности , где сумма всех плюс интеграл от всегда равна единице. Если можно различить наблюдение, соответствующее одной из дискретных вероятностных масс, от наблюдения, соответствующего компоненте плотности, то функция правдоподобия для наблюдения из непрерывного компонента может быть обработана, как описано выше. Для наблюдения из дискретного компонента функция правдоподобия для этого наблюдения просто равна
где – индекс дискретной вероятностной массы, соответствующей наблюдению , поскольку максимизация вероятностной массы (или вероятности) в эквивалентна максимизации правдоподобия конкретного наблюдения. Тот факт, что функция правдоподобия может быть определена таким образом, чтобы включать несоизмеримые вклады (плотность и вероятностную массу), обусловлен тем, что функция правдоподобия определяется с точностью до константы пропорциональности, при этом эта "константа" может меняться в зависимости от наблюдения , но не от параметра .
Функция относительной вероятности
Поскольку фактическое значение функции правдоподобия зависит от выборки, часто удобно работать со стандартизированной мерой. Предположим, что максимальная оценка правдоподобия для параметра θ равна . Относительную правдоподобность других значений θ можно найти, сравнив правдоподобия этих других значений с правдоподобием . Относительное правдоподобие θ определяется как .
Таким образом, относительное правдоподобие – это отношение правдоподобия (рассмотренное выше) с фиксированным знаменателем. Это соответствует стандартизации правдоподобия, чтобы оно имело максимум равный 1.
Регион вероятности
Область правдоподобия — это множество всех значений θ, относительное правдоподобие которых больше или равно заданному порогу. В процентном выражении область правдоподобия p% для θ определяется как…
Если θ является единственным вещественным параметром, область правдоподобия p% обычно представляет собой интервал вещественных значений. Если область действительно представляет собой интервал, то он называется интервалом правдоподобия. Интервалы правдоподобия и, в более общем смысле, области правдоподобия используются для интервальной оценки в правдоподобностной статистике: они аналогичны доверительным интервалам в частотной статистике и достоверным интервалам в байесовской статистике. Интервалы правдоподобия интерпретируются непосредственно с точки зрения относительного правдоподобия, а не с точки зрения вероятности охвата (частотный подход) или апостериорной вероятности (байесовский подход). При наличии модели интервалы правдоподобия можно сравнить с доверительными интервалами. Если θ является единственным вещественным параметром, то при определенных условиях интервал правдоподобия 14,65% (приблизительно 1:7 правдоподобия) для θ будет эквивалентен 95% доверительному интервалу (вероятность охвата 19/20). Эти подходы также полезны, когда многомерную поверхность правдоподобия необходимо свести к одному или двум интересующим параметрам для построения графика.
Вероятность профиля
Можно уменьшить размерность, сосредоточив функцию правдоподобия для подмножества параметров, выражая неинтересующие параметры как функции интересующих параметров и подставляя их в функцию правдоподобия. В общем случае, для функции правдоподобия, зависящей от вектора параметров, который можно разбить на и , где соответствие между ними можно определить явно, концентрация снижает вычислительную нагрузку исходной задачи максимизации. Например, в линейной регрессии с нормально распределенными ошибками, вектор коэффициентов можно разбить на (и, следовательно, матрицу регрессии ). Максимизация по дает оптимальную функцию значения. Используя этот результат, максимальное правдоподобие для можно получить как
где – матрица проекции. Этот результат известен как теорема Фриша — Вау — Ловелла. Поскольку графически процедура концентрации эквивалентна "срезанию" поверхности правдоподобия вдоль гребня значений неинтересующего параметра, максимизирующего функцию правдоподобия, создавая изометрический профиль функции правдоподобия для заданного , результат этой процедуры также известен как профильное правдоподобие. Помимо графического представления, профильное правдоподобие можно использовать для вычисления доверительных интервалов, которые часто обладают лучшими свойствами для малых выборок, чем интервалы, основанные на асимптотических стандартных ошибках, рассчитанных на основе полной функции правдоподобия.
Условная вероятность
Иногда удается найти достаточную статистику для мешающих параметров, и при условии этой статистики получается функция правдоподобия, не зависящая от мешающих параметров. Один из примеров возникает в таблицах 2×2, где обусловленность по всем четырем граничным суммам приводит к условной функции правдоподобия, основанной на нецентральном гипергеометрическом распределении. Этот вид обусловленности также лежит в основе точного критерия Фишера.
Маргинальная вероятность
Иногда мы можем избавиться от нежелательных параметров, рассматривая функцию правдоподобия, основанную лишь на части информации в данных, например, используя ранги вместо численных значений. Другой пример встречается в линейных смешанных моделях, где вычисление функции правдоподобия только для остатков после оценки фиксированных эффектов приводит к оценке максимального правдоподобия методом остаточных максимальных правдоподобий для компонентов дисперсии.
Частичная вероятность
Частичная функция правдоподобия — это модификация полной функции правдоподобия, в которой учитывается лишь часть параметров (параметры, представляющие интерес). Она является ключевым компонентом модели пропорциональных рисков: благодаря ограничению, накладываемому на функцию риска, функция правдоподобия не содержит информации о форме функции риска во времени.
График
График функции логарифмического правдоподобия называется кривой поддержки (в одномерном случае). В многомерном случае понятие обобщается до поверхности поддержки над пространством параметров. Она связана, но отличается от поддержки распределения. Термин был введен А. В. Ф. Эдвардсом. Аналогичный результат можно получить, используя теорему Ролля. Вторая производная, вычисленная в точке , известная как информация Фишера, определяет кривизну поверхности правдоподобия и, следовательно, указывает на точность оценки.
Интерпретации в различных основаниях
Среди статистиков нет единого мнения о том, на чём должен основываться фундамент статистики. Было предложено четыре основных подхода к основанию статистики: фреквентистский, байесовский, основанный на функции правдоподобия и основанный на AIC. Для каждого из этих подходов интерпретация функции правдоподобия различна. Четыре интерпретации описаны в следующих подразделах.
Байесовская интерпретация
В байесовском выводе, хотя можно говорить о правдоподобии любого утверждения или случайной величины при заданной другой случайной величине – например, правдоподобия значения параметра или статистической модели (см. предельное правдоподобие) при наличии определенных данных или других свидетельств, функция правдоподобия остается неизменной, но приобретает дополнительные интерпретации: (i) как условная плотность данных при заданном параметре (поскольку параметр рассматривается как случайная величина) и (ii) как мера или количество информации, содержащейся в данных о значении параметра или даже о модели. Вследствие введения вероятностной структуры на пространстве параметров или на множестве моделей, возможно, что значение параметра или статистическая модель имеют высокое правдоподобие для данных, но при этом низкую вероятность, и наоборот. В соответствии с правилом Байеса, правдоподобие, рассматриваемое как условная плотность, можно умножить на априорную плотность вероятности параметра и затем нормализовать, чтобы получить апостериорную плотность вероятности.