Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
В теории байесовской вероятности
In Bayesian probability theory
Маргинальная вероятность – это функция правдоподобия, проинтегрированная по пространству параметров. В байесовской статистике она представляет собой вероятность получения наблюдаемой выборки для всех возможных значений параметров; её можно понимать как вероятность самой модели и поэтому она часто называется доказательством модели или просто доказательством. В силу интегрирования по пространству параметров, маргинальная вероятность не зависит напрямую от параметров. Если задача не состоит в сравнении моделей, то маргинальная вероятность является просто нормировочной константой, обеспечивающей, чтобы апостериорное распределение было корректным распределением вероятностей. Она связана с функцией разделения в статистической механике.
A marginal likelihood is a likelihood function that has been integrated over the parameter space. In Bayesian statistics, it represents the probability of generating the observed sample for all possible values of the parameters; it can be understood as the probability of the model itself and is therefore often referred to as model evidence or simply evidence. Due to the integration over the parameter space, the marginal likelihood does not directly depend upon the parameters. If the focus is not on model comparison, the marginal likelihood is simply the normalizing constant that ensures that the posterior is a proper probability. It is related to the partition function in statistical mechanics.
Концепция
При наличии множества независимых одинаково распределенных точек данных, где согласно некоторому распределению вероятности, параметризованному , где само является случайной величиной, описываемой распределением, то есть предельная вероятность в общем случае задает вопрос о вероятности , где переменная была исключена путем интегрирования (маргинализации):
Given a set of independent identically distributed data points where according to some probability distribution parameterized by , where itself is a random variable described by a distribution, i. e. the marginal likelihood in general asks what the probability is, where has been marginalized out (integrated out):
Вышеуказанное определение сформулировано в контексте байесовской статистики, в этом случае называется априорной плотностью, а – правдоподобием. Предельная вероятность количественно определяет степень соответствия между данными и априорным распределением в геометрическом смысле, который точно определен в de Carvalho et al. (2019). В классической (частотной) статистике концепция предельной вероятности возникает в контексте совместного параметра , где – интересующий параметр, а – неинтересующий параметр-помеха. Если для существует распределение вероятностей, часто желательно рассматривать функцию правдоподобия только относительно , путем маргинализации по :
The above definition is phrased in the context of Bayesian statistics in which case is called prior density and is the likelihood. The marginal likelihood quantifies the agreement between data and prior in a geometric sense made precise in de Carvalho et al. (2019). In classical (frequentist) statistics, the concept of marginal likelihood occurs instead in the context of a joint parameter , where is the actual parameter of interest, and is a non interesting nuisance parameter. If there exists a probability distribution for , it is often desirable to consider the likelihood function only in terms of , by marginalizing out :
К сожалению, предельные вероятности обычно сложно вычислить. Точные решения известны для небольшого класса распределений, особенно когда исключаемый параметр является сопряженным априорным распределением для распределения данных. В других случаях требуется какой-либо метод численного интегрирования, либо общий метод, такой как гауссова интеграция или метод Монте-Карло, либо метод, специализирующийся на статистических задачах, такой как аппроксимация Лапласа, выборка Гиббса/Метрополиса или алгоритм EM. Также можно применить вышеуказанные соображения к одной случайной величине (точке данных) вместо набора наблюдений. В байесовском контексте это эквивалентно априорному предсказательному распределению точки данных.
Unfortunately, marginal likelihoods are generally difficult to compute. Exact solutions are known for a small class of distributions, particularly when the marginalized out parameter is the conjugate prior of the distribution of the data. In other cases, some kind of numerical integration method is needed, either a general method such as Gaussian integration or a Monte Carlo method, or a method specialized to statistical problems such as the Laplace approximation, Gibbs/Metropolis sampling, or the EM algorithm. It is also possible to apply the above considerations to a single random variable (data point) , rather than a set of observations. In a Bayesian context, this is equivalent to the prior predictive distribution of a data point.