Введение
Распределение неопределённой величины
Априорное распределение вероятности неопределённой величины, часто называемое просто априорным, представляет собой предполагаемое распределение вероятности до учёта каких-либо данных. Например, априорным может быть распределение вероятности, отражающее относительные пропорции избирателей, которые проголосуют за конкретного политика на предстоящих выборах. Неизвестная величина может быть параметром модели или латентной переменной, а не наблюдаемой переменной. В байесовской статистике правило Байеса предписывает, как обновить априорное распределение с помощью новой информации для получения апостериорного распределения вероятности, которое является условным распределением неопределённой величины при заданных новых данных. Исторически выбор априорных распределений часто ограничивался сопряжённым семейством заданной функции правдоподобия, поскольку это приводило к удобному для вычислений апостериорному распределению того же семейства. Однако широкая доступность методов Монте-Карло Марковских цепей сделала это менее актуальным. Существует множество способов построения априорного распределения. В некоторых случаях априорное распределение может быть определено на основе предыдущей информации, например, предыдущих экспериментов. Априорное распределение также может быть получено на основе субъективной оценки опытного эксперта. Если информация отсутствует, может быть принято неинформативное априорное распределение, что оправдано принципом безразличия. В современных приложениях априорные распределения часто выбираются на основе их практических свойств, таких как регуляризация и отбор признаков. Априорные распределения параметров модели часто зависят от собственных параметров. Неопределённость этих гиперпараметров, в свою очередь, может быть выражена в виде гиперприорных распределений вероятности. Например, если для моделирования распределения параметра p распределения Бернулли используется бета-распределение, то: p является параметром базовой системы (распределения Бернулли), а α и β — параметры априорного распределения (бета-распределения); следовательно, гиперпараметрами. В принципе, априорные распределения могут быть разложены на множество условных уровней распределений, так называемые иерархическими априорными распределениями.
p is a parameter of the underlying system (Bernoulli distribution), and
α and β are parameters of the prior distribution (beta distribution); hence hyperparameters. In principle, priors can be decomposed into many conditional levels of distributions, so called hierarchical priors.
Сильный предварительный
Сильное априорное предположение – это предшествующее предположение, теория, концепция или идея, на основе которых, с учетом новой информации, формируется текущее предположение, теория, концепция или идея. Сильный априор – это тип информативного априор, в котором информация, содержащаяся в априорном распределении, преобладает над информацией, содержащейся в анализируемых данных. Байесовский анализ объединяет информацию, содержащуюся в априорном распределении, с информацией, полученной из данных, для получения апостериорного распределения, которое, в случае "сильного априор", практически не отличается от априорного распределения.
Слабо информативные предыдущие исследования
Слабо информативный априорный параметр выражает частичную информацию о переменной, направляя анализ к решениям, соответствующим имеющимся знаниям, не слишком ограничивая результаты и не исключая экстремальные оценки. Например, при задании априорного распределения для температуры завтра в полдень в Сент-Луисе можно использовать нормальное распределение со средним значением 50 градусов по Фаренгейту и стандартным отклонением 40 градусов, что лишь незначительно ограничивает температуру диапазоном (10 градусов, 90 градусов) с небольшой вероятностью опуститься ниже 30 градусов или подняться выше 130 градусов. Цель слабо информативного априорного параметра – регуляризация, то есть поддержание выводов в разумных пределах.
Неинформативные приоры
Неинформативный, плоский или диффузный априорный распределение выражает расплывчатую или общую информацию о переменной. В качестве более спорного примера, Джейнс опубликовал аргумент, основанный на инвариантности априорного распределения при изменении параметров, который предполагает, что априорным распределением, представляющим полную неопределенность относительно вероятности, должно быть априорное распределение Холдена p⁻¹(1 − p)⁻¹. Пример, который приводит Джейнс, – это обнаружение химического вещества в лаборатории и вопрос о том, растворится ли оно в воде в ходе повторных экспериментов. Априорное распределение Холдена придает наибольший вес значениям 0 и 1, указывая на то, что образец будет растворяться каждый раз или никогда не растворяться, с равной вероятностью. Однако, если наблюдалось, что образцы химического вещества растворяются в одном эксперименте и не растворяются в другом, то это априорное распределение обновляется до равномерного распределения на интервале [0, 1]. Это достигается путем применения теоремы Байеса к набору данных, состоящему из одного наблюдения растворения и одного наблюдения нерастворения, используя вышеуказанное априорное распределение. Априорное распределение Холдена является несобственным априорным распределением (то есть имеет бесконечную массу). Гарольд Джеффрис разработал систематический способ конструирования неинформативных априорных распределений, например, априорное распределение Джеффриса p⁻¹/²(1 − p)⁻¹/² для случайной переменной Бернулли. Априорные распределения могут быть построены пропорционально мере Хаара, если параметрическое пространство X имеет естественную структуру группы, которая сохраняет наше байесовское состояние знаний. Такие методы используются в теории индуктивного вывода Соломоноффа. Конструирование объективных априорных распределений было недавно внедрено в биоинформатике, и особенно в биологии раковых систем, где размер выборки ограничен и доступно большое количество априорных знаний. В этих методах используется либо критерий, основанный на теории информации, такой как дивергенция Кульбака — Лейблера, либо функция логарифмического правдоподобия для задач бинарного обучения с учителем и задач смешанных моделей. Философские проблемы, связанные с неинформативными априорными распределениями, связаны с выбором подходящей метрики или шкалы измерения. Предположим, мы хотим узнать о скорости бега неизвестного нам бегуна. Мы могли бы указать, скажем, нормальное распределение в качестве априорного для его скорости, но альтернативно мы могли бы указать нормальное априорное распределение для времени, которое он затрачивает на преодоление 100 метров, которое пропорционально обратной величине первого априорного распределения. Это очень разные априорные распределения, но неясно, какое из них предпочтительнее. Метод групп преобразований Джейнса может ответить на этот вопрос в некоторых ситуациях. Аналогично, если попросить оценить неизвестную пропорцию между 0 и 1, мы можем сказать, что все пропорции равновероятны, и использовать равномерное априорное распределение. Альтернативно, мы можем сказать, что все порядки величины для пропорции равновероятны, логарифмическое априорное распределение, которое является равномерным априорным распределением на логарифме пропорции. Априорное распределение Джеффриса пытается решить эту проблему, вычислив априорное распределение, которое выражает одно и то же убеждение, независимо от используемой метрики. Априорное распределение Джеффриса для неизвестной пропорции p равно p⁻¹/²(1 − p)⁻¹/², что отличается от рекомендации Джейнса. Априорные распределения, основанные на понятиях алгоритмической вероятности, используются в индуктивном выводе в качестве основы для индукции в очень общих условиях. Практические проблемы, связанные с неинформативными априорными распределениями, включают требование, чтобы апостериорное распределение было собственным. Обычные неинформативные априорные распределения для непрерывных, неограниченных переменных являются несобственными. Это не обязательно является проблемой, если апостериорное распределение является собственным. Другой важный вопрос заключается в том, что если неинформативное априорное распределение будет использоваться регулярно, то есть с множеством различных наборов данных, оно должно иметь хорошие частотные свойства. Обычно байесовцы не будут заниматься такими вопросами, но это может быть важно в данной ситуации. Например, можно предположить, что любое правило принятия решения, основанное на апостериорном распределении, должно быть допустимым в соответствии с принятой функцией потерь. К сожалению, проверка допустимости часто бывает трудной, хотя некоторые результаты известны (например, Berger и Strawderman 1996). Проблема особенно актуальна для иерархических байесовских моделей; обычные априорные распределения (например, априорное распределение Джеффриса) могут давать плохо допустимые правила принятия решений, если они используются на более высоких уровнях иерархии.
Неправильные приоритеты
Пусть события будут взаимоисключающими и исчерпывающими. Если теорема Байеса записана как , то очевидно, что тот же результат будет получен, если все априорные вероятности P(Ai) и P(Aj) умножить на некоторую постоянную; то же самое справедливо и для непрерывной случайной величины. Если сумма в знаменателе сходится, апостериорные вероятности все равно будут суммироваться (или интегрироваться) в 1, даже если априорные значения не нормированы, и поэтому априорные распределения могут быть заданы только в правильной пропорции. Развивая эту идею, во многих случаях сумма или интеграл априорных значений может даже не быть конечным, чтобы получить осмысленные значения для апостериорных вероятностей. В этом случае априорное распределение называется несобственным. Однако, апостериорное распределение не обязательно будет собственным, если априорное распределение несобственное. Это очевидно из случая, когда событие B не зависит от всех Aj. Статистики иногда используют несобственные априорные распределения как неинформативные. Например, если им необходимо априорное распределение для среднего и дисперсии случайной величины, они могут предположить p(m, v) ~ 1/v (при v > 0), что подразумевает, что любое значение среднего "равновероятно", а значение положительной дисперсии становится "менее вероятным" обратно пропорционально ее значению. Многие авторы (Линдли, 1973; Де Грот, 1937; Касс и Вассерман, 1996) предостерегают от опасности чрезмерной интерпретации этих априорных распределений, поскольку они не являются функциями плотности вероятности. Единственная релевантность, которую они имеют, заключается в соответствующем апостериорном распределении, при условии, что оно хорошо определено для всех наблюдений. (Априорное распределение Холдейна является типичным контрпримером.) В отличие от этого, функции правдоподобия не требуют интегрирования, а функция правдоподобия, равномерно равная 1, соответствует отсутствию данных (все модели равновероятны при отсутствии данных): правило Байеса умножает априорное распределение на функцию правдоподобия, а пустое произведение – это просто постоянная функция правдоподобия, равная 1. Однако, не начиная с априорного распределения вероятностей, нельзя получить апостериорное распределение вероятностей и, следовательно, нельзя интегрировать или вычислять математические ожидания или потери. Подробности см. в.
then it is clear that the same result would be obtained if all the prior probabilities P(Ai) and P(Aj) were multiplied by a given constant; the same would be true for a continuous random variable. If the summation in the denominator converges, the posterior probabilities will still sum (or integrate) to 1 even if the prior values do not, and so the priors may only need to be specified in the correct proportion. Taking this idea further, in many cases the sum or integral of the prior values may not even need to be finite to get sensible answers for the posterior probabilities. When this is the case, the prior is called an improper prior. However, the posterior distribution need not be a proper distribution if the prior is improper. This is clear from the case where event B is independent of all of the Aj. Statisticians sometimes use improper priors as uninformative priors. For example, if they need a prior distribution for the mean and variance of a random variable, they may assume p(m, v) ~ 1/v (for v > 0) which would suggest that any value for the mean is "equally likely" and that a value for the positive variance becomes "less likely" in inverse proportion to its value. Many authors (Lindley, 1973; De Groot, 1937; Kass and Wasserman, 1996) warn against the danger of over interpreting those priors since they are not probability densities. The only relevance they have is found in the corresponding posterior, as long as it is well defined for all observations. (The Haldane prior is a typical counterexample.) By contrast, likelihood functions do not need to be integrated, and a likelihood function that is uniformly 1 corresponds to the absence of data (all models are equally likely, given no data): Bayes' rule multiplies a prior by the likelihood, and an empty product is just the constant likelihood 1. However, without starting with a prior probability distribution, one does not end up getting a posterior probability distribution, and thus cannot integrate or compute expected values or loss. See for details.
Пример
Следующий пример иллюстрирует априорную вероятность (или априорное взвешивание) в (а) классическом и (b) квантовом контекстах.