Введение
Семья распределений вероятностей, связанных с нормальным распределением
В теории вероятностей и статистике экспоненциальное семейство – это параметрический набор распределений вероятностей определенной формы, которая приведена ниже. Эта специальная форма выбирается для математической удобности, в том числе для возможности вычисления математических ожиданий и ковариаций с использованием дифференцирования, основанного на полезных алгебраических свойствах, а также для общности, поскольку экспоненциальные семейства в определенном смысле представляют собой очень естественные множества распределений для рассмотрения. Термин «экспоненциальный класс» иногда используется вместо «экспоненциального семейства», или более старый термин «семейство Купмана — Дармоа». Иногда неформально именуемый как «экспоненциальное семейство», этот класс распределений отличается тем, что все они обладают рядом желательных свойств, наиболее важным из которых является существование достаточной статистики. Концепция экспоненциальных семейств принадлежит Э. Дж. Г. Питману, Г. Дармоа и Б. О. Купману, которые внесли вклад в её развитие в 1935–1936 годах. Экспоненциальные семейства распределений предоставляют общую основу для выбора возможной альтернативной параметризации параметрического семейства распределений в терминах естественных параметров, а также для определения полезных выборочных статистик, называемых естественными достаточными статистиками семейства.
Трудности номенклатуры
Термины "распределение" и "семейство" часто используются неточно: в частности, экспоненциальное семейство представляет собой набор распределений, в котором конкретное распределение меняется в зависимости от параметра. Однако параметрическое семейство распределений часто называют просто "распределением" (например, "нормальное распределение", подразумевая "семейство нормальных распределений"), а совокупность всех экспоненциальных семейств иногда небрежно именуют "экспоненциальным семейством".
Определение
Большинство часто используемых распределений образуют экспоненциальное семейство или подсемейство экспоненциального семейства, перечисленные в следующем подразделе. Последующие подразделы представляют собой последовательность всё более общих математических определений экспоненциального семейства. Читателю, не углубляющемуся в детали, можно ограничиться первым и самым простым определением, которое соответствует семейству распределений вероятностей с одним параметром, дискретного или непрерывного типа.
Вектор оценивается и
Часто является вектором измерений, в этом случае может быть функцией из пространства возможных значений до действительных чисел. В более общем случае, и могут быть векторнозначными, так что является функцией с действительным значением. Однако, см. обсуждение ниже о векторных параметрах, касающееся искривлённого экспоненциального семейства.
Каноническая формулировка
Если то экспоненциальное семейство считается находящимся в канонической форме. Определив преобразованный параметр, всегда можно привести экспоненциальное семейство к канонической форме. Каноническая форма не является единственной, поскольку параметр можно умножить на любую ненулевую константу, при этом умножив на обратную этой константе, или к можно добавить константу c и умножить на неё, чтобы компенсировать это добавление. В частном случае, когда и , семейство называется естественным экспоненциальным семейством. Даже если является скаляром и существует только один параметр, функции и всё равно могут быть векторами, как описано ниже. Функция или, эквивалентно, автоматически определяется после выбора остальных функций, поскольку она должна иметь вид, обеспечивающий нормализацию распределения (суммирование или интегрирование по всей области определения даёт единицу). Более того, обе эти функции всегда могут быть выражены как функции даже если не является взаимно однозначной функцией, то есть двум или более различным значениям соответствует одно и то же значение , и, следовательно, её нельзя обратить. В таком случае все значения, отображающиеся в одно и то же , также будут иметь одно и то же значение для .
Свойства
Экспоненциальные семейства обладают большим количеством свойств, которые делают их чрезвычайно полезными для статистического анализа. Во многих случаях можно показать, что только экспоненциальные семейства обладают этими свойствами. Примеры:
Exponential families are the only families with sufficient statistics that can summarize arbitrary amounts of independent identically distributed data using a fixed number of values. (Pitman–Koopman–Darmois theorem)
Exponential families have conjugate priors, an important property in Bayesian statistics. The posterior predictive distribution of an exponential family random variable with a conjugate prior can always be written in closed form (provided that the normalizing factor of the exponential family distribution can itself be written in closed form). In the mean field approximation in variational Bayes (used for approximating the posterior distribution in large Bayesian networks), the best approximating posterior distribution of an exponential family node (a node is a random variable in the context of Bayesian networks) with a conjugate prior is in the same family as the node. Given an exponential family defined by , where is the parameter space, such that Then
If has nonempty interior in , then given any IID samples , the statistic is a complete statistic for is a minimal statistic for iff for all , and in the support of , if , then or .
Экспоненциальные семейства – это единственные семейства, для которых существуют достаточные статистики, способные суммировать произвольные объемы независимых одинаково распределенных данных, используя фиксированное число значений. (Теорема Питмана — Коопмана — Дармоа)
Exponential families are the only families with sufficient statistics that can summarize arbitrary amounts of independent identically distributed data using a fixed number of values. (Pitman–Koopman–Darmois theorem)
Exponential families have conjugate priors, an important property in Bayesian statistics. The posterior predictive distribution of an exponential family random variable with a conjugate prior can always be written in closed form (provided that the normalizing factor of the exponential family distribution can itself be written in closed form). In the mean field approximation in variational Bayes (used for approximating the posterior distribution in large Bayesian networks), the best approximating posterior distribution of an exponential family node (a node is a random variable in the context of Bayesian networks) with a conjugate prior is in the same family as the node. Given an exponential family defined by , where is the parameter space, such that Then
If has nonempty interior in , then given any IID samples , the statistic is a complete statistic for is a minimal statistic for iff for all , and in the support of , if , then or .
Экспоненциальные семейства имеют сопряженные априорные распределения, что является важным свойством в байесовской статистике. Постериорное предсказательное распределение случайной величины из экспоненциального семейства с сопряженным априорным распределением всегда может быть записано в замкнутой форме (при условии, что нормализующая константа распределения экспоненциального семейства также может быть записана в замкнутой форме). В приближении среднего поля в вариационном байесовском выводе (используемом для аппроксимации апостериорного распределения в больших байесовских сетях) наилучшее аппроксимирующее апостериорное распределение узла экспоненциального семейства (узел – это случайная величина в контексте байесовских сетей) с сопряженным априорным распределением принадлежит тому же семейству, что и узел. Пусть задано экспоненциальное семейство, определенное как , где – пространство параметров, такое что тогда, если имеет непустой внутренний интервал в , то для любых независимо и одинаково распределенных выборок , статистика является полной статистикой для , а является минимальной статистикой для тогда и только тогда, когда для всех , и в области определения , если , то или .
Exponential families are the only families with sufficient statistics that can summarize arbitrary amounts of independent identically distributed data using a fixed number of values. (Pitman–Koopman–Darmois theorem)
Exponential families have conjugate priors, an important property in Bayesian statistics. The posterior predictive distribution of an exponential family random variable with a conjugate prior can always be written in closed form (provided that the normalizing factor of the exponential family distribution can itself be written in closed form). In the mean field approximation in variational Bayes (used for approximating the posterior distribution in large Bayesian networks), the best approximating posterior distribution of an exponential family node (a node is a random variable in the context of Bayesian networks) with a conjugate prior is in the same family as the node. Given an exponential family defined by , where is the parameter space, such that Then
If has nonempty interior in , then given any IID samples , the statistic is a complete statistic for is a minimal statistic for iff for all , and in the support of , if , then or .
Примеры
При рассмотрении примеров в этом разделе важно помнить вышеупомянутое обсуждение того, что означает говорить, что «распределение» является экспоненциальным семейством, и в особенности учитывать, что набор параметров, которым разрешено изменяться, критически важен для определения того, является ли «распределение» экспоненциальным семейством или нет. Нормальное, экспоненциальное, логнормальное, гамма, хи-квадрат, бета, Дирихле, Бернулли, категориальное, Пуассона, геометрическое, обратное Гауссово, ALAAM, фон Мизеса и фон Мизеса-Фишера — все это экспоненциальные семейства. Некоторые распределения являются экспоненциальными семействами только при условии, что некоторые из их параметров зафиксированы. Семейство распределений Парето с фиксированной минимальной границей xm образует экспоненциальное семейство. Семейства биномиального и мультиномиального распределений с фиксированным числом испытаний n, но неизвестным параметром вероятности, являются экспоненциальными семействами. Семейство отрицательных биномиальных распределений с фиксированным числом неудач (также известным как параметр времени остановки) r является экспоненциальным семейством. Однако, когда любой из вышеупомянутых фиксированных параметров допускает изменение, полученное семейство перестает быть экспоненциальным. Как упоминалось выше, в общем случае, область определения экспоненциального семейства должна оставаться неизменной при всех значениях параметров в семействе. Именно поэтому вышеуказанные случаи (например, биномиальное распределение с изменяющимся числом испытаний, Парето с изменяющейся минимальной границей) не являются экспоненциальными семействами — во всех этих случаях рассматриваемый параметр влияет на область определения (в частности, изменяя минимальное или максимальное возможное значение). По аналогичным причинам, ни дискретное равномерное распределение, ни непрерывное равномерное распределение не являются экспоненциальными семействами, поскольку одна или обе границы варьируются. Распределение Вейбулла с фиксированным параметром формы k является экспоненциальным семейством. В отличие от предыдущих примеров, параметр формы не влияет на область определения; тот факт, что разрешение его изменения делает Вейбулл неэкспоненциальным, скорее обусловлено специфической формой функции плотности вероятности Вейбулла (k появляется в экспоненте степени). В общем, распределения, являющиеся результатом конечной или бесконечной смеси других распределений, например, плотности смешанных моделей и составных распределений вероятностей, не являются экспоненциальными семействами. Примерами служат типичные гауссовские смешанные модели, а также многие распределения с тяжелыми хвостами, возникающие в результате соединения (т.е. бесконечного смешивания) распределения с априорным распределением по одному из его параметров, например, t-распределение Стьюдента (соединение нормального распределения с гамма-распределенной точностью), а также бета-биномиальное и дирихле-мультиномиальное распределения. Другими примерами распределений, не являющихся экспоненциальными семействами, являются распределение Фишера, распределение Коши, гипергеометрическое распределение и логистическое распределение. Ниже приведены некоторые подробные примеры представления полезных распределений в виде экспоненциальных семейств.
Классическая оценка: достаточность
Согласно теореме Питмана — Купмана — Дармоа, среди семейств распределений вероятностей, область определения которых не меняется при изменении оцениваемого параметра, только в экспоненциальных семействах существует достаточная статистика, размерность которой остаётся ограниченной при увеличении объёма выборки. Говоря менее кратко, пусть Xk (где k = 1, 2, 3, …, n) — независимые одинаково распределённые случайные величины. Достаточная статистика T(X1, …, Xn), число скалярных компонент которой не увеличивается с ростом объёма выборки n, существует только в том случае, если их распределение принадлежит к экспоненциальному семейству распределений. Статистика T может быть вектором или единственным скалярным числом, но вне зависимости от этого её размер не будет ни увеличиваться, ни уменьшаться при поступлении новых данных. В качестве контрпримера, если эти условия ослабить, то семейство равномерных распределений (дискретных или непрерывных, с одной или обеими границами неизвестными) обладает достаточной статистикой, а именно максимальным и минимальным значениями выборки, а также объёмом выборки, но не является экспоненциальным семейством, поскольку область определения зависит от параметров.
Непредвзятая оценка
Если функция правдоподобия принадлежит экспоненциальному семейству, то несмещенной оценкой является .
Испытание гипотезы: однозначно самые мощные тесты
В однопараметрическом экспоненциальном семействе отношение правдоподобия монотонно не убывает по достаточному статистике T(x), при условии, что η(θ) не убывает. Как следствие, существует равномерно самый мощный критерий для проверки гипотезы H0: θ ≥ θ0 против H1: θ < θ0.
Обобщенные линейные модели
Экспоненциальные семейства лежат в основе функций распределения, применяемых в обобщенных линейных моделях (GLM) – класса моделей, охватывающего многие из наиболее распространенных регрессионных моделей в статистике. Примерами являются логистическая регрессия, использующая биномиальное семейство, и регрессия Пуассона.