Введение

Распределение вероятности

В теории вероятностей и статистике распределение Дирихле (названо в честь Питера Густава Лежена Дирихле), часто обозначаемое как , представляет собой семейство непрерывных многомерных распределений вероятностей, параметризованных вектором положительных вещественных чисел. Оно является многомерным обобщением бета-распределения, отсюда и его альтернативное название – многомерное бета-распределение (MBD). Распределения Дирихле широко используются в качестве априорных распределений в байесовской статистике, и, фактически, распределение Дирихле является сопряжённым априорным распределением для категориального и мультиномиального распределений. Бесконечномерным обобщением распределения Дирихле является процесс Дирихле.

Поддержка

Поддержкой распределения Дирихле является множество K-мерных векторов, компоненты которых – действительные числа в интервале [0, 1], при этом сумма компонент равна 1. Эти векторы можно интерпретировать как вероятности K-путевого категориального события. Другими словами, область определения распределения Дирихле сама по себе является множеством распределений вероятностей, а именно – множеством K-мерных дискретных распределений. Специальный термин для множества точек в поддержке K-мерного распределения Дирихле – открытый стандартный (K–1)-симплекс, который представляет собой обобщение треугольника, вложенного в пространство на единицу размерность выше. Например, при K = 3 поддержка представляет собой равносторонний треугольник, вложенный в трехмерное пространство, ориентированный вершиной вниз, с вершинами в точках (1, 0, 0), (0, 1, 0) и (0, 0, 1), то есть касающийся каждой из координатных осей в точке, находящейся на расстоянии 1 от начала координат.

Особые случаи

Общим частным случаем является симметричное распределение Дирихле, где все элементы, составляющие вектор параметров, имеют одно и то же значение. Симметричный случай может быть полезен, например, когда требуется априорное распределение Дирихле для компонент, но нет предварительных знаний, отдающих предпочтение одной компоненте над другой. Поскольку все элементы вектора параметров имеют одно и то же значение, симметричное распределение Дирихле может быть параметризовано единственным скалярным значением α, называемым параметром концентрации. В терминах α функция плотности имеет вид.

Когда α=1, симметричное распределение Дирихле эквивалентно равномерному распределению на открытом стандартном (K–1)-симплексе, то есть оно равномерно распределено по всем точкам в своей области определения. Это конкретное распределение известно как плоское распределение Дирихле. Значения параметра концентрации, превышающие 1, благоприятствуют вариациям, которые представляют собой плотные, равномерно распределенные распределения, то есть все значения в пределах одной выборки похожи друг на друга. Значения параметра концентрации, меньшие 1, благоприятствуют разреженным распределениям, то есть большинство значений в пределах одной выборки будут близки к 0, и основная масса будет сосредоточена в нескольких значениях. В более общем виде вектор параметров иногда записывается как произведение (скалярного) параметра концентрации α и (векторной) базовой меры, где лежит в пределах (K–1)-симплекса (то есть: сумма его координат равна единице). В этом случае параметр концентрации больше в K раз, чем параметр концентрации для симметричного распределения Дирихле, описанного выше. Эта конструкция связана с понятием базовой меры при обсуждении процессов Дирихле и часто используется в литературе по тематическому моделированию. Если мы определим параметр концентрации как сумму параметров Дирихле для каждого измерения, то распределение Дирихле с параметром концентрации K, равным размерности распределения, является равномерным распределением на (K–1)-симплексе.

Режим

Режим распределения — вектор (x₁, …, xₖ) с

Отношение к дирихлеевскому многочленному распределению

В модели, в которой на множество категориальных наблюдений накладывается априорное распределение Дирихле, краевое совместное распределение наблюдений (то есть совместное распределение наблюдений, с исключением априорного параметра) является распределением Дирихле-мультиномиального типа. Это распределение играет важную роль в иерархических байесовских моделях, поскольку при выполнении вывода для таких моделей с использованием методов, таких как выборка Гиббса или вариационный вывод, априорные распределения Дирихле часто исключаются путем интегрирования. Более подробную информацию можно найти в статье, посвященной этому распределению.

Неравенство

Функция плотности вероятности играет ключевую роль в многофункциональном неравенстве, которое влечет за собой различные оценки для распределения Дирихле.

Байесовские модели

Распределения Дирихле наиболее часто используются в качестве априорного распределения для категориальных или мультиномиальных переменных в байесовских моделях смесей и других иерархических байесовских моделях. (Во многих областях, например, в обработке естественного языка, категориальные переменные часто неточно называют "мультиномиальными переменными". Такое употребление вряд ли приведет к путанице, как и в случае с объединением распределений Бернулли и биномиальных распределений.) Вывод в иерархических байесовских моделях часто выполняется с помощью выборки Гиббса, и в этом случае экземпляры распределения Дирихле обычно исключаются из модели путем интегрирования случайной переменной Дирихле. Это приводит к корреляции между различными категориальными переменными, полученными из одной и той же случайной переменной Дирихле, а их совместное распределение принимает вид дирихле-мультономиального распределения, обусловленного гиперпараметрами распределения Дирихле (параметрами концентрации). Одна из причин этого заключается в том, что выборка Гиббса из дирихле-мультономиального распределения чрезвычайно проста; подробности можно найти в соответствующей статье.

Параметр концентрации

Распределения Дирихле очень часто используются в качестве априорных распределений в байесовском выводе. Самый простой и, пожалуй, наиболее распространенный тип априорного распределения Дирихле — это симметричное распределение Дирихле, в котором все параметры равны. Это соответствует случаю, когда у вас нет предварительной информации, чтобы отдать предпочтение какому-либо одному компоненту перед другими. Как описано выше, единственное значение α, которому приравнены все параметры, называется параметром концентрации. Если пространство выборок распределения Дирихле интерпретируется как дискретное распределение вероятностей, то интуитивно параметр концентрации можно рассматривать как определяющий, насколько "концентрирована" вероятностная масса распределения Дирихле вокруг его центра, что приводит к выборкам с массой, почти равномерно распределенной между всеми компонентами. То есть, при значении, значительно меньшем 1, масса будет сильно сконцентрирована в нескольких компонентах, а все остальные будут иметь почти нулевую массу, а при значении, значительно большем 1, масса будет распределена почти равномерно между всеми компонентами. Подробнее см. статью о параметре концентрации.

Резка струны

Одним из примеров использования распределения Дирихле является задача разделения нити (каждая из которых имеет начальную длину 1.0) на K частей разной длины, где для каждой части задана средняя длина, но допускается некоторое отклонение в относительных размерах частей. Вспомните, что значения определяют средние длины полученных частей нити, соответствующие распределению. Дисперсия вокруг этого среднего изменяется обратно пропорционально .

Урна Поля

Возьмем урну, содержащую шарики K разных цветов. Изначально в урне находится α1 шаров цвета 1, α2 шаров цвета 2 и так далее. Теперь выполним N извлечений из урны, при этом после каждого извлечения шар возвращается в урну вместе с еще одним шаром того же цвета. В пределе, когда N стремится к бесконечности, пропорции шаров разных цветов в урне будут распределены согласно распределению Дирихле Dir(α1, ..., αK). Для строгого доказательства заметим, что пропорции шаров разных цветов образуют ограниченный мартингейл со значениями в [0,1]K. Следовательно, по теореме о сходимости мартингейлов, эти пропорции сходятся почти наверное и в среднем к предельному случайному вектору. Чтобы показать, что этот предельный вектор имеет указанное распределение Дирихле, необходимо проверить, что все смешанные моменты совпадают. Каждое извлечение из урны изменяет вероятность извлечения шара любого цвета в будущем. Эта модификация уменьшается с увеличением числа извлечений, поскольку относительное влияние добавления нового шара в урну снижается по мере накопления все большего количества шаров в урне.

Когда каждый альфа равен 1.

Когда , образец из распределения можно получить, случайно выбрав набор из K − 1 значений независимо и равномерно из интервала [0, 1], добавив к этому набору значения 0 и 1, чтобы получить K + 1 значение, отсортировав набор и вычислив разность между каждой парой соседних упорядоченных значений, что даст , , .

Когда каждый альфа 1/2 и отношения к гиперсфере

Когда , образец из распределения можно получить, случайно выбрав K значений независимо из стандартного нормального распределения, возведя эти значения в квадрат и нормализовав их, разделив на их сумму, чтобы получить , , . Точку , , можно равномерно случайно выбрать из (K-1)-мерной гиперсферы (которая является поверхностью K-мерного гипершара) с помощью аналогичной процедуры. Случайно выберите K значений независимо из стандартного нормального распределения и нормализуйте эти координатные значения, разделив каждое на константу, равную квадратному корню из суммы их квадратов.