Введение

Статистическое понятие

В статистике смешанная модель – это вероятностная модель, предназначенная для представления наличия субпопуляций в общей популяции, без необходимости идентифицировать, к какой субпопуляции относится каждое отдельное наблюдение в наблюдаемом наборе данных. Формально смешанная модель соответствует распределению смеси, которое представляет собой распределение вероятностей наблюдений в общей популяции. Однако, если проблемы, связанные с "распределениями смеси", касаются вывода свойств общей популяции из свойств субпопуляций, то "смешанные модели" используются для получения статистических выводов о свойствах субпопуляций, основываясь только на наблюдениях объединенной популяции, без информации об идентификации субпопуляций. Смешанные модели применяются для кластеризации, известной как кластеризация на основе моделей, а также для оценки плотности. Смешанные модели не следует путать с моделями для композиционных данных, то есть данных, компоненты которых ограничены суммой до постоянной величины (1, 100% и т.д.). Тем не менее, композиционные модели можно рассматривать как смешанные модели, в которых элементы популяции отбираются случайным образом. И наоборот, смешанные модели можно рассматривать как композиционные модели, в которых общий размер популяции нормализован до 1.

Многовариантная модель гауссовской смеси

Модель байесовской гауссовской смеси обычно расширяется для соответствия вектору неизвестных параметров (обозначенному жирным шрифтом) или многомерным нормальным распределениям. В многомерном распределении (то есть при моделировании вектора с N случайными переменными) можно моделировать вектор параметров (например, несколько наблюдений сигнала или фрагменты изображения) с использованием априорного распределения в виде гауссовской смеси для вектора оценок, определяемого тем, что i-я векторная компонента характеризуется нормальными распределениями с весами, средними значениями и матрицами ковариации. Для включения этого априорного распределения в байесовскую оценку, оно умножается на известное распределение данных, обусловленное оцениваемыми параметрами. При такой формулировке апостериорное распределение также является гауссовской смесью вида с новыми параметрами и , которые обновляются с использованием алгоритма EM. Хотя обновления параметров на основе EM хорошо изучены, предоставление начальных оценок этих параметров в настоящее время является активной областью исследований. Следует отметить, что эта формулировка дает аналитическое решение для полного апостериорного распределения. Оценки случайной переменной могут быть получены с помощью одного из нескольких оценочных методов, таких как среднее или максимум апостериорного распределения. Такие распределения полезны, например, для моделирования формы фрагментов изображений и кластеров. В случае представления изображений каждое гауссовское распределение может быть наклонено, растянуто и искажено в соответствии с матрицами ковариации. К каждому фрагменту изображения (обычно размером 8x8 пикселей) подбирается одно гауссовское распределение из набора. Важно отметить, что любое распределение точек вокруг кластера (как в k-средних) может быть точно представлено при достаточном количестве гауссовских компонент, однако для точного моделирования заданного распределения изображения или кластера данных редко требуется более K=20 компонент.

Финансовая модель

Финансовая доходность часто ведет себя по-разному в обычных условиях и во время кризисов. Смешанная модель для данных о доходности представляется целесообразной. В некоторых случаях используется модель скачкообразной диффузии или смесь двух нормальных распределений. Подробности см. в работах и .

Цены на жилье

Предположим, мы наблюдаем цены на N различных домов. Различные типы домов в разных районах будут значительно отличаться по цене, однако цены на конкретный тип дома в конкретном районе (например, трехкомнатный дом в районе средней обеспеченности) будут, как правило, довольно плотно группироваться вокруг среднего значения. Одной из возможных моделей для описания таких цен является предположение, что цены точно описываются смесью из K различных компонент, каждая из которых имеет нормальное распределение с неизвестным средним и дисперсией, при этом каждая компонента соответствует определенной комбинации типа дома и района. Подгонка этой модели к наблюдаемым ценам, например, с использованием алгоритма максимизации ожиданий, приведет к группировке цен по типу дома и району, а также позволит выявить разброс цен для каждого типа и района. (Следует отметить, что для значений, таких как цены или доходы, которые гарантированно положительны и имеют тенденцию к экспоненциальному росту, логнормальное распределение может оказаться более подходящей моделью, чем нормальное распределение.)

Темы в документе

Предположим, что документ состоит из N различных слов из общего словарного запаса размером V, где каждое слово соответствует одной из K возможных тем. Распределение этих слов можно смоделировать как смесь K различных V-мерных категориальных распределений. Такая модель обычно называется тематической моделью. Следует отметить, что применение метода максимизации ожиданий к такой модели, как правило, не приводит к реалистичным результатам из-за (в частности) избыточного количества параметров. Для получения хороших результатов обычно требуются дополнительные предположения. Как правило, в модель добавляют два типа дополнительных компонентов:
На параметры, описывающие тематические распределения, накладывается априорное распределение, использующее распределение Дирихле с параметром концентрации, установленным значительно ниже 1, чтобы стимулировать разреженные распределения (в которых лишь небольшое число слов имеет существенно ненулевые вероятности). Также на тематическую принадлежность слов накладываются дополнительные ограничения, чтобы использовать преимущества естественной кластеризации. Например, на тематическую принадлежность можно наложить цепь Маркова (то есть на латентные переменные, определяющие компонент смеси для каждого наблюдения), что соответствует тому факту, что соседние слова относятся к схожим темам. (Это приводит к скрытой модели Маркова, в частности, к модели, в которой на переходы между состояниями накладывается априорное распределение, благоприятствующее переходам, остающимся в том же состоянии.) Другой вариант – латентное распределение Дирихле, которое разделяет слова на D различных документов и предполагает, что в каждом документе лишь небольшое количество тем встречается с заметной частотой.

Распознавание почерка

Следующий пример основан на примере из книги Кристофера М. Бишопа «Распознавание образов и машинное обучение». Представьте, что нам дано черно-белое изображение размером N×N, которое, как известно, является сканом рукописной цифры от 0 до 9, но мы не знаем, какая именно цифра написана. Мы можем создать смесь моделей с различными компонентами, где каждый компонент представляет собой вектор из распределений Бернулли размером, равным количеству пикселей (по одному на пиксель). Такая модель может быть обучена алгоритмом максимизации ожиданий на неразмеченном наборе рукописных цифр и эффективно группировать изображения в соответствии с написанной цифрой. Затем ту же модель можно использовать для распознавания цифры на другом изображении, просто зафиксировав параметры, вычислив вероятность нового изображения для каждой возможной цифры (тривиальное вычисление) и выбрав цифру, которая сгенерировала наибольшую вероятность.

Оценка точности снаряда (также известная как вероятность круговой ошибки, CEP)

Смешанные модели применяются при решении задачи наведения нескольких снарядов на цель (например, в системах противовоздушной, наземной или морской обороны), где физические и/или статистические характеристики снарядов различаются между собой. Примером может служить стрельба из разных типов боеприпасов или стрельба с разных позиций по одной цели. Совокупность типов снарядов может быть описана как гауссовская смесь. Более того, широко известной мерой точности для группы снарядов является радиус вероятного кругового расхождения (РВК), определяемый как радиус R, внутри которого, в среднем, половина снарядов из группы попадает вокруг точки цели. Смешанная модель может быть использована для определения (или оценки) величины R, корректно учитывая различные типы снарядов.

Прямые и косвенные применения

Финансовый пример, приведенный выше, является одним из прямых применений модели смеси – ситуации, в которой мы предполагаем наличие некоторого базового механизма, согласно которому каждое наблюдение принадлежит к одному из нескольких различных источников или категорий. Однако этот базовый механизм может быть как наблюдаемым, так и ненаблюдаемым. В данной форме модели смеси каждый из источников описывается функцией плотности вероятности компоненты, а его вес в смеси представляет собой вероятность того, что наблюдение происходит из этой компоненты. В косвенном применении модели смеси мы не постулируем наличие такого механизма. Модель смеси просто используется благодаря своей математической гибкости. Например, смесь двух нормальных распределений с различными средними может привести к плотности с двумя модами, что не может быть описано стандартными параметрическими распределениями. Другой пример заключается в возможности использования смеси распределений для моделирования более "тяжелых" хвостов, чем у базового гауссовского распределения, что делает ее кандидатом для моделирования более экстремальных событий. В сочетании с динамической согласованностью, этот подход применяется для оценки финансовых деривативов в условиях волатильности смайла в контексте моделей локальной волатильности. Это определяет область нашего применения.

Прогнозирующее обслуживание

Кластеризация на основе смеси моделей также широко используется для определения состояния оборудования при прогнозирующем обслуживании. Графики плотности применяются для анализа плотности признаков высокой размерности. Если наблюдаются мультимодальные плотности, предполагается, что конечное число плотностей формируется конечным числом нормальных смесей. Для кластеризации данных о признаках в k групп, где k соответствует каждому состоянию оборудования, используется многомерная гауссовская смесь. Состояние оборудования может быть нормальным, выключенным или неисправным. Каждую сформированную группу можно диагностировать с использованием таких методов, как спектральный анализ. В последние годы этот подход также широко применяется в других областях, например, для раннего обнаружения неисправностей.

Нечеткая сегментация изображения

В обработке изображений и компьютерном зрении традиционные модели сегментации изображений часто присваивают одному пикселю только один исключительный шаблон. В нечеткой или мягкой сегментации любой шаблон может обладать определенной степенью "принадлежности" к любому отдельному пикселю. Если шаблоны являются гауссовыми, то нечеткая сегментация естественным образом приводит к гауссовым смесям. В сочетании с другими аналитическими или геометрическими инструментами (например, фазовыми переходами на диффузионных границах), такие пространственно-регуляризованные модели смесей могут привести к более реалистичным и вычислительно эффективным методам сегментации.

Определяемость

Идентифицируемость относится к существованию однозначной параметризации для любой модели из рассматриваемого класса (семейства). Процедуры оценивания могут быть плохо определены, а асимптотическая теория может оказаться неприменимой, если модель не идентифицируема.

Пример

Пусть J – класс всех биномиальных распределений с параметром. Тогда смесь двух элементов из J будет иметь вид

и Очевидно, что, задав p0 и p1, нельзя однозначно определить указанную модель смеси, так как необходимо оценить три параметра (π, θ1, θ2).

Определение

Рассмотрим смесь параметрических распределений одного класса. Пусть 𝓙 – класс всех компонентных распределений. Тогда выпуклая оболочка K от 𝓙 определяет класс всех конечных смесей распределений из 𝓙:

Говорят, что K идентифицируема, если все её элементы уникальны, то есть, для любых двух элементов p и p′ из K, являющихся смесями k и k′ распределений соответственно из 𝓙, выполняется p = p′ тогда и только тогда, когда, во-первых, k = k′, и во-вторых, можно перенумеровать слагаемые так, чтобы pᵢ = p′ᵢ для всех i.

Оценка параметров и идентификация системы

Модели параметрических смесей часто используются, когда известно распределение Y и можно получить выборку из X, но требуется определить значения ai и θi. Подобные ситуации возникают в исследованиях, где выборка производится из популяции, состоящей из нескольких различных подпопуляций. Моделирование вероятностных смесей часто рассматривается как задача с пропущенными данными. Один из способов понять это – предположить, что каждая точка данных имеет "принадлежность" к одному из распределений, используемых для моделирования данных. В начале работы эта принадлежность неизвестна или отсутствует. Задача оценки состоит в подборе подходящих параметров для выбранных функций модели, где связь с точками данных выражается через их принадлежность к отдельным распределениям модели. Предложено множество подходов к задаче разложения смеси, многие из которых основаны на методах максимального правдоподобия, таких как максимизация ожиданий (EM) или оценка максимального апостериорного правдоподобия (MAP). Как правило, эти методы рассматривают вопросы идентификации системы и оценки параметров по отдельности: методы определения числа и функциональной формы компонентов смеси отличаются от методов оценки соответствующих значений параметров. Некоторые заметные исключения – это графические методы, описанные Тартером и Локом, и более поздние методы минимальной длины сообщения (MML), такие как методы Фигейреду и Джейна, а также, в некоторой степени, процедуры анализа соответствия моментов, предложенные МакУильямсом и Ло (2009).

Графические методы

Tarter and Lock, 2000), хотя обычно ссылаются на работу Карла Пирсона (1894) как на первого автора, который явно сформулировал проблему разложения при описании ненормативных признаков соотношения длины лба к длине тела у самок береговых крабов. Толчком к этой работе послужили предположения зоолога Уолтера Франка Рафаэля Уэлдона, высказанные им в 1893 году (в Tarter and Lock). С тех пор было проведено огромное количество исследований в этой области, охватывающих такие сферы, как рыболовство, сельское хозяйство, ботаника, экономика, медицина, генетика, психология, палеонтология, электрофорез, финансы, геология и зоология.