Введение

Модель вероятности

В обработке естественного языка скрытое распределение Дирихле (LDA) — это байесовская сеть (и, следовательно, генеративная статистическая модель) для моделирования автоматически выделенных тем в текстовых корпусах. LDA является примером байесовской тематической модели. В рамках этой модели наблюдения (например, слова) группируются в документы, и появление каждого слова объясняется принадлежностью к одной из тем, представленных в документе. Каждый документ содержит небольшое число тем.

История

В контексте популяционной генетики LDA была предложена Дж. К. Причардом, М. Стивенсом и П. Доннелли в 2000 году. LDA была применена в машинном обучении Дэвидом Блей, Эндрю Нг и Майклом И. Джорданом в 2003 году.

Эволюционная биология и биомедицина

В эволюционной биологии и биомедицине модель используется для выявления наличия структурированной генетической изменчивости в группе особей. Модель исходит из того, что аллели, носителями которых являются исследуемые особи, имеют происхождение из различных существующих или вымерших популяций. Модель и различные алгоритмы вывода позволяют ученым оценивать частоты аллелей в этих исходных популяциях и происхождение аллелей, переносимых исследуемыми особями. Исходные популяции могут быть интерпретированы постфактум в контексте различных эволюционных сценариев. В исследованиях ассоциаций выявление наличия генетической структуры считается необходимым предварительным этапом для избежания искажений результатов.

Клиническая психология, психическое здоровье и социальные науки

В исследованиях клинической психологии LDA использовался для выявления общих тем, связанных с представлениями о себе, которые испытывают молодые люди в социальных ситуациях. Другие социальные ученые применяли LDA для анализа больших массивов тематических данных из обсуждений в социальных сетях (например, твитов о рецептурных препаратах).

Музыковедение

В контексте вычислительной музыкологии LDA используется для выявления тональных структур в различных корпусах.

Вариационный Байес

В оригинальной статье по машинному обучению использовалось вариационно-байесовское приближение апостериорного распределения.

Неизвестное количество популяций/темы

На практике оптимальное количество популяций или тем заранее неизвестно. Его можно оценить путем аппроксимации апостериорного распределения с помощью обратимой цепи Маркова Монте-Карло. Недавние исследования были сосредоточены на ускорении вывода скрытого распределения Дирихле для поддержки обработки огромного количества тем в большом объеме документов. Уравнение обновления коллапсирующего сэмплера Гиббса, упомянутое в предыдущем разделе, обладает естественной разреженностью, которую можно использовать. Интуитивно, поскольку каждый документ содержит лишь подмножество тем, а слово также встречается лишь в подмножестве тем, вышеуказанное уравнение обновления можно переписать с учетом этой разреженности. В этом уравнении у нас три слагаемых, из которых два разреженные, а одно – малое. Обозначим эти слагаемые и соответственно. Теперь, если нормализовать каждое слагаемое, суммируя по всем темам, получим:

Здесь мы видим, что является суммой тем, присутствующих в документе , а также является разреженной суммой тем, которым слово присвоено во всем корпусе. , с другой стороны, плотное, но из-за малых значений и , его значение очень мало по сравнению с двумя другими слагаемыми. Теперь, при выборке темы, если мы выбираем случайную переменную равномерно из , мы можем проверить, в какое «ведро» попала наша выборка. Поскольку мало, мы вряд ли попадем в это ведро; однако, если это произойдет, выборка темы займет время (как и в оригинальном Collapsed Gibbs Sampler). Но если мы попадем в другие два ведра, нам нужно будет проверить только подмножество тем, если мы будем вести учет разреженных тем. Тему можно выбрать из «ведра» за время , а тему – из «ведра» за время , где и обозначают количество тем, присвоенных текущему документу и текущему типу слова соответственно. Обратите внимание, что после выборки каждой темы обновление этих ведер требует лишь базовых арифметических операций.

Связанные модели

Моделирование тем — классическое решение проблемы поиска информации с использованием связанных данных и технологий семантической сети. К связанным моделям и методам относятся, в частности, скрытое семантическое индексирование, независимый компонентный анализ, вероятностное скрытое семантическое индексирование, неотрицательная матричная факторизация и распределение Гамма-Пуассона. Модель LDA обладает высокой модульностью и, следовательно, может быть легко расширена. Основная область интереса — моделирование взаимосвязей между темами. Это достигается путем использования другого распределения на симплексе вместо распределения Дирихле. Модель коррелированных тем следует этому подходу, индуцируя структуру корреляции между темами с помощью логистически нормального распределения вместо распределения Дирихле. Другим расширением является иерархическая LDA (hLDA), в которой темы объединяются в иерархию с использованием вложенного китайского ресторанного процесса, структура которого изучается на основе данных. LDA также может быть расширена для корпуса, в котором документ содержит два типа информации (например, слова и имена), как в двойной модели LDA. Непараметрические расширения LDA включают иерархическую модель смеси процессов Дирихле, которая позволяет неограниченному количеству тем и их изучению на основе данных. Как отмечалось ранее, pLSA аналогична LDA. Модель LDA по сути является байесовской версией модели pLSA. Байесовская формулировка, как правило, показывает лучшие результаты на небольших наборах данных, поскольку байесовские методы позволяют избежать переобучения. Для очень больших наборов данных результаты обеих моделей, как правило, сходятся. Одно из различий заключается в том, что pLSA использует переменную для представления документа в обучающем наборе. Таким образом, в pLSA, при представлении документа, который модель ранее не видела, мы фиксируем вероятность слов по темам, полученную из обучающего набора, и используем тот же алгоритм EM для вывода распределения тем. Блей утверждает, что этот шаг является некорректным, поскольку по сути модель перенастраивается на новые данные.

Пространственные модели

В эволюционной биологии часто естественно предполагать, что географическое положение наблюдаемых особей несет некоторую информацию об их предках. Именно этим обусловлено использование различных моделей для генетических данных с географической привязкой. Вариации метода LDA применялись для автоматической классификации естественных изображений по категориям, таким как "спальня" или "лес", рассматривая изображение как документ, а небольшие фрагменты изображения как слова; одна из таких вариаций называется пространственным латентным распределением Дирихле.