Введение

В области информационного поиска, отклонение от случайности, одна из первых моделей, является одним из типов вероятностных моделей. Она в основном используется для оценки объема информации, содержащейся в документах. Модель основана на двухпараметрической модели Пуассона Хартера. Модель двухпараметрического распределения Пуассона предполагает, что релевантность документов связана с набором документов, в которых определенные слова встречаются чаще, чем в остальных документах. Это не столько "модель", сколько основа для взвешивания терминов с использованием вероятностных методов, обладающая специфической связью с взвешиванием терминов, основанным на понятии элитности. Веса терминов рассматриваются как показатель принадлежности конкретного слова к этому набору. Веса терминов вычисляются путем измерения расхождения между распределением терминов, генерируемым случайным процессом, и фактическим распределением терминов. Модели отклонения от случайности создаются путем определения трех основных компонентов этой основы: сначала выбирается базовая модель случайности, затем применяется первая нормализация и, наконец, нормализуются частоты терминов. Базовые модели представлены в следующих таблицах.

Модели DFR

BB2 Модель Бернулли-Эйнштейна с последействием Бернулли и нормализацией 2. IFB2 Модель обратной частоты терминов с последействием Бернулли и нормализацией 2. В expB2 Модель обратной ожидаемой частоты документов с последействием Бернулли и нормализацией 2. Логарифмы используются по основанию 2. Эта модель может быть использована для классических ad hoc задач. В expC2 Модель обратной ожидаемой частоты документов с последействием Бернулли и нормализацией 2. Логарифмы используются по основанию e. Эта модель может быть использована для классических ad hoc задач. InL2 Модель обратной частоты документов с последействием Лапласа и нормализацией 2. Эта модель может быть использована для задач, требующих высокой точности на ранних этапах. PL2 Пуассоновская модель с последействием Лапласа и нормализацией 2. Эта модель может быть использована для задач, требующих высокой точности на ранних этапах[7,8].

Первая нормализация

Когда конкретный редкий термин не удается найти в документе, вероятность того, что этот термин будет информативным в этом документе, приближается к нулю. С другой стороны, если редкий термин часто встречается в документе, он может иметь очень высокую, близкую к 100%, вероятность быть информативным для темы, затронутой в документе. Также может быть полезно применить языковую модель Понте и Крофта. Следует отметить, что в DFR учитывается компонент риска. Логически, если частота термина в документе относительно высока, то риск того, что термин не является информативным, соответственно невелик. Например, если Формула 1 выдает высокое значение, то минимальный риск может негативно сказаться, показывая небольшой прирост информации. Поэтому мы выбираем организовывать вес Формулы 1, учитывая только ту часть, которая представляет собой объем информации, полученной с этим термином. Чем чаще термин встречается в элитном наборе, тем меньше его частота обусловлена случайностью и, следовательно, тем ниже связанный с ним риск. По сути, мы применяем две модели для вычисления прироста информации от термина в документе: модель Лапласа L и отношение двух процессов Бернулли B.

Заключение

Дивергенция от модели случайности основана на модели Бернулли и её предельных формах, гипергеометрическом распределении, статистике Бозе — Эйнштейна и её предельных формах, композиции биномиального распределения с бета-распределением и распределениях с «тяжёлыми хвостами». Модель дивергенции от случайности представляет собой унифицированную основу, обладающую потенциалом для построения множества различных эффективных моделей информационного поиска.

Применение и характеристики

Модель "Отклонение от случайности" может быть применена в автоматической индексации в информационном поиске. Это можно объяснить как "элитность документа", понимаемую как информативность термина в контексте документа. Эффективность моделей, основанных на отклонении от случайности, значительно выше, чем у BM25 и языковой модели. Для коротких запросов производительность моделей отклонения от случайности заметно превосходит модель BM25, которая с 1994 года используется в качестве стандартного базового уровня для сравнения моделей. Модель "Отклонение от случайности" может демонстрировать наилучшие результаты, используя лишь небольшое количество документов, в отличие от других методов расширения запросов. Структура модели "Отклонение от случайности" очень универсальна и гибкая. Благодаря расширению запросов, предоставляемому для каждого компонента, можно применять различные технологии для достижения оптимальной производительности.

Близость

Близость может быть учтена при отклонении от случайности, чтобы оценить количество совместных появлений пары поисковых запросов в окне заданного размера. В частности, модификатор оценки зависимости DFR (DFR Dependence Score Modifier DSM) реализует модели pBiL и pBiL2, которые вычисляют случайность, деленную на длину документа, а не статистику этой пары в корпусе документов.

Примеры расхождения от случайности

Пусть t – термин, а c – коллекция. Пусть термин встречается в tfc = nL(t,c) = 200 местах, а в df(t,c) = nL(t,c) = 100 документах. Ожидаемый средний показатель частоты терминов составляет avgtf(t,c) = 200/100 = 2; это среднее значение по документам, в которых встречается термин. Пусть N.D(c) = 1000 – общее количество документов. Термин встречается в 10% документов: P.D(t|c) = 100/1000. Ожидаемая средняя частота термина во всех документах составляет 200/1000 = 1/5. Частота термина показана как Kt = 0, 6. В следующей таблице столбец nD – это количество документов, содержащих kt вхождений t, обозначаемое как nD(t,c,kt). Другой столбец nL – это количество мест, в которых встречается термин, вычисляемое по формуле: nL = kt * nD. Колонки справа показывают наблюдаемые и вероятности Пуассона. Pobs,elite(Kt) – наблюдаемая вероятность по всем документам. Ppoisson,all,lambda(Kt) – вероятность Пуассона, где lambda(t,c) = nL(t,c) / N.D(c) = 0.20 – параметр Пуассона. Таблица иллюстрирует, как наблюдаемая вероятность отличается от вероятности Пуассона. Ppoisson(1) больше, чем Pobs(1), в то время как для kt > 1 наблюдаемые вероятности больше, чем вероятности Пуассона. В хвосте наблюдаемого распределения больше массы, чем предполагает распределение Пуассона. Кроме того, колонки справа иллюстрируют использование элитных документов вместо всех документов. Здесь вероятность единичного события основана только на местоположении элитных документов.