Введение

Документный поиск определяется как сопоставление запроса пользователя с набором текстовых документов. Эти документы могут представлять собой любой тип преимущественно неструктурированного текста, например, газетные статьи, записи о недвижимости или абзацы в руководстве. Запросы пользователей могут варьироваться от многословных описаний информационной потребности до нескольких слов. Документный поиск иногда называют поиском текста или рассматривают как его часть. Поиск текста — это раздел информационного поиска, в котором информация хранится преимущественно в текстовом формате. Текстовые базы данных стали децентрализованными благодаря появлению персональных компьютеров. Поиск текста является важной областью исследований сегодня, поскольку он лежит в основе всех интернет-поисковых систем.

Вариации

Существуют два основных класса схем индексирования для систем поиска документов: формальная (или словарная) и контентная индексация. Используемая схема классификации документов (или алгоритм индексирования) определяет тип системы поиска документов.

Форма основана

Поиск документов на основе формы учитывает точные синтаксические свойства текста, аналогично поиску подстроки в строковых запросах. Текст обычно неструктурирован и не обязательно представлен естественным языком; система, например, может использоваться для обработки больших наборов химических структур в молекулярной биологии. Алгоритм суффиксного дерева является примером индексирования на основе формы.

Основанное на содержании

Контент-ориентированный подход использует семантические связи между документами и их частями, а также семантические связи между запросами и документами. Большинство систем поиска документов на основе контента используют алгоритм инвертированного индекса. Файл сигнатур – это техника, создающая быстрый и приблизительный фильтр, например, фильтр Блума, который отбирает все документы, соответствующие запросу, и, возможно, несколько не соответствующих. Это достигается путем создания для каждого файла сигнатуры, как правило, в виде хеш-кода. Один из методов – суперпозиционное кодирование. Последующий этап обработки используется для отсеивания ложных срабатываний. Поскольку в большинстве случаев эта структура уступает инвертированным файлам по скорости, объему и функциональности, она не получила широкого распространения. Однако при правильной настройке параметров она может превзойти инвертированные файлы в определенных условиях.

Пример: PubMed

Интерфейс PubMed предоставляет поиск "связанных статей", который работает посредством сравнения слов из заголовков, аннотаций и MeSH-терминов документов с использованием алгоритма, основанного на взвешивании слов.