Введение

Технология поиска информации Федеральный поиск получает информацию из различных источников через поисковое приложение, построенное на одной или нескольких поисковых системах. Пользователь делает один запрос, который распространяется на поисковые системы, базы данных или другие поисковые системы, участвующие в федерации. Затем объединенный поиск агрегирует результаты, полученные от поисковых систем для представления пользователю. Федеральный поиск может использоваться для интеграции разрозненных информационных ресурсов в рамках одной большой организации ("предприятия") или для всей сети. Федерализованный поиск, в отличие от распределенного поиска, требует централизованной координации поисковых ресурсов. Это включает как координацию запросов, переданных в отдельные поисковые системы, так и объединение результатов поиска, возвращаемых каждой из них.

Цель

Федеральный поиск появился, чтобы удовлетворить потребность в поиске нескольких разрозненных источников контента с помощью одного запроса. Это позволяет пользователю искать несколько баз данных одновременно в режиме реального времени, упорядочивать результаты из различных баз данных в полезную форму, а затем представлять результаты пользователю. Как таковой, это информационный агрегат или интеграционный подход, который обеспечивает однозначный доступ к многим информационным ресурсам и обычно возвращает данные в стандартной или частично гомогенизированной форме. Другие подходы включают в себя создание хранилища данных предприятия, озера данных или центра данных. Федеральный поиск запросов много раз разными способами (каждый источник запрошен отдельно), где другие подходы импортируют и преобразуют данные много раз, как правило, в процессах сбора за одну ночь. Федеральный поиск обеспечивает представление всех источников в реальном времени (в той степени, в которой они все доступны в Интернете). В промышленных поисковых системах, таких как LinkedIn, федеральный поиск используется для персонализации вертикального предпочтения для неоднозначных запросов. Например, когда пользователь задает запрос типа "машинное обучение" в LinkedIn, он или она может означать поиск людей с навыками машинного обучения, рабочих мест, требующих навыков машинного обучения или контента по теме. В таких случаях, федеральный поиск может использовать намерение пользователя (например, наем, поиск работы или контент потребления) для персонализации вертикального порядка для каждого отдельного пользователя.

Процесс

Как описано Питером Джаксо (2004), объединенный поиск состоит из (1) преобразования запроса и его трансляции в группу разрозненных баз данных или других веб-ресурсов с соответствующим синтаксисом, (2) объединения результатов, собранных из баз данных, (3) представления их в лаконичном и едином формате с минимальным дублированием и (4) предоставления средства, выполняемого автоматически или пользователем портала, для сортировки объединенного набора результатов. Федеративные поисковые порталы, как коммерческие, так и открытые, обычно используют для поиска библиографические базы данных общедоступных источников, каталоги библиотек в Интернете (OPAC), поисковые системы в Интернете, такие как Google и/или открытый доступ, правительственные или корпоративные сборники данных. Эти отдельные источники информации отправляют обратно в интерфейс портала список результатов поискового запроса. Пользователь может просмотреть этот список. Некоторые порталы просто отсканируют фактические результаты базы данных и не позволят пользователю напрямую ввести приложение источника информации. Более сложные методы будут дедулировать список результатов путем объединения и удаления дубликатов. На многих порталах есть дополнительные функции, но основная идея одинакова: повысить точность и актуальность отдельных поисков, а также сократить время, необходимое для поиска ресурсов. Этот процесс позволяет объединить поиск в несколько ключевых преимуществ по сравнению с существующими поисковыми системами на основе сканеров. Федеральный поиск не должен создавать никаких требований или бремени для владельцев отдельных источников информации, кроме обработки увеличенного трафика. Объединенные поиски по своей сути актуальны, как и отдельные источники информации, поскольку они ищут в режиме реального времени.

Реализация

Одним из применений федеративного поиска является метапоисковая система. Однако метапоисковый подход не преодолевает недостатки компонентных поисковых систем, таких как неполные индексы. Документы, которые не индексируются поисковыми системами, создают то, что известно как глубокая сеть, или невидимая сеть. Google Scholar - один из многих проектов, пытающихся решить эту проблему, путем индексации электронных документов, которые поисковые системы игнорируют. И метапоисковый подход, как и основополагающая технология поисковой системы, работает только с информационными источниками, хранящимися в электронном виде. Одна из главных проблем метапоиска - обеспечение совместимости поискового запроса с компонентами поисковых систем, которые объединяются и объединяются. Если поисковый словарь или модель данных поисковой системы отличаются от модели данных одной или нескольких зарубежных целевых систем, запрос должен быть переведен на каждую из зарубежных целевых систем. Это может быть сделано с использованием простого перевода элементов данных или может потребоваться семантический перевод. Например, если одна поисковая система позволяет цитировать точные строки или n граммов, а другая - нет, запрос должен быть переведен так, чтобы он был совместим с каждой поисковой системой. Для перевода цитируемого запроса точного строки его можно разбить на набор перекрывающихся N граммов, которые с наибольшей вероятностью дадут желаемые результаты поиска в каждой поисковой системе. Еще одна проблема, с которой сталкивается внедрение объединенных поисковых систем, - это масштабируемость. Трудно поддерживать производительность, скорость ответа, объединенной поисковой системы, поскольку она объединяет все больше и больше источников информации. Одной из реализаций федеративного поиска, которая начала решать эту проблему, является WorldWideScience, организованная Управлением научной и технической информации Министерства энергетики США. WorldWideScience состоит из более чем 40 источников информации, некоторые из которых являются объединенными поисковыми порталами. Один из таких порталов - это Science. gov, которая сама объединяет более 30 источников информации, представляющих большую часть продукции НИОКР федерального правительства США. Наука. gov возвращает свои самые высоко ранжированные результаты в WorldWideScience, который затем объединяет и ранжирует эти результаты с поиском, возвращенным другими источниками информации, которые составляют WorldWideScience. Sesam Search Application Toolkit - это платформа, которая обеспечивает большую часть структуры и функциональности, необходимых для обработки параллельных и трубопроводных поисков и их элегантного отображения в пользовательском интерфейсе, позволяя инженерам сосредоточиться на настройке конфигурации индекса / базы данных. Для персонализации вертикальных заказов в федеральном поиске поисковая система LinkedIn является поисковой системой с открытым исходным кодом, выпущенной под лицензией Apache 2.0. Он включает в себя предварительно созданные соединители с популярными поисковыми системами с открытым исходным кодом и пересчитывает результаты с использованием сходства вектора косинуса.