Введение
Сегментированная поисковая система с конкретными областями контента Вертикальная поисковая система отличается от общей поисковой системы в Интернете тем, что она фокусируется на определенном сегменте онлайн-контента. Они также называются специализированными или тематическими поисковыми системами. Вертикальная область контента может быть основана на актуальности, типе медиа или жанре контента. Общие вертикали включают шопинг, автомобильную промышленность, юридическую информацию, медицинскую информацию, научную литературу, поиск работы и путешествия. Примеры вертикальных поисковых систем включают Библиотеку Конгресса, Mocavo, Nuroa, Trulia и Yelp. В отличие от общих поисковых систем, которые пытаются проиндексировать большие части Всемирной паутины с помощью веб-сканера, вертикальные поисковые системы обычно используют ориентированный сканер, который пытается проиндексировать только соответствующие веб-страницы по заранее определенной теме или набору тем. Некоторые вертикальные поисковые сайты сосредоточены на отдельных вертикалях, в то время как другие сайты включают в себя несколько вертикальных поисков в одной поисковой системе.
A vertical search engine is distinct from a general web search engine, in that it focuses on a specific segment of online content. They are also called specialty or topical search engines. The vertical content area may be based on topicality, media type, or genre of content. Common verticals include shopping, the automotive industry, legal information, medical information, scholarly literature, job search and travel. Examples of vertical search engines include the Library of Congress, Mocavo, Nuroa, Trulia, and Yelp. In contrast to general web search engines, which attempt to index large portions of the World Wide Web using a web crawler, vertical search engines typically use a focused crawler which attempts to index only relevant web pages to a pre defined topic or set of topics. Some vertical search sites focus on individual verticals, while other sites include multiple vertical searches within one search engine.
Поиск по конкретному домену
Специфические вертикали для домена сосредоточены на определенной теме. Джон Баттелл описывает это в своей книге "Поиск" (2005): решения для поисковых запросов, ориентированные на определенную область знаний, создают настраиваемый опыт поиска, который из-за ограниченного корпуса домена и четких отношений между понятиями обеспечивает поисковикам чрезвычайно релевантные результаты. Любая общая поисковая система будет индексировать все страницы и искать в широком первом порядке, чтобы собрать документы. Пауковое обращение в поисковых системах, ориентированных на определенную область, более эффективно ищет небольшой подмножество документов, сосредоточившись на определенном наборе. Было обнаружено, что паутинка, выполняемая с помощью системы обучения с подкреплением, в три раза эффективнее, чем поиск с широты.
Domain specific search solutions focus on one area of knowledge, creating customized search experiences, that because of the domain's limited corpus and clear relationships between concepts, provide extremely relevant results for searchers. Any general search engine would be indexing all the pages and searches in a breadth first manner to collect documents. The spidering in domain specific search engines more efficiently searches a small subset of documents by focusing on a particular set. Spidering accomplished with a reinforcement learning framework has been found to be three times more efficient than breadth first search.
Программа DARPA Memex
В начале 2014 года Агентство перспективных исследовательских проектов обороны (DARPA) опубликовало заявление на своем веб-сайте, в котором излагаются предварительные детали "программы Memex", целью которой является разработка новых поисковых технологий, преодолевающих некоторые ограничения текстового поиска. DARPA хочет, чтобы технология Memex, разработанная в ходе этого исследования, была доступна для поисковых систем, которые могут искать информацию в глубокой сети - части Интернета, которая в значительной степени недоступна коммерческим поисковым системам, таким как Google или Yahoo. На веб-сайте DARPA говорится, что "цель состоит в том, чтобы изобрести лучшие методы взаимодействия и обмена информацией, чтобы пользователи могли быстро и тщательно организовывать и искать подмножества информации, соответствующей их индивидуальным интересам". Как сообщалось в статье Wired за 2015 год, технология поиска, разрабатываемая в рамках программы Memex, "целью является освещение темной сети и выявление закономерностей и связей в онлайн-данных, чтобы помочь правоохранительным органам и другим отслеживать незаконную деятельность". DARPA намерена, чтобы программа заменила централизованные процедуры, используемые коммерческими поисковыми системами, заявив, что "создание новой доменной парадигмы индексации и поиска обеспечит механизмы для улучшения обнаружения контента, извлечения информации, извлечения информации, сотрудничества пользователей и расширения текущих возможностей поиска в глубокой сети, темной сети и нетрадиционном (например, мультимедийном) контенте". Модули были доступны для загрузки.