Поиск по близости: расширенный поиск текста, находящий документы с терминами на заданном расстоянии. Учитывает порядок слов и исключает разрозненные совпадения.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Функция запроса компьютерного текстового поиска. При обработке текста поиск по близости находит документы, в которых два или более отдельных совпадений терминов расположены на заданном расстоянии друг от друга, где расстояние измеряется количеством промежуточных слов или символов. Помимо близости, некоторые реализации могут также учитывать порядок слов, требуя, чтобы порядок слов в искомом тексте соответствовал порядку слов в поисковом запросе. Поиск по близости расширяет возможности простого сопоставления слов, добавляя условие близости и обычно считается одной из форм расширенного поиска. Например, поиск можно использовать для нахождения фразы "красный кирпичный дом", и он будет соответствовать таким фразам, как "красный дом из кирпича" или "дом, построенный из красного кирпича". Ограничивая расстояние между словами, можно находить эти фразы, избегая при этом документов, где слова разбросаны по тексту или встречаются в несвязанных статьях в сборнике.
Computer text search query functionIn text processing, a proximity search looks for documents where two or more separately matching term occurrences are within a specified distance, where distance is the number of intermediate words or characters. In addition to proximity, some implementations may also impose a constraint on the word order, in that the order in the searched text must be identical to the order of the search query. Proximity searching goes beyond the simple matching of words by adding the constraint of proximity and is generally regarded as a form of advanced search. For example, a search could be used to find "red brick house", and match phrases such as "red house of brick" or "house made of red brick". By limiting the proximity, these phrases can be matched while avoiding documents where the words are scattered or spread across a page or in unrelated articles in an anthology.
Обоснование
Основное лингвистическое предположение поиска по близости заключается в том, что близость слов в документе подразумевает наличие между ними связи. Поскольку авторы документов стремятся формулировать предложения, выражающие одну идею, или группировать связанные идеи в соседних предложениях или абзацах, в структуре документа существует естественная, относительно высокая вероятность того, что совместно используемые слова связаны между собой. Напротив, если два слова находятся на противоположных концах книги, вероятность их связи относительно невелика. Ограничение результатов поиска только теми совпадениями, в которых слова находятся на указанном максимальном расстоянии друг от друга, позволяет предположить, что эти результаты более релевантны, чем совпадения, где слова разбросаны по тексту. Коммерческие интернет-поисковые системы, как правило, выдают слишком много результатов (так называемый охват) для среднего поискового запроса. Поиск по близости – один из способов уменьшить количество найденных страниц и повысить релевантность результатов, используя близость слов для улучшения ранжирования. Кроме того, поиск по близости помогает бороться со спам-дексингом, отсеивая веб-страницы, содержащие списки слов или «дробовики» из тысяч терминов, которые в противном случае заняли бы высокие позиции, если бы поисковая система сильно ориентировалась на частоту слов.
The basic linguistic assumption of proximity searching is that the proximity of the words in a document implies a relationship between the words. Given that authors of documents try to formulate sentences which contain a single idea, or cluster of related ideas within neighboring sentences or organized into paragraphs, there is an inherent, relatively high, probability within the document structure that words used together are related. On the other hand, when two words are on the opposite ends of a book, the probability of a relationship between the words is relatively weak. By limiting search results to only include matches where the words are within the specified maximum proximity, or distance, the search results are assumed to be of higher relevance than the matches where the words are scattered. Commercial internet search engines tend to produce too many matches (known as recall) for the average search query. Proximity searching is one method of reducing the number of pages matches, and to improve the relevance of the matched pages by using word proximity to assist in ranking. As an added benefit, proximity searching helps combat spamdexing by avoiding webpages which contain dictionary lists or shotgun lists of thousands of words, which would otherwise rank highly if the search engine was heavily biased toward word frequency.
Булевой синтаксис и операторы
Обратите внимание, что поиск по близости может быть настроен таким образом, чтобы только некоторые ключевые слова находились на определенном расстоянии друг от друга. Поиск по близости можно использовать в сочетании с другими элементами синтаксиса и/или управления поиском для создания более точных запросов. Для указания ограничения по близости между ключевыми словами часто используются операторы запроса, такие как NEAR, NOT NEAR, FOLLOWED BY, NOT FOLLOWED BY, SENTENCE или FAR: например, "brick NEAR house".
Note that a proximity search can designate that only some keywords must be within a specified distance. Proximity searching can be used with other search syntax and/or controls to allow more articulate search queries. Sometimes query operators like NEAR, NOT NEAR, FOLLOWED BY, NOT FOLLOWED BY, SENTENCE or FAR are used to indicate a proximity search limit between specified keywords: for example, "brick NEAR house".