Введение
Обычное слово, которое поисковые системы избегают индексировать, чтобы сэкономить время и место. Стоп-слова — это слова из стоп-листа (или списка стоп-слов, или негативного словаря), которые отфильтровываются (то есть исключаются) до или после обработки данных естественного языка (текста), поскольку считаются несущественными. Не существует единого универсального списка стоп-слов, используемого всеми инструментами обработки естественного языка, и согласованных правил для их определения; более того, не все инструменты даже используют такие списки. Поэтому для конкретной задачи можно выбрать любую группу слов в качестве стоп-слов. "Общая тенденция в системах [информационного поиска] со временем заключалась в переходе от стандартного использования довольно больших списков стоп-слов (200–300 терминов) к очень маленьким спискам (7–12 терминов) и, наконец, к полному отказу от использования списков стоп-слов".
Stop words are the words in a stop list (or stoplist or negative dictionary) which are filtered out (i. e. stopped) before or after processing of natural language data (text) because they are deemed insignificant. There is no single universal list of stop words used by all natural language processing tools, nor any agreed upon rules for identifying stop words, and indeed not all tools even use such a list. Therefore, any group of words can be chosen as the stop words for a given purpose. The "general trend in [information retrieval] systems over time has been from standard use of quite large stop lists (200–300 terms) to very small stop lists (7–12 terms) to no stop list whatsoever".
История слов-остановки
Для создания некоторых конкордансов использовалась предшествующая концепция. Например, первый еврейский конкорданс, «Me’ir Nativ» Исаака Натана бен Калонимуса, содержал список неиндексированных слов на одной странице, включавший несущественные предлоги и союзы, аналогичные современным стоп-словам. Хансу Питеру Луну, одному из пионеров в области информационного поиска, приписывают введение этого термина и использование концепции при разработке его автоматического процесса индексирования «Ключевое слово в контексте». Фраза «stop word», отсутствующая в презентации Луна 1959 года, и связанные с ней термины «stop list» и «stoplist» появились в литературе вскоре после этого. Хотя обычно предполагается, что стоп-листы содержат только наиболее часто встречающиеся слова в языке, именно К. Дж. Ван Рисберген предложил первый стандартизированный список, не основанный на информации о частоте слов. В «списке Ван Рисбергена» было 250 английских слов. Программа стемминга слов Мартина Портера, разработанная в 1980-х годах, была основана на списке Ван Рисбергена, и список Портера теперь обычно используется в качестве стоп-листа по умолчанию во многих программных приложениях. В 1990 году Кристофер Фокс предложил первый общий стоп-лист, основанный на эмпирической информации о частоте слов, полученной из Брауновского корпуса: «В данной статье описывается эксперимент по созданию стоп-листа для общего текста на основе Брауновского корпуса, состоящего из 1 014 000 слов, взятых из широкого спектра англоязычной литературы. Мы начинаем со списка токенов, встречающихся более 300 раз в Брауновском корпусе. Из этого списка в 278 слов 32 слова исключены, поскольку они слишком важны в качестве потенциальных индексных терминов. Затем к списку добавляется 26 слов, исходя из предположения, что они могут часто встречаться в определенных видах литературы. Наконец, 149 слов добавляются в список, поскольку фильтр на основе конечного автомата, для которого предназначен этот список, может фильтровать их практически без затрат. Конечным результатом является список из 421 стоп-слова, которые должны быть максимально эффективными при фильтрации наиболее часто встречающихся и семантически нейтральных слов в общей англоязычной литературе». В терминологии SEO стоп-словами называют наиболее распространенные слова, которые многие поисковые системы игнорируют для экономии места и времени при обработке больших объемов данных во время сканирования или индексации. Для некоторых поисковых систем это одни из самых распространенных коротких служебных слов, таких как the, is, at, which и on. В этом случае стоп-слова могут вызывать проблемы при поиске фраз, содержащих их, особенно в названиях, таких как «The Who», «The The» или «Take That». Другие поисковые системы удаляют некоторые из наиболее распространенных слов — включая лексические слова, такие как «want» — из запроса для повышения производительности. В последние годы лучшие практики SEO в отношении стоп-слов развивались вместе с областями машинного обучения и обработки естественного языка. В феврале 2021 года Джон Мюллер, аналитик тенденций для веб-мастеров в Google, написал в Твиттере: «Я бы вообще не беспокоился о стоп-словах; пишите естественно. Поисковые системы смотрят на гораздо больше, чем на отдельные слова. «Быть или не быть» — это всего лишь набор стоп-слов, но одних стоп-слов недостаточно, чтобы передать его смысл».