Введение

Обычное слово, которое поисковые системы избегают индексировать, чтобы сэкономить время и место. Стоп-слова — это слова из стоп-листа (или списка стоп-слов, или негативного словаря), которые отфильтровываются (то есть исключаются) до или после обработки данных естественного языка (текста), поскольку считаются несущественными. Не существует единого универсального списка стоп-слов, используемого всеми инструментами обработки естественного языка, и согласованных правил для их определения; более того, не все инструменты даже используют такие списки. Поэтому для конкретной задачи можно выбрать любую группу слов в качестве стоп-слов. "Общая тенденция в системах [информационного поиска] со временем заключалась в переходе от стандартного использования довольно больших списков стоп-слов (200–300 терминов) к очень маленьким спискам (7–12 терминов) и, наконец, к полному отказу от использования списков стоп-слов".

История слов-остановки

Для создания некоторых конкордансов использовалась предшествующая концепция. Например, первый еврейский конкорданс, «Me’ir Nativ» Исаака Натана бен Калонимуса, содержал список неиндексированных слов на одной странице, включавший несущественные предлоги и союзы, аналогичные современным стоп-словам. Хансу Питеру Луну, одному из пионеров в области информационного поиска, приписывают введение этого термина и использование концепции при разработке его автоматического процесса индексирования «Ключевое слово в контексте». Фраза «stop word», отсутствующая в презентации Луна 1959 года, и связанные с ней термины «stop list» и «stoplist» появились в литературе вскоре после этого. Хотя обычно предполагается, что стоп-листы содержат только наиболее часто встречающиеся слова в языке, именно К. Дж. Ван Рисберген предложил первый стандартизированный список, не основанный на информации о частоте слов. В «списке Ван Рисбергена» было 250 английских слов. Программа стемминга слов Мартина Портера, разработанная в 1980-х годах, была основана на списке Ван Рисбергена, и список Портера теперь обычно используется в качестве стоп-листа по умолчанию во многих программных приложениях. В 1990 году Кристофер Фокс предложил первый общий стоп-лист, основанный на эмпирической информации о частоте слов, полученной из Брауновского корпуса: «В данной статье описывается эксперимент по созданию стоп-листа для общего текста на основе Брауновского корпуса, состоящего из 1 014 000 слов, взятых из широкого спектра англоязычной литературы. Мы начинаем со списка токенов, встречающихся более 300 раз в Брауновском корпусе. Из этого списка в 278 слов 32 слова исключены, поскольку они слишком важны в качестве потенциальных индексных терминов. Затем к списку добавляется 26 слов, исходя из предположения, что они могут часто встречаться в определенных видах литературы. Наконец, 149 слов добавляются в список, поскольку фильтр на основе конечного автомата, для которого предназначен этот список, может фильтровать их практически без затрат. Конечным результатом является список из 421 стоп-слова, которые должны быть максимально эффективными при фильтрации наиболее часто встречающихся и семантически нейтральных слов в общей англоязычной литературе». В терминологии SEO стоп-словами называют наиболее распространенные слова, которые многие поисковые системы игнорируют для экономии места и времени при обработке больших объемов данных во время сканирования или индексации. Для некоторых поисковых систем это одни из самых распространенных коротких служебных слов, таких как the, is, at, which и on. В этом случае стоп-слова могут вызывать проблемы при поиске фраз, содержащих их, особенно в названиях, таких как «The Who», «The The» или «Take That». Другие поисковые системы удаляют некоторые из наиболее распространенных слов — включая лексические слова, такие как «want» — из запроса для повышения производительности. В последние годы лучшие практики SEO в отношении стоп-слов развивались вместе с областями машинного обучения и обработки естественного языка. В феврале 2021 года Джон Мюллер, аналитик тенденций для веб-мастеров в Google, написал в Твиттере: «Я бы вообще не беспокоился о стоп-словах; пишите естественно. Поисковые системы смотрят на гораздо больше, чем на отдельные слова. «Быть или не быть» — это всего лишь набор стоп-слов, но одних стоп-слов недостаточно, чтобы передать его смысл».