Кіріспе

Іздеу жүйелері уақытты және жадты үнемдеу үшін индекстеуден жалғыз қалдыратын жиі кездесетін сөздер. Тоқтату сөздері – бұл тоқтату тізіміндегі (немесе тоқтату тізімі немесе теріс сөздіктегі) сөздер, олар табиғи тілдік деректерді (мәтінді) өңдеу алдында немесе кейін сүзіліп шығарылады (яғни тоқтатылады), себебі олар маңызды емес деп есептеледі. Барлық табиғи тілді өңдеу құралдарында қолданылатын жалғыз әмбебап тоқтату сөздерінің тізімі жоқ, сондай-ақ тоқтату сөздерін анықтау үшін келісілген ережелер де жоқ, тіпті кейбір құралдар мұндай тізімді қолданбайды. Сондықтан, кез келген сөздер тобы белгілі бір мақсат үшін тоқтату сөздері ретінде таңдалуы мүмкін. "[Ақпаратты іздеу] жүйелеріндегі бақыланатын үрдіс – үлкен тоқтату тізімдерін (200-300 термин) стандартты түрде қолданудан бастап, өте кішкентай тоқтату тізімдеріне (7-12 термин) және тіпті тоқтату тізімін қолданбауға дейін жетті".

Тоқтату сөздерінің тарихы

Кейбір конкорданстарды құруда бұрынғы түсінік пайдаланылды. Мысалы, алғашқы еврей конкордансы, Исаак Натан бен Калонимустың «Меир Nativ» кітабында бір беттік, индекстелмеген сөздердің тізімі болды, онда қазіргі заманғы тоқтату сөздеріне ұқсас, мағыналық емес алғы сөздер мен қосымшалар бар еді. Ақпаратты іздеу саласындағы пионерлердің бірі Ханс Петер Лун осы терминді ойлап тапты және өзінің «Контексттегі кілт сөз» автоматты индекстеу процесін енгізген кезде осы ұғымды қолданды. 1959 жылғы Лунның баяндамасында кездеспейтін «stop word» термині және оған байланысты «stop list» және «stoplist» терминдері кейін әдебиетте пайда болды. Көптеген адамдар тоқтату тізімдері тек тілдегі ең жиі кездесетін сөздерді қамтиды деп есептесе де, С. Дж. Ван Рижберген сөз жиілігі туралы ақпаратқа негізделмеген алғашқы стандартталған тізімді ұсынды. «Ван тізіміне» 250 ағылшын сөзі енді. Мартин Портердің 1980-ші жылдардағы сөз түбірін анықтау бағдарламасы Ван тізіміне негізделген, ал Портер тізімі қазір түрлі бағдарламалық қамтамасыздарда әдепкі тоқтату тізімі ретінде кеңінен қолданылады. 1990 жылы Кристофер Фокс Браун корпусынан алынған эмпирикалық сөз жиілігі туралы ақпаратқа негізделген алғашқы жалпы тоқтату тізімін ұсынды: Бұл мақалада ағылшын тіліндегі әдебиеттің кең ауқымынан алынған 1,014,000 сөзден тұратын Браун корпусына негізделген жалпы мәтін үшін тоқтату тізімін жасау туралы тәжірибе баяндалған. Біз Браун корпусында 300-ден астам рет кездесетін сөздердің тізімінен бастаймыз. 278 сөзден тұратын тізімнен 32 сөз индекстеу үшін тым маңызды деп танылды және алынып тасталды. Содан кейін тізімге 26 сөз қосылды, себебі олар әдебиеттің белгілі бір түрлерінде жиі кездеседі. Соңында, тізімге 149 сөз қосылды, өйткені осы тізімді пайдалануға арналған автоматты сүзгі оларды өте төмен құнмен сүзе алады. Соңғы өнім – 421 тоқтату сөзінен тұратын тізім, ол ағылшын тіліндегі жалпы әдебиеттегі ең көп кездесетін және семантикалық бейтарап сөздерді сүзуде максималды тиімділік пен нәтижелілікке ие болуға тиіс. SEO терминологиясында тоқтату сөздері – іздеу жүйелерінің көпшілігі іздеу немесе индекстеу кезінде үлкен деректерді өңдеу кезінде орын мен уақытты үнемдеу үшін назардан тыс қалдыратын ең көп таралған сөздер. Кейбір іздеу жүйелері үшін бұл ең көп таралған, қысқа функциялық сөздер, мысалы, the, is, at, which және on. Мұндай жағдайда, тоқтату сөздер оларды қамтитын сөз тіркестерін іздеу кезінде қиындықтар тудыруы мүмкін, әсіресе «The Who», «The The» немесе «Take That» сияқты аттарда. Басқа іздеу жүйелері өнімділікті арттыру үшін «want» сияқты лексикалық сөздерді қоса, кейбір ең көп кездесетін сөздерді сұраныстан алып тастайды. Соңғы жылдары SEO-ның ең жақсы тәжірибелері машиналық оқыту және табиғи тілді өңдеу салаларымен бірге тоқтату сөздерімен бірге дамыды. 2021 жылдың ақпан айында Google-дың Webmaster Trends Analyst Джон Мюллер «Твиттерде» былай деп жазды: «Мен тоқтату сөздері туралы мүлдем уайымдамас едім; табиғи түрде жазыңыз. Іздеу жүйелері жеке сөздерден гөрі әлдеқайда көп нәрсені қарастырады. «Болу немесе болмау» – бұл тек тоқтату сөздерінің жиынтығы, бірақ тоқтату сөздері оған әділдік етпейді».