Кіріспе

Құжаттардың толық мәтінін қолданып іздеу – мәтін іздеу кезінде толық мәтіндік деректер базасында компьютерде сақталған жеке құжатты немесе құжаттар жиынтығын іздеу техникаларын білдіреді. Толық мәтіндік іздеу, деректер базасында ұсынылған түпнұсқа мәтіндердің бөліктеріне (мысалы, тақырыптар, аннотациялар, таңдалған бөлімдер немесе библиографиялық сілтемелер) немесе метадеректерге негізделген іздеулерден өзгеше. Толық мәтіндік іздеу кезінде іздеу жүйесі, іздеу критерийлеріне (мысалы, пайдаланушы енгізген мәтінге) сәйкес келуге тырысып, сақталған әрбір құжаттағы барлық сөздерді тексеріп шығады. Толық мәтіндік іздеу техникалары 1960 жылдары пайда болды, мысалы, 1969 жылдан бастап IBM STAIRS, және 1990 жылдары онлайн библиографиялық деректер базаларында кеңінен қолданыс тапты. Көптеген веб-сайттар мен қолданба бағдарламалары (мысалы, мәтін өңдеу бағдарламалық құралы) толық мәтіндік іздеу мүмкіндіктерін ұсынады. Кейбір веб-іздеу жүйелері, мысалы, бұрынғы AltaVista, толық мәтіндік іздеу техникаларын пайдаланады, ал басқалары өздерінің индекстеу жүйелері қараған веб-беттердің тек бір бөлігін ғана индекстейді.

Индекстеу

Кішкене сандағы құжаттармен жұмыс істегенде, толық мәтіндік іздеу жүйесі әр сұраныс бойынша құжаттардың мазмұнын тікелей сканерлеуі мүмкін, бұл "тізбекті сканерлеу" деп аталатын стратегия. grep сияқты кейбір құралдар іздеу кезінде осылай істейді. Дегенмен, іздеуге арналған құжаттар саны үлкен болған жағдайда немесе іздеу сұраныстарының саны көп болғанда, толық мәтіндік іздеу мәселесі көбінесе екі тапсырмаға бөлінеді: индекстеу және іздеу. Индекстеу кезеңінде барлық құжаттардың мәтіні сканерленіп, іздеу терминдерінің тізімі құрылады (көбінесе индекс деп аталады, бірақ дұрысы конкорданс деп аталады). Іздеу кезеңінде нақты сұранысты орындау кезінде түпнұсқа құжаттардың мәтініне емес, тек индекске жүгініледі. Индекстеуші құжатта табылған әрбір термин немесе сөз үшін индекске жазба жасайды және мүмкін болса, құжат ішіндегі оның орнын көрсетеді. Әдетте, индекстеуші іздеуде пайдалы болмайтын, жиі кездесетін және мағынасы аз сөздерді (мысалы, "the" және "and" сияқты) елемейді. Кейбір индекстеушілер индекстелетін сөздерге тілдік тамырлауды (stemming) да қолданады. Мысалы, "drives", "drove" және "driven" сөздері индекске "drive" деген түбір сөзбен жазылады.

Дәлдік пен қайта шақырудың арақатынасы

Еске алу іздеу нәтижесінде кері қайтарылған тиісті нәтижелердің санын өлшейді, ал дәлдік – кері қайтарылған нәтижелердің сапасын. Еске алу – кері қайтарылған тиісті нәтижелердің барлық тиісті нәтижелерге қатынасы. Дәлдік – кері қайтарылған тиісті нәтижелер санының кері қайтарылған нәтижелердің жалпы санына қатынасы. Оң жақтағы диаграмма төмен дәлдікті және төмен еске алуды көрсетеді. Диаграммадағы қызыл және жасыл нүктелер белгілі бір іздеу үшін мүмкін болатын іздеу нәтижелерінің жалпы санын көрсетеді. Қызыл нүктелер тиісті емес нәтижелерді, ал жасыл нүктелер тиісті нәтижелерді білдіреді. Іздеу нәтижелерінің ішкі шеңбердің ортасына жақындығы олардың тиістілігін көрсетеді. Кері қайтарылған барлық мүмкін нәтижелер ашық көк түсті фонда көрсетілген. Мысалда, 3 мүмкін тиісті нәтижеден тек 1-і ғана кері қайтарылды, сондықтан еске алу өте төмен, 1/3 немесе 33% құрайды. Мысал үшін дәлдік те өте төмен, 1/4 немесе 25% құрайды, себебі кері қайтарылған 4 нәтижеден тек 1-і ғана тиісті болды. Табиғи тілдің көп мағыналылығына байланысты, толық мәтінді іздеу жүйелері әдетте дәлдікті арттыру үшін тоқтату сөздері және еске алуды арттыру үшін түбірге дейін талдау сияқты опцияларды қамтиды. Бақыланатын сөздіктерді пайдалану да тиісті емес мәселелерді шешуге көмектеседі, себебі құжаттарды осылайша белгілеу арқылы көп мағыналылық жойылады. Дәлдік пен еске алу арасындағы қарым-қатынас қарапайым: дәлдіктің жоғарылауы жалпы еске алуды төмендетуі мүмкін, ал еске алудың жоғарылауы дәлдікті төмендетеді.

Жалған оңдылық проблемасы

Толық мәтіндік іздеу көптеген қатысы жоқ құжаттарды табуы мүмкін. Мұндай құжаттар жалған оң нәтижелер деп аталады (I типтегі қателіктерді қараңыз). Қатысы жоқ құжаттарды табу көбінесе табиғи тілдің мәнділігімен байланысты. Оң жақтағы мысал диаграммасында жалған оң нәтижелер іздеу нәтижесінде алынған маңызсыз нәтижелермен (қызыл нүктелермен) көрсетілген (ақшыл көк түсті фонда). Бейес алгоритмдеріне негізделген кластерлеу техникалары жалған оң нәтижелерді азайтуға көмектеседі. Мысалы, "банк" деген сөзді іздеу кезінде кластерлеу құжаттар/деректер жиынтығын "қаржы мекемесі", "отыруға арналған орын", "сақтау орны" сияқты санаттарға бөлуге болады. Санаттарға қатысты сөздердің жиілігіне байланысты іздеу сөзі немесе іздеу нәтижесі бір немесе бірнеше санатқа орналастырылуы мүмкін. Бұл техника электрондық ашу саласында кеңінен қолданылады.

Жүзеге асыруды жақсарту

Толық мәтіндік іздеудің кемшіліктері екі тәсілмен шешілді: пайдаланушыларға іздеу сауалдарын дәлдеуге мүмкіндік беретін құралдар ұсыну арқылы және іздеу нәтижелерінің дәлдігін арттыратын жаңа іздеу алгоритмдерін жасау арқылы.

Іздеу алгоритмдерінің жетілдірілуі

Google әзірлеген PageRank алгоритмі басқа веб-беттер сілтеме берген құжаттарды көбірек көзге шығарады. Қосымша мысалдар үшін іздеу жүйесіне қараңыз.

Бағдарламалық жасақтама

Төменде толық мәтінді индекстеу және іздеуге арналған қолданылатын бағдарламалық өнімдердің ішінара тізімі келтірілген. Олардың кейбіреулері жұмыс істеу принципінің немесе ішкі алгоритмдерінің толық сипаттамаларымен қоса берілген, бұл толық мәтінді іздеу қалай жүзеге асырылатыны туралы қосымша мәлімет береді.