Кіріспе

Құжаттарды іздеу – белгілі бір пайдаланушы сұранысын еркін мәтіндік жазбалар жиынтығымен сәйкестендіру деп анықталады. Бұл жазбалар газет мақалалары, жылжымайтын мүлік туралы мәліметтер немесе нұсқаулықтардағы абзацтар сияқты, көбінесе құрылымдалмаған мәтіннің кез келген түрі болуы мүмкін. Пайдаланушы сұраныстары ақпараттық қажеттіліктің толық сипаттамасынан, бірнеше сөйлемнен бастап, немесе бірнеше сөзден ғана тұруы мүмкін. Құжаттарды іздеу кейде мәтінді іздеу деп те аталады, немесе мәтінді іздеудің бір саласы болып табылады. Мәтінді іздеу – ақпаратты іздеудің саласы, онда ақпарат негізінен мәтін түрінде сақталады. Мәтіндік деректер базалары жеке компьютерлердің пайда болуының арқасында орталықтандырылмаған жүйеге көшті. Мәтінді іздеу бүгінде маңызды зерттеу саласы болып табылады, себебі ол барлық интернет іздеу жүйелерінің негізгі құралы болып табылады.

Вариациялар

Құжаттарды іздеу жүйелері үшін индекстеу схемаларының екі негізгі түрі бар: формаға (немесе сөзге) негізделген және мазмұнына негізделген индекстеу. Қолданылып жатқан құжат жіктеу схемасы (немесе индекстеу алгоритмі) құжатты іздеу жүйесінің қызметін анықтайды.

Нысан негізінде

Нысанға негізделген құжатты іздеу мәтіннің нақты синтаксистік ерекшеліктерін қарастырады, бұл жол іздеудегі үзінділерді сәйкестендіруге ұқсас. Мәтін көбінесе құрылымдалмаған және міндетті түрде табиғи тілде болмайды, мысалы, жүйе молекулалық биологиядағы химиялық формулалардың үлкен жиынтығын өңдеуге қолданылуы мүмкін. Суффикс ағашы алгоритмі – нысанға негізделген индекстеудің бір мысалы.

Мазмұнға негізделген

Мазмұнға негізделген тәсіл құжаттар мен олардың бөліктері арасындағы семантикалық байланыстарды, сондай-ақ сұранымдар мен құжаттар арасындағы семантикалық байланыстарды пайдаланады. Көптеген мазмұнға негізделген құжаттарды іздеу жүйелері инверттік индекс алгоритмін қолданады. Қолтаңба файлы – бұл жылдам, бірақ шамалы дәлдіктегі сүзгі, мысалы, Bloom сүзгісі, ол сұранысқа сәйкес келетін барлық құжаттарды, және мүмкін, сәйкес келмейтін кейбір құжаттарды да сақтайды. Бұл әрбір файл үшін қолтаңба жасау арқылы іске асырылады, әдетте, хэштелген түрде. Бір әдіс – үстіне жабылатын кодтау. Қате дабылдарды (false alarms) жою үшін қосымша өңдеу қадамы жасалады. Көп жағдайларда бұл құрылым жылдамдық, көлем және функционалдық тұрғысынан инверттік файлдардан нашар болғандықтан, кеңінен қолданылмайды. Дегенмен, дұрыс параметрлер таңдалған жағдайда, ол белгілі бір жағдайларда инверттік файлдардан артық болуы мүмкін.

Мысал: PubMed

PubMed формасы интерфейсінде "байланысты мақалалар" іздеуі бар, ол құжаттардың тақырыбындағы, аннотациясындағы және MeSH терминдеріндегі сөздерді сөз салмағын ескеретін алгоритм арқылы салыстыру негізінде жұмыс істейді.