Кіріспе

Деректер қоры индексінің түрі Компьютерлік ғылымда кері индекс (осыны жарияланымдар тізімі, жарияланымдар файлы немесе кері файл деп те атайды) – мазмұннан, мысалы, сөздерден немесе сандардан, кестедегі немесе құжаттағы немесе құжаттар жиынтығындағы орналасқан жерлеріне сәйкестіктерді сақтайтын деректер қорының индексі (алға бағытталған индекспен салыстырылады, ол құжаттардан мазмұнға сәйкестіктерді ұсынады). Кері индекстің мақсаты – дерекқорға құжат қосылғанда өңдеуді күшейту есебінен толық мәтінді жылдам іздеуге мүмкіндік беру. Кері файл деректер қорының өзі болуы мүмкін, индексі емес. Бұл құжаттарды іздеу жүйелерінде қолданылатын ең танымал дерек құрылымы, мысалы, іздеу жүйелерінде кеңінен қолданылады. Сонымен қатар, ADABAS, DATACOM/DB және Model 204 сияқты бірнеше маңызды, жалпы мақсаттағы, негізгі деректерді басқару жүйелері кері тізім архитектураларын пайдаланған. Инвертті индекстердің екі негізгі түрі бар: жазба деңгейіндегі инвертті индекс (немесе инвертті файл индексі немесе жай ғана инвертті файл) әрбір сөз үшін құжаттарға сілтемелердің тізімін қамтиды. Сөз деңгейіндегі инвертті индекс (немесе толық инвертті индекс немесе инвертті тізім) құжаттағы әрбір сөздің орналасқан жерін де қамтиды. Соңғы түр көбірек мүмкіндіктер ұсынады (мысалы, сөз тіркестерін іздеу), бірақ оны құру үшін көбірек өңдеу қуаты мен жад қажет.

Қолданбалар

Инверттік индекс дерек құрылымы – әдеттегі іздеу жүйесінің индекстеу алгоритмінің орталық компоненті. Іздеу жүйесін іске асырудың мақсаты – сұраныстың жылдамдығын оңтайландыру: X сөзі қай құжаттарда кездеседі оны табу. Алға қарай индекс құрылғаннан кейін, ол әр құжаттағы сөздердің тізімдерін сақтайды, содан кейін инверттік индексті құру үшін кері индекске айналдырылады. Алға қарай индексті сұрау әрбір құжатты және сәйкес құжатты тексеру үшін әрбір сөзді тізбектеп қарауды қажет етеді. Мұндай сұранысты орындау үшін қажетті уақыт, жад және өңдеу ресурстары техникалық тұрғыдан әрқашан жеткілікті болмайды. Алға қарай индексте әр құжат бойынша сөздерді тізімдеудің орнына, инверттік индекс дерек құрылымы құрылады, ол әр сөз бойынша құжаттардың тізімін ұсынады. Инверттік индекс құрылғаннан кейін, сұранысты инверттік индекстегі сөз ID-сіне (тікелей кіру арқылы) өту арқылы шешуге болады. Компьютерлер пайда болмай тұрған кезде, маңызды кітаптарға конкорданстар қолмен жинастырылатын. Бұл, әсерлі шамада еңбек жұмсалып жасалған, кері индекстердің кішкентай түсіндірмелерімен толықтырылған нұсқасы болды. Биоинформатикада инверттік индекстер ДНҚ тізбегінің қысқа фрагменттерін біріктіруде маңызды рөл атқарады. Фрагменттің бастауын табудың бір жолы – оны анықтамалық ДНҚ тізбегімен сәйкес іздеу. ДНҚ тізбегі мен анықтамалық ДНҚ арасындағы айырмашылықтарға немесе қателіктерге байланысты туындаған шағын сәйкессіздіктерді жою үшін фрагментті кішірек фрагменттерге бөлуге болады – кем дегенде бір субфрагмент анықтамалық ДНҚ тізбегімен сәйкес келуі мүмкін. Сәйкестікті табу үшін анықтамалық ДНҚ тізбегінен белгілі бір ұзындықтағы барлық ішкі тізбектердің инверттік индексін құру қажет. Адам ДНҚ-сы 3 миллиардтан астам негіз жұбынан тұратындықтан, әр индекс үшін ДНҚ ішкі тізбегін және индекс үшін 32 биттік бүтін санды сақтау қажет болғандықтан, мұндай инверттік индекс үшін қажетті жад көлемі ондаған гигабайтқа жетеді.

Сығу

Тарихи себептерге байланысты, кері тізімдік сығыстыру және битмаптық сығыстыру жеке-жеке зерттеу бағыттары ретінде дамытылды, және кейін ғана олардың бірдей мәселені шешетіні анықталды.