Кіріспе
Деректер қоры индексінің түрі Компьютерлік ғылымда кері индекс (осыны жарияланымдар тізімі, жарияланымдар файлы немесе кері файл деп те атайды) – мазмұннан, мысалы, сөздерден немесе сандардан, кестедегі немесе құжаттағы немесе құжаттар жиынтығындағы орналасқан жерлеріне сәйкестіктерді сақтайтын деректер қорының индексі (алға бағытталған индекспен салыстырылады, ол құжаттардан мазмұнға сәйкестіктерді ұсынады). Кері индекстің мақсаты – дерекқорға құжат қосылғанда өңдеуді күшейту есебінен толық мәтінді жылдам іздеуге мүмкіндік беру. Кері файл деректер қорының өзі болуы мүмкін, индексі емес. Бұл құжаттарды іздеу жүйелерінде қолданылатын ең танымал дерек құрылымы, мысалы, іздеу жүйелерінде кеңінен қолданылады. Сонымен қатар, ADABAS, DATACOM/DB және Model 204 сияқты бірнеше маңызды, жалпы мақсаттағы, негізгі деректерді басқару жүйелері кері тізім архитектураларын пайдаланған. Инвертті индекстердің екі негізгі түрі бар: жазба деңгейіндегі инвертті индекс (немесе инвертті файл индексі немесе жай ғана инвертті файл) әрбір сөз үшін құжаттарға сілтемелердің тізімін қамтиды. Сөз деңгейіндегі инвертті индекс (немесе толық инвертті индекс немесе инвертті тізім) құжаттағы әрбір сөздің орналасқан жерін де қамтиды. Соңғы түр көбірек мүмкіндіктер ұсынады (мысалы, сөз тіркестерін іздеу), бірақ оны құру үшін көбірек өңдеу қуаты мен жад қажет.
In computer science, an inverted index (also referred to as a postings list, postings file, or inverted file) is a database index storing a mapping from content, such as words or numbers, to its locations in a table, or in a document or a set of documents (named in contrast to a forward index, which maps from documents to content). The purpose of an inverted index is to allow fast full text searches, at a cost of increased processing when a document is added to the database. The inverted file may be the database file itself, rather than its index. It is the most popular data structure used in document retrieval systems, used on a large scale for example in search engines. Additionally, several significant general purpose mainframe based database management systems have used inverted list architectures, including ADABAS, DATACOM/DB, and Model 204. There are two main variants of inverted indexes: A record level inverted index (or inverted file index or just inverted file) contains a list of references to documents for each word. A word level inverted index (or full inverted index or inverted list) additionally contains the positions of each word within a document. The latter form offers more functionality (like phrase searches), but needs more processing power and space to be created.
Қолданбалар
Инверттік индекс дерек құрылымы – әдеттегі іздеу жүйесінің индекстеу алгоритмінің орталық компоненті. Іздеу жүйесін іске асырудың мақсаты – сұраныстың жылдамдығын оңтайландыру: X сөзі қай құжаттарда кездеседі оны табу. Алға қарай индекс құрылғаннан кейін, ол әр құжаттағы сөздердің тізімдерін сақтайды, содан кейін инверттік индексті құру үшін кері индекске айналдырылады. Алға қарай индексті сұрау әрбір құжатты және сәйкес құжатты тексеру үшін әрбір сөзді тізбектеп қарауды қажет етеді. Мұндай сұранысты орындау үшін қажетті уақыт, жад және өңдеу ресурстары техникалық тұрғыдан әрқашан жеткілікті болмайды. Алға қарай индексте әр құжат бойынша сөздерді тізімдеудің орнына, инверттік индекс дерек құрылымы құрылады, ол әр сөз бойынша құжаттардың тізімін ұсынады. Инверттік индекс құрылғаннан кейін, сұранысты инверттік индекстегі сөз ID-сіне (тікелей кіру арқылы) өту арқылы шешуге болады. Компьютерлер пайда болмай тұрған кезде, маңызды кітаптарға конкорданстар қолмен жинастырылатын. Бұл, әсерлі шамада еңбек жұмсалып жасалған, кері индекстердің кішкентай түсіндірмелерімен толықтырылған нұсқасы болды. Биоинформатикада инверттік индекстер ДНҚ тізбегінің қысқа фрагменттерін біріктіруде маңызды рөл атқарады. Фрагменттің бастауын табудың бір жолы – оны анықтамалық ДНҚ тізбегімен сәйкес іздеу. ДНҚ тізбегі мен анықтамалық ДНҚ арасындағы айырмашылықтарға немесе қателіктерге байланысты туындаған шағын сәйкессіздіктерді жою үшін фрагментті кішірек фрагменттерге бөлуге болады – кем дегенде бір субфрагмент анықтамалық ДНҚ тізбегімен сәйкес келуі мүмкін. Сәйкестікті табу үшін анықтамалық ДНҚ тізбегінен белгілі бір ұзындықтағы барлық ішкі тізбектердің инверттік индексін құру қажет. Адам ДНҚ-сы 3 миллиардтан астам негіз жұбынан тұратындықтан, әр индекс үшін ДНҚ ішкі тізбегін және индекс үшін 32 биттік бүтін санды сақтау қажет болғандықтан, мұндай инверттік индекс үшін қажетті жад көлемі ондаған гигабайтқа жетеді.
Сығу
Тарихи себептерге байланысты, кері тізімдік сығыстыру және битмаптық сығыстыру жеке-жеке зерттеу бағыттары ретінде дамытылды, және кейін ғана олардың бірдей мәселені шешетіні анықталды.