Құжаттарды жіктеу – кітапхана, ақпарат және компьютер ғылымдарындағы маңызды мәселе. Құжаттарды санаттарға бөлудің әдістері мен зерттеулері туралы ақпарат.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Құжаттарды жіктеу процесі
Process of categorizing documents
Құжаттарды жіктеу немесе құжаттарды санатқа бөлу – кітапхана ғылымы, ақпараттық ғылым және компьютерлік ғылым салаларындағы мәселе. Міндет – құжатты бір немесе бірнеше классқа немесе санатқа жатқызу. Бұл қолмен (немесе интеллектуалды түрде) немесе алгоритмдік жолмен жасалуы мүмкін. Құжаттарды интеллектуалды жіктеу көбінесе кітапхана ғылымының құзырында болды, ал құжаттарды алгоритмдік жіктеу негізінен ақпараттық ғылым мен компьютерлік ғылымда жүзеге асырылады. Дегенмен, мәселелер өзара байланысты, сондықтан құжаттарды жіктеуді зерттейтін салааралық зерттеулер бар. Жіктеуге жататын құжаттар мәтін, сурет, музыка және т.б. болуы мүмкін. Әрбір құжат түрінің өзіне тән жіктеу мәселелері бар. Басқаша көрсетілмесе, мәтіндік жіктеу түсініледі. Құжаттар мазмұнына немесе басқа да белгілеріне (мысалы, құжат түрі, авторы, басылған жылы және т.б.) қарай жіктелуі мүмкін. Осы мақаланың қалған бөлігінде тек мазмұндық жіктеу қарастырылады. Мазмұндық жіктеудің екі негізгі философиясы бар: мазмұнға негізделген тәсіл және сұранысқа негізделген тәсіл.
Document classification or document categorization is a problem in library science, information science and computer science. The task is to assign a document to one or more classes or categories. This may be done "manually" (or "intellectually") or algorithmically. The intellectual classification of documents has mostly been the province of library science, while the algorithmic classification of documents is mainly in information science and computer science. The problems are overlapping, however, and there is therefore interdisciplinary research on document classification. The documents to be classified may be texts, images, music, etc. Each kind of document possesses its special classification problems. When not otherwise specified, text classification is implied. Documents may be classified according to their subjects or according to other attributes (such as document type, author, printing year etc.). In the rest of this article only subject classification is considered. There are two main philosophies of subject classification of documents: the content based approach and the request based approach.
"Мазмұнға негізделген" және "өтінішке негізделген" жіктеу
Мазмұнға негізделген жіктеу – құжаттағы белгілі бір тақырыптардың салмағы құжаттың қандай сыныпқа жатқызылатынын анықтайтын жіктеу түрі. Мысалы, кітапханаларда кітапты жіктеудің қалыпты ережесі – кітаптың мазмұнының кем дегенде 20% сол кітапқа тағайындалған сыныпқа қатысты болуы тиіс. Автоматты жіктеуде бұл құжаттағы белгілі бір сөздердің қайталану санымен анықталуы мүмкін. Сұранысқа бағытталған жіктеу (немесе индекстеу) – пайдаланушылардан күтілетін сұраулар құжаттардың жіктелу әдісіне әсер ететін жіктеу. Жіктеуші өзін-өзі сұрайды: «Бұл объектіні қандай сипаттамалармен табуға болады?» және «Барлық мүмкін сұрақтарды ойлап, осы объектіге қандай сұрақтар тиісті екенін анықтаңыз» (Soergel, 1985, 230-бет). Сұранысқа бағытталған жіктеу белгілі бір аудиторияға немесе пайдаланушылар тобына бағытталған жіктеу болуы мүмкін. Мысалы, феминистік зерттеулер кітапханасы немесе дерекқоры тарихи кітапханаға қарағанда құжаттарды басқаша жіктеуі мүмкін. Дегенмен, сұранысқа бағытталған жіктеуді саясатқа негізделген жіктеу ретінде қарастыру дұрыс: жіктеу белгілі бір принциптерге сәйкес жасалады және жіктеуді жүзеге асыратын кітапхананың немесе дерекқорының мақсатын көрсетеді. Осылайша, бұл міндетті түрде пайдаланушылар туралы зерттеулерге негізделген жіктеу немесе индекстеу түрі емес. Тек пайдалану немесе пайдаланушылар туралы эмпирикалық деректер қолданылған жағдайда ғана сұранысқа бағытталған жіктеу пайдаланушыға бағытталған тәсіл ретінде қарастырылуы керек.
Content based classification is classification in which the weight given to particular subjects in a document determines the class to which the document is assigned. It is, for example, a common rule for classification in libraries, that at least 20% of the content of a book should be about the class to which the book is assigned. In automatic classification it could be the number of times given words appears in a document. Request oriented classification (or indexing) is classification in which the anticipated request from users is influencing how documents are being classified. The classifier asks themself: “Under which descriptors should this entity be found?” and “think of all the possible queries and decide for which ones the entity at hand is relevant” (Soergel, 1985, p. 230). Request oriented classification may be classification that is targeted towards a particular audience or user group. For example, a library or a database for feminist studies may classify/index documents differently when compared to a historical library. It is probably better, however, to understand request oriented classification as policy based classification: The classification is done according to some ideals and reflects the purpose of the library or database doing the classification. In this way it is not necessarily a kind of classification or indexing based on user studies. Only if empirical data about use or users are applied should request oriented classification be regarded as a user based approach.
Жіктеу мен индекстеу
Кейде құжаттарды санаттарға ("классификация") бөлу және құжаттарға тақырыптарды ("тақырыптау") тағайындау арасында ерекшелік жасалады, бірақ Фредерик Уилфрид Ланкастердің пікірінше, бұл ерекшелік жемісті емес. "Бұл терминологиялық ерекшеліктер, – деп жазады ол, – мүлдем мағынасыз және тек қана шатасуға себеп болады" (Lancaster, 2003, 21 б.). Бұл ерекшелік тек сыртқы көрініс екенін көрсету үшін классификация жүйесін тезаурусқа және керісінше (қ. Aitchison, 1986, 2004; Broughton, 2008; Riesthuis & Bliedung, 1991) түрлендіру мүмкіндігі де дәлелдейді. Сондықтан, құжатты белгілеу (мысалы, бақыланатын сөздіктен термин тағайындау) – сол терминмен индекстелген құжаттар тобына құжатты жатқызумен бірдей (барлық индекстелген немесе X деп жіктелген құжаттар бір топқа жатады). Яғни, құжатты белгілеу оны сол белгімен индекстелген құжаттар тобына жатқызумен тең.
Sometimes a distinction is made between assigning documents to classes ("classification") versus assigning subjects to documents ("subject indexing") but as Frederick Wilfrid Lancaster has argued, this distinction is not fruitful. "These terminological distinctions,” he writes, “are quite meaningless and only serve to cause confusion” (Lancaster, 2003, p. 21). The view that this distinction is purely superficial is also supported by the fact that a classification system may be transformed into a thesaurus and vice versa (cf., Aitchison, 1986, 2004; Broughton, 2008; Riesthuis & Bliedung, 1991). Therefore, the act of labeling a document (say by assigning a term from a controlled vocabulary to a document) is at the same time to assign that document to the class of documents indexed by that term (all documents indexed or classified as X belong to the same class of documents). In other words, labeling a document is the same as assigning it to the class of documents indexed under that label.
Құжаттарды автоматты түрде жіктеу (ADC)
Құжаттарды автоматты түрде жіктеу міндеттерін үш түрге бөлуге болады: сыртқы бақылаумен құжаттарды жіктеу, онда кейбір сыртқы механизм (мысалы, адамның пікірі) құжаттардың дұрыс жіктелуі туралы ақпаратты ұсынады, бақылаусыз құжаттарды жіктеу (құжаттарды топтастыру деп те аталады), онда жіктеу сыртқы ақпаратқа сілтеме жасамай толығымен жүзеге асырылуы тиіс, және жартылай бақылаумен құжаттарды жіктеу, онда құжаттардың бір бөлігі сыртқы механизммен белгіленеді. Әртүрлі лицензиялық модельдер бойынша бірнеше бағдарламалық өнімдер қолжетімді.
Automatic document classification tasks can be divided into three sorts: supervised document classification where some external mechanism (such as human feedback) provides information on the correct classification for documents, unsupervised document classification (also known as document clustering), where the classification must be done entirely without reference to external information, and semi supervised document classification, where parts of the documents are labeled by the external mechanism. There are several software products under various license models available.