Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Білімді ұйымдастыру әдісі
Method of organizing knowledge
Бақыланатын сөздіктер білімді кейіннен іздеу үшін ұйымдастыру тәсілін ұсынады. Олар тақырыптық индекстеу жүйелерінде, тақырыптар тізімінде, тезаурустарда, таксономияларда және басқа да білімді ұйымдастыру жүйелерінде қолданылады. Бақыланатын сөздіктер жүйелері схеманың авторлары алдын ала таңдаған, белгіленген, басымдық берілген терминдерді қолдануды міндеттейді, бұл табиғи тілдегі сөздіктерден өзгеше, оларда мұндай шектеулер жоқ.
Controlled vocabularies provide a way to organize knowledge for subsequent retrieval. They are used in subject indexing schemes, subject headings, thesauri, taxonomies and other knowledge organization systems. Controlled vocabulary schemes mandate the use of predefined, preferred terms that have been preselected by the designers of the schemes, in contrast to natural language vocabularies, which have no such restriction.
Кітапхана және ақпараттану саласында
Кітапхана және ақпараттық ғылымда бақыланатын сөздік – ақпараттық бірліктерді (құжат немесе жұмыс) іздеу арқылы оңай табуға мүмкіндік беретін, мұқият таңдалған сөздер мен тіркестердің тізімі. Бақыланатын сөздіктер гомографтар, синонимдер және полисемия мәселелерін ұғымдар мен басымдық берілген терминдер арасындағы бір-бірге сәйкестік арқылы шешеді. Қысқасы, бақыланатын сөздіктер бір ұғымға әртүрлі атаулар берілуінен туындайтын қажетсіз беймаздықтарды азайтады және тұрақтылықты қамтамасыз етеді. (Бақыланатын сөздікті пайдаланатын тақырыптар жүйесінде) басымдық берілген терминдер – осы жағдайда тақырыптар – бір сөздің әртүрлі жазылуы (американдық және британдық нұсқалары), ғылыми және көп қолданылатын терминдер (тарақан және Periplaneta americana), сондай-ақ синонимдер (автомобиль және көлік) сияқты қиын мәселелерді шешу үшін таңдалуы керек. Басымдық берілген терминдерді таңдау пайдаланушының қажеттілігі (пайдаланушылар қандай терминдерді қолдануы мүмкін), әдебиеттік қажеттілігі (әдебиетте және құжаттарда қандай терминдер жиі қолданылады) және құрылымдық қажеттілігі (бақыланатын сөздіктің құрылымы мен көлемін ескере отырып таңдалған терминдер) принциптеріне негізделеді. Бақыланатын сөздіктер гомографтар мәселесін анықтаушылармен шешуге де көмектеседі. Мысалы, "бассейн" термині жүзу бассейнін немесе ойын бассейнін білдіру үшін нақтылануы керек, осылайша әрбір басымдық берілген термин немесе тақырып тек бір ұғымды көрсетеді.
In library and information science, controlled vocabulary is a carefully selected list of words and phrases, which are used to tag units of information (document or work) so that they may be more easily retrieved by a search. Controlled vocabularies solve the problems of homographs, synonyms and polysemes by a bijection between concepts and preferred terms. In short, controlled vocabularies reduce unwanted ambiguity inherent in normal human languages where the same concept can be given different names and ensure consistency. (a subject heading system that uses a controlled vocabulary), preferred terms—subject headings in this case—have to be chosen to handle choices between variant spellings of the same word (American versus British), choice among scientific and popular terms (cockroach versus Periplaneta americana), and choices between synonyms (automobile versus car), among other difficult issues. Choices of preferred terms are based on the principles of user warrant (what terms users are likely to use), literary warrant (what terms are generally used in the literature and documents), and structural warrant (terms chosen by considering the structure, scope of the controlled vocabulary). Controlled vocabularies also typically handle the problem of homographs with qualifiers. For example, the term pool has to be qualified to refer to either swimming pool or the game pool to ensure that each preferred term or heading refers to only one concept.
Кітапханаларда қолданылатын типтер
Кітапханаларда қолданылатын бақыланатын сөздік құралдарының екі негізгі түрі бар: тақырыптық атаулар және тезаурустар. Екі түрдің арасындағы айырмашылықтар азайып бара жатқанмен, әлі де шағын ерекшеліктер бар. Тарихи тұрғыдан алғанда, тақырыптық атаулар кітапхана каталогтарында кітаптарды сипаттау үшін каталогтаушылармен, ал тезаурустар құжаттар мен мақалаларға кіріспе терминдерді тағайындау үшін индекстеушілермен қолданылды. Тақырыптық атаулар көбінесе кең ауқымды болып, тұтас кітаптарды сипаттайды, ал тезаурустар көбінесе мамандандырылған, өте нақты салаларды қамтиды. Карталық каталог жүйесінің салдарынан тақырыптық атауларда тікелей емес реттегі терминдер жиі кездеседі (бірақ автоматтандырылған жүйелердің пайда болуымен бұл кемітілуде), ал тезаурустардағы терминдер әрқашан тікелей ретте болады. Тақырыптық атаулар терминдерді алдын ала үйлестіруге бейім, яғни бақыланатын сөздіктің авторы әртүрлі ұғымдарды біріктіріп, бір таңдалған тақырыптық атауды құрайды (мысалы, балалар және терроризм), ал тезаурустар көбінесе жеке тікелей терминдерді қолданады. Тезаурустар тек эквивалентті терминдерді ғана емес, сонымен қатар тар, кең және қатысты терминдерді, әртүрлі басым және басым емес (бірақ синонимді болуы мүмкін) терминдердің арасында да тізімдейді, ал тарихи тұрғыдан алғанда, көптеген тақырыптық атауларда мұндай мүмкіндік болмады. Мысалы, Конгресс кітапханасының тақырыптық атаулары 1943 жылға дейін жеткілікті синдетикалық құрылымға ие болмады, ал 1985 жылға дейін ғана «Кең термин» және «Тар термин» сияқты тезаурусқа тән терминдерді қабылдай бастады. Терминдерді білікті мамандар (кітапханашылар мен ақпараттану ғалымдары сияқты) таңдап, ұйымдастырады, олар берілген сала бойынша білімі бар. Бақыланатын сөздік терминдері құжаттың мәтінінде кездеспесе де, құжаттың мазмұнын дәл сипаттауға мүмкіндік береді. Белгілі тақырыптық атаулар жүйелеріне Конгресс кітапханасы жүйесі, АҚШ Ұлттық медицина кітапханасы жасаған Медициналық тақырыптар (MeSH) және Sears жүйесі жатады. Белгілі тезаурустарға «Көркем өнер және сәулет» және ERIC тезаурусы кіреді. Бақыланатын сөздік үшін терминдерді таңдағанда, дизайнер таңдалған терминнің ерекшелігін, тікелей енгізуді пайдалануды, тілдің өзара сәйкестігі мен тұрақтылығын ескеруі керек. Соңында, жүйедегі алдын ала үйлестіру деңгейі (осы жағдайда санау мен синтез арасындағы қатынас маңызды) және кейін үйлестіру де маңызды мәселе болып табылады. Құжаттардың мазмұнын анықтау процесіне көмектесу үшін тегтер ретінде қолданылатын бақыланатын сөздік элементтері (терминдер/фразалар) немесе басқа ақпараттық жүйе элементтері (мысалы, СҚДБ, веб-қызметтер) метадеректер болып саналады.
There are two main kinds of controlled vocabulary tools used in libraries: subject headings and thesauri. While the differences between the two are diminishing, there are still some minor differences. Historically, subject headings were designed to describe books in library catalogs by catalogers while thesauri were used by indexers to apply index terms to documents and articles. Subject headings tend to be broader in scope describing whole books, while thesauri tend to be more specialized covering very specific disciplines. Because of the card catalog system, subject headings tend to have terms that are in indirect order (though with the rise of automated systems this is being removed), while thesaurus terms are always in direct order. Subject headings tend to use more pre coordination of terms such that the designer of the controlled vocabulary will combine various concepts together to form one preferred subject heading. (e. g., children and terrorism) while thesauri tend to use singular direct terms. Thesauri list not only equivalent terms but also narrower, broader terms and related terms among various preferred and non preferred (but potentially synonymous) terms, while historically most subject headings did not. For example, the Library of Congress Subject Heading itself did not have much syndetic structure until 1943, and it was not until 1985 when it began to adopt the thesauri type term "Broader term" and "Narrow term". The terms are chosen and organized by trained professionals (including librarians and information scientists) who possess expertise in the subject area. Controlled vocabulary terms can accurately describe what a given document is actually about, even if the terms themselves do not occur within the document's text. Well known subject heading systems include the Library of Congress system, Medical Subject Headings (MeSH) created by the United States National Library of Medicine, and Sears. Well known thesauri include the Art and Architecture Thesaurus and the ERIC Thesaurus. When selecting terms for a controlled vocabulary, the designer has to consider the specificity of the term chosen, whether to use direct entry, inter consistency and stability of the language. Lastly the amount of pre coordination (in which case the degree of enumeration versus synthesis becomes an issue) and post coordination in the system is another important issue. Controlled vocabulary elements (terms/phrases) employed as tags, to aid in the content identification process of documents, or other information system entities (e. g. DBMS, Web Services) qualifies as metadata.
Артықшылықтар
Бақыланатын сөздіктер еркін мәтіндік іздеудің дәлдігін арттырады деп жиі айтылады, мысалы, іздеу нәтижелері тізіміндегі қатысы жоқ элементтерді азайту үшін. Бұл қатысы жоқ элементтер (жалған оң нәтижелер) көбінесе табиғи тілдің мәнділігіне байланысты туындайды. Мысалы, "футбол" деген сөзді қарастырайық. Футбол – бірнеше түрлі командалық спорттың атауы. Әлем бойынша осы командалық спорт түрлерінің ең танымал түрі – футбол, ал кейбір елдерде ол "соққыр" деп те аталады. "Футбол" сөзі регби футболына (регби одағы және регби лигасы), американдық футболға, австралиялық футболға, гэль футболға және канадалық футболға да қолданылады. Сондықтан, "футбол" сөзімен іздеу нәтижесінде бірнеше мүлдем басқа спорт түрлері туралы құжаттар табылады. Бақыланатын сөздік бұл мәселені құжаттарды осылайша таңбалау арқылы шешеді, осылайша мәнділік жойылады. Егер өнімділік дәлдікпен өлшенсе (іздеу нәтижелері тізіміндегі іздеу тақырыбына қатысты құжаттардың пайызы), бақыланатын сөздіктерді пайдалану еркін мәтіндік іздеумен салыстырғанда ақпараттық іздеу жүйесінің тиімділігін едәуір арттыра алады. Кейбір жағдайларда бақыланатын сөздіктер есте сақтау қабілетін де жақсарта алады, себебі табиғи тіл схемаларынан айырмашылығы, дұрыс таңдалған термин ізделгеннен кейін, осы терминнің синонимдерін іздеудің қажеті болмайды.
Controlled vocabularies are often claimed to improve the accuracy of free text searching, such as to reduce irrelevant items in the retrieval list. These irrelevant items (false positives) are often caused by the inherent ambiguity of natural language. Take the English word football for example. Football is the name given to a number of different team sports. Worldwide the most popular of these team sports is association football, which also happens to be called soccer in several countries. The word football is also applied to rugby football (rugby union and rugby league), American football, Australian rules football, Gaelic football, and Canadian football. A search for football therefore will retrieve documents that are about several completely different sports. Controlled vocabulary solves this problem by tagging the documents in such a way that the ambiguities are eliminated. Compared to free text searching, the use of a controlled vocabulary can dramatically increase the performance of an information retrieval system, if performance is measured by precision (the percentage of documents in the retrieval list that are actually relevant to the search topic). In some cases controlled vocabulary can enhance recall as well, because unlike natural language schemes, once the correct preferred term is searched, there is no need to search for other terms that might be synonyms of that term.
Қиындықтар
Бақыланатын сөздікпен іздеу қанағаттандырмас нәтижелерге әкелуі мүмкін, себебі ол іздеу сұрағына қатысты нақты құжаттардың кейбіреулерін таба алмайды. Бұл әсіресе іздеу сұрағы тақырыпқа байланысты, бірақ тікелей қатысы жоқ терминдерді қамтығанда маңызды проблема тудырады, сондықтан индекстеуші басқа терминмен белгілеуді жөн санауы мүмкін (ал іздеуші оны солай деп есептеуі мүмкін). Ақиқатында, мұндай жағдайдан тек бақыланатын сөздікті жақсы білетін, оның мағынасын индекстеушімен бірдей түсінетін тәжірибелі қолданушы ғана сақтануы мүмкін. Тағы бір мүмкіндік – мақаланың индекстеуші тарапынан белгіленбеуі, себебі индекстеудің толықтығы жеткіліксіз. Мысалы, мақалада футбол екінші дәрежелі тақырып ретінде айтылса, индекстеуші оны «футбол» деп белгілемеуі мүмкін, өйткені ол басты тақырыпқа қарағанда маңызды емес. Бірақ бұл мақала іздеуші үшін қажет болып шығуы мүмкін, нәтижесінде еске түсіру сәтсіз аяқталады. Ашық мәтіндік іздеу мұндай жағдайда мақаланы автоматты түрде табады. Алайда, ашық мәтіндік іздеудің толықтығы жоғары (әрбір сөз ізделеді), сондықтан дәлдігі төмен болғанымен, іздеуші синонимдер мәселесін шешіп, барлық мүмкін комбинацияларды енгізсе, жоғары нәтиже алуға мүмкіндік бар. Бақыланатын сөздіктер білім саласы қарқынды дамыған жағдайда тез ескіретін болуы мүмкін, егер таңдалған терминдер үнемі жаңартылмаса. Тіпті ең жақсы жағдайда да, бақыланатын сөздіктер мәтіннің өзінен гөрі аз нақты болады. Индекстеушілер тиісті термин таңдауға тырысқанда авторды дұрыс түсінбеуі мүмкін, ал мұндай мәселе ашық мәтіндік іздеуде туындамайды, себебі ол автордың нақты сөздерін пайдаланады. Бақыланатын сөздіктерді пайдалану ашық мәтіндік іздеуге қарағанда қымбатқа түсуі мүмкін, өйткені әрбір жазбаны индекстеу үшін тәжірибелі мамандар немесе қымбат автоматтандырылған жүйелер қажет. Сонымен қатар, қолданушы жүйеден ең көп пайда алу үшін бақыланатын сөздіктер жүйесімен таныс болуы керек. Бірақ айтқанымыздай, синонимдер мен гомографтарды бақылау дәлдікті арттыруға көмектеседі. Бақыланатын сөздіктерді құруға көмектесетін көптеген әдістер әзірленді, соның ішінде фасеттік жіктеу, ол деректерді немесе құжатты бірнеше тәсілмен сипаттауға мүмкіндік береді. Таңдалған сөздіктердегі сөздерді таңдау бейтарап емес, сондықтан индекстеуші сөздерді таңдаудың этикалық жақтарын мұқият қарастыруы керек. Мысалы, дәстүрлі колониалистік терминдер Бірінші Ұлттар мәселелерін талқылау кезінде таңдалған сөздіктерде жиі артықшылықты терминдер болып келді, бұл дау тудырды.
A controlled vocabulary search may lead to unsatisfactory recall, in that it will fail to retrieve some documents that are actually relevant to the search question. This is particularly problematic when the search question involves terms that are sufficiently tangential to the subject area such that the indexer might have decided to tag it using a different term (but the searcher might consider the same). Essentially, this can be avoided only by an experienced user of controlled vocabulary whose understanding of the vocabulary coincides with that of the indexer. Another possibility is that the article is just not tagged by the indexer because indexing exhaustivity is low. For example, an article might mention football as a secondary focus, and the indexer might decide not to tag it with "football" because it is not important enough compared to the main focus. But it turns out that for the searcher that article is relevant and hence recall fails. A free text search would automatically pick up that article regardless. On the other hand, free text searches have high exhaustivity (every word is searched) so although it has much lower precision, it has potential for high recall as long as the searcher overcome the problem of synonyms by entering every combination. Controlled vocabularies may become outdated rapidly in fast developing fields of knowledge, unless the preferred terms are updated regularly. Even in an ideal scenario, a controlled vocabulary is often less specific than the words of the text itself. Indexers trying to choose the appropriate index terms might misinterpret the author, while this precise problem is not a factor in a free text, as it uses the author's own words. The use of controlled vocabularies can be costly compared to free text searches because human experts or expensive automated systems are necessary to index each entry. Furthermore, the user has to be familiar with the controlled vocabulary scheme to make best use of the system. But as already mentioned, the control of synonyms, homographs can help increase precision. Numerous methodologies have been developed to assist in the creation of controlled vocabularies, including faceted classification, which enables a given data record or document to be described in multiple ways. Word choice in chosen vocabularies is not neutral, and the indexer must carefully consider the ethics of their word choices. For example, traditionally colonialist terms have often been the preferred terms in chosen vocabularies when discussing First Nations issues, which has caused controversy.
Қолданбалар
Бақыланатын сөздіктер, мысалы, Конгресс кітапханасының тақырыптық тақырыптары, библиографияның – кітаптарды зерттеу және жіктеудің – маңызды құрамдас бөлігі болып табылады. Олар бастапқыда кітапхана және ақпараттану ғылымында жасалды. 1950 жылдары мемлекеттік органдар мамандандырылған салалардағы қарқынды өсіп келе жатқан журнал әдебиеттері үшін бақыланатын сөздіктерді әзірлеуге кірісті; мысалы, АҚШ Ұлттық медицина кітапханасы жасаған Медициналық тақырыптар (MeSH) тізімін атауға болады. Кейіннен, пайда табуға бағытталған фирмалар (абстракциялау және индекстеу қызметтері деп аталады) білімнің барлық салаларындағы тез өсіп келе жатқан әдебиетті индекстеу үшін пайда болды. 1960 жылдары X.25 желісіне негіделген онлайн библиографиялық деректер базасы индустриясы дамыды. Бұл қызметтер көбінесе қолдану қиын болғандықтан, көпшілікке сирек ұсынылды; іздеу жұмысын мамандандырылған кітапханашылар – іздеу операторлары жүргізді. 1980 жылдары алғашқы толық мәтіндік деректер базалары пайда болды; бұл деректер базалары индекстелген мақалалардың толық мәтінімен қатар библиографиялық ақпаратты да қамтиды. Онлайн библиографиялық деректер базалары Интернетке көшірілді және қазір көпшілікке қолжетімді; алайда, олардың көпшілігі жекеменшік болып табылады және қолдану құны жоғары болуы мүмкін. Колледждер мен университеттерде оқитын студенттер осы қызметтердің кейбіреулеріне ақысыз қол жеткізе алады; ал кейбір қызметтерге қоғамдық кітапханада тегін қол жеткізуге болады.
Controlled vocabularies, such as the Library of Congress Subject Headings, are an essential component of bibliography, the study and classification of books. They were initially developed in library and information science. In the 1950s, government agencies began to develop controlled vocabularies for the burgeoning journal literature in specialized fields; an example is the Medical Subject Headings (MeSH) developed by the U. S. National Library of Medicine. Subsequently, for profit firms (called Abstracting and indexing services) emerged to index the fast growing literature in every field of knowledge. In the 1960s, an online bibliographic database industry developed based on dialup X.25 networking. These services were seldom made available to the public because they were difficult to use; specialist librarians called search intermediaries handled the searching job. In the 1980s, the first full text databases appeared; these databases contain the full text of the index articles as well as the bibliographic information. Online bibliographic databases have migrated to the Internet and are now publicly available; however, most are proprietary and can be expensive to use. Students enrolled in colleges and universities may be able to access some of these services without charge; some of these services may be accessible without charge at a public library.
Техникалық байланыс
Үлкен ұйымдарда техникалық коммуникацияны жақсарту үшін бақыланатын сөздіктер енгізілуі мүмкін. Бақыланатын сөздіктерді қолдану барлық адамның бірдей нәрсені білдіру үшін бірдей сөзді қолдануын қамтамасыз етеді. Бұл терминдердің дәйектілігі техникалық жазу және білімді басқарудың ең маңызды принциптерінің бірі болып табылады, онда бір нәрсені атау үшін бірдей мағынаны білдіретін, бірақ сәл өзгеше сөздердің орнына, құжат немесе ұйым бойынша бір сөзді қолдануға күш жұмсалады.
In large organizations, controlled vocabularies may be introduced to improve technical communication. The use of controlled vocabulary ensures that everyone is using the same word to mean the same thing. This consistency of terms is one of the most important concepts in technical writing and knowledge management, where effort is expended to use the same word throughout a document or organization instead of slightly different ones to refer to the same thing.
Семантикалық желі және құрылымдалған деректер
Веб-беттерді сипаттау үшін бақыланатын сөздіктің дамуы веб-іздеуді едәуір жақсартуға мүмкіндік береді; мұндай сөздікті қолдану нәтижесінде Семантикалық веб құрылуы мүмкін, онда веб-беттердің мазмұны машинамен оқылатын метадеректер схемасын пайдалана отырып сипатталады. Мұндай схемаға жасалған алғашқы ұсыныстардың бірі – Dublin Core Initiative. Веб-беттерді индекстеуге қолданылатын бақыланатын сөздіктің мысалы – PSH. Бір метадеректер схемасы бүкіл вебтің мазмұнын сипаттауға жеткіліксіз болуы мүмкін. Семантикалық вебті құру үшін веб-беттің мазмұнын сипаттау үшін екі немесе одан көп метадеректер жүйесін пайдалану қажет болуы мүмкін. eXchangeable Faceted Metadata Language (XFML) бақыланатын сөздіктерді жасаушыларға метадеректер жүйелерін жариялауға және бөлісуге мүмкіндік беру үшін әзірленген. XFML фасетті жіктеу принциптеріне негізделген. Семантикалық вебтің бақыланатын сөздіктері қызығушылық немесе маңызды мәселелерді сипаттау үшін қолданылатын түсініктер мен қатынастарды (терминдерді) анықтайды. Мысалы, адамды машинамен оқылатын форматта көрсету үшін "Адам" терминінің ресми анықтамасы бар сөздік қажет, мысалы, Friend of a Friend (FOAF) сөздігі, онда адамның әдеттегі қасиеттерін анықтайтын "Адам" класы бар, оның ішінде аты, құрметтеу префиксі, ұйымдық байланысы, электрондық пошта мекенжайы және бас беті, немесе Schema.org-тың "Адам" сөздігі. Сол сияқты, кітапты Schema.org-тың "Кітап" сөздігін және Dublin Core сөздігінен алынған жалпы жарияланым терминдерін пайдаланып сипаттауға болады, ал оқиғаны – Schema.org-тың "Оқиға" сөздігін пайдаланып сипаттауға болады, және т.б. Кез келген бақыланатын сөздіктен машинамен оқылатын терминдерді пайдалану үшін веб-дизайнерлер әртүрлі түсіндіру форматтарын таңдай алады, оның ішінде RDFa, HTML5 Microdata немесе JSON LD белгілеу тілінде немесе RDF форматтарын (RDF/XML, Turtle, N3, TriG, TriX) сыртқы файлдарда.
Web searching could be dramatically improved by the development of a controlled vocabulary for describing Web pages; the use of such a vocabulary could culminate in a Semantic Web, in which the content of Web pages is described using a machine readable metadata scheme. One of the first proposals for such a scheme is the Dublin Core Initiative. An example of a controlled vocabulary which is usable for indexing web pages is PSH. It is unlikely that a single metadata scheme will ever succeed in describing the content of the entire Web. To create a Semantic Web, it may be necessary to draw from two or more metadata systems to describe a Web page's contents. The eXchangeable Faceted Metadata Language (XFML) is designed to enable controlled vocabulary creators to publish and share metadata systems. XFML is designed on faceted classification principles. Controlled vocabularies of the Semantic Web define the concepts and relationships (terms) used to describe a field of interest or area of concern. For instance, to declare a person in a machine readable format, a vocabulary is needed that has the formal definition of "Person", such as the Friend of a Friend (FOAF) vocabulary, which has a Person class that defines typical properties of a person including, but not limited to, name, honorific prefix, affiliation, email address, and homepage, or the Person vocabulary of Schema. org. Similarly, a book can be described using the Book vocabulary of Schema. org and general publication terms from the Dublin Core vocabulary, an event with the Event vocabulary of Schema. org, and so on. To use machine readable terms from any controlled vocabulary, web designers can choose from a variety of annotation formats, including RDFa, HTML5 Microdata, or JSON LD in the markup, or RDF serializations (RDF/XML, Turtle, N3, TriG, TriX) in external files.