Кіріспе

Білімді ұйымдастыру әдісі

Бақыланатын сөздіктер білімді кейіннен іздеу үшін ұйымдастыру тәсілін ұсынады. Олар тақырыптық индекстеу жүйелерінде, тақырыптар тізімінде, тезаурустарда, таксономияларда және басқа да білімді ұйымдастыру жүйелерінде қолданылады. Бақыланатын сөздіктер жүйелері схеманың авторлары алдын ала таңдаған, белгіленген, басымдық берілген терминдерді қолдануды міндеттейді, бұл табиғи тілдегі сөздіктерден өзгеше, оларда мұндай шектеулер жоқ.

Кітапхана және ақпараттану саласында

Кітапхана және ақпараттық ғылымда бақыланатын сөздік – ақпараттық бірліктерді (құжат немесе жұмыс) іздеу арқылы оңай табуға мүмкіндік беретін, мұқият таңдалған сөздер мен тіркестердің тізімі. Бақыланатын сөздіктер гомографтар, синонимдер және полисемия мәселелерін ұғымдар мен басымдық берілген терминдер арасындағы бір-бірге сәйкестік арқылы шешеді. Қысқасы, бақыланатын сөздіктер бір ұғымға әртүрлі атаулар берілуінен туындайтын қажетсіз беймаздықтарды азайтады және тұрақтылықты қамтамасыз етеді. (Бақыланатын сөздікті пайдаланатын тақырыптар жүйесінде) басымдық берілген терминдер – осы жағдайда тақырыптар – бір сөздің әртүрлі жазылуы (американдық және британдық нұсқалары), ғылыми және көп қолданылатын терминдер (тарақан және Periplaneta americana), сондай-ақ синонимдер (автомобиль және көлік) сияқты қиын мәселелерді шешу үшін таңдалуы керек. Басымдық берілген терминдерді таңдау пайдаланушының қажеттілігі (пайдаланушылар қандай терминдерді қолдануы мүмкін), әдебиеттік қажеттілігі (әдебиетте және құжаттарда қандай терминдер жиі қолданылады) және құрылымдық қажеттілігі (бақыланатын сөздіктің құрылымы мен көлемін ескере отырып таңдалған терминдер) принциптеріне негізделеді. Бақыланатын сөздіктер гомографтар мәселесін анықтаушылармен шешуге де көмектеседі. Мысалы, "бассейн" термині жүзу бассейнін немесе ойын бассейнін білдіру үшін нақтылануы керек, осылайша әрбір басымдық берілген термин немесе тақырып тек бір ұғымды көрсетеді.

Кітапханаларда қолданылатын типтер

Кітапханаларда қолданылатын бақыланатын сөздік құралдарының екі негізгі түрі бар: тақырыптық атаулар және тезаурустар. Екі түрдің арасындағы айырмашылықтар азайып бара жатқанмен, әлі де шағын ерекшеліктер бар. Тарихи тұрғыдан алғанда, тақырыптық атаулар кітапхана каталогтарында кітаптарды сипаттау үшін каталогтаушылармен, ал тезаурустар құжаттар мен мақалаларға кіріспе терминдерді тағайындау үшін индекстеушілермен қолданылды. Тақырыптық атаулар көбінесе кең ауқымды болып, тұтас кітаптарды сипаттайды, ал тезаурустар көбінесе мамандандырылған, өте нақты салаларды қамтиды. Карталық каталог жүйесінің салдарынан тақырыптық атауларда тікелей емес реттегі терминдер жиі кездеседі (бірақ автоматтандырылған жүйелердің пайда болуымен бұл кемітілуде), ал тезаурустардағы терминдер әрқашан тікелей ретте болады. Тақырыптық атаулар терминдерді алдын ала үйлестіруге бейім, яғни бақыланатын сөздіктің авторы әртүрлі ұғымдарды біріктіріп, бір таңдалған тақырыптық атауды құрайды (мысалы, балалар және терроризм), ал тезаурустар көбінесе жеке тікелей терминдерді қолданады. Тезаурустар тек эквивалентті терминдерді ғана емес, сонымен қатар тар, кең және қатысты терминдерді, әртүрлі басым және басым емес (бірақ синонимді болуы мүмкін) терминдердің арасында да тізімдейді, ал тарихи тұрғыдан алғанда, көптеген тақырыптық атауларда мұндай мүмкіндік болмады. Мысалы, Конгресс кітапханасының тақырыптық атаулары 1943 жылға дейін жеткілікті синдетикалық құрылымға ие болмады, ал 1985 жылға дейін ғана «Кең термин» және «Тар термин» сияқты тезаурусқа тән терминдерді қабылдай бастады. Терминдерді білікті мамандар (кітапханашылар мен ақпараттану ғалымдары сияқты) таңдап, ұйымдастырады, олар берілген сала бойынша білімі бар. Бақыланатын сөздік терминдері құжаттың мәтінінде кездеспесе де, құжаттың мазмұнын дәл сипаттауға мүмкіндік береді. Белгілі тақырыптық атаулар жүйелеріне Конгресс кітапханасы жүйесі, АҚШ Ұлттық медицина кітапханасы жасаған Медициналық тақырыптар (MeSH) және Sears жүйесі жатады. Белгілі тезаурустарға «Көркем өнер және сәулет» және ERIC тезаурусы кіреді. Бақыланатын сөздік үшін терминдерді таңдағанда, дизайнер таңдалған терминнің ерекшелігін, тікелей енгізуді пайдалануды, тілдің өзара сәйкестігі мен тұрақтылығын ескеруі керек. Соңында, жүйедегі алдын ала үйлестіру деңгейі (осы жағдайда санау мен синтез арасындағы қатынас маңызды) және кейін үйлестіру де маңызды мәселе болып табылады. Құжаттардың мазмұнын анықтау процесіне көмектесу үшін тегтер ретінде қолданылатын бақыланатын сөздік элементтері (терминдер/фразалар) немесе басқа ақпараттық жүйе элементтері (мысалы, СҚДБ, веб-қызметтер) метадеректер болып саналады.

Артықшылықтар

Бақыланатын сөздіктер еркін мәтіндік іздеудің дәлдігін арттырады деп жиі айтылады, мысалы, іздеу нәтижелері тізіміндегі қатысы жоқ элементтерді азайту үшін. Бұл қатысы жоқ элементтер (жалған оң нәтижелер) көбінесе табиғи тілдің мәнділігіне байланысты туындайды. Мысалы, "футбол" деген сөзді қарастырайық. Футбол – бірнеше түрлі командалық спорттың атауы. Әлем бойынша осы командалық спорт түрлерінің ең танымал түрі – футбол, ал кейбір елдерде ол "соққыр" деп те аталады. "Футбол" сөзі регби футболына (регби одағы және регби лигасы), американдық футболға, австралиялық футболға, гэль футболға және канадалық футболға да қолданылады. Сондықтан, "футбол" сөзімен іздеу нәтижесінде бірнеше мүлдем басқа спорт түрлері туралы құжаттар табылады. Бақыланатын сөздік бұл мәселені құжаттарды осылайша таңбалау арқылы шешеді, осылайша мәнділік жойылады. Егер өнімділік дәлдікпен өлшенсе (іздеу нәтижелері тізіміндегі іздеу тақырыбына қатысты құжаттардың пайызы), бақыланатын сөздіктерді пайдалану еркін мәтіндік іздеумен салыстырғанда ақпараттық іздеу жүйесінің тиімділігін едәуір арттыра алады. Кейбір жағдайларда бақыланатын сөздіктер есте сақтау қабілетін де жақсарта алады, себебі табиғи тіл схемаларынан айырмашылығы, дұрыс таңдалған термин ізделгеннен кейін, осы терминнің синонимдерін іздеудің қажеті болмайды.

Қиындықтар

Бақыланатын сөздікпен іздеу қанағаттандырмас нәтижелерге әкелуі мүмкін, себебі ол іздеу сұрағына қатысты нақты құжаттардың кейбіреулерін таба алмайды. Бұл әсіресе іздеу сұрағы тақырыпқа байланысты, бірақ тікелей қатысы жоқ терминдерді қамтығанда маңызды проблема тудырады, сондықтан индекстеуші басқа терминмен белгілеуді жөн санауы мүмкін (ал іздеуші оны солай деп есептеуі мүмкін). Ақиқатында, мұндай жағдайдан тек бақыланатын сөздікті жақсы білетін, оның мағынасын индекстеушімен бірдей түсінетін тәжірибелі қолданушы ғана сақтануы мүмкін. Тағы бір мүмкіндік – мақаланың индекстеуші тарапынан белгіленбеуі, себебі индекстеудің толықтығы жеткіліксіз. Мысалы, мақалада футбол екінші дәрежелі тақырып ретінде айтылса, индекстеуші оны «футбол» деп белгілемеуі мүмкін, өйткені ол басты тақырыпқа қарағанда маңызды емес. Бірақ бұл мақала іздеуші үшін қажет болып шығуы мүмкін, нәтижесінде еске түсіру сәтсіз аяқталады. Ашық мәтіндік іздеу мұндай жағдайда мақаланы автоматты түрде табады. Алайда, ашық мәтіндік іздеудің толықтығы жоғары (әрбір сөз ізделеді), сондықтан дәлдігі төмен болғанымен, іздеуші синонимдер мәселесін шешіп, барлық мүмкін комбинацияларды енгізсе, жоғары нәтиже алуға мүмкіндік бар. Бақыланатын сөздіктер білім саласы қарқынды дамыған жағдайда тез ескіретін болуы мүмкін, егер таңдалған терминдер үнемі жаңартылмаса. Тіпті ең жақсы жағдайда да, бақыланатын сөздіктер мәтіннің өзінен гөрі аз нақты болады. Индекстеушілер тиісті термин таңдауға тырысқанда авторды дұрыс түсінбеуі мүмкін, ал мұндай мәселе ашық мәтіндік іздеуде туындамайды, себебі ол автордың нақты сөздерін пайдаланады. Бақыланатын сөздіктерді пайдалану ашық мәтіндік іздеуге қарағанда қымбатқа түсуі мүмкін, өйткені әрбір жазбаны индекстеу үшін тәжірибелі мамандар немесе қымбат автоматтандырылған жүйелер қажет. Сонымен қатар, қолданушы жүйеден ең көп пайда алу үшін бақыланатын сөздіктер жүйесімен таныс болуы керек. Бірақ айтқанымыздай, синонимдер мен гомографтарды бақылау дәлдікті арттыруға көмектеседі. Бақыланатын сөздіктерді құруға көмектесетін көптеген әдістер әзірленді, соның ішінде фасеттік жіктеу, ол деректерді немесе құжатты бірнеше тәсілмен сипаттауға мүмкіндік береді. Таңдалған сөздіктердегі сөздерді таңдау бейтарап емес, сондықтан индекстеуші сөздерді таңдаудың этикалық жақтарын мұқият қарастыруы керек. Мысалы, дәстүрлі колониалистік терминдер Бірінші Ұлттар мәселелерін талқылау кезінде таңдалған сөздіктерде жиі артықшылықты терминдер болып келді, бұл дау тудырды.

Қолданбалар

Бақыланатын сөздіктер, мысалы, Конгресс кітапханасының тақырыптық тақырыптары, библиографияның – кітаптарды зерттеу және жіктеудің – маңызды құрамдас бөлігі болып табылады. Олар бастапқыда кітапхана және ақпараттану ғылымында жасалды. 1950 жылдары мемлекеттік органдар мамандандырылған салалардағы қарқынды өсіп келе жатқан журнал әдебиеттері үшін бақыланатын сөздіктерді әзірлеуге кірісті; мысалы, АҚШ Ұлттық медицина кітапханасы жасаған Медициналық тақырыптар (MeSH) тізімін атауға болады. Кейіннен, пайда табуға бағытталған фирмалар (абстракциялау және индекстеу қызметтері деп аталады) білімнің барлық салаларындағы тез өсіп келе жатқан әдебиетті индекстеу үшін пайда болды. 1960 жылдары X.25 желісіне негіделген онлайн библиографиялық деректер базасы индустриясы дамыды. Бұл қызметтер көбінесе қолдану қиын болғандықтан, көпшілікке сирек ұсынылды; іздеу жұмысын мамандандырылған кітапханашылар – іздеу операторлары жүргізді. 1980 жылдары алғашқы толық мәтіндік деректер базалары пайда болды; бұл деректер базалары индекстелген мақалалардың толық мәтінімен қатар библиографиялық ақпаратты да қамтиды. Онлайн библиографиялық деректер базалары Интернетке көшірілді және қазір көпшілікке қолжетімді; алайда, олардың көпшілігі жекеменшік болып табылады және қолдану құны жоғары болуы мүмкін. Колледждер мен университеттерде оқитын студенттер осы қызметтердің кейбіреулеріне ақысыз қол жеткізе алады; ал кейбір қызметтерге қоғамдық кітапханада тегін қол жеткізуге болады.

Техникалық байланыс

Үлкен ұйымдарда техникалық коммуникацияны жақсарту үшін бақыланатын сөздіктер енгізілуі мүмкін. Бақыланатын сөздіктерді қолдану барлық адамның бірдей нәрсені білдіру үшін бірдей сөзді қолдануын қамтамасыз етеді. Бұл терминдердің дәйектілігі техникалық жазу және білімді басқарудың ең маңызды принциптерінің бірі болып табылады, онда бір нәрсені атау үшін бірдей мағынаны білдіретін, бірақ сәл өзгеше сөздердің орнына, құжат немесе ұйым бойынша бір сөзді қолдануға күш жұмсалады.

Семантикалық желі және құрылымдалған деректер

Веб-беттерді сипаттау үшін бақыланатын сөздіктің дамуы веб-іздеуді едәуір жақсартуға мүмкіндік береді; мұндай сөздікті қолдану нәтижесінде Семантикалық веб құрылуы мүмкін, онда веб-беттердің мазмұны машинамен оқылатын метадеректер схемасын пайдалана отырып сипатталады. Мұндай схемаға жасалған алғашқы ұсыныстардың бірі – Dublin Core Initiative. Веб-беттерді индекстеуге қолданылатын бақыланатын сөздіктің мысалы – PSH. Бір метадеректер схемасы бүкіл вебтің мазмұнын сипаттауға жеткіліксіз болуы мүмкін. Семантикалық вебті құру үшін веб-беттің мазмұнын сипаттау үшін екі немесе одан көп метадеректер жүйесін пайдалану қажет болуы мүмкін. eXchangeable Faceted Metadata Language (XFML) бақыланатын сөздіктерді жасаушыларға метадеректер жүйелерін жариялауға және бөлісуге мүмкіндік беру үшін әзірленген. XFML фасетті жіктеу принциптеріне негізделген. Семантикалық вебтің бақыланатын сөздіктері қызығушылық немесе маңызды мәселелерді сипаттау үшін қолданылатын түсініктер мен қатынастарды (терминдерді) анықтайды. Мысалы, адамды машинамен оқылатын форматта көрсету үшін "Адам" терминінің ресми анықтамасы бар сөздік қажет, мысалы, Friend of a Friend (FOAF) сөздігі, онда адамның әдеттегі қасиеттерін анықтайтын "Адам" класы бар, оның ішінде аты, құрметтеу префиксі, ұйымдық байланысы, электрондық пошта мекенжайы және бас беті, немесе Schema.org-тың "Адам" сөздігі. Сол сияқты, кітапты Schema.org-тың "Кітап" сөздігін және Dublin Core сөздігінен алынған жалпы жарияланым терминдерін пайдаланып сипаттауға болады, ал оқиғаны – Schema.org-тың "Оқиға" сөздігін пайдаланып сипаттауға болады, және т.б. Кез келген бақыланатын сөздіктен машинамен оқылатын терминдерді пайдалану үшін веб-дизайнерлер әртүрлі түсіндіру форматтарын таңдай алады, оның ішінде RDFa, HTML5 Microdata немесе JSON LD белгілеу тілінде немесе RDF форматтарын (RDF/XML, Turtle, N3, TriG, TriX) сыртқы файлдарда.