Кіріспе
Семантикалық жағынан байланысты реттелген сөздер арасындағы реті лексикалық тізбектей жіктеледі. Лексикалық тізбе - бұл тар (бір-біріне жақын сөздер немесе сөйлемдер) немесе кең контекст терезесін (бүкіл мәтін) қамтитын, жазудағы байланысты сөздер тізбегі. Лексикалық тізбек мәтіннің грамматикалық құрылысына тәуелсіз, және бұл мәтіннің біріктірілген құрылысының бір бөлігін қамтитын сөз тізімі. Лексикалық тізбек түсініксіз терминді шешу үшін контекстті қамтамасыз ете алады және термин білдіретін ұғымдарды түсініктілігін жоюға мүмкіндік береді. Рим → астана → қала → тұрғындар → ресурс → веб
Wikipedia → resource → web
Қадамдар мен әдістер
Лексикалық тізбектерді табиғи тілдерді өңдеуде қолдану (мысалы, мәтіннің ұқсастығы, сөз мағынасының түсініктілігін жою, құжат кластерлеу) әдебиетте кеңінен зерттелген. Барзилай және басқалар мәтіннен түйіндер жасау үшін лексикалық тізбектерді қолданады. Олар төрт қадамға негізделген әдісті ұсынады: түпнұсқа мәтіннің сегментациясы, лексикалық тізбектердің құрылысы, сенімді тізбектерді анықтау және маңызды сөйлемдерді шығару. Сильбер мен МакКой мәтіннің түйіндемесін де зерттейді, бірақ олардың лексикалық тізбектерді құруға деген көзқарасы сызықтық уақытпен жүреді. Кейбір авторлар лексикалық тізбектерді іздеу мен бағалауды жақсарту үшін WordNet-ті қолданады. Буданицкий мен Кирст WordNet-пен бірлесіп лексикалық тізбектерді қолдана отырып, семантикалық қашықтық пен туыстық қатынастың бірнеше өлшеуін салыстырады. Олардың зерттеуі бойынша Цзян мен Конраттың ұқсастық өлшемі ең жақсы қорытындыны береді. Молдова мен Адриан сұрақ-жауап жүйелері үшін тақырыптық байланысты сөздерді табу үшін лексикалық тізбектерді қолдануды зерттейді. Бұл WordNet-тегі әрбір синсеттің глоссасын ескере отырып жасалады. Олардың зерттеулеріне сәйкес, лексикалық тізбектер арқылы тақырыптық қатынастар WordNet-пен біріктірілген кезде сұрақ-жауап жүйелерінің жұмысын жақсартады. Маккарти және басқалар. WordNet арқылы белгіленбеген мәтіндердің ең көп таралған синсеттерін табу және санаттауға арналған әдістемені ұсыну. Дәстүрлі тәсілдерден (мысалы, BOW) айырмашылығы, олар терминдер арасындағы қатынастарды анық емес деп санайды. Еркан мен Цикели кілт сөзді алу тапсырмасындағы лексикалық тізбектердің әсерін бақылаудағы машиналық оқыту арқылы зерттейді. Вей және басқалар. лексикалық тізбектер мен WordNet-ті біріктіріп, мәтіннен семантикалық байланысты сөздер жиынтығын шығарып, оларды кластерлеу үшін қолданады. Олардың тәсілдері сөз мағынасын анықтайтын тапсырма кезінде терминдер арасындағы ұқсастықты толығырақ бағалау үшін онтологиялық иерархиялық құрылымды қолданады.
Лексикалық тізбегі мен сөзді ендіру
Лексикалық тізбектердің қолданылуы әр түрлі болғанымен, оларды NLP-дегі соңғы жетістіктермен, атап айтқанда сөздерді ендірумен зерттеу жұмыстары аз. In, лексикалық тізбектер WordNet-те кездесетін белгілі бір үлгілерді пайдалана отырып, нейрондық машиналық аударма моделімен біріктірілген лексикалық тізбектерді өндіру үшін сөз мағынасының кіріктіруін қолданады. Маскарелли лексикалық тізбектерді пайдаланатын модельді ұсынады. Сыртқы лексикалық деректер базасын пайдаланудың орнына, олар бастапқы мәтіндегі лексикалық тізбектерді анықтау үшін сөздерді ендіруді қолданады. Руас және басқалар. лексикалық деректер базаларын, лексикалық тізбектерді және сөздерді ендіруді біріктіретін екі әдісті ұсынады, атап айтқанда, икемді лексикалық тізбек II (FLLC II) және тұрақты лексикалық тізбек II" (FXLC II). FLLC II және FXLC II-дің негізгі мақсаты - сөздерді олардың семантикалық мәндері бойынша қысқаша бейнелеу. FLLC II-де лексикалық тізбектер әр бағаланған терминнің семантикалық мазмұнына және оның көршілес көршілерімен қарым-қатынасына сәйкес динамикалық түрде құрастырылады. Екі немесе одан да көп сөзді байланыстыратын семантикалық байланыс болған жағдайда, оларды бірегей ұғымға біріктіру керек. Семантикалық қатынас WordNet арқылы алынады, ол екі сөзді қандай лексикалық құрылыммен байланыстыратынын көрсету үшін негіздік шындықты жасайды (мысалы, гипернимдер, гипонимдер, меринимдер). Егер сөздің қазіргі тізбегімен семантикалық байланысы болмаса, жаңа лексикалық тізбегі басталады. Екінші жағынан, FXLC II мәтін сегменттерін алдын ала белгіленген бөліктерге бөледі, әрқайсысы белгілі бір сөз санымен. FLLC II-ден айырмашылығы, FXLC II әдісі лексикалық деректер базасында көрсетілген семантикалық байланыстығына қарамастан, белгілі бір сандағы сөздерді бір құрылымға топтастырады. Екі әдісте де әр құрылған тізбекті сөзбен бейнелейді, оның алдын ала дайындалған сөзді ендіру векторы сол тізбектегі құраушы сөздердің орташа векторына өте ұқсас.