Семантикалық лексикон және сөздердің мағыналық желісі
Semantic lexicon
Семантикалық лексикон – сөздердің мағыналық кластармен белгіленген цифрлық сөздігі. Сөздер арасындағы байланыстарды анықтайды, анықтамалар береді. SEO үшін маңызды!
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Семантикалық лексикон – семантикалық сыныптармен белгіленген сөздердің цифрлық сөздігі, осы арқылы бұрын кездеспеген сөздер арасында байланыстар орнатуға болады. Семантикалық лексикондар сөздер арасындағы семантикалық қатынастарды көрсететін семантикалық желілердің негізінде құрастырылады. Семантикалық лексикон мен семантикалық желінің арасындағы ерекшелік – семантикалық лексиконның әрбір сөзге анықтамасы немесе "түсіндірмесі" болатындығында.
A semantic lexicon is a digital dictionary of words labeled with semantic classes so associations can be drawn between words that have not previously been encountered. Semantic lexicons are built upon semantic networks, which represent the semantic relations between words. The difference between a semantic lexicon and a semantic network is that a semantic lexicon has definitions for each word, or a "gloss".
Құрылымы
Семантикалық лексикон лексикалық бірліктерден құралады. Бұл бірліктер орфографиялық емес, семантикалық болып келеді, омонимия және полисемия мәселелерін жояды. Бұл лексикалық бірліктер гиперонимия, гипонимия, меронимия немесе тропонимия сияқты семантикалық қатынастар арқылы байланыстырылған. Синонимдерден тұратын бірліктер Принстон WordNet терминімен "синсеттер" деп аталады.
Semantic lexicons are made up of lexical entries. These entries are not orthographic, but semantic, eliminating issues of homonymy and polysemy. These lexical entries are interconnected with semantic relations, such as hyperonymy, hyponymy, meronymy, or troponymy. Synonymous entries are grouped together in what the Princeton WordNet calls "synsets"
Есімдіктер
Есімдер таксономияға реттеледі, иерархиялық құрылымға ұйымдастырылады, онда ең жалпы және кең қамтуға ие есім жоғарыда орналасқан, мысалы, "зат", ал есімдер жоғарыдан алшақтаған сайын нақтырақ болады. Семантикалық лексиконның ең жоғарғы есімі – бірегей бастамашы деп аталады. Ең нақты есімдер (ешқандай бағыныштысы жоқ) – терминалдық түйіндер. Бұл – “бөліктен бүтінге” қатынас, мысалы, кілттер ноутбуктің бір бөлігі. Нақты жазбаны анықтайтын қажетті атрибуттар сол жазбаның гипонимінде де міндетті түрде болады. Егер компьютерде кілттер болса және ноутбук компьютердің бір түрі болса, онда ноутбукте кілттер болуы керек. Дегенмен, бұл айырмашылықтың шашыраңқы болатын көптеген жағдайлар бар. Бұған орындық мысалы жақсы дәлел. Көптеген адамдар орындықты аяқтары мен отыруға арналған орын бар деп сипаттайды (оның ішінде отыруға арналған бөлігі). Алайда, кейбір көркемдік немесе заманауи орындықтардың аяқтары мүлдем жоқ. Бұршақ қаптарында да аяқтар жоқ, бірақ олар орындық емес деп айтатындар аз. Осындай сұрақтар таксономия және онтология салаларындағы зерттеулер мен жұмыстарды жетелейтін негізгі мәселелер болып табылады.
Nouns are ordered into a taxonomy, structured into a hierarchy where the broadest and most encompassing noun is located at the top, such as "thing", with the nouns becoming more and more specific the further they are from the top. The very top noun in a semantic lexicon is called a unique beginner. The most specific nouns (those that do not have any subordinates), are terminal nodes. which is a “part to whole” relationship, such as keys are part of a laptop. The necessary attributes that define a specific entry are also necessarily present in that entry’s hyponym. So, if a computer has keys, and a laptop is a type of computer, then a laptop must have keys. However, there are many instances where this distinction can become vague. A good example of this is the item chair. Most would define a chair as having legs and a seat (as in the part one sits on). However, there are some artistic or modern chairs that do not have legs at all. Beanbags also do not have legs, but few would argue that they aren't chairs. Questions like this are the core questions that drive research and work in the fields of taxonomy and ontology.
Іс-әрекеттер
Етістіктердің сөз тіркестері есімдіктерге ұқсас орналасады: иерархияның жоғарғы жағында жалпы және кең ауқымды етістіктер, ал тропонимдер (бір нәрсені жасаудың нақты жолын сипаттайтын етістіктер) төменгі жағында топтастырылған. Етістіктің ерекшелігі вектор бойынша өзгереді, етістіктер белгілі бір сапаға қатысты нақтырақ болып кетеді. Бұл машиналық аударма саласында өте қиын және әлі шешілмеген мәселе. Мәселенің бірі – екі тілдің бірін-бірі сөзбе-сөз аудару мүмкін еместігінде. Яғни, әр тілдің басқа тілдерден құрылымдық немесе синтаксистік айырмашылықтары бар. Сонымен қатар, тілдерде басқа тілдерге оңай аударылмайтын сөздер жиі кездеседі, тіпті сөзбе-сөз сәйкес келетін сөздер де табылмайды. Wordnet-терді құру үшін стандартты негіз жасау туралы ұсыныстар енгізілген. Зерттеулер көрсеткендей, белгілі барлық адам тілінде синонимия, гипонимия, меронимия және антонимияға ұқсас ұғымдар бар. Дегенмен, қазіге дейін ұсынылған әрбір идея ағылшын тілі үшін тиімді үлгіні қолданғаны үшін сынға ұшырады, ал басқа тілдерде тиімділігі төмен болды. Бұл саладағы тағы бір кедергі – семантикалық лексиканың құрылымы мен мазмұнына қатысты нақты ережелердің жоқтығы. Әр түрлі тілдердегі әр лексикалық жобаның сөздік желісіне қатысты көзқарасы әлдебір дәрежеде (немесе айқын) ерекшеленеді. Тіпті «сөз» дегеннің қандай екендігіне келісім жоқ. Орфографиялық тұрғыдан алғанда, сөз – екі жағында бос орын бар әріптер тізбегі, бірақ семантикалық тұрғыдан бұл өте күрделі мәселе. Мысалы, «ит» және «таяқ» сөздерін анықтау оңай болса да, «күзетші ит» және «найзағай таяғы» қалай анықталады? Соңғы екі мысал орфографиялық тұрғыдан бөлек сөздер болып саналады, бірақ семантикалық тұрғыдан бір ұғымды білдіреді: бірі – иттың бір түрі, екіншісі – таяқтың бір түрі. Бұған қоса, wordnet-тер тұрақсыз, себебі элементтерді біркелкі белгілемейді. Олар қайталанады, себебі әрбір мағынаға бірнеше сөз (сөз тіркестері) беріледі. Сонымен қатар, олар ашық, себебі көбінесе терминология мен салалық сөздікке назар аударады және оны кеңейтеді.
Verb synsets are arranged much like their noun counterparts: the more general and encompassing verbs are near the top of the hierarchy while troponyms (verbs that describe a more specific way of doing something) are grouped beneath. Verb specificity moves along a vector, with the verbs becoming more and more specific in reference to a certain quality. This is an extremely challenging and as of yet unsolved issue in the Machine Translation field. One issue arises from the fact that no two languages are word for word translations of each other. That is, every language has some sort of structural or syntactic difference from every other. In addition, languages often have words that don’t translate easily into other languages, and certainly not with an exact word to word match. Proposals have been made to create a set framework for wordnets. Research has shown that every known human language has some sort of concept resembling synonymy, hyponymy, meronymy, and antonymy. However, every idea so far proposed has been met with criticism for using a pattern that works best for English and less for other languages. Another obstacle in the field is that no solid guidelines exist for semantic lexicon framework and contents. Each lexicon project in each different language has had a slightly (or not so slightly) different approach to their wordnet. There is not even an agreed upon definition of what a “word” is. Orthographically, they are defined as a string of letters with spaces on either side, but semantically it becomes a very debated subject. For example, though it is not difficult to define dog or rod as words, but what about guard dog or lightning rod? The latter two examples would be considered orthographically separate words, though semantically they make up one concept: one is a type of dog and one is a type of rod. In addition to these confusions, wordnets are also idiosyncratic, in that they do not consistently label items. They are redundant, in that they often have several words assigned to each meaning (synsets). They are also open ended, in that they often focus on and extend into terminology and domain specific vocabulary.