Кіріспе

Ағылшын тілінің есептеулік лексикасы – сөздер арасындағы семантикалық қатынастардың лексикалық дерекқоры, сөздерді синонимдер, гипонимдер және меронимдер сияқты семантикалық байланыстар арқылы ұштастырады. Синонимдер қысқаша анықтамалармен және қолданылу мысалдарымен синсеттерге топтастырылған. Осылайша, оны сөздік пен тезаурустың біріктірілген және кеңейтілген нұсқасы деп қарастыруға болады. Ол веб-браузер арқылы қолданушыларға қолжетімді болғанымен, негізгі қолданылуы автоматты мәтіндік талдау және жасанды интеллект саласындағы қолданбаларда. Алғаш рет ол ағылшын тілінде жасалды, ал ағылшын тіліндегі WordNet дерекқоры мен бағдарламалық құралдары BSD стиліндегі лицензия бойынша жарияланды және WordNet веб-сайтынан тегін жүктеуге қолжетімді. Қазіргі таңда 200-ден астам тілде WordNet бар.

Тарих және топ мүшелері

WordNet алғаш рет 1985 жылы, тек ағылшын тілінде, Принстон университетінің когнитивтік ғылымдар зертханасында психология профессоры Джордж Армитаж Миллердің басшылығымен құрылды. Кейін оны Кристиан Феллбаум басқарды. Жоба бастапқыда АҚШ Әскери-теңіз зерттеулер басқармасымен қаржыландырылды, ал кейіннен DARPA, Ұлттық ғылым қоры, инновациялық технологиялар кеңсесі (бұрынғы Ғылыми-зерттеу және даму қызметі) және REFLEX сияқты басқа да АҚШ үкіметтік мекемелері де қаржыландырды. Джордж Миллер мен Кристиан Феллбаум WordNet бойынша жасаған жұмыстары үшін 2006 жылы Антонио Замполли сыйлығына ие болды. Global WordNet Association – әлемдегі барлық тілдердегі WordNet жүйелерін талқылау, бөлісу және байланыстыру үшін платформа ұсынатын коммерциялық емес ұйым. Оның тең төрағалары – Кристиан Феллбаум және Пик Т. Й. М. Воссен.

Психолингвистикалық аспектілер

WordNet жобасының бастапқы мақсаты – 1960 жылдардың соңында қалыптасқан адамның семантикалық жады теорияларымен үйлесетін лексикалық деректер базасын құру еді. Психологиялық эксперименттер көрсеткендей, адамдар түсініктер туралы білімдерін экономикалық, иерархиялық түрде ұйымдастырады. Тұжырымдамалық білімге қол жеткізуге қажетті уақыт, сөйлеушінің білімге қол жеткізу үшін «өтүі» қажет иерархиялар санымен тікелей байланысты болды. Мысалы, адамдар канаридің ән айта алатынын тез растады, себебі канари – әнші құс, бірақ канаридің ұша алатынын растау үшін сәл көбірек уақыт кетті (олар «құс» түсінігіне жоғары деңгейде жүгінуі керек болды), ал канаридің терісі бар екенін растау үшін одан да көп уақыт қажет болды (гипонимияның бірнеше деңгейлерін, тіпті «жануарға» дейін қарау қажет болды). Мұндай психолингвистикалық эксперименттер мен оларға негіделген теориялар сынға түскенімен, WordNet ұйымдастыруының бір бөлігі тәжірибелік деректермен сәйкес келеді. Мысалы, аномальды афазия сөйлеушілердің белгілі бір семантикалық категориядан, WordNet иерархиясынан сөздерді шығару қабілетіне таңдамалы түрде әсер етеді. WordNet-тің «гиря» құрылымындағы орталық сөздер болып табылатын антонимдік сын есімдер, кездейсоқтықтан гөрі әлдеқайда жиі кездеседі, және бұл факт көптеген тілдерде орын алған.

Лексикалық онтология ретінде

WordNet кейде онтология деп аталады, бірақ оның авторлары мұндай мәлімдеме жасамайды. Атау синсеттері арасындағы гиперним/гипоним қатынастарын ұғымдық санаттар арасындағы мамандану қатынастары ретінде қарастыруға болады. Басқаша айтқанда, WordNet компьютер ғылымы мағынасында лексикалық онтология ретінде түсіндіріліп, қолданылуы мүмкін. Дегенмен, мұндай онтологияны қолдану алдында түзету қажет, себебі оның құрамында жүздеген негізгі семантикалық қайшылықтар бар; мысалы, (i) өзгеше санаттар үшін ортақ маманданулар және (ii) мамандану иерархиясындағы қайталаулар кездеседі. Сонымен қатар, WordNet-ті білімді ұсыну үшін қолданылатын лексикалық онтологияға түрлендіру кезінде әдетте (i) мамандану қатынастарын subtypeOf және instanceOf қатынастарына бөлу және (ii) әр санатқа интуитивті бірегей идентификаторлар тағайындау қажет. Мұндай түзетулер мен түрлендірулер WordNet 1.7-нің WebKB 2 білім базасына біріктірілуінің аясында орындалып, құжатталған болса да, WordNet-ті білімге негізделген қолданбалар үшін (әдетте, білімге бағытталған ақпаратты іздеу) қайта пайдаланатынын мәлімдейтін көптеген жобалар оны тікелей пайдаланады. WordNet гибридтік төменнен жоғары және жоғарыдан төмен әдістеме арқылы ресми сипаттамаға айналдырылды, осы арқылы одан байланыс қатынастарын автоматты түрде шығарып алып, осы байланыстарды DOLCE негізгі онтологиясында ресми түрде анықталған ұғымдық қатынастар жиынтығы тұрғысынан түсіндіруге болады. WordNet-ті онтологияға біріктіргендері туралы мәлімдейтін көптеген жұмыстарда WordNet мазмұны қажет болған жағдайда түзетілген жоқ; керісінше, ол қажет болған кезде ауқымды түрде қайта қаралып, жаңартылды. Мысалы, WordNet-тің жоғары деңгейлі онтологиясы OntoClean негізделген тәсілге сәйкес қайта құрылғанда немесе ол SENSUS онтологиясының төменгі кластарын құру үшін бастапқы көз ретінде қолданылғанда осылай болды.

Шектеулер

WordNet-тің (және ImageNet сияқты байланысты ресурстардың) ең көп талқыланған шектеулерінің бірі – кейбір семантикалық қатынастар абстрактілі ұғымдарға қарағанда нақты ұғымдарға көбірек сай келеді. Мысалы, "коньер" – "ағаш" түрі, "ағаш" – "өсімдік" түрі, ал "өсімдік" – "организм" түрі екенін көрсету үшін гипонимдер/гипернимдер қатынастарын құру оңай, бірақ "қорқыныш" немесе "бақыт" сияқты сезімдерді бірдей тереңдіктегі және анықталған гипонимдер/гипернимдерге жіктеу қиын. WordNet-тегі көптеген ұғымдар нақты бір тілге тән, ал тілдер арасындағы ең жоғары дәлдіктегі сәйкестік 94% құрайды. Синонимдер, гипонимдер, меронимдер және антонимдер WordNet-і бар барлық тілдерде кездеседі, бірақ басқа семантикалық қатынастар тілге қатысты болады. Бұл тілдер арасындағы өзара жұмыс істеу мүмкіндігін шектейді. Дегенмен, бұл WordNet-ті тілдер арасындағы айырмашылықтарды анықтау және зерттеу үшін пайдалы ресурс етеді, сондықтан бұл барлық қолдану жағдайлары үшін міндетті түрде шектеу болып табылмайды. WordNet сөздердің этимологиясы және айтылуы туралы ақпаратты қамтымайды, сондай-ақ қолданылуы туралы да шектеулі мәлімет береді. WordNet көбінесе күнделікті қолданыстағы сөздерді қамтуға бағытталған және салалық терминологияны көп қамтымайды. WordNet – ағылшын тіліндегі сөздердің мағынасын ажырату (WSD) үшін ең көп қолданылатын есептеу лексикасы, мақсаты – мәтіндегі сөздерге контекстке сай келетін мағынаны (яғни, синсет мүшелерін) тағайындау. Алайда, WordNet мағыналық айырмашылықтарды тым егжей-тегжейлі түрде кодтайды деген пікір бар. Бұл мәселе WSD жүйелерінің адамдарға қарағанда жоғары нәтижеге қол жеткізуіне кедергі келтіреді, себебі адамдар кейде сөздіктегі сөздің мағынын контекстке сай таңдау кезінде келіспейді. Бұл мәселені шешу үшін бір сөздің ұқсас мағыналарын автоматты түрде топтастыратын кластерлеу әдістері ұсынылған.

Ұялы мазмұн

WordNet-ке қарапайым тұрғыдан немесе жағымсыз деп естіле алатын сөздер кіреді. Сөздің мағынасы уақыт өте келе және әлеуметтік топтар арасында өзгеріп отыруы мүмкін, сондықтан WordNet-тің бір сөзді жеке-дара "жағымсыз" немесе "нашар" деп анықтауы әрқашан мүмкін емес. Сондықтан WordNet-ті пайдаланатындар қорлаушы немесе жағымсыз сөздерді анықтау үшін өздерінің тәсілдерін қолдануы керек. Дегенмен, бұл кемшілік басқа лексикалық ресурстарға да тән, мысалы, сөздіктер мен синонимдер жинағында да жағымсыз және қорлаушы сөздер кездеседі. Кейбір сөздіктер сөздердің жағымсыз екенін көрсетеді, бірақ әртүрлі әлеуметтік топтар үшін сөздердің қабылданылуы немесе қорлаушы болып естілуі мүмкін жағдайлардың барлығын қамтымайды. Сондықтан сөздіктерді пайдаланатындар барлық қорлаушы сөздерді анықтау үшін өздерінің тәсілдерін қолдануы керек.

Лицензияланған және ашық WordNets

Кейіннен басқа тілдер үшін де бірнеше сөз желілері жасалды. 2012 жылғы шолуда сөз желілерінің тізімі және олардың қолжетімділігі келтірілген. WordNet-тердің қолданылуын кеңейту үшін Global WordNet қауымдастығы өз WordNet-терін ашық қолданысқа қайта лицензиялауды жүзеге асырып келеді, бұл зерттеушілер мен бағдарламашыларға WordNet-терге оңай қол жеткізіп, оларды табиғи тілді өңдеу (NLP) міндеттерінде онтологиялық және лексикалық білімді ұсыну үшін тілдік ресурстар ретінде пайдалануға мүмкіндік береді. Ашық көптілді WordNet әртүрлі тілдердегі ашық лицензияланған сөз желілеріне қол жеткізуді қамтамасыз етеді, олардың барлығы Принстон ағылшын тілінің сөз желісімен (PWN) байланысты. Мақсаты – бірнеше тілде сөз желілерін пайдалануды жеңілдету.

Қолданбалар

WordNet ақпараттық жүйелерде көптеген мақсаттар үшін қолданылған, оның ішінде сөз мағынасын ажырату, ақпаратты іздеу, автоматты мәтіндерді жіктеу, автоматты мәтіндерді тұжырымдау, машиналық аударма және тіпті автоматты кроссвордтар құру сияқты. WordNet-ті пайдаланудың кең таралған жолы – сөздердің ұқсастығын анықтау. Әртүрлі алгоритмдер ұсынылған, соның ішінде WordNet-тің графиктік құрылымындағы сөздер мен синонимдер топтары арасындағы қашықтықты өлшеу, мысалы, синонимдер топтары арасындағы қабырғалар санын санау арқылы. Екі сөз немесе синонимдер тобы неғұрлым жақын болса, олардың мағынасы да соғұрлым жақын деген ой бар. WordNet негізіндегі сөз ұқсастығын анықтайтын алгоритмдердің бірнешеуі WordNet::Similarity деп аталатын Perl жинағында және NLTK деп аталатын Python жинағында іске асырылған. Басқа, күрделірек WordNet негізделген ұқсастық техникаларына ADW жатады, оның Java-да іске асырылуы қолжетімді. WordNet басқа сөздіктермен өзара байланыс орнату үшін де пайдаланылуы мүмкін.

Интерфейстер

Принстон университеті WordNet-ке түрлі бағдарламалау тілдері мен орталарында қол жеткізуге арналған, көп қолданылатын қолданбалы бағдарламалау интерфейстеріне сілтемелерді қамтитын, байланысты жобалардың тізімін ұстап тұрады.

Байланысты жобалар мен кеңейтулер

WordNet Семантикалық Вебтің бірнеше дерекқорына байланысты. WordNet синсеттері мен онтологиялардағы санаттар арасындағы шамалас кестелер арқылы да жиі қайта қолданылады. Көбінесе WordNet-тің жоғарғы деңгейдегі санаттары ғана шамалас кестеге түсіріледі.

Дүниежүзілік WordNet қауымдастығы

Глобалды WordNet қауымдастығы (GWA) – әлемдегі барлық тілдер үшін сөз тіркесімдерін талқылауға, бөлісуге және байланыстыруға арналған платформа ұсынатын, коммерциялық емес қоғамдық ұйым. GWA сондай-ақ, адам тілдеріндегі синонимдер топтарын (синсеттерді) есептеудегі біркелкілікті қамтамасыз ету мақсатында, түрлі тілдердегі сөз тіркесімдерін стандартизациялауды ілгерілетеді. GWA әлем бойынша жасалған сөз тіркесімдерінің тізімін сақтайды.

Байланысты деректер

BabelNet – WordNet және Wikipedia-ны автоматты түрде кестелеу алгоритмін қолдана отырып біріктіру арқылы алынған миллиондаған түсініктер бар, өте ірі көптілді семантикалық желі. SUMO онтологиясы барлық WordNet синсеттері мен SUMO-ның барлығы арасында толық қолмен сәйкестендірілген (оның ішінде домендік онтологиялары, егер WordNet берілген SUMO термині үшін сөз мағынасын қамтыса), мысалы, OpenCyc-те қарастырылған. OpenCyc – күнделікті ақылға қонымды білімнің ашық онтологиясы және білім базасы, онда WordNet синонимдер жиынтығымен байланысты 12 000 термин бар. DOLCE – WonderWeb Foundational Ontologies Library (WFOL) кітапханасының бірінші модулі. Бұл жоғары деңгейлі онтология философиялық дәстүрге негізделген қатаң онтологиялық принциптер бойынша, тіл мен танымға бағытталған түрде жасалған. OntoWordNet – WordNet-тің жоғарғы деңгейін DOLCE-мен эксперименттік түрде кестелеудің нәтижесі. Мұндай кестелеу «онтологиялық жақсартылған» WordNet-ке алып келуі мүмкін, ол тұжырымдық тұрғыдан дұрыс, когнитивтік тұрғыдан түсінікті және бірнеше қолданыста тиімді пайдалануға болады. DBpedia – құрылымдалған ақпараттың дерекқоры, WordNet-ке байланысты. eXtended WordNet – Техас университетінің Даллас қаласындағы жобасы, мақсаты WordNet-ті глоссаларды семантикалық талдау арқылы жақсарту, осылайша осы анықтамалардағы ақпаратты автоматты білімді өңдеу жүйелері үшін қолжетімді ету. Ол WordNet-ке ұқсас лицензия бойынша тегін қолжетімді. GCIDE жобасы 1913 жылғы Webster's Dictionary сөздігін, кейбір WordNet анықтамаларын және еріктілер ұсынған материалдарды біріктіріп сөздік жасады. Ол copyleft лицензиясы GPL бойынша жарияланды. ImageNet – WordNet иерархиясы бойынша ұйымдастырылған кескіндер базасы (қазіргі уақытта тек есімдер), онда иерархияның әрбір түйіні миллиондаған кескіндермен бейнеленген. Қазіргі уақытта әрбір түйінге орта есеппен 500-ден астам кескін бар. BioWordnet – WordNet-тің биомедициналық кеңейтімдері нұсқалардың тұрақтылығына қатысты мәселелерге байланысты тоқтатылды. WikiTax2WordNet – WordNet синсеттері мен Wikipedia санаттары арасындағы кестелеу. WordNet++ – Wikipedia-дан алынған миллиондаған семантикалық байланыстарды және WordNet синсеттерінің жұптарын қамтитын ресурс. SentiWordNet – пікірлерді талдау қолданбаларын қолдауға арналған ресурс, ол WordNet 3.0-тың барлық синсеттерін олардың оң, теріс және бейтарап болу дәрежесіне сәйкес белгілеу арқылы алынған. ColorDict – Wordnet дерекқоры және Wikipedia сияқты басқа дереккөздерді пайдаланатын ұялы телефондарға арналған Android қосымшасы. UBY LMF – WordNet-ті қоса алғанда 10 ресурстың дерекқорын қамтиды.

Қатысушы жобалар

FrameNet – WordNet-пен кейбір ортақтықтары бар және оған сілтеме жасайтын лексикалық деректер базасы. Лексикалық белгілеу жүйесі (LMF) – WordNet-ті қоса алғанда, сөздіктерді құру үшін ортақ, стандартталған базаны анықтау мақсатында ISO/TC37 стандартында белгіленген ISO стандарты. Wordnet үшін LMF-тің таңдамалы бөлігі Wordnet LMF деп аталады. KYOTO жобасы шеңберінде оның үлгісі жасалды. UNL бағдарламасы – машиналық аударма және ақпаратты іздеу жүйелерінде қолдану үшін көптеген тілдердің лексикосемантикалық деректерін біріктіруге бағытталған БҰҰ басшылығымен жүзеге асырылатын жоба. Meaning Monkey – WordNet деректер базасына негізделген тегін онлайн сөздік. Dictionary.video – айтылуға назар аударатын видео сөздік. Оның мәтіндік бөлігі WordNet-тен дамытылған.