Кіріспе
Құрылымдалмаған мәтінде аталған тұлға аталымдарын алдын ала анықталған санаттарға бөліп шығару.
Аталған тұлғаны тану (NER) (сондай-ақ, (аталған) тұлғаны анықтау, тұлғалық кесектерге бөлу және тұлғаны алу деп те аталады) – бұл ақпаратты алудың бір саласы, ол құрылымдалмаған мәтінде кездесетін аталған тұлғаларды, мысалы, адам аттары, ұйымдар, орналасқан жерлер, медициналық кодтар, уақыт тіркестері, сандық мәндер, ақша сомалары, проценттер және т.б. сияқты алдын ала анықталған санаттарға жіктеуге және орналастыруға бағытталған. NER/NEE жүйелеріне қатысты зерттеулердің көп бөлігі мәтіннің белгіленбеген бөлігін қабылдау түрінде жүзеге асырылады, мысалы:
Джим 2006 жылы Acme Corp. компаниясының 300 акциясын сатып алды. Осыдан кейін, тұлға аталымдары белгіленген мәтін бөлігін құрады:
[Джим]Адам 2006 жылы [Acme Corp.]Ұйымның 300 акциясын сатып алды [2006]Уақыт. Бұл мысалда бір сөзден тұратын адам аты, екі сөзден тұратын компания аты және уақытша тіркес анықталып, жіктелді. Ағылшын тіліндегі NER жүйелерінің қазіргі деңгейдегі жетістіктері адамның өнімділігіне жақын нәтижелер береді. Мысалы, MUC 7 жарысына қатысқан ең жақсы жүйе F-өлшемі бойынша 93,39% көрсеткен, ал адам-анотаторлар 97,60% және 96,95% нәтижелерге қол жеткізген.
Мәселе анықтамасы
Аталған тұлға атауындағы «аталған» сөзі тапсырманы бір немесе бірнеше тіркестермен, мысалы сөздермен немесе сөз тіркестерімен, белгілі бір нысанды тұрақты түрде білдіретін тұлғаларға шектейді. Бұл Крипке анықтаған қатаң белгілермен тығыз байланысты, бірақ іс жүзінде АТТ (аталған тұлғаны тану) философиялық тұрғыдан «қатаң» емес көптеген атаулар мен нысандармен жұмыс істейді. Мысалы, Генри Форд 1903 жылы құрған автомобиль компаниясын «Форд» немесе «Форд Мотор Компани» деп атауға болады, бірақ «Форд» басқа да көптеген нысандарды білдіре алады (Форд туралы қараңыз). Қатаң белгілерге жеке атаулармен қатар белгілі бір биологиялық түрлер мен заттардың терминдері кіреді, бірақ есімдіктер («осы», coreference resolution қараңыз), нысанын қасиеттері арқылы анықтайтын сипаттамалар (De dicto және de re қараңыз), және жеке нысандарға қарағанда заттардың түрлері (мысалы, «Банк») кірмейді. Толық аталған тұлғаны тану тұжырымдық және мүмкін іске асыруда екі бөлек мәселеге бөлінеді: атауларды анықтау және олар көрсеткен нысан түріне қарай жіктеу (мысалы, адам, ұйым немесе орналасқан жер). Бірінші кезең әдетте сегментация мәселесіне дейін жеңілдетіледі: атаулар токендердің тізбекті аралықтары ретінде анықталады, ішкі ұялаусыз, сондықтан «Америка Банкі» — бұл бір атау, атаудың ішіндегі «Америка» сөзінің өзі атау екенін ескермей. Бұл сегментация мәселесі формальды түрде бөлшектеуге ұқсас. Екінші кезеңде заттар санаттарын ұйымдастыру үшін онтологияны таңдау қажет. Уақыттық және кейбір сандық өрнектер (мысалы, ақша, пайыздық көрсеткіштер және т.б.) АТТ тапсырмасы аясында аталған тұлғалар ретінде де қарастырылуы мүмкін. Бұл типтердің кейбір мысалдары қатаң белгілердің жақсы мысалдары болғанымен (мысалы, 2001 жыл), көптеген жарамсыз мысалдар да бар (мысалы, мен маусымда демалысқа шығамын). Бірінші жағдайда 2001 жыл Григориан күнтізбесінің 2001-ші жылын білдіреді. Екінші жағдайда маусым айы белгісіз жылдың айына қатысты болуы мүмкін (өткен маусым, келесі маусым, әр маусым және т.б.). Мұндай жағдайларда аталған тұлғаның анықтамасы практикалық себептермен жеңілдетілуі мүмкін. Сондықтан «аталған тұлға» терминінің анықтамасы қатаң емес және оны қолданылған контексте түсіндіру қажет. Әдебиетте аталған тұлғалардың түрлерінің бірнеше иерархиялары ұсынылған. 2002 жылы ұсынылған BBN санаттары сұрақтарға жауап беру үшін қолданылады және 29 тип пен 64 субтиптен тұрады. 2002 жылы ұсынылған Секиннің кеңейтілген иерархиясы 200 субтиптен тұрады. Соңғы уақыттарда, 2011 жылы Риттер әлеуметтік желілердегі мәтін бойынша АТТ-дегі жаңа эксперименттерде Freebase-тің кең таралған нысан түрлеріне негізделген иерархияны қолданды.
Қадамдар
НЭР жүйелері лингвистикалық грамматикаға негізделген әдістерді, сондай-ақ машиналық оқыту сияқты статистикалық модельдерді қолданады. Қолмен жасалған грамматикаға негізделген жүйелер әдетте жақсы дәлдікке қол жеткізеді, бірақ тәжірибелі есептеу лингвистерінің айлар бойы жұмыс істеуіне және есте сақтаудың төмендеуіне әкеледі. Статистикалық НЭР жүйелеріне әдетте қолмен белгіленген оқу деректерінің көп мөлшері қажет. Аннотациялау жұмысын азайту үшін жартылай қадағалау әдістері ұсынылған. Машиналық оқыту арқылы НЭР-ді жүзеге асыру үшін түрлі классификаторлар қолданылды, олардың ішінде шартты кездейсоқ өрістер ең көп таңдалатыны болып табылады.
Проблемалық салалар
2001 жылы жүргізілген зерттеулер көрсеткендей, тіпті ең жетілген NER жүйелері де нашар болды, яғни бір сала үшін жасалған NER жүйелері басқа салаларда тиімді жұмыс істемейді. Жаңа салаға бейімдеу үшін NER жүйелерін жақсартуға көп күш жұмсалады; бұл қағидаға негізделген және оқытылатын статистикалық жүйелерге де қатысты. 1990 жылдардағы NER жүйелеріндегі алғашқы жұмыстар көбінесе журналистік мақалалардан ақпаратты алуға бағытталған. Кейін әскери хабарламалар мен есептерді өңдеуге назар аударылды. Автоматты мазмұн алу (ACE) бағалауының келесі кезеңдеріне веблогтар және телефон арқылы жүргізілген әңгімелердің мәтіндік транскрипттері сияқты бейресми мәтілдердің бірнеше түрі енгізілді. 1998 жылдан бері молекулалық биология, биоинформатика және медициналық табиғи тілді өңдеу салаларындағы мамандар тұлғаларды анықтауға үлкен қызығушылық танытты. Бұл салаларда ең көп қызығушылық тудырған нәрсе – гендер мен ген өнімдерінің атаулары болды. CHEMDNER бәйгесі аясында химиялық заттар мен дәрі-дәрмектерді тануға да қызығушылық артты, оған 27 команда қатысты.
competition, with 27 teams participating in this task.
Қазіргі кездегі қиындықтар мен зерттеулер
MUC 7 деректер жиынтығында жоғары F1 көрсеткіштері хабарланғанына қарамастан, атаулы субъектілерді тану мәселесі толық шешілген жоқ. Басты күш-жігерлер жартылай қадағаланатын оқыту арқылы аннотацияға жұмсалатын еңбекті азайтуға, домендерде тұрақты нәтижелерге қол жеткізуге және нақты жіктемелерге дейін масштабтауға бағытталған. Соңғы жылдары көптеген жобалар көпшілікке жүктеуге көшті, бұл бақыланатын және жартылай қадағаланатын машиналық оқыту тәсілдері үшін NER-ге қатысты жоғары сапалы жиынтық адам пікірлерін алудың перспективті жолы болып табылады. Тағы бір қиындық – Twitter және іздеу сұрақтары сияқты тілдік тұрғыдан күрделі жағдайларды шешуге арналған модельдерді жасау. Кейбір зерттеушілер HMM (жасырын Марков моделі), ME (максималды энтропия) және CRF (шартты кездейсоқ өрістер) сияқты әртүрлі статистикалық модельдердің және ерекшелік жиынтықтарының NER көрсеткіштерін салыстырды. Ал кейбір зерттеушілер жақында тілге қатысты NER міндеттері үшін графикалық негіздегі жартылай қадағаланатын оқыту моделін ұсынды. Мәтіндегі "маңызды тіркестерді" анықтау және оларды Wikipedia-мен байланыстыру міндеті, өте жіктемелі атаулы субъектілерді танудың мысалы ретінде қарастырылуы мүмкін, онда типтер – (әлеуетті екіұшты) түсініктерді сипаттайтын нақты Wikipedia беттері. Төмендегісі – Wikification жүйесінің мысалы:
<ENTITY url="https://en.wikipedia.org/wiki/Michael_I._Jordan">Michael Jordan</ENTITY> <ENTITY url="https://en.wikipedia.org/wiki/University_of_California,_Berkeley">Berkeley</ENTITY> университетінде профессор.
<ENTITY url="https://en. wikipedia. org/wiki/Michael I. Jordan"> Michael Jordan </ENTITY> is a professor at <ENTITY url="https://en. wikipedia. org/wiki/University of California, Berkeley"> Berkeley </ENTITY>
Стандартты емес орфография, мәтіндердің қысқалығы мен ресми емес тіліне байланысты "шулы" деп саналатын Twitter және басқа микроблогтарға NER қолдану – жетістікке жеткенімен, әлі де қиындықтарды тудыратын тағы бір сала. NER-ді бағалау үшін ағылшын тіліндегі твиттер бойынша зерттеу қауымдастықтары ұйымдастырылған, олар екі бағытты LSTM, Learning to Search немесе CRF сияқты әртүрлі тәсілдердің нәтижелерін салыстырды.