Кіріспе
Машинамен құрылымсыз құжаттарды оқу Ақпаратты алу (IE) – құрылымдалмаған және/немесе жартылай құрылымдалған машинамен оқылатын құжаттардан және басқа да электрондық түрде ұсынылған көздерден құрылымдалған ақпаратты автоматты түрде алу міндеті. Әдетте, бұл табиғи тілдік өңдеу (NLP) құралдарымен адам тіліндегі мәтіндерді өңдеуді қамтиды. Мультимедиалық құжаттарды өңдеудегі соңғы жетістіктер, мысалы, автоматты түсіндірмелер беру және суреттерден/аудиодан/видеодан/құжаттардан мазмұнды алу да ақпаратты алудың бір түрі болып саналады. Жақында NLP техникасының дамуы бұрынғы жылдармен салыстырғанда өнімділіктің айтарлықтай артуына мүмкіндік берді. Мысалы, корпоративтік бірігулер туралы жаңалықтар баяндамаларынан ақпаратты алу, мысалы, келесі ресми қатынас арқылы белгіленген: , онлайн жаңалықтардан: "Кеше Нью-Йорк қаласындағы Foo Inc. Bar Corp. компаниясын сатып алғанын жариялады" сияқты мәтіндерден алуға болады. IE-нің басты мақсаты – бұрын құрылымдалмаған деректермен есептеулер жасауға мүмкіндік беру. Нақтырақ айтқанда, кіріс деректерінің логикалық формасы туралы автоматты түрде қорытынды жасауға рұқсат ету. Құрылымдалған деректер – бұл таңдалған салаға қатысты санаты мен контекстісі нақты анықталған, семантикалық тұрғыдан дұрыс бейнеленген деректер. Ақпаратты алу – мәтінді басқарудың автоматты әдістерін жасау мәселесін шешетін үлкен проблеманың бір бөлігі, оның беруінен, сақтаудан және көрсетуінен асып түседі. Ақпаратты іздеу (IR) саласы ірі құжат жинақтарын индекстеу және құжаттарды жіктеу үшін әдетте статистикалық тәсілдерге негізделген автоматты әдістерді әзірледі. Тағы бір толықтыратын тәсіл – табиғи тілдік өңдеу (NLP), ол адам тілін модельдеу мәселесін тапсырманың күрделілігін ескере отырып, үлкен жетістіктерге қол жеткізді. IE IR және NLP-нің арасындағы міндеттердің қиындығы мен маңыздылығы тұрғысынан қарастырылады. IE кіріс деректері ретінде әрбір құжаттың белгілі бір үлгіге сәйкес келетін, яғни басқа құжаттардағы сияқты бір немесе бірнеше нысанды немесе оқиғаны сипаттайтын, бірақ егжей-тегжейлі мәліметтерімен ерекшеленетін құжаттар жиынтығын қарастырады. Мысалы, Латын Америкасындағы терроризм туралы жаңалықтар жиынтығын қарастырайық, онда әр мақала бір немесе бірнеше террористік актілерге негізделген деп есептеледі. Сондай-ақ, кез келген IE міндеті үшін шаблонды анықтаймыз, ол бір құжаттағы ақпаратты сақтауға арналған (немесе) кейс фреймінің жиынтығы болып табылады. Терроризм мысалында шаблон террористік актіні жасаған адам, құрбан, қару және оқиға болған күнді көрсететін слоттардан тұрады. Бұл мәселеге арналған IE жүйесі шабуыл туралы мақаланы осы шаблонның слоттарына сәйкес келетін деректерді табу үшін жеткілікті деңгейде "түсінуі" керек.
Information extraction (IE) is the task of automatically extracting structured information from unstructured and/or semi structured machine readable documents and other electronically represented sources. Typically, this involves processing human language texts by means of natural language processing (NLP). Recent activities in multimedia document processing like automatic annotation and content extraction out of images/audio/video/documents could be seen as information extraction. Recent advances in NLP techniques have allowed for significantly improved performance compared to previous years. An example is the extraction from newswire reports of corporate mergers, such as denoted by the formal relation:
,
from an online news sentence such as:
"Yesterday, New York based Foo Inc. announced their acquisition of Bar Corp."
A broad goal of IE is to allow computation to be done on the previously unstructured data. A more specific goal is to allow automated reasoning about the logical form of the input data. Structured data is semantically well defined data from a chosen target domain, interpreted with respect to category and context. Information extraction is the part of a greater puzzle which deals with the problem of devising automatic methods for text management, beyond its transmission, storage and display. The discipline of information retrieval (IR) has developed automatic methods, typically of a statistical flavor, for indexing large document collections and classifying documents. Another complementary approach is that of natural language processing (NLP) which has solved the problem of modelling human language processing with considerable success when taking into account the magnitude of the task. In terms of both difficulty and emphasis, IE deals with tasks in between both IR and NLP. In terms of input, IE assumes the existence of a set of documents in which each document follows a template, i. e. describes one or more entities or events in a manner that is similar to those in other documents but differing in the details. An example, consider a group of newswire articles on Latin American terrorism with each article presumed to be based upon one or more terroristic acts. We also define for any given IE task a template, which is a(or a set of) case frame(s) to hold the information contained in a single document. For the terrorism example, a template would have slots corresponding to the perpetrator, victim, and weapon of the terroristic act, and the date on which the event happened. An IE system for this problem is required to "understand" an attack article only enough to find data corresponding to the slots in this template.
Тарих
Ақпаратты алу тарихы 1970 жылдардың соңына, табиғи тілді өңдеудің (NLP) алғашқы кезеңіне дейін жетеді. 1980 жылдардың ортасынан бастап Карнеги тобы Inc. компаниясы Reuters үшін қаржы саудагерлеріне нақты уақыт режимінде қаржылық жаңалықтарды ұсыну мақсатымен JASPER коммерциялық жүйесін жасады. 1987 жылдан бастап ақпаратты алу (ИЕ) хабарды түсіну конференцияларының бірнешесі арқылы дамыды. MUC – бұл келесі салаларға бағытталған, бәсекеге негізделген конференция: MUC 1 (1987), MUC 3 (1989): Теңіз операциялары туралы хабарламалар. MUC 3 (1991), MUC 4 (1992): Латын Америкасы елдеріндегі терроризм. MUC 5 (1993): Бірлескен кәсіпорындар және микроэлектроника саласы. MUC 6 (1995): Басқарудағы өзгерістер туралы жаңалықтар. MUC 7 (1998): Спутниктерді ұшыру туралы есептер. АҚШ Қорғаныс министрлігінің жоғары технологиялық зерттеулер агенттігі (DARPA) үкіметтік сарапшылардың газеттерді терроризммен байланысты іздеу сияқты күнделікті жұмыстарын автоматтандыруды мақсат етті.
MUC 1 (1987), MUC 3 (1989): Naval operations messages. MUC 3 (1991), MUC 4 (1992): Terrorism in Latin American countries. MUC 5 (1993): Joint ventures and microelectronics domain. MUC 6 (1995): News articles on management changes. MUC 7 (1998): Satellite launch reports. Considerable support came from the U. S. Defense Advanced Research Projects Agency (DARPA), who wished to automate mundane tasks performed by government analysts, such as scanning newspapers for possible links to terrorism.
Қазіргі маңыздылығы
Қазіргі уақытта ақпаратты іздеудің (IE) маңыздылығы құрылымдалмаған түрде қол жетімді ақпарат көлемінің артуымен байланысты. World Wide Web-тің авторы Тим Бернерс Ли қазіргі Интернетті құжаттар желісі деп атайды және мазмұнның басым бөлігі деректер желісі ретінде қолжетімді болуын жақтайды. Бұл орын алғанша, веб көбінесе семантикалық метадеректерден dépour құрылымдалмаған құжаттардан тұрады. Осы құжаттардағы білімді машиналық өңдеуге қолайлы ету үшін оны реляциялық формаға түрлендіру немесе XML тегтерімен белгілеу қажет. Жаңалықтар ағынына мониторинг жасайтын интеллектуалды агентке құрылымдалмаған деректерді логикалық тұрғыдан өңдеуге болатын күйге келтіру үшін ақпаратты іздеу қажет. Ақпаратты іздеудің типолық қолданылуы – табиғи тілде жазылған құжаттар жиынтығын қарап шығу және алынған ақпаратты деректер базасына енгізу.
Дүниежүзілік веб-қосымшалар
ИЭ МКК конференцияларының негізгі тақырыбы болды. Дегенмен, Интернеттің кең таралуы адамдарға онлайн қолжетімді мол деректермен жұмыс істеуге көмектесетін ИЭ жүйелерін жасау қажеттігін күшейтті. Онлайн мәтіндерден ИЭ-ні жүзеге асыратын жүйелер төмен құн, дамудағы икемділік және жаңа салаларға оңай бейімделу талаптарын қанағаттандыруы керек. MUC жүйелері бұл критерийлерге сай келмейді. Сонымен қатар, құрылымдалмаған мәтінге жасалған тілдік талдау онлайн мәтіндерде қолжетімді HTML/XML тегтері мен макет форматтарын пайдаланбайды. Нәтижесінде, Интернеттегі ИЭ үшін аз тілдік күш жұмсалатын тәсілдер әзірленді, олар нақты бір беттің мазмұнын шығарып алатын wrapper-лер (қаптамалар) жиынтығын пайдаланады. Wrapper-лерді қолмен жасау уақытты көп алатын және жоғары біліктілікті талап ететін жұмыс болып табылады. Мұндай ережелерді автоматты түрде құру үшін бақыланатын немесе бақыланбайтын машиналық оқыту техникалары қолданылды. Wrapper-лер әдетте өнім каталогтары және телефон анықтамалары сияқты жоғары құрылымдалған веб-беттер жиынтығымен жұмыс істейді. Алайда, мәтіннің құрылымы нашар болған кезде, олар жеткіліксіз болады, бұл Интернетте де жиі кездеседі. Адаптивті ақпаратты алу бойынша соңғы жұмыстар, жақсы құрылымдалғаннан бастап дерлік еркін мәтінге дейін, әртүрлі мәтін түрлерін өңдей алатын ИЭ жүйелерін дамытуға серпін берді, мұнда әдеттегі wrapper-лер сәтсіздікке ұшырайды, соның ішінде аралас түрлерді де қамтиды. Мұндай жүйелер тілдің терең білімін пайдалана алады және сондықтан нашар құрылымдалған мәтіндерге де қолданылуы мүмкін. Соңғы жетістік – Визуалды ақпаратты алу, ол веб-бетті браузерде көрсетуге және көрсетілген веб-беттегі аймақтардың жақындығына негізделген ережелерді құруға негізделген. Бұл HTML бастапқы кодында анық үлгісі жоқ, бірақ визуалды үлгіні көрсете алатын күрделі веб-беттерден нысандарды алуға көмектеседі.