Кіріспе

Машинамен құрылымсыз құжаттарды оқу Ақпаратты алу (IE) – құрылымдалмаған және/немесе жартылай құрылымдалған машинамен оқылатын құжаттардан және басқа да электрондық түрде ұсынылған көздерден құрылымдалған ақпаратты автоматты түрде алу міндеті. Әдетте, бұл табиғи тілдік өңдеу (NLP) құралдарымен адам тіліндегі мәтіндерді өңдеуді қамтиды. Мультимедиалық құжаттарды өңдеудегі соңғы жетістіктер, мысалы, автоматты түсіндірмелер беру және суреттерден/аудиодан/видеодан/құжаттардан мазмұнды алу да ақпаратты алудың бір түрі болып саналады. Жақында NLP техникасының дамуы бұрынғы жылдармен салыстырғанда өнімділіктің айтарлықтай артуына мүмкіндік берді. Мысалы, корпоративтік бірігулер туралы жаңалықтар баяндамаларынан ақпаратты алу, мысалы, келесі ресми қатынас арқылы белгіленген: , онлайн жаңалықтардан: "Кеше Нью-Йорк қаласындағы Foo Inc. Bar Corp. компаниясын сатып алғанын жариялады" сияқты мәтіндерден алуға болады. IE-нің басты мақсаты – бұрын құрылымдалмаған деректермен есептеулер жасауға мүмкіндік беру. Нақтырақ айтқанда, кіріс деректерінің логикалық формасы туралы автоматты түрде қорытынды жасауға рұқсат ету. Құрылымдалған деректер – бұл таңдалған салаға қатысты санаты мен контекстісі нақты анықталған, семантикалық тұрғыдан дұрыс бейнеленген деректер. Ақпаратты алу – мәтінді басқарудың автоматты әдістерін жасау мәселесін шешетін үлкен проблеманың бір бөлігі, оның беруінен, сақтаудан және көрсетуінен асып түседі. Ақпаратты іздеу (IR) саласы ірі құжат жинақтарын индекстеу және құжаттарды жіктеу үшін әдетте статистикалық тәсілдерге негізделген автоматты әдістерді әзірледі. Тағы бір толықтыратын тәсіл – табиғи тілдік өңдеу (NLP), ол адам тілін модельдеу мәселесін тапсырманың күрделілігін ескере отырып, үлкен жетістіктерге қол жеткізді. IE IR және NLP-нің арасындағы міндеттердің қиындығы мен маңыздылығы тұрғысынан қарастырылады. IE кіріс деректері ретінде әрбір құжаттың белгілі бір үлгіге сәйкес келетін, яғни басқа құжаттардағы сияқты бір немесе бірнеше нысанды немесе оқиғаны сипаттайтын, бірақ егжей-тегжейлі мәліметтерімен ерекшеленетін құжаттар жиынтығын қарастырады. Мысалы, Латын Америкасындағы терроризм туралы жаңалықтар жиынтығын қарастырайық, онда әр мақала бір немесе бірнеше террористік актілерге негізделген деп есептеледі. Сондай-ақ, кез келген IE міндеті үшін шаблонды анықтаймыз, ол бір құжаттағы ақпаратты сақтауға арналған (немесе) кейс фреймінің жиынтығы болып табылады. Терроризм мысалында шаблон террористік актіні жасаған адам, құрбан, қару және оқиға болған күнді көрсететін слоттардан тұрады. Бұл мәселеге арналған IE жүйесі шабуыл туралы мақаланы осы шаблонның слоттарына сәйкес келетін деректерді табу үшін жеткілікті деңгейде "түсінуі" керек.

Тарих

Ақпаратты алу тарихы 1970 жылдардың соңына, табиғи тілді өңдеудің (NLP) алғашқы кезеңіне дейін жетеді. 1980 жылдардың ортасынан бастап Карнеги тобы Inc. компаниясы Reuters үшін қаржы саудагерлеріне нақты уақыт режимінде қаржылық жаңалықтарды ұсыну мақсатымен JASPER коммерциялық жүйесін жасады. 1987 жылдан бастап ақпаратты алу (ИЕ) хабарды түсіну конференцияларының бірнешесі арқылы дамыды. MUC – бұл келесі салаларға бағытталған, бәсекеге негізделген конференция: MUC 1 (1987), MUC 3 (1989): Теңіз операциялары туралы хабарламалар. MUC 3 (1991), MUC 4 (1992): Латын Америкасы елдеріндегі терроризм. MUC 5 (1993): Бірлескен кәсіпорындар және микроэлектроника саласы. MUC 6 (1995): Басқарудағы өзгерістер туралы жаңалықтар. MUC 7 (1998): Спутниктерді ұшыру туралы есептер. АҚШ Қорғаныс министрлігінің жоғары технологиялық зерттеулер агенттігі (DARPA) үкіметтік сарапшылардың газеттерді терроризммен байланысты іздеу сияқты күнделікті жұмыстарын автоматтандыруды мақсат етті.

Қазіргі маңыздылығы

Қазіргі уақытта ақпаратты іздеудің (IE) маңыздылығы құрылымдалмаған түрде қол жетімді ақпарат көлемінің артуымен байланысты. World Wide Web-тің авторы Тим Бернерс Ли қазіргі Интернетті құжаттар желісі деп атайды және мазмұнның басым бөлігі деректер желісі ретінде қолжетімді болуын жақтайды. Бұл орын алғанша, веб көбінесе семантикалық метадеректерден dépour құрылымдалмаған құжаттардан тұрады. Осы құжаттардағы білімді машиналық өңдеуге қолайлы ету үшін оны реляциялық формаға түрлендіру немесе XML тегтерімен белгілеу қажет. Жаңалықтар ағынына мониторинг жасайтын интеллектуалды агентке құрылымдалмаған деректерді логикалық тұрғыдан өңдеуге болатын күйге келтіру үшін ақпаратты іздеу қажет. Ақпаратты іздеудің типолық қолданылуы – табиғи тілде жазылған құжаттар жиынтығын қарап шығу және алынған ақпаратты деректер базасына енгізу.

Дүниежүзілік веб-қосымшалар

ИЭ МКК конференцияларының негізгі тақырыбы болды. Дегенмен, Интернеттің кең таралуы адамдарға онлайн қолжетімді мол деректермен жұмыс істеуге көмектесетін ИЭ жүйелерін жасау қажеттігін күшейтті. Онлайн мәтіндерден ИЭ-ні жүзеге асыратын жүйелер төмен құн, дамудағы икемділік және жаңа салаларға оңай бейімделу талаптарын қанағаттандыруы керек. MUC жүйелері бұл критерийлерге сай келмейді. Сонымен қатар, құрылымдалмаған мәтінге жасалған тілдік талдау онлайн мәтіндерде қолжетімді HTML/XML тегтері мен макет форматтарын пайдаланбайды. Нәтижесінде, Интернеттегі ИЭ үшін аз тілдік күш жұмсалатын тәсілдер әзірленді, олар нақты бір беттің мазмұнын шығарып алатын wrapper-лер (қаптамалар) жиынтығын пайдаланады. Wrapper-лерді қолмен жасау уақытты көп алатын және жоғары біліктілікті талап ететін жұмыс болып табылады. Мұндай ережелерді автоматты түрде құру үшін бақыланатын немесе бақыланбайтын машиналық оқыту техникалары қолданылды. Wrapper-лер әдетте өнім каталогтары және телефон анықтамалары сияқты жоғары құрылымдалған веб-беттер жиынтығымен жұмыс істейді. Алайда, мәтіннің құрылымы нашар болған кезде, олар жеткіліксіз болады, бұл Интернетте де жиі кездеседі. Адаптивті ақпаратты алу бойынша соңғы жұмыстар, жақсы құрылымдалғаннан бастап дерлік еркін мәтінге дейін, әртүрлі мәтін түрлерін өңдей алатын ИЭ жүйелерін дамытуға серпін берді, мұнда әдеттегі wrapper-лер сәтсіздікке ұшырайды, соның ішінде аралас түрлерді де қамтиды. Мұндай жүйелер тілдің терең білімін пайдалана алады және сондықтан нашар құрылымдалған мәтіндерге де қолданылуы мүмкін. Соңғы жетістік – Визуалды ақпаратты алу, ол веб-бетті браузерде көрсетуге және көрсетілген веб-беттегі аймақтардың жақындығына негізделген ережелерді құруға негізделген. Бұл HTML бастапқы кодында анық үлгісі жоқ, бірақ визуалды үлгіні көрсете алатын күрделі веб-беттерден нысандарды алуға көмектеседі.