Кіріспе
Мәтінді талдау, мәтіндік деректерді өндіру (ТДМ) немесе мәтіндік талдау – мәтіннен жоғары сапалы ақпаратты алу процесі. Бұл «компьютер арқылы әртүрлі жазбалардан автоматты түрде ақпаратты алу арқылы бұрыннан белгісіз жаңа ақпаратты табуды» білдіреді. Жазба ресурстарына веб-сайттар, кітаптар, электрондық пошта, пікірлер және мақалалар жатуы мүмкін. Жоғары сапалы ақпарат көбінесе статистикалық үлгілерді оқыту сияқты тәсілдер арқылы үлгілер мен тенденцияларды анықтау арқылы алынады. Hotho және авторлар (2005) мәтіндік өндірудің үш түрлі көзқарасын ажыратады: ақпаратты алу, деректерді өндіру және деректер базасындағы білімді ашу (KDD) процесі. Мәтінді өндіру әдетте кіріс мәтінін құрылымдау процесін қамтиды (әдетте, синтаксистік талдау, сондай-ақ туынды тілдік ерекшеліктерді қосу және басқаларын жою, содан кейін деректер базасына енгізу), құрылымдалған деректердегі үлгілерді анықтау және, соңында, нәтижені бағалау және интерпретациялау. Мәтіндік өндірудегі «жоғары сапалы» көбінесе маңыздылығы, жаңалығы және қызығушылығының комбинациясын білдіреді. Типикалық мәтіндік өндіру міндеттеріне мәтінді жіктеу, мәтінді кластерлеу, түйсіктер/объектілерді алу, егжей-тегжейлі таксономияларды жасау, сезімталдық талдау, құжаттарды қорытындылау және объектілер арасындағы қатынастарды модельдеу (яғни, аталатын объектілер арасындағы қарым-қатынастарды үйрену) кіреді. Мәтіндік талдау ақпаратты іздеуді, сөздердің жиілігін зерттеу үшін лексикалық талдауды, үлгіні тануды, белгілеу/түсіндіруді, ақпаратты алуды, сілтемелік және ассоциативтік талдауды қоса алғандағы деректерді өндіру әдістерін, визуализацияны және болжамдық талдауды қамтиды. Басты мақсат – мәтінді табиғи тілді өңдеу (NLP), әртүрлі алгоритмдер мен талдау әдістерін қолдану арқылы талдау үшін деректерге айналдыру. Осы процестің маңызды кезеңі – алынған ақпаратты интерпретациялау. Типикалық қолданылуы – табиғи тілде жазылған құжаттар жиынтығын сканерлеу және оларды болжамдық жіктеу мақсатында модельдеу немесе алынған ақпаратпен деректер базасын немесе іздеу индексін толтыру. Құжат мәтіндік өндіруді бастау үшін негізгі элемент болып табылады. Мұнда құжатты мәтіндік деректердің бірлігі ретінде анықтаймыз, ол әдетте көптеген жинақтарда кездеседі.
Text mining, text data mining (TDM) or text analytics is the process of deriving high quality information from text. It involves "the discovery by computer of new, previously unknown information, by automatically extracting information from different written resources." Written resources may include websites, books, emails, reviews, and articles. High quality information is typically obtained by devising patterns and trends by means such as statistical pattern learning. According to Hotho et al. (2005) we can distinguish between three different perspectives of text mining: information extraction, data mining, and a knowledge discovery in databases (KDD) process. Text mining usually involves the process of structuring the input text (usually parsing, along with the addition of some derived linguistic features and the removal of others, and subsequent insertion into a database), deriving patterns within the structured data, and finally evaluation and interpretation of the output. 'High quality' in text mining usually refers to some combination of relevance, novelty, and interest. Typical text mining tasks include text categorization, text clustering, concept/entity extraction, production of granular taxonomies, sentiment analysis, document summarization, and entity relation modeling (i. e., learning relations between named entities). Text analysis involves information retrieval, lexical analysis to study word frequency distributions, pattern recognition, tagging/annotation, information extraction, data mining techniques including link and association analysis, visualization, and predictive analytics. The overarching goal is, essentially, to turn text into data for analysis, via the application of natural language processing (NLP), different types of algorithms and analytical methods. An important phase of this process is the interpretation of the gathered information. A typical application is to scan a set of documents written in a natural language and either model the document set for predictive classification purposes or populate a database or search index with the information extracted. The document is the basic element when starting with text mining. Here, we define a document as a unit of textual data, which normally exists in many types of collections.
Мәтіндік талдау
Мәтіндік талдау – бизнес-анализ, зерттеулік деректерді талдау, зерттеу немесе тергеу мақсатында мәтіндік деректердің ақпараттық мазмұнын модельдеу және құрылымдау үшін қолданылатын лингвистикалық, статистикалық және машиналық оқыту әдістерінің жиынтығын қамтиды. Бұл термин мәтіндік өңдеумен шамамен синонимді болып табылады; шындығында, Ронен Фельдман 2004 жылы "мәтіндік өңдеу" туралы 2000 жылғы сипаттаманы "мәтіндік талдау" деп өзгертіп сипаттады. Соңғы термин қазір бизнес саласында жиі қолданылады, ал "мәтіндік өңдеу" 1980-ші жылдардан бері қолданылып келе жатқан өмір ғылымдары зерттеуі және мемлекеттік барлау сияқты алғашқы қолданыс салаларында қолданылады. Мәтіндік талдау термині бизнес мәселелеріне жауап беру үшін мәтіндік талдауды қолдануды, дербес немесе жиналған сандық деректерді сұрау және талдаумен бірге қарастырады. Бизнеске қатысты ақпараттың 80 пайызы құрылымдалмаған түрде, негізінен мәтін түрінде пайда болады. Бұл әдістер мен процестер автоматтандырылған өңдеуге қол жеткізбейтін, мәтін түрінде сақталған фактілер, бизнес ережелері және қарым-қатынастар сияқты білімді ашып, ұсынады.
Қолданбалар
Мәтін қазу технологиясы қазіргі таңда үкіметтік, ғылыми және бизнес салаларында кеңінен қолданылуда. Бұл салалардың барлығы мәтін қазуды күнделікті жұмыстарына қатысты құжаттарды басқару және іздеу үшін пайдалана алады. Мысалы, заңгерлер электрондық сот ісін жүргізуде мәтін қазудан көмек алады. Үкіметтер мен әскери ұйымдар ұлттық қауіпсіздік және барлау мақсатында мәтін қазуды қолданады. Ғылыми зерттеушілер мәтіндік деректердің үлкен жиынтығын ұйымдастыру (яғни, құрылымдалмаған деректер мәселесін шешу), мәтін арқылы білдірілетін идеяларды анықтау (әлеуметтік желілердегі пікірлерді талдау сияқты) және тірі организмдер ғылымы мен биоинформатика салаларындағы ғылыми жаңалықтарды қолдау үшін мәтін қазу әдістерін пайдаланады. Бизнес саласында бәсекелестік талдауы мен автоматтандырылған жарнама орналастыру сияқты көптеген қолданбалар қолданылады.
Қауіпсіздік қолданбалары
Көптеген мәтіндік тау-кендік бағдарламалық құралдар қауіпсіздік саласында, әсіресе ұлттық қауіпсіздік мақсатында интернеттегі жаңалықтар, блогтар сияқты ашық мәтіндік көздерді бақылау және талдау үшін сатылады. Ол мәтінді шифрлау және шифрдан шығаруды зерттеуде де қолданылады.
Биомедициналық қолдану
Биомедициналық әдебиетте мәтіндік тау-кенді қолданудың әртүрлі түрлері сипатталған, оның ішінде ақуыздық байланыстыру, ақуыздық өзара әрекеттесу және ақуыз бен аурудың байланысын зерттеуге көмектесетін есептеу тәсілдері бар. Бұдан өзге, клиникалық саладағы пациенттердің үлкен мәтіндік деректер жиынтықтары, халық зерттеулеріндегі демографиялық ақпарат жиынтықтары мен жағымсыз құбылыстар туралы хабарламалар мәтіндік тау-кенді клиникалық зерттеулерді және жекелеген медицинаны дамытуға мүмкіндік береді. Мәтіндік тау-кен алгоритмдері электрондық денсаулық сақтау деректерінен, оқиғалар туралы хабарламалардан және диагностикалық тесттерден алынған симптомдар, жанама әсерлер және бірмезгілде болатын аурулар туралы үлкен мәтіндік деректердегі нақты клиникалық оқиғаларды жіктеуге және индекстеуге көмектеседі. Биомедициналық әдебиеттегі онлайн мәтіндік тау-кеннің бір мысалы – PubGene, биомедициналық мәтіндік тау-кенді желілік визуализациямен біріктіретін, барлығына қолжетімді іздеу жүйесі. GoPubMed – биомедициналық мәтіндерді іздеуге арналған білімдік жүйе. Мәтіндік тау-кен техникалары клиникалық саладағы құрылымдалмаған құжаттардан жаңа білімді табуға да мүмкіндік береді.
Бағдарламалық бағдарламалар
Мәтінді өндіру әдістері мен бағдарламалық жасақтамасын ірі фирмалар, соның ішінде IBM және Microsoft, іздеу және талдау процестерін одан әрі автоматтандыру үшін, ал жалпы іздеу және индекстеу саласында жұмыс істейтін түрлі фирмалар өз нәтижелерін жақсарту мақсатында зерттеп, дамытуда. Мемлекеттік секторда террористік қызметті қадағалау және бақылауға арналған бағдарламалық қамтамасыз ету құруға көп күш жұмсалды. Оқу мақсатында Weka бағдарламалық жасақтамасы ғылыми әлемде ең танымал нұсқалардың бірі болып табылады және бастаушылар үшін тамаша бастапқы нүкте болып саналады. Python бағдарламашылары үшін NLTK деп аталатын тамаша құралдар жиынтығы бар. Ал тәжірибелі бағдарламашылар үшін сөздерді ендіруге негізделген мәтіндік бейнелеулерге бағытталған Gensim кітапханасы қолжетімді.
Онлайн медиа қолданбалары
Мәтінді талдау Tribune Company сияқты ірі медиа компаниялар ақпаратты түсінікті ету және оқырмандарға іздеу мүмкіндіктерін жақсарту үшін қолданылуда, бұл өз кезегінде сайтқа қызығушылықты ұзартуға және кірісті арттыруға көмектеседі. Сонымен қатар, редакторлар жаңалықтарды әртүрлі платформаларда бөлісіп, байланыстырып, жинақтап, мазмұнды монетизациялау мүмкіндіктерін едәуір арттыруда.
Бизнес және маркетингтік қолданбалар
Мәтіндік талдау бизнес саласында, әсіресе, маркетингте, мысалы, клиенттермен қарым-қатынасты басқаруда қолданылады. Coussement және Van den Poel (2008) оны клиенттердің кетіп қалуын (клиенттік ағымды) болжау талдау модельдерін жақсарту үшін пайдаланады.
Сезімталдықты талдау
Көңіл-күйді талдау фильмдер, кітаптар немесе қонақүйлер туралы пікірлерді талдауды қамтиды, бұл өнімге қаншалықты жағымды баға берілгенін анықтауға мүмкіндік береді. Мұндай талдау үшін белгіленген деректер жиынтығы немесе сөздердің эмоционалдық бояуын анықтау қажет болуы мүмкін. WordNet және ConceptNet сөздер мен ұғымдардың эмоционалдық сипаттамалары үшін ресурстар ұсынады. Эмоцияларды анықтау үшін мәтін қолданылған, бұл аффективтік есептеу саласымен байланысты. Аффективтік есептеуге негізделген мәтіндік тәсілдер студенттік бағалаулар, балалар әңгімелері және жаңалықтар сияқты әртүрлі деректер жиынтықтарында қолданылды.
Ғылыми әдебиеттер қазу әдістері
Ғылыми әдебиеттен ақпаратты іздеуге көмектесетін есептеу әдістері жасалған. Жарияланған тәсілдерге техникалық есептер арасында іздеу, жаңалықты анықтау және біртекті атауларды (омонимдерді) нақтылау әдістері кіреді.
Бағдарламалық жасақтама
Мәтінді талдауға арналған компьютерлік бағдарламалар көптеген коммерциялық және ашық кодты компаниялар мен дереккөздерден қол жетімді.
АҚШ-тағы жағдай
АҚШ-тың авторлық құқық заңнамасы, әсіресе оның әділ пайдалану шаралары, Америкадағы мәтіндік қазбалауды, сондай-ақ Израиль, Тайвань және Оңтүстік Корея сияқты әділ пайдалануға рұқсат беретін басқа елдердегі мәтіндік қазбалауды заңды деп қарастырады. Мәтіндік қазбалау трансформациялық сипатта болғандықтан, яғни ол бастапқы туындыны ығыстырмайды, сондықтан әділ пайдалану шеңберінде заңды деп есептеледі. Мысалы, Google Book келісімі аясындағы сотта төрағалық еткен судья Google-дың авторлық құқыққа ие кітаптарды цифрлық форматқа көшіру жобасының заңды екенін қабылдады, себебі жоба трансформациялық пайдаланудың мысалдары көрсетті – осы пайдалану түрлерінің бірі мәтін мен деректерді өңдеу болды.
Австралиядағы жағдай
Австралияның 1968 жылғы Авторлық құқық туралы заңында мәтін немесе деректерді өндіруге ешқандай ерекшелік көзделмеген. Австралия Заң реформасы комиссиясы "ғылыми зерттеу және оқу" бойынша әділ пайдалану ерекшелігі мұндай жағдайды қамтымайды деп санайды, себебі ол "нақты көлем" талабынан асып түседі.
Салдары
Соңғы уақытқа дейін веб-сайттар көбінесе пайдаланушы анықтаған нақты сөздер мен тіркестерді қамтитын құжаттарды ғана табатын мәтіндік іздеуді қолданды. Бірақ енді семантикалық желіні пайдалану арқасында мәтінді табу технологиясы мағынасы мен контекстісіне сүйене отырып мазмұн іздеуге мүмкіндік береді (жанама сөздерге емес). Сонымен қатар, мәтіндік өңдеу бағдарламалық құралдарын белгілі бір адамдар мен оқиғалар туралы кең көлемді ақпарат жинақтау үшін қолдануға болады. Мысалы, жаңалықтардан алынған деректерге негізделген үлкен деректер жиынтығын әлеуметтік желілерді талдау немесе қарсы барлау жұмыстарын жеңілдету үшін құруға болады. Іс жүзінде, мәтіндік өңдеу бағдарламалық құралы шектеулі ауқымда болса да, барлау аналитигі немесе зерттеу кітапханашысы сияқты қызмет атқаруы мүмкін. Мәтіндік өңдеу кейбір электрондық пошта спам-сүзгілерінде жарнамалық немесе басқа да қосымша материалдар болуы мүмкін хабарламалардың ерекшеліктерін анықтау үшін де қолданылады. Мәтіндік өңдеу қаржы нарығындағы көңіл-күйді анықтауда маңызды рөл атқарады.